刷到一条标题很冲的视频:「一分钱不用花,养龙虾实现 Token 自由!」点进去,作者「合芯栈道」开门见山先吐了一肚子苦水——一晚上跑 agent,给他干掉了 6000 万 token,「养个小龙虾能破产」。然后话锋一转:现在好了,全换成 Ollama 本地部署,谷歌最新的 Gemma 跑起来,一分钱不用花。

先把黑话翻译清楚,不然全片看不懂:这里的「小龙虾 / 龙虾」是 OpenClaw(claw=爪=虾的谐音梗)这类 agent;「Token 自由」是说不再为 agent 烧的 token 付费。整条视频干的事,就是把一个吃 token 的 agent,模型后端从「按量付费的云端 API」换成「Ollama 托管的免费模型」——本地能跑就本地跑,跑不动就用 Ollama 云端的免费额度。

视频本身是篇能照着点的教程。但值得记下来的,从来不是「Ollama 现在能白嫖」这条会过期的信息,而是它背后那个反复能用的结构判断:agent 真正烧钱的不是聊天,是它自己那套没人盯着的多步循环;要省这笔钱,得换的是「后端能扛住高频调用的那个模型」,不是换工具。 这篇就顺着这条线,把它怎么做、哪几步有坑、以及「免费 / 本地满血」这话该信几分,一次拆透。

一句话定性

这条视频教的不是「某个免费模型」,而是一个把 agent 后端接到 Ollama 的动作:Ollama 桌面版现在把「本地开源模型」和「云端免费额度模型」收进了同一个界面,还预留了一键接 OpenClaw 这类 agent 的集成位。于是你的 agent 后端,从绑死的付费云端,变成「本地 Gemma(白嫖算力)+云端 MiniMax(白嫖额度)」的可插拔零件。所谓 Token 自由,本质是把「按量付费的焦虑」换成「本地一次性算力投入+云端免费档」——省的是 token 账单,换来的是硬件门槛和限额。

为什么这套能成:Ollama 从「本地 runner」变成了「免费模型枢纽」

要看懂它的价值,得先知道 Ollama 这一年悄悄变了。过去大家认识的 Ollama,是个命令行工具:ollama run 拉个开源模型在本地跑。视频里展示的是它的新形态——桌面版(有 GUI 了),而且干了两件关键的事:

  • 一个界面,本地云端模型混在一起列。 打开就是个本地 AI 聊天窗口,模型列表里既有本地模型,也有云端模型。你按自己的显卡性能挑:扛得动就选本地的,扛不动就选带 cloud 后缀的云端款。
  • 一个 Launch / 集成菜单,一键把模型喂给 agent。 这是全片的题眼。Ollama 现在内置了一堆应用集成,菜单第一个就是 OpenClaw(小龙虾)。你不用自己去 agent 里抠配置,复制它给的命令丢进命令行跑,按提示选一个 Ollama 里的模型,回车——agent 的后端就指过来了。

换句话说,Ollama 不再只是「把模型跑起来」,它把自己做成了 agent 后端的一个免费插座:左手插本地开源模型,右手插云端免费额度,再用集成菜单一键接到 agent 上。这就是「为什么能白嫖」的底层——不是某家良心,是这个枢纽同时握住了「本地算力免费」和「云端拉新送额度」两个口子。

它到底演示了什么:从选模型到操控淘宝,一条龙

视频没停在「换好了」,而是把这套后端从头跑到尾,正好覆盖了 agent 的几种典型动作。

① 本地档:按显卡挑一个开源模型,对话验证。 在桌面版模型列表里选谷歌的 Gemma(视频里标的是 Gemma4 / 27B 档),跟它说句「你好」,它就自动开始下载——进度条从 4.8GB / 16.8GB 一路爬到 16.7GB / 16.8GB,下完模型思考一下就回话了。这一步打底:本地模型一旦下好,之后 token「免费随便用」,因为跑的是你自己的电费。

② 云端档:显卡不够就选 cloud 模型,还自带免费额度。 作者明说了退路——显卡性能不行,就选带 cloud 后缀的云端模型,比如 MiniMax。这些云端款都有免费额度,而且在设置里点 Manage(云使用情况)能看到已消耗多少、额度会定期自动重置(视频里口播说「每小时」、画面字幕标「每 3 小时」,按哪个为准得自己进面板看,反正是隔几小时回一次血),跑些小任务够用。

③ 把这个后端接到 OpenClaw。 回到 Ollama 的 Launch 菜单,第一个就是小龙虾(OpenClaw)。把它给的命令丢进命令行运行,按提示选 Ollama 里的模型(作者这里选了 MiniMax),回车跑起来,打开 agent 的 Web 窗口问一句「你是哪个模型」——它如实回「是 Ollama 的 MiniMax」。后端换没换、换成了哪个,这一问就验证了。

④ 接飞书,让 agent 真去干活。 最后用手机飞书给 agent 发了句「打开淘宝」,浏览器就自动把淘宝开起来了。作者一摊手:「这不就 Token 自由了吗?」

四步连起来,是同一句话的四次证明:后端一旦接到 Ollama 这个免费枢纽,文本对话、本地 / 云端切换、agent 工具调用、IM 操控全链路,都能低成本甚至零成本跑起来。

两个能直接抄走的实操判断

教程类视频,最值钱的是那几个「不说就会卡住」的点。这条里有两个:

一、先认清「本地」和「云端」是两条路,按显卡选,别硬刚。 本地档(如 Gemma 27B)要先下十几个 G 的权重、跑起来还吃显存,是拿「一次性硬件 / 算力投入」换「token 免费」;显卡不够别死磕本地,直接走云端 cloud 模型那条,拿「免费额度 + 定期重置」顶上。这俩不是二选一的信仰之争,是按你机器条件分流——本地白嫖的是电费,云端白嫖的是额度,门槛和上限完全不同。

二、换后端后,第一件事是问 agent「你是哪个模型」做验证。 视频里这一步看着随意,其实是个该养成的习惯:agent 的模型配置层层嵌套,命令跑完不代表真接上了。开口问一句模型身份、看它回的是不是你刚选的那个,是最便宜的「换没换成功」自检——比闷头跑半天发现还在烧付费后端强。

该清醒的地方:「本地满血」「Token 自由」要信几分

这是全片最需要泼冷水的部分。方法本身(把 agent 后端接到 Ollama)完全成立,但有三层滤镜得自己摘掉:

  • 「31B 击败 397B」是聊天分,不是 agent 分。 视频里晒了张 Arena Elo 图,说这个小参数模型干翻了某个几百 B 的大模型。Arena Elo 测的是「人类觉得哪个聊天回答更顺眼」,而 agent 干活拼的是长上下文里稳定地调对工具、按计划走多步不跑偏——这恰恰是小模型最容易崩的地方。聊天分高 ≠ 跑 agent 稳。别被「本地满血跑龙虾真香」这句带节奏,自己的活自己拿小模型先压测过再下结论。
  • 「本地免费」是硬件门槛换来的。 Gemma 27B 那十几个 G 的权重,要跑得动得有像样的显卡 / 显存,这笔钱只是从「token 账单」挪到了「机器投入」,没凭空消失。显卡不够,「本地满血」就是空话,只能退云端——而云端就回到了限额、排队、定期重置那套。
  • 云端免费额度=消耗品,且大概率用数据换。 免费云端模型的商业逻辑通常是拉新 / 引流 / 攒数据,额度有限、随时可能变政策。敏感信息、客户数据、私有代码,别往来路不清的免费端点上喂;想稳定产出,免费档的排队限速会把你打回付费。

所以「Token 自由」更准确的读法是:你拿回了「后端说了算」的主动权,但没拿到「免费的午餐」。 本地是一次性算力投入换长期低边际成本,云端免费档是零成本练手场——练手、玩具、跑创意完全合适;当生产基础设施,仍然该付费的付费。

适用 vs 短板

场景合不合适
有像样显卡,想让 agent 长期低成本跑✅ 本地 Ollama+开源模型,跑的是电费
显卡一般,想零成本练 agent / 试集成✅ 走云端 cloud 模型免费额度,够玩
学 OpenClaw 这类 agent、跑好玩的自动化✅ 一键集成,正中下怀
拿小模型扛复杂多步 agent 工作流⚠️ 先压测工具调用可靠性,别信聊天分
用免费云端端点处理敏感 / 私有数据⚠️ 隐私换不起,别碰
指望「长期免费」「本地满血」一劳永逸❌ 额度会变、硬件有门槛,按消耗品规划

写在最后

这条视频教的「白嫖」会过期,Ollama 的免费额度政策也会变,但它演示的那个动作不会:把 agent 的模型后端,从绑死的付费云端,挪到一个你说了算的枢纽上。

记住一条就够本了:当你的 agent 把账单跑爆,第一反应不该是「这玩意太贵不玩了」,而是问一句——它烧 token 的那个后端,能不能换成我自己的本地算力,或者一个有免费额度的云端? 能换,你就从「按量付费的人质」变回了「握着插座的人」。

至于「Token 自由」——它不是真的不要钱,是你终于能选:今天插本地的省着跑,明天插云端免费的练手,后天活重了再插个靠谱的付费后端攻坚。自由的不是价格,是选择权。