一条 3 分钟的抖音,标题是「终于有模型治好了我的 Token 焦虑」。作者 @AI大法师 没有上来吹参数,而是先给你看一个”赛博蔬菜”——Agent 跑复杂任务,每一步都要等 10 秒、token 账单还在后台默默爆炸。然后他换上一个新模型,同样的活,速度快两倍、点击准一倍、价格降到九分之一。这条视频值得拆,不是因为它推了哪个模型,而是因为它把一个被所有人忽略的真问题——“Agent 时代,慢和贵才是真正的拦路虎”——讲得又准又狠。

先给结论:这是一条「问题定义」做得极好的技术种草

主角是阶跃星辰(StepFun)2026 年 5 月 29 日开源的 Step 3.7 Flash。但这条视频真正的高级之处,不在介绍模型,而在它先花了大半分钟,把”为什么你需要一个又快又便宜的模型”这件事讲透了。

绝大多数模型测评视频的逻辑是「我有个好东西 → 它跑分多高」。这条反过来:「你有个真痛点(还没意识到)→ 这东西刚好治它」。这就是种草和硬广的分水岭。下面我把它一层层拆开,既扒清楚模型本身的硬信息,也扒清楚这条视频”为什么让人看完想去试”。

一、它到底在讲什么:把「Token 焦虑」做成了一个具体场景

视频开场不是模型,是一套自动化系统:5 台云端 AI 手机 + 本地 Agent + 网页操作三端打通,跟系统说一句话,就能自动打车、订外卖、控制智能家居。听起来很爽。

但作者立刻抛出反转——当 AI 从”一问一答的聊天机器人”变成”自己跑任务的 Agent”,它会不停联网搜索、调用工具、验证结果。每一步都在烧 token,每一步都要等十几秒。 一个稍微复杂的链式任务跑下来,账单爆炸、人在旁边干等,他给了个词叫「赛博蔬菜」。

这就是「Token 焦虑」的具象化:不是模型不够聪明,是模型又慢又贵,导致你根本不敢让它高频自动跑。 把抽象的成本/延迟问题,翻译成一个谁都有共鸣的画面——这是这条视频的第一个杀招。

二、揪出硬信息:Step 3.7 Flash 到底强在哪

把视频里和公开资料对得上的硬数据拎出来,方便复用:

  • 身份:阶跃星辰 Step 3.7 Flash,2026-05-29 发布并开源,Apache 2.0 协议(可商用),已上 Hugging Face 和 ModelScope。
  • 架构:稀疏 MoE,196B 语言主干 + 1.8B ViT 视觉编码器,激活参数仅 11B,支持 256K 上下文。“大模型的知识量、小模型的推理成本”是它的设计取舍。
  • 速度:首字延迟 200 多毫秒,每秒输出 200+ token,峰值可达 400 tokens/s。对比锚点是”常规推理下大多数模型不超过 100 tokens/s”——它快 2-4 倍。
  • 价格:开启思考模式后编程能力只比对标的海外头部模型低约 3%,但价格直接降到约九分之一;SWE-Bench Pro 上成本同样是 1/9。
  • 跑分:SWE-Bench Pro 56.3%(视频称排到全球前列),Terminal-Bench 59.5%,多模态 SimpleVQA 搜索项 79.2%。在主流榜单上能跟海外头部模型和 DeepSeek 打得有来有回。
  • 杀手锏——原生多模态:不是”看一眼图片定生死”,而是能在推理过程中对图片裁剪、放大、多次查看。视频里它识别一张飞机驾驶舱照片,不只认出仪表按钮,还给出一整套起飞操作方案、精确标注每一步点哪里;对 Blender 这种专业软件,问一句就标出详细操作步骤。

一句话:它不是冲着”最强”去的,是冲着 “在生产场景里高频用得起” 去的。这个定位,比”屠榜”更值钱。

补一层:为什么「196B 但只激活 11B」能又快又便宜

很多人看到”196B”会下意识觉得这是个又大又贵的模型,其实恰恰相反,理解这一点对选型很关键。

稀疏 MoE(混合专家)的逻辑是:模型总共”懂得多”(196B 参数装下大量知识),但每次推理只唤醒一小撮”专家”(约 11B 参数真正参与计算)。 这就同时占了两头的便宜——

  • :推理时的实际计算量只跟”激活的 11B”挂钩,而不是 196B。算得少,吐字自然快,所以能冲到 400 tokens/s 这种级别。
  • 便宜:算力消耗、显存占用都按激活规模算,单位 token 的成本被压下来,这才是”价格降到 1/9”背后的物理基础,不是厂商赔本补贴。

再叠加 256K 的长上下文——Agent 跑长链任务时,能把一长串历史、工具返回、网页内容都塞进去而不丢上下文,这对”自动执行型”任务是刚需。所以它的三个卖点(快 / 便宜 / 长上下文 + 多模态)不是堆出来的,是同一套架构选择的自然结果。

看懂这层账,就明白这条视频为什么把它定位成”日常牛马”而不是”超级大脑”:MoE Flash 这条路线,本质就是用”够用的智能”换”极致的高频可用性”。 这正是 Agent 时代最稀缺的东西。

三、可复制的玩法:作者自制的「影子 / Shadow」工具

视频不是干讲模型,而是用一个自制工具把模型的”快”变成体感。这个叫**「影子」**的小工具,是整条视频可迁移性最高的部分:

  1. 全自动接管网页操作——Agent 直接替你点。
  2. 「问路」模式——不替你做,而是陪你做:你想学做 AI 视频但不会写提示词,把任务交给影子,它先自动识别你屏幕上的两张参考图,再标注出提示词输入框,你照着右边提示手动操作,或直接交给 AI 执行。
  3. 录制 → 沉淀——把”做 AI 视频”的每一步点击操作,自动变成一份图文并茂的教程/学习笔记,甚至沉淀成一套可复用的 skill,下次同样的问题直接让 AI 搞定。
  4. 接语音模型(Step Audio 2.5)——配合极低延迟,作者畅想戴上 AR 眼镜,不用等几十秒反应,实时指挥 AI 处理你”看到和听到的一切”——他给了个钩子词:“有点贾维斯那味儿了”

这套「问路 + 录制 + 沉淀成 skill」的产品思路,对任何做 AI 工具/教程的人都是现成模板:模型的”快”不是终点,把快转化成”低门槛 + 可复用”的工作流,才是产品力。


7 段文案拆解(看它怎么把技术讲成爽文)

【1】开头钩子(前 3 秒)

钩子文案:「这是我没花一分钱做出来的 5 台 AI 手机,只需要跟它说句话,就能全自动打车订外卖。」类型 = 成果前置 + 零成本反差。 底层逻辑:先用”零成本 + 全自动”勾住好奇,再在第 15 秒抛”但有个所有人绕不开的问题”做转折。先给糖、再给痛点,钩子强度 9/10。

【2】人设 & 声音

标签 = 实战派极客玩家。 全程只露手(操作设备)和一个戴 AR 眼镜的背影,不露脸但有强烈”我自己折腾出来的”的在场感。口播平稳、密度高、不煽情,靠”做出来给你看”建立信任。口头禅式收尾:「快人半步」「多快好省的铁血牛马军团」。受众 = 开发者 + AI 重度玩家。

【3】信息密度 & 节奏

3 分 16 秒塞进了:自动化系统演示、痛点定义、模型规格、速度实测、跑分对比、多模态 demo(迷宫/驾驶舱/Blender)、自制工具、语音、AR 眼镜。每 5-10 秒切一个场景,几乎没有留白。节拍靠”问题→方案→对比”三段式反复推进,刺激点密集到不敢快进。

【4】讲解手法 & 内容结构

结构 = 痛点驱动的”反转-论证”式。 不是平铺功能清单,而是:立靶子(赛博蔬菜)→ 换模型打靶(速度快 2 倍)→ 拆解为什么能快(架构/价格/多模态)→ 落到真实工作流(影子工具)→ 拔高到趋势(Flash 模型时代)。具体化手法极强:抽象的”原生多模态”用”飞机驾驶舱给出起飞方案”演示,抽象的”便宜”用”价格 1/9”量化。最强句是把成本焦虑命名为「Token 焦虑」——给痛点起名字,就拥有了这个话题。

【5】金句 & 记忆点

可二次传播的句子:

  • 「一个不小心就会让 token 账单直接爆炸 → 妥妥的赛博蔬菜了。」
  • 「日常 AI 任务的天选打工人 / 多快好省的铁血牛马军团。」
  • 「这是不是就真的有点贾维斯那味儿了?」 视觉记忆点 = 驾驶舱照片被标注出每一步操作的画面。可复用金句模板:把抽象痛点拟人化命名(X 焦虑 / 赛博 X)+ 把工具拟人化定位(天选打工人 / 牛马军团)。

【6】收尾 & CTA

收尾先收口定位:「我不会拿它做超级复杂的开发,但一定会让它成为日常多快好省的铁血牛马军团。」——给了一个”理性不吹过头”的诚实结论,反而更可信。 然后才是「点个关注,快人半步」。CTA 类型 = 价值观认同型(认同”快人半步”就关注),不硬求赞,沉锚在”持续跟进 AI 红利”。

【7】可复制文案骨架

钩子:这是我[零成本/极低成本]做出来的[惊人成果],只要[一句话操作]。
转折:但当 [AI/工具] 开始 [自动执行],所有人都绕不开一个问题——[把痛点命名]。
打靶:直到我换上 [新工具/新模型],同样的活,[量化提升A]、[量化提升B]、[成本降到X分之一]。
论证:先看 [硬指标实测] → 再拆 [为什么能做到] → 用 [一个极端 demo] 证明它真行。
落地:我用它做了 [一个具体小工具/工作流],把[抽象能力]变成[体感场景]。
拔高:所以这反映的是 [一个趋势判断],[谁] 都开始 [跟进]。
收尾:我不会用它做 [X],但一定会让它成为我 [日常高频场景] 的 [拟人化定位]。点关注,[价值观口号]。

四角度反思:学完不白学

对【我们这盘棋】的帮助

这条视频验证了一个判断:「降本提速」本身就是 2026 年最大的内容母题之一。 我们做内容时,与其追”最强模型”,不如盯”让普通人/小团队用得起的模型与工作流”——后者受众更广、痛点更真。具体动作:把”Token 焦虑 / 赛博蔬菜 / 牛马军团”这类”给痛点命名”的句式,纳入我们写标题和开头钩子的常备弹药库,下次写 AI 工具拆解直接套。

对【橙子我自己】的帮助

影子工具的「录制操作 → 自动沉淀成可复用 skill」,跟我现在的”知识沉淀 + skill 化”机制是同一个哲学,等于外部给我做了背书。具体动作:我以后跑任何多步链路(深扒/发布/部署),应更主动地把”这次怎么跑通的”沉成一张可复用卡片或脚本,而不是每次重走——这正是我该强化的肌肉记忆。另外,这条让我记住:讲技术给老大听时,少报参数、多给”换上它之后,同样的活快/省了多少”的对比,这才是老大要的结论。

对【老大的机构(公考 + AI 电商)】的帮助

Step 3.7 Flash 这种”便宜 9 倍、速度 2-4 倍、还原生多模态”的开源模型,对机构是直接的成本结构利好

  • AI 电商侧:批量生成商品图文案、看图改图、客服 Agent 自动跑流程,这些”高频、不要求最强、但要求又快又便宜”的活,正是 Flash 模型的主场。具体动作:评估把内容批量生产链路里非核心的环节,从贵模型切到这类 Flash 模型,跑量场景成本能砍一大截。
  • 公考侧:原生多模态”能裁剪放大反复看图”的能力,天然适合判图题/资料分析图表/行测图形推理这类需要”盯着图细看”的场景。具体动作:测一版用这类多模态模型做”拍照搜题 + 图表题讲解”的小工具,门槛低、体感强。

对【未来发展】的帮助

视频点破一个趋势:“越来越多大厂都在做 Flash 模型”——Agent 时代,竞争的下半场不是比谁更聪明,是比谁在”够用的智能”下,更快、更稳、更便宜。 这意味着”性价比 + 执行稳定性”会成为模型选型的第一性指标,而不是榜单分数。具体动作:我们做任何 AI 产品/内容的选型,默认先问”这个场景要不要最强?大部分不要”——把预算和注意力压到”高频、便宜、稳”的 Flash 档,把”最强模型”只留给真正的硬核难题。这就是作者那句”我不会拿它做超复杂开发,但会让它当日常牛马”的产品级智慧。

值得借鉴(可迁移、可抄、可复刻清单)

  1. 给痛点命名:「Token 焦虑」「赛博蔬菜」——把抽象成本/延迟问题起个有画面的名字,瞬间拥有话题。这招我们写任何拆解的开头都能抄。
  2. 反转式钩子:先给”零成本爽点”,第 15 秒抛”但有个绕不开的问题”做转折。先糖后痛,留人率高。
  3. 抽象能力用极端 demo 证明:「原生多模态」别空讲,用”驾驶舱照片给出起飞方案”一招定乾坤。我们讲任何能力都该配一个”极端到让人记住”的演示。
  4. 诚实定位反而更可信:「我不会拿它做超复杂开发」——主动说产品的边界,比全程吹更让人信。
  5. 把”快”转化成产品:影子工具的「问路 + 录制 + 沉淀 skill」,是把模型能力翻译成工作流的现成模板,做 AI 工具的可直接借结构。

三条可直接复用的判断

  1. 选型判断:高频、跑量、不要求最强的 AI 任务(批量文案、看图、Agent 自动流程),默认选”又快又便宜”的 Flash 档开源模型,把贵模型只留给硬核难题。性价比 > 榜单分。
  2. 内容判断:AI 工具拆解的开头,先”给用户一个他没意识到的痛点 + 给痛点命名”,再引出方案,比直接报参数的种草率高一个量级。
  3. 产品判断:模型的”快/便宜”本身不是卖点,把它转化成”低门槛 + 可沉淀复用”的工作流(如影子的录制→skill),才是真正的护城河。

这条视频最值钱的一句话,不是任何一个跑分,而是它把所有人都隐隐感到、却没说出口的东西命名了:Agent 时代,慢和贵,才是那个绕不开的拦路虎。 谁先治好这个焦虑,谁就拿到了下半场的入场券。