Demo 里 95%,上生产只剩 8%——Agent「能干活」和「能上线」是两层东西

你的 agent 在 demo 里表现很好,跑十几步二十步,成功率能到 95%;可链路一拉长,跑到第 50 步,成功率只剩 8%。这不是模型不行,是「能干活」和「能上线」根本是两层东西——大部分人只做到了第一层。

这是抖音「赋范AI说」一条 18.5 分钟视频的深度拆解。视频标题叫《Vibe Coding 从入门到进阶!基于 OpenClaw 开源项目二次开发全流程》,但先把话说在前面:这个标题是钩子,正片其实是一场「2026 企业级 Agent 落地」直播公开课的节选——vibe coding 只是课程大纲八个部分里的第六部分,「OpenClaw 二次开发全流程」是课件和正课承诺的内容,视频里只演示了成品。冲标题点进去的人会失望,但正片里那套「demo 与生产之间隔着什么」的框架,比标题承诺的东西更值钱。这也是本文要拆的核心。

拆解方法照旧是双轨:SenseVoice 逐字稿(6800+ 字)+ 豆包视觉逐段读屏(时间轴、字幕、图表),交叉核对。


一、这条视频的真实结构

18.5 分钟分两段,两个讲师:

  • 前 2 分钟:短视频节奏的「认知冲突」包装——95% vs 8% 的数据反差钩、两层论、四件躲不掉的事、两个警示案例。信息密度极高,每 10 秒一个刺激点,柱状图+绿粉色文字框强调。
  • 后 16 分钟:直播公开课本体(讲师「木羽」),讲 2026 企业 Agent 落地的课程大纲:行业现状、五大核心能力、核心技术(工具调用/状态管理/长短期记忆)、多 Agent 协作误区、vibe coding 的阶段与坑、技术选型、求职简历、企业项目拆解(智能客服/数字员工/文档审核),并演示了他们官网基于 OpenClaw 和 Claude Code 搭的「数字员工」「内容工厂」等在线项目。

CTA 是教培行业标准双钩:评论区打「课件」领资料 + 加助教 1v1。这个结构本身就值得内容创作者抄,文末细说。


二、核心框架:「能干活」和「能上线」的两层论

视频最有价值的一张认知地图:

第一层「能干活」:工具调用、记忆状态、多智能体协作。讲师原话——「现在随便一个人拿 Claude Code 或者 Codex 都能搭出来,这一层门槛已经很低了。」

第二层「能上线」:稳定、可交付、可监控、可审计、有权限分级。真正决定一个 agent 能不能进生产的是这一层,而且「至少有四件事躲不掉」。

这个分层解释了一个普遍现象:为什么超九成企业都在喊 Agent 落地、却迟迟落不了地——因为大家学的、演示的、面试吹的都是第一层,而企业验收的是第二层。讲师给的行业口径是:真正验证下来「可以完全交由 AI 委托落地」的场景不足 40%

三、「能上线」躲不掉的四件事

这是全片的干货核心,四道门,一道都绕不过:

1. 确定性检查——你的 agent 能做什么、不能做什么,「得写成硬规则,不能靠一句提示词让它最好别这样做。模型对提示词的约束力其实很弱」。这句是全片最狠的一句:提示词层面的规矩(包括现在流行的 CLAUDE.md/AGENTS.md 那类规矩文件)管的是方向和习惯,真正的红线必须落在代码级的硬门上——发送前的关键词拦截、权限白名单、操作前的强制校验,这些不能指望模型「自觉」。

2. 语义评分——agent 每次输出到底算好还是算坏,得有一套能打分的标准。「这是能不能替代人工的核心依据。」没有评分器,你就没法回答「它替代人工到什么程度」,也没法迭代——你甚至不知道改一版提示词之后是变好了还是变坏了。

3. 对抗测试——专门验证它会不会越界,比如会不会把内部信息说漏出去。注意这跟测「功能对不对」是两回事:功能测试问「它能不能做到」,对抗测试问「它会不会做不该做的」。绝大多数团队只测前者。

4. 人工审查——敏感场景必须有人在环节里把关。医疗、金融、对外发布,最后一道门留给人。

对照一下你手里的 agent 项目:四道门开了几道?多数 demo 的答案是零道或一道——这就是 95% 和 8% 之间的距离。

四、两个警示案例

案例一:OpenClaw 智能体市场被恶意投放。 OpenClaw 火了之后开了智能体市场,几万个智能体挂在上面,结果被人拿去做批量恶意投放——「就是因为护栏这一层没做够」。开放生态的繁荣和护栏缺失是同一枚硬币的两面。

案例二:工具调用 85% → 27%。 工具调用环节在公开评测能到 85% 的准确率,放到实际业务的定制化场景里实测掉到 27%。讲师强调「这些数字不是我编的,是真实测出来的」。公开 benchmark 测的是通用任务,你的业务里全是长尾:内部系统的怪接口、行话字段名、隐含的业务规则——这些 benchmark 里一个都没有。

一句话总结这两个案例:demo 能跑 ≠ 能用,中间这段路没人替你走完。

五、三阶段论:2026 是「规模化验证期」

讲师把 Agent 行业分成三个阶段,这张时间线可以当行业罗盘用:

  • 2023–2024 概念期:GPT 爆火后开发框架大爆发——LangChain、LangGraph、AutoGen、CrewAI、OpenAI Agents SDK、谷歌 ADK……每家公司都按自己对 agent 运行时的理解出一套框架。
  • 2025 试验期:框架洗牌,「活下来的也就那么几个」;DeepSeek 让企业看到国产模型私有化的希望,大量公司在内部验证「传统链路能不能交给 AI」。
  • 2026 规模化验证期:一批公司完成 AI 转型,约 40% 的企业在把 Agent 从 Pilot 推向规模化——瓶颈从「能不能搭」变成成本、稳定性、场景适配。

另一个值得记的转折判断:随着编程模型变强 + Claude Code / OpenClaw 这类多 agent 框架成熟,越来越多场景可以用「通用型 agent」直接开发,而不是为每个场景写专用框架代码。他们官网的「数字员工」就是这个思路:后端由 Claude Code / OpenClaw 自主驱动一个 agent team 完成协作流程;「内容工厂」则是动嘴下需求、全链路产出图文视频。专用框架的位置,正在被「通用 agent + 工程化约束」挤压。

还有一个反直觉提醒:多 Agent 不是万金油。「架构设计得足够复杂、用越强的模型、构建越复杂的体系,效果就非常好——恰恰不是这样。」简单任务强行上多 agent 框架,效果反而更差。架构复杂度要匹配任务复杂度,这条和 Anthropic 官方「能单 agent 就别多 agent」的工程建议完全一致。

模型侧同理:不是接入最强模型就能落地。更强的模型只是提升了任务复杂度的上限,「不上任何工程化手段就直接落地,显然不太现实」。讲师点了一句:OpenAI、Anthropic 这些大厂最近发布的 harness 提示工程,本质就是在约束 agent 的运行行为——连模型厂自己都在给 agent 上缰绳。

六、「普通理解」vs「企业真实需求」

视频里有一段对照,值得每个准备拿 agent 项目去面试/接单的人自查:

普通理解企业真实需求
会 LangChain / Dify / n8n 搭工作流稳定、可交付
链路能解决 90% 的问题,「效果看着不错」有监控、有审计、可追踪运行链路
agent 能自主做事,越自主越好有权限分级:leader 有审批权限,普通员工只有受限执行权限
接最强的模型用同样的模型,靠工程化手段把可靠性做出来

右列四条,本质都是第二层「能上线」的展开。简历上写「用 LangChain 搭过智能客服」和写「给客服 agent 做过评分器和对抗测试、上线后准确率从 X 提到 Y」,在面试官眼里是两个物种。

七、Vibe Coding 的位置:进阶的尽头是工程治理

回到标题的 vibe coding。它在这门课的大纲里排第六,讲师给的框架是「vibe coding 经历的阶段、学习和落地的技巧、正在踩的坑」。放进两层论里看,vibe coding 的进阶路线其实非常清晰:

  • 入门:会指挥模型写代码——描述需求、看结果、迭代。这对应第一层「能干活」,门槛已经很低。
  • 进阶:不是 prompt 写得更花,而是把工程治理那一层补上——给 AI 立规矩(规矩文件管方向)、写硬规则(代码级门禁管底线)、搭评分器(知道输出好坏)、做对抗测试(知道它会不会越界)、留人工审查位(敏感操作有人把关)。

换句话说:vibe coding 从入门到进阶,就是从「能让 AI 干活」走到「敢让 AI 上线」。标题没骗人,只是这条路的后半段不叫技巧,叫工程。

八、内容侧拆解:这条公开课引流片的可抄骨架

按 7 段文案框架过一遍,重点挑值得抄的:

  • 钩子(前 3 秒):数据反差钩——「demo 里 95%,第 50 步只剩 8%」。数字具体、落差巨大、直指痛点,9/10 的钩子。
  • 结构:认知冲突(数据反差)→ 概念分层(两层论)→ 清单(四件事)→ 案例背书(OpenClaw/85→27)→ 课程大纲(解决方案在正课)。这是标准的「公开课引流片」结构:短视频前 2 分钟给足干货建立信任,后 16 分钟直播节选展示课程质感。
  • 金句:「能干活和能上线,根本是两层东西」「demo 能跑不等于能用,这中间没人替你走完」「模型对提示词的约束力其实很弱」——三句都是「命名一个大家隐约感到但没说破的现象」,可二次传播性强。
  • CTA:双钩——评论区打「课件」(拉互动权重+筛意向)→ 加助教 1v1(私域转化)。「我挨个踢」制造人工稀缺感。
  • 可复制骨架[惊人数据反差] + 这不是 X 不行,是 A 和 B 根本是两层东西 + 第一层是…门槛已经很低 + 真正决定成败的第二层至少有 N 件事躲不掉 + [翻车案例] + 完整清单我准备好了,评论区打 XX。任何「入门易精通难」的领域都能套。

九、四个角度的反思

对个人开发者:别再堆「我会 N 个框架」,挑一个项目把四道门走完——哪怕是玩具项目,有评分器、有对抗测试记录、有上线前 checklist,含金量立刻碾压十个纯 demo。四道门就是你的项目升级清单。

对做 AI 产品的团队:把「确定性检查/语义评分/对抗测试/人工审查」翻译成上线前的硬性 checklist;红线一律写成代码级硬门,不放在提示词里;给每个 agent 输出配打分标准,否则迭代全靠感觉。

对教育/培训机构:两点。一是业务上,AI 出题、AI 批改要交付给学员,必须先过「语义评分」(判分标准显性化)和「人工审查」(老师终审)两道门——「不足 40% 场景可全交 AI」意味着半自动是常态,全自动是陷阱。二是营销上,这条片子的「公开课引流结构」(干货短视频钩 → 直播课节选 → 评论区领资料 → 助教 1v1)是被验证过的教培获客链路,可直接迁移。

对未来:2026 的分水岭不在「会不会用 AI」,在「敢不敢让 AI 上生产」。模型能力在拉平,四道门的工程能力拉不平——Agent 评测、护栏、可观测性这些「AI 质检」方向,会是接下来几年最实的技能栈。


诚实标注

  • 视频是直播公开课节选 + 引流片,标题(Vibe Coding 进阶/OpenClaw 二开全流程)与正片内容不完全对应——OpenClaw 二次开发的「下载源码→架构逆向→换模型接飞书→交付」全流程在其课件/正课中,视频只演示了官网成品。
  • 95%→8%、85%→27%、「不足 40%」「40% 企业规模化」等数字均为讲师口径,出处未给、本文未独立核实,引用请标注来源。
  • 「OpenClaw 智能体市场被批量恶意投放」为讲师转述的案例,细节(规模、时间)视频未给证据。
  • 逐字稿来自 ASR,个别专有名词按上下文校正(如 clod code→Claude Code、open cloud→OpenClaw、郎信/狼倩→LangChain);「四阶段检查清单」为视频原话中「四件事」的课件包装说法。
  • 本文不构成对该课程的推荐或背书;框架有价值,报不报课自行判断。

来源:抖音 @赋范AI说《Vibe Coding 从入门到进阶!基于 OpenClaw 开源项目二次开发全流程》(18.5min)。拆解方法:SenseVoice 音频转写 + 豆包视觉画面理解双轨交叉核对。