模型更强,为什么 AI 还是会把事做砸?Harness 五层诊断法
模型更强,为什么 AI 还是会把事做砸?——怀曼 172 秒讲透 Harness 工程思维
先说结论:这条视频最有价值的,不是推荐了一门 GitHub 课程,而是给出了一个更便宜、更可控的 AI 故障诊断顺序:当任务失败时,先别急着换更贵的模型,依次检查任务规范、上下文供给、执行环境、验证反馈、状态管理。模型能力决定“它有没有可能做出来”,Harness 决定“这一次能不能稳定、可验证、可接续地做出来”。
但要注意:视频为了便于传播,把 Harness 压缩成了五层任务诊断框架;课程 Lecture 02 的官方五子系统是 Instructions、Tools、Environment、State、Feedback。二者高度相关,却不是逐字同名、可以无损互换的同一张表。本文会把两套表述分开,再给出可直接用于自学、调研和机构业务的落地模板。
一、视频元信息
- 视频标题:Harness 工程思维:解决大模型不可靠问题
- 作者:怀曼(Whyman)
- 平台:抖音
- aweme_id:7674295185861266731
- 时长:172 秒(本地音频识别为 171.99 秒)
- 发布时间:2026-08-16 00:24(北京时间;由原始 Unix 时间戳折算)
- 话题标签:#Codex #Claude #Harness #AI #AI工程化
- 采集时互动快照:304 赞、209 收藏、23 分享、0 评论。平台统计会持续变化,只能视作采集时点快照。
- 视频推荐项目:walkinglabs/learn-harness-engineering
- 项目状态(核查时点:2026-08-15):14 lectures、8 projects、15 languages、MIT License;GitHub 星标约 1.1 万,属于动态数据。
平台自动章节把视频切成七段:引言、AI 模型误区、可靠性的五个因素、自学应用、调研应用、五层归因问题、核心原则。这个切法基本准确,也恰好呈现了视频的逻辑路线:推荐资源 → 打破误区 → 给诊断框架 → 做跨场景迁移 → 收束成行动原则。
二、方法与边界:这篇深扒是怎么做的
本次分析使用了四类材料:
- 抖音视频元信息与平台自动章节;
- Faster Whisper small 的本地中文转写;
- 每 10 秒抽取一帧组成的联系表,通过本地抽帧视觉分析辅助观察画面结构、字幕和节奏;
- 原项目 README、GitHub API 与官方 Lecture 02 页面进行事实核验。
必须诚实说明的降级
原计划中的 SenseVoice 音频识别和豆包视觉分析因缺少所需环境变量未能运行。本次不是“SenseVoice + 豆包视觉双轨”,而是采用 Faster Whisper small + 本地抽帧视觉分析的降级链路。
这意味着:
- 逐字稿依据单一 ASR 主轨整理,已结合上下文纠正明显同音误识别,例如 Honest/Hanis → Harness、最小避环 → 最小闭环、数据员 → 数据源、可签议性 → 可迁移性;
- 对个别低置信度词,只做不改变原意的标点、病句和术语修正,不补写视频中没有的信息;
- 抽帧间隔为 10 秒,能判断主要版式和信息推进,但无法覆盖每一次转场、手势和逐帧动画;
- 视频中的课程介绍与观点,需区分“作者概括”“课程自述”和“外部已验证事实”。
三、校订转写稿(摘要式整理)
说明:本节不是逐词转载,而是按视频顺序做摘要式整理;仅保留少量关键原意引文,并修正明确的 ASR 同音错误。
视频先推荐 GitHub 上的 Learn Harness Engineering 课程,随后抛出核心判断:**模型能力越强,并不代表模型执行就越可靠。**作者认为,真实任务失败往往不只来自模型本身,还可能来自目标不清、隐性知识未提供、工具或权限不足、缺少验收标准,以及过程没有记录。
接着,作者把这套方法从 AI 编程迁移到两个日常场景。自学时,不应只让 AI 不断输出内容,而要定义最小学习闭环、最小阅读量、反馈循环和知识边界;市场调研时,则要先说清楚究竟是交一份报告,还是验证某个商业假设,并明确用户、数据源、行业背景、可用工具、可信度标准和结果落点。
整条视频最终收束为五个问题:
- 完成这件事到底应该是什么样子?
- 执行者需要什么信息,才能不用猜?
- 需要哪些工具、条件和权限,才能真正执行?
- 如何证明任务确实完成,而不是 AI “自以为完成”?
- 过程如何记录、如何衔接,才能回溯和继续?
作者最后给出的行动原则是:当 AI 执行失败时,不一定先换更先进、成本更高的模型;应先检查整个 Harness 过程是否仍有优化空间。
四、172 秒内容的七段拆解
1. 开头钩子:不造焦虑,先给一个“值得收藏”的资源
视频开头不是“99% 的人都用错 AI”,而是直接说“真的非常推荐大家去 GitHub 找这门课”。这是一种资源型钩子:先承诺一个高价值外部对象,再快速解释它不只是教概念,而是在讲头部 AI 公司如何让模型完成真实任务。
它的优点是可信、克制,适合知识类账号;缺点是对完全不了解 Harness 的普通观众而言,“课程名 + GitHub”仍有门槛。更强的版本可以先加一句结果冲突:
“同一个模型,为什么有的人用起来像工程师,有的人用起来像实习生?差别可能不在模型,在 Harness。”
然后再推荐课程,停留率会更好。
2. 人设与声音:学习者型专家,而不是权威宣判者
作者采用的是“我读过、我筛过、我把最值钱的部分翻译给你”的人设。声音上的核心特征是:
- 用“真的非常推荐”“我认为非常有价值”表达个人判断,而非假装绝对权威;
- 大量使用“比如”“又或者”“所以”,像在白板前逐步推导;
- 术语不炫技,马上转译成任务、自学和市场调研三个普通场景。
这种人设的信任来源不是职位背书,而是替观众完成信息筛选和概念迁移。对于知识账号,这是可持续的人设:持续读一手材料,把抽象概念转换为可执行问题。
3. 信息密度与节奏:中高密度,画面负责“稳”,字幕负责“跟”
从联系表可见,视频主要使用白底手写板书:蓝色写五层,红色写标题或核心原则,随后叠加深色表格总结自学、调研与通用五问。没有高频切换人物镜头,也没有复杂 B-roll。
信息推进大约分为:
- 0—16 秒:课程推荐与价值承诺;
- 17—34 秒:打破“模型越强就越可靠”的误区;
- 34—59 秒:五类故障来源;
- 60—91 秒:自学迁移;
- 91—116 秒:市场调研迁移;
- 117—155 秒:抽象成通用五问;
- 156—172 秒:核心原则收束。
节奏的强项是几乎没有闲聊,每 20—30 秒完成一次认知升级;弱项是长句较多,观众一旦漏掉某个并列项,不容易在纯口播中找回来。深色总结表格正好承担了“视觉回看点”的作用。
4. 讲解结构:先制造概念张力,再用两个案例完成迁移
这条视频不是平铺五个定义,而是用了一个很成熟的知识讲解结构:
- 资源背书:有一门系统课程值得看;
- 反常识判断:模型能力强,不等于执行可靠;
- 框架拆解:失败可归因到五层;
- 第一次迁移:从编程迁移到自学;
- 第二次迁移:从自学迁移到市场调研;
- 抽象回收:把案例重新压成五个通用问题;
- 行动结论:失败时先查 Harness,再考虑换模型。
真正高明的是第 4、5 步。很多知识视频只解释概念,观众觉得“懂了”,却不知道明天怎么用;这里连续做两次迁移,证明五层框架不是编程黑话,而是一套任务工程方法。
5. 金句与记忆点:把复杂工程压成一句故障判断
最值得记住的句子有三类:
- 反常识句:“模型能力越强,并不代表模型执行能力就会越可靠。”
- 验收句:“怎么验证它真的完成了,而不是它自己自以为完成?”
- 行动句:“AI 执行失败时,不一定先换更贵的模型,先检查 Harness 还有没有优化空间。”
其中第二句最有传播力,因为它命中了所有 AI 用户都经历过的痛点:模型说“已经完成”,人一检查才发现只是写了方案、跳过测试或漏了关键步骤。
6. 收尾 CTA:认知收束强,互动引导弱
结尾完成了观点闭环,却几乎没有显式 CTA:没有让观众收藏五问、评论失败案例,也没有明确提示去主页或项目页继续学习。
更适配短视频传播的结尾可以是:
“下次 AI 又说‘做完了’,先拿这五问过一遍。收藏这张表,再去 GitHub 搜 Learn Harness Engineering。”
这样既不破坏知识感,又增加收藏和后续行动。
7. 可复制文案骨架
这条视频可以抽象成一个通用的知识型短视频模板:
资源钩子:最近我看到一份/一门很值得读的【一手资料】。
价值翻译:它表面讲【术语 A】,其实解决的是【大众痛点 B】。
反常识冲突:很多人以为【常见认知】,但实际上【关键反转】。
框架拆解:这件事可以拆成【N 个因素】,分别是【简列】。
场景迁移一:放到【场景 1】,你要问【具体问题】。
场景迁移二:放到【场景 2】,你要问【具体问题】。
抽象回收:归根到底,它在回答【N 个通用问题】。
行动 CTA:下次遇到【失败】,先检查【框架】,再决定是否【高成本动作】。
这个骨架尤其适合开源项目、论文、行业报告、课程拆解:不是复述材料,而是把材料变成观众可以复用的判断工具。
五、五层诊断模型:逐项解释
以下先按视频的任务诊断语言解释,再与官方课程的五子系统对照。
第一层:任务规范——“完成”到底长什么样?
任务规范不是一句“帮我做个报告”,而是明确:目标、范围、交付格式、必须满足的约束、不能做的事、完成标准。
常见故障:
- 只描述动作,不描述结果;
- 没有限定范围,AI 越做越大;
- 没说面向谁,输出风格和深度漂移;
- 没有 Definition of Done,模型只能凭语言自信宣布完成。
一个合格任务规范至少要回答:交付物是什么、服务谁、做到什么程度、哪些不在范围内。
第二层:上下文供给——它需要知道什么,才不用猜?
上下文不是越多越好,而是提供“完成当前任务所需的最小充分信息”:背景、术语、已有决策、样例、数据源、受众、边界条件。
常见故障有两个极端:
- 给得太少,AI 用通用常识补空白,输出看似合理却不适用;
- 给得太多,关键约束淹没在材料里,导致注意力稀释和范围蔓延。
好的上下文供给强调按需读取、逐步披露、来源可追溯,而不是把所有文档一次塞进提示词。
第三层:执行环境——它有没有工具、条件和权限把事做完?
知道怎么做,不等于能够做。AI 可能理解任务,却缺少文件、浏览器、数据库、运行环境、可用账号、依赖、网络或必要权限。
这里的关键不是“权限越大越好”,而是最小必要权限 + 可复现环境:该读的能读,该运行的能运行,不该接触的保持隔离;版本、依赖和启动方式要明确。
视频把“工具、环境、权限”合并为一层,适合作为任务诊断;官方课程则把 Tools 与 Environment 明确分成两个子系统,粒度更细。
第四层:验证反馈——如何证明做对了,而不是“看起来完成了”?
这是最容易被忽略、也通常回报最高的一层。模型的自信表达不是证据。验证必须尽可能外部化、可执行:
- 代码:测试、lint、类型检查、构建、端到端运行;
- 调研:来源可访问、关键数字交叉核验、反面证据、结论与证据一一对应;
- 内容:事实核验、要求清单、敏感信息扫描、目标读者试读;
- 学习:闭卷复述、做题、解释错误、迁移练习。
反馈不只是最后验收,还应该形成“执行—检查—纠错—再执行”的循环。
第五层:状态管理——做到了哪里,下次怎么接上?
长任务失败常常不是能力不足,而是跨轮次后失忆、重复劳动、遗漏阻塞项。状态管理要记录:
- 已完成什么;
- 正在做什么;
- 哪些地方被阻塞;
- 哪些事实已验证、哪些仍未验证;
- 下一步从哪里开始;
- 产物和证据在哪里。
状态不是把全部聊天记录永久累积,而是保留足以安全恢复工作的结构化摘要。
六、别混写:视频五层与 Lecture 02 官方五子系统如何对应
官方 Lecture 02 明确写的是:
- Instructions:告诉 Agent 做什么、按什么顺序、先读什么;
- Tools:提供完成任务所需的工具访问;
- Environment:让依赖、版本和运行条件可描述、可复现;
- State:持久化进度、阻塞与下一步;
- Feedback:用测试和检查给出可执行反馈。
视频的五层是:任务规范、上下文供给、执行环境、验证反馈、状态管理。
可以做“近似映射”,但不能说完全相同:
| 视频诊断语言 | 更接近的官方子系统 | 差异 |
|---|---|---|
| 任务规范 | Instructions | 视频突出目标与完成标准;官方 Instructions 还包括顺序、入口和文档导航 |
| 上下文供给 | Instructions(部分) | 官方没有单列 Context;上下文通常由指令结构、仓库文档和按需读取共同承载 |
| 执行环境 | Tools + Environment | 视频将工具、条件、权限合并;官方拆成两个子系统 |
| 验证反馈 | Feedback | 高度对应,均强调外部证据和纠错回路 |
| 状态管理 | State | 高度对应,均强调跨会话连续性 |
此外,项目 README 的某些总览段落又用 Instructions、State、Verification、Scope、Session Lifecycle 描述完整 Harness。这是官方仓库内部不同页面的口径差异,也反映课程从不同教学视角组织材料;不应把 README 总览、Lecture 02 五子系统和视频五层拼成一套“官方唯一命名”。最稳妥的做法是:引用时标明出处与语境,落地时关注它们共同覆盖的责任,而不是争论名词。
七、可立即执行的“Harness 五问”模板
每次把任务交给 AI 或人之前,先填这五问:
Harness 五问卡
- 任务规范:这件事“完成”具体长什么样?交付物、受众、范围、格式、截止条件和禁止项是什么?
- 上下文供给:执行者必须知道哪些背景、样例、历史决策、数据源和行业知识,才不用猜?最小充分材料是什么?
- 执行环境:需要哪些工具、渠道、文件、依赖、运行条件和最小权限?它们现在是否真的可用?
- 验证反馈:用什么可检查证据证明结果正确?谁检查、何时检查、失败后如何回到执行环?
- 状态管理:进度、证据、阻塞、未验证点和下一步记录在哪里?中断后,另一个人或下一轮 AI 能否继续?
一页式任务模板
任务:
目标用户/使用场景:
交付物与格式:
完成标准:
范围外/禁止项:
必须读取的最小上下文:
可信数据源:
可参考样例:
可用工具与渠道:
环境/依赖/权限边界:
验证清单:
- [ ]
- [ ]
- [ ]
失败后的修正方式:
状态记录:
已完成:
阻塞项:
未验证点:
下一步:
八、迁移案例一:把“AI 帮我自学”改造成可验收的学习系统
假设目标是用一周理解“概率论中的贝叶斯定理”。普通提示往往是:“请详细讲讲贝叶斯定理。”AI 会生成一篇看似完整的教材,但学习者是否掌握无法判断。
用五问重构:
- 任务规范:完成不是“读过一篇解释”,而是能闭卷说出先验、似然、后验,完成 10 道基础题,并用一个新案例解释更新过程。范围暂不扩展到贝叶斯网络。
- 上下文供给:提供当前数学基础、教材章节、术语表和两道已做错的题;限制 AI 先读取一章和错题,不无限扩展参考资料。
- 执行环境:纸笔、计算器、题库、可运行简单 Python 的环境;如果只做概念学习,就明确不需要联网搜索更多材料。
- 验证反馈:每学完一个小节,先闭卷复述,再做题;AI 只能根据答案证据判断薄弱点,不能用“你理解得很好”代替测验。
- 状态管理:学习日志只记“已掌握概念、错误类型、待复习题、下一节入口”,不把整段对话当状态。
这样,最小闭环就从“AI 输出内容”变成:
明确一个知识单元 → 读取最小材料 → 主动回忆/做题 → 根据错误反馈修正 → 记录掌握状态。
Harness 在这里没有让 AI 更懂概率论,而是让学习过程不再被流畅讲解所欺骗。
九、迁移案例二:把“做市场调研”改造成证据驱动的决策任务
假设要调研某类 AI 电商工具是否值得进入。普通任务“帮我做一份市场调研报告”很容易产出行业套话和漂亮表格,却不支持决策。
用五问重构:
- 任务规范:先明确调研是为了“写一份报告”,还是为了“验证三个进入假设并给出是否继续的建议”。定义目标用户、区域、时间窗口和决策门槛。
- 上下文供给:给出机构现有能力边界、目标客群画像、假设清单;明确优先数据源,如官方定价、产品文档、公开案例、用户评价和竞品动态。
- 执行环境:可用搜索渠道、访谈/问卷工具、数据表、网页归档方式;说明哪些数据需登录、哪些渠道不可访问,禁止伪造样本。
- 验证反馈:关键结论至少有一手来源;重大数字做交叉核验;主动搜索失败案例、限制和替代方案;将“事实、推断、建议”分栏。
- 状态管理:保存来源清单、证据摘录、冲突点、尚缺数据和下一轮访谈问题;最终数据落到可继续更新的结构化表,而不是只停留在一次性报告里。
最终交付应是:
假设 A/B/C 的证据状态 + 支持与反对证据 + 不确定性 + 下一步低成本验证动作,
而不只是“市场前景广阔,建议持续关注”。
十、事实核验与必要补充
1. “模型能力强 ≠ 任务执行可靠”——方向成立,但别走到另一个极端
项目官方材料明确区分:模型决定写什么,Harness 约束它何时、在哪里、以什么流程完成和验证。这个区分与视频核心观点一致。
但“先查 Harness”不等于“模型永远不重要”。如果任务超出模型的语言、推理、视觉、代码或上下文能力上限,再完美的流程也无法凭空创造能力。正确顺序应是:
- 先判断是不是能力上限:模型是否根本不会、看不懂或无法处理该模态?
- 再判断是不是系统可靠性:目标是否模糊、信息是否缺失、工具是否不可用、验证是否缺位、状态是否断裂?
- 若两者都有问题,优先修复低成本且可观测的系统缺口,再用基准任务比较是否值得升级模型。
2. Harness 不只是“更长的提示词”
Lecture 02 明确指出:一个 prompt 文件不是 Harness。Harness 涵盖模型权重之外的工程基础设施,包括指令、工具、环境、状态和反馈。把所有规则塞进超长提示词,反而可能稀释重点。更好的方式是给“地图”而不是“百科全书”:入口文件保持简洁,详细材料按需读取。
3. 视频的跨场景迁移是合理类比,不是课程官方适用范围声明
原项目定位是 AI coding agents 的工程课程。视频把五层迁移到自学和市场调研,是作者基于任务结构做的二次抽象,具有启发性,但不应写成“课程官方专门教授自学和市场调研”。
4. 五层不是独立抽屉,而是互相耦合
例如“完成标准”既属于任务规范,也会变成验证反馈;“最小阅读量”属于上下文供给,但通常由 Instructions 指引;权限属于工具访问,也影响环境可复现性。诊断时可以分层,设计时必须看接口。
5. 验证不能只靠同一个 Agent 自评
官方材料强调测试等可执行证据,并提到将执行者与检查者分离的思路。对于高风险任务,可采用 maker-checker:一个 Agent 生成,另一个独立检查;再配合确定性测试、人审或外部数据,而不是让同一模型用不同措辞重复确认自己。
6. 项目规模与热度已核查,但星标是动态值
项目 README 在核查时显示 14 讲、8 个项目、15 种语言、MIT License;GitHub API 返回星标 11145,而任务采集记录约为 11.4k。两者可能来自不同抓取时点或前端近似展示,因此公开表述采用“约 1.1 万”,不把动态数字写成永久事实。
十一、关键区分:模型能力 vs. 系统可靠性
| 维度 | 模型能力 | 系统可靠性 |
|---|---|---|
| 核心问题 | 它会不会做? | 它能否稳定把这次任务做完并证明做对? |
| 典型因素 | 知识、推理、代码、视觉、多语言、上下文处理 | 规范、上下文、工具、环境、反馈、状态、权限与流程 |
| 典型症状 | 看不懂任务本质、无法进行所需推理、缺少模态能力 | 漏步骤、用错数据、跑不了工具、提前宣布完成、跨轮次失忆 |
| 改进方式 | 换更适合或更强的模型、微调、专门模型 | 改任务定义、补上下文、修环境、加验证、持久化状态 |
| 验证方法 | 标准化能力基准、同条件模型对比 | 固定模型,逐项修复/移除 Harness 组件并记录任务成功率 |
一个实用判断法:
同一个模型在信息齐全、工具可用、标准明确时能做对,而换个任务现场就失败,多半是 Harness 问题;在这些条件都满足后仍持续无法完成核心推理,才更像模型能力瓶颈。
这不是绝对分界,但足够指导低成本排查。
十二、四角度反思:学完以后具体做什么
角度一:对“我们”的帮助
最大的价值,是把“AI 又做砸了”从情绪判断变成可复盘的故障单。以后任何长期任务,都先附 Harness 五问卡;失败后不写“模型不行”,而是标注故障层和证据。
具体动作:
- 所有复杂任务开工前,补齐交付物、最小上下文、工具条件、验收方式和状态落点;
- 复盘表新增“失败归因层”,连续统计一个月,找出最常见缺口;
- 高价值流程做成可复用模板,不再靠每次临时提示。
角度二:对 AI 助手工作流(橙子)的帮助
这套框架要求 AI 助手从“会回答”升级为“会完成并举证”。不能把生成了一段文字当成交付;凡是能运行、能核验、能落盘的任务,都要实际执行并报告证据。同时,结束前必须留下未验证点和可恢复状态。
具体动作:
- 接任务时先识别五层缺口,不盲目开始生成;
- 把“已写”与“已运行”“已验证”分开报告;
- 遇到工具失败时如实降级,不能把未跑通链路写成已完成;
- 长任务采用生成者—检查者分离,降低自评偏差。
角度三:对公考 / AI 电商机构的帮助
不虚构机构数据,仅看通用场景,Harness 可以直接改善内容、教研、客服和电商调研的稳定性。
公考场景动作:
- 教研任务明确题型、考点口径、来源年份、答案标准和复核人;
- AI 出题后必须经过答案唯一性、难度、事实时效和解析一致性检查;
- 学员学习记录采用“掌握/薄弱/错因/下一练习”状态,而不是只保留聊天记录。
AI 电商场景动作:
- 素材拆解明确目标平台、品类、受众、转化阶段和交付表头;
- 市场数据保留来源、抓取时间和可信度,避免把平台动态数据当永久事实;
- 文案生成后检查禁限词、商品事实、价格时效和品牌语气;
- 将选题—脚本—审核—投放—反馈变成状态可追踪的闭环。
角度四:对未来发展的帮助
模型能力会继续提升,但系统可靠性不会自动出现。模型越能做长任务,状态漂移、权限边界、验证成本和多 Agent 协作反而越重要。竞争优势会从“谁先用上新模型”,逐步转向“谁有更好的任务规范、私有上下文、评测集、反馈回路和可恢复工作流”。
具体动作:
- 提前积累真实任务评测集,而不是只看公开榜单;
- 把组织经验写成可被 Agent 读取的结构化规则和样例;
- 建立可观测性:每次运行记录输入、关键动作、验证结果和失败原因;
- 从单 Agent 提示词,逐步升级到 maker-checker 循环,再按必要性进入多 Agent/图工作流,避免过度编排。
十三、值得借鉴清单
内容表达上
- 反常识核心:用“模型更强 ≠ 执行更可靠”制造认知张力;
- 外部资源 + 自己判断:不是只丢链接,而是提炼最值钱的原则;
- 连续两次迁移:用自学、调研证明框架可跨领域;
- 板书分层:蓝色写结构、红色写结论、深色表格做总结;
- 最后回收成五问:让观众带走一张可以立即使用的检查表。
方法论上
- AI 失败先分层,不先甩锅模型;
- “完成标准”必须可检查;
- 上下文追求最小充分,不追求无限堆料;
- 工具、环境和权限在开工前验证;
- 状态要让下一轮或另一个人接得上;
- 对高风险结果采用独立检查者和外部证据;
- 用固定模型做对照实验,评估 Harness 改造的边际价值。
十四、30 天落地建议
第 1 周:做一次故障盘点
- 选取过去 10 个 AI 失败任务;
- 按任务规范、上下文、环境、验证、状态进行主因/次因标注;
- 找出出现频率最高的一层;
- 建立一个最小 Harness 五问模板。
**周末交付:**失败归因表 + 五问模板 v1。
第 2 周:补最便宜、回报最高的验证层
- 给三类高频任务分别定义完成标准;
- 能自动化的加确定性检查,不能自动化的加人工清单;
- 要求 AI 交付时附证据和未验证点;
- 随机抽查“自称完成”与“真实完成”的差距。
**周末交付:**三套验收清单 + 一周误报记录。
第 3 周:建立上下文与状态标准
- 每类任务只保留最小充分上下文入口;
- 将背景、样例、规则和数据源分开管理,按需读取;
- 统一状态字段:已完成、进行中、阻塞、证据、未验证、下一步;
- 做一次中断恢复测试,让另一个执行者接手。
**周末交付:**上下文地图 + 状态模板 + 接力测试结果。
第 4 周:固定模型做对照实验
- 选择一个重复性高、可验收的真实任务;
- A 组用旧流程,B 组用完整五问;
- 固定模型和核心任务,比较完成率、返工次数、人工介入次数、耗时和成本;
- 根据失败记录补最薄弱层,而不是继续增加提示词长度。
**30 天最终交付:**一份 Harness v1、对照实验数据、前三大故障模式和下一月改进项。
不要一开始就建庞大平台。先证明一个模板能减少返工,再逐步自动化。
十五、未验证点与阅读提醒
- 视频中“很多头部 AI 公司如何使用 Harness”的说法是概括性表达;原课程确实引用 OpenAI、Anthropic 等一手资料,但本文没有逐家公司验证其所有内部实践。
- 视频将五层迁移到自学与市场调研,属于作者的应用性扩展,并非原课程官方明确声明的全部适用范围。
- 逐字稿的“头部 AI 公司”“这一章”等少量词组来自语境校正;因 SenseVoice 未跑通,未获得第二条独立 ASR 全文轨进行逐词交叉比对。
- 10 秒抽帧无法验证所有转场细节和每一帧屏幕文字;本文只描述联系表中可辨认的主要视觉结构。
- 互动量、粉丝量和 GitHub stars 都是动态数据。文中仅保留采集/核查时点快照,不代表当前值。
- Lecture 02 页面中的案例数据和课程自述,本文只用于说明课程观点;若要将其中具体成功率或成本数字用于商业决策,应继续追溯原始实验记录。
十六、来源链接
视频与项目
- 抖音分享链接:https://v.douyin.com/Ex58O_XJtwE/
- 原始项目:https://github.com/walkinglabs/learn-harness-engineering
- 项目 README:https://raw.githubusercontent.com/walkinglabs/learn-harness-engineering/main/README.md
- GitHub 仓库 API:https://api.github.com/repos/walkinglabs/learn-harness-engineering
- Lecture 02(英文):https://walkinglabs.github.io/learn-harness-engineering/en/lectures/lecture-02-what-a-harness-actually-is/
- Lecture 02(简体中文):https://walkinglabs.github.io/learn-harness-engineering/zh/lectures/lecture-02-what-a-harness-actually-is/
课程列出的核心延伸阅读
- OpenAI, Harness engineering: https://openai.com/index/harness-engineering/
- Anthropic, Effective harnesses for long-running agents: https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents
- Anthropic, Harness design for long-running application development: https://www.anthropic.com/engineering/harness-design-long-running-apps
结语
这条 172 秒的视频,真正贡献的是一个简单但高杠杆的判断:
AI 的失败,不要默认归因于“模型不够强”;先判断任务有没有被工程化。
模型能力是发动机,Harness 是方向盘、仪表盘、道路规则、维修记录和验收站。发动机更强,当然重要;但没有后面这些,车只会更快地开向错误的地方。
下一次 AI 对你说“已经完成”,先别问“要不要换更贵的模型”。先问五件事:完成长什么样、它知道什么、它能用什么、如何证明做对、下一轮怎么接上。能把这五问持续做实,才是从“会用 AI”走向“能让 AI 稳定交付”的分水岭。