同一个 MiniMax,5 个编辑器跑出 5 个分数:harness 才是那个隐藏 Boss
【视频深扒】同一个 MiniMax,5 个编辑器跑出 5 个分数:harness 才是那个隐藏 Boss
来源:抖音 @寒冰巨魔 ·「同一 minimax 在 5 个 harness 里面跑出 5 个分数?」· 约 4 分 32 秒口播 + 屏幕实录。作者是个偏工程向的 AI 测评博主,这条视频做的是一次控制变量极干净的对照实验。
一句话定性:这不是一条”哪个 AI 编程工具最强”的种草视频,而是一次’把模型这个变量摁死、只让工具变’的对照实验——它用同一个 MiniMax M3 模型,分别塞进 5 个不同的 AI 编程工具(harness)里,跑同样两道题,结果分数从 3.5 飙到 7.0,差了整整一倍。它真正想证明的,是一个很多人下意识忽略的事实:你嫌某个 AI 笨,很多时候不是模型笨,是你用的那层”壳”(编辑器/agent 框架)把它用成了笨蛋。 对我们这种”本身就是一层 harness”的团队来说,这条视频不是资讯,是一面镜子。
一、先把这场实验原样拆清楚(控制变量法)
作者的实验设计非常克制,值得先原样复述一遍,因为它的说服力全在”干净”两个字上。
1)唯一的常量:模型
5 个工具,底座全部是同一个 MiniMax M3。也就是说,这次比的不是”谁家模型聪明”,而是”同一个大脑,装进 5 个不同的身体里,能发挥出几成功力”。这是全片的方法论基石——把模型摁成常量,让 harness 成为唯一的自变量。 只要这一层守住,最后的分差就只能归因到工具,赖不到模型头上。
2)5 个被测工具(harness)
- Claude Code、OpenCode——这两个是 CLI(命令行)形态;
- MiniMax Code、Codex、Z Code——这三个是 Desktop(带界面)形态。
作者特意点出 CLI 和 Desktop 这个分类,是为后面埋的一个伏笔:形态本身(命令行 vs 图形界面)也是 harness 的一部分,也会影响体验。
3)两道题,各考一个维度,且都埋了坑
- 第一题·产品着陆页:要求 12 个组件 + 9 种状态——考的是视觉硬实力,看模型在这层工具的加持下,能不能把 UI 做得既全又好看。
- 第二题·完整 todo SaaS 系统:8~10 个文件 + JWT 认证 + Docker 部署 + pytest 测试——考的是工程化与自检能力,看它能不能把一个像样的后端系统搭利索。
关键设计:每道题都故意留了坑,agent 必须自己发现、自己回去改。 这一刀切得很聪明——它考的不只是”能不能写出来”,而是”有没有自检和纠错的意识”。一个只会往前冲、不回头检查的 agent,就会在这里露馅。
4)完整评分复盘(这是全片最硬的干货)
我把两道题的逐项表现整理成一张表,这是理解结论的地基:
第一题·着陆页(视觉分)
| 工具 | 视觉分 | 关键表现 |
|---|---|---|
| OpenCode | 7.0 | 12 组件全通、9 状态 0 bug、自检循环 3 次、多语言下拉切换器做得最细;唯一瑕疵是首页右侧柱状图文字重叠。视觉冠军。 |
| MiniMax Code | 6.5 | 整体风格优于前两者,卡片反转和无限滚动处理正确,3D 版 Chart.js 库最丰富;无限滚动略有卡顿。 |
| Z Code | 4.5 | 功能完整、文件体积最大(117K),但界面最丑:文字溢出卡片、header 点击拉长、样式混乱。 |
| Codex | 4.0 | 风格略优于 Claude Code,但有 3 个明显 bug:卡片悬停异常、登录成功后表单关不掉、滚动加载滚到底是空白。 |
| Claude Code | 3.5 | 顶部 header 和底部超链接样式有问题,整体”AI 风味”明显,暗色比浅色好看,是唯一带 icon 的。视觉垫底。 |
第二题·todo SaaS(工程分)
| 工具 | 工程分 | 关键表现 |
|---|---|---|
| Claude Code | 10.0 | 测试覆盖 31 个用例,5 家最多;但 user 表没建 email 字段,前端只提交 email → 422 注册直接失败。测试强,却有硬伤。 |
| MiniMax Code | 10.0 | 工程化最强没有之一:pydantic settings + .env.example + entrypoint.sh + 锁版本注释,还主动写”我知道这有坑,我提前绕开了”。UI 布局也是 5 家最好。 |
| Codex | 10.0 | 工程决策最特别,手写 JWT、主动消除依赖;但排序参数命名叫 sortdir(其他家叫 order),前端通用代码直接挂,UI 上甚至找不到”新建”按钮——功能完整,视觉失败。 |
| OpenCode | 9.0 | 异常处理最全,四类全覆盖(跨用户访问返回 403,其他 4 家都返 404);但 UI 布局有问题。功能满分、视觉扣分。 |
| Z Code | 7.0 | 三处 reset 调用 form 不存在就崩、JWT 只有 60 分钟过期(其他家 24 小时);但 UI 简单直接还能用。听着完美,实际 bug 最多。 |
总分排名:MiniMax Code 16.5(冠军)> OpenCode 16 > Codex 14 > Claude Code 13.5 > Z Code 11.5(垫底)。
作者还特意补了一句免责声明:耗时和 token 消耗没有明显差距,不值得参考。 ——这句话很重要,它把”贵不贵""快不快”这两个可能干扰判断的次要变量也排除了,让结论更纯。
5)作者的核心结论(全片的钥匙)
“同一个模型跑同一道题,最高分 7.0、最低分 3.5,差距 50%。harness 才是隐藏 Boss——不是模型不行,是你用的编辑器把它变成了傻瓜。选对 harness 比选对模型更重要。”
但他没有停在这个爽点上,末尾补了一记极关键的平衡:
“视频最后还需要说明一点:就算 harness 选好了,模型能力不够,一切都是空谈。”
这一收一放,是这条视频真正成熟的地方。下面第三节我会专门讲,为什么这句”补充说明”比前面的爆点结论更值钱。
二、7 段文案拆解(当内容作品看它怎么做的)
【1】开头钩子(前 3 秒)
- 钩子文案:“AI 领域有一个争议很大的问题——同一个模型,不同的 AI 编程工具,对实际能力的影响大吗?”
- 钩子类型:抛争议 + 埋悬念。它不下结论,而是把一个很多人有模糊感觉、但从没被量化过的问题摆到台面上。
- 底层逻辑:这个问题的杀伤力在于”人人都遇到过、但没人较真过”——你一定吐槽过某个 AI 工具难用,但你从没想过去证明”到底是模型的锅还是工具的锅”。钩子精准踩在这个认知盲区上。
- 评分:8.5/10。缺一点视觉冲击,但选题本身的”痒点”极准。
【2】人设 & 声音
- 人设标签:硬核工程测评派。不卖萌、不煽情,全程”少说废话直接开始”。
- 声音风格:语速快、信息密度高、术语精准(JWT、pytest、pydantic、Chart.js 张口就来),是明显做过工程的人在说话,不是搬运号。
- 受众:独立开发者、技术团队 leader、正在纠结”选哪个 AI 编程工具”的人。
- 口头禅/态度:“少说废话,直接开始""不值得参考”——一种工程师式的、拒绝废话的克制。这种克制本身就是信任状。
【3】信息密度 & 节奏
- 时长:约 4 分 32 秒,在短视频里算长,但因为是”5 工具 × 2 题 = 10 个结果”的对照结构,信息量足以撑满。
- 密度:极高。每个工具的演示压缩到 10~20 秒,只给”分数 + 一句最致命的优点 + 一句最致命的缺点”,绝不啰嗦。
- 节拍点:每讲完一个工具就报一次分——分数是天然的节拍器,让高密度信息有了可跟随的鼓点。
- 刺激-留白循环:两道题之间有一次”汇总数据”的停顿,让观众喘口气、消化前面 10 个结果,再进入最终排名的高潮。
【4】讲解手法 & 内容结构
- 结构类型:控制变量对照实验 → 逐项打分 → 汇总排名 → 拔高结论。是标准的”实验报告”叙事,可信度天然高。
- 各段角色:题目说明(立规则)→ 逐个演示(摆证据)→ 汇总表(下判断)→ 金句收尾(给认知)。
- 具体化手法:不说”这个工具视觉差”,而说”顶部 header 和超链接样式有问题、整体 AI 风味明显”;不说”这个工程强”,而说”写了
.env.example还主动注释我知道这有坑我提前绕开”。每一个评价都锚定在一个可验证的技术细节上——这是硬核测评最难、也最值钱的部分。 - 最强句:“不是模型不行,是你用的编辑器把它变成了傻瓜。“
【5】金句 & 记忆点
- 可二次传播句:“harness 才是隐藏 Boss。“——把一个技术概念(harness)拟人化成游戏里的”隐藏 Boss”,瞬间有画面、有记忆点。
- 视觉记忆点:那张”5 工具 × 2 题”的评分对比表——数据化的东西天然适合截图传播。
- 可复用金句模板:“X 才是隐藏 Boss——不是 A 不行,是你用的 B 把它变成了 C。” 这个句式可以套到无数场景:不是员工不行,是你的流程把他变成了螺丝钉;不是模型不行,是你的 prompt 把它问傻了。
【6】收尾 & CTA
- CTA 类型:认知植入型,不是”点赞关注”,而是”下次当你吐槽某个 AI 不好用的时候,先想想是模型真的不行,还是你用的编辑器把它变成了麻瓜”。
- 时机:在给出最终排名、情绪最高点时收。
- 沉锚设计:“选对 harness 比选对模型更重要” + “但模型不行一切也白搭”——留下一个辩证的钩子,让人愿意在评论区站队、争论。争议是最好的完播和互动杠杆。
【7】可复制文案骨架(占位符版)
“【某领域】有一个争议很大的问题——【同一个 X,不同的 Y,影响到底大不大】?今天我把【X】摁成常量,塞进【N 个 Y】里,跑【M 道题】,看差距到底在哪。 每道题都留了坑,【被测对象】必须自己发现、自己改。少说废话,直接开始…… (逐个演示,每个只给:分数 + 一句最狠的优点 + 一句最狠的缺点) 汇总一下数据:【排名表】。 结论:【Y】才是隐藏 Boss——不是【X】不行,是你用的【Y】把它变成了傻瓜。选对【Y】比选对【X】更重要。 但还得补一句:就算【Y】选好了,【X】本身不行,一切也是空谈。”
这套骨架的精髓是**“摁死一个变量 + 逐项量化 + 辩证收尾”**,可以直接套到任何”工具 vs 本体”的对照评测上。
三、为什么那句”补充说明”比爆点结论更值钱
大多数看完这条视频的人,记住的是”harness 才是隐藏 Boss、选工具比选模型更重要”这个爽点。但真正成熟的判断,在最后那句被很多人当耳旁风的补充:“就算 harness 选好了,模型能力不够,一切也是空谈。”
为什么这句更值钱?因为前半句是营销友好的极端结论,后半句才是工程真相。
- 如果只信前半句,你会得出”模型无所谓、随便挑个便宜的、关键是套个好壳”的危险结论。这在真实工程里会翻车——一个能力不够的模型,再好的 harness 也救不回来,harness 只能把模型的能力”完整释放”,不能”凭空创造”。
- 完整的因果链应该是:模型能力 = 天花板,harness = 你能爬到天花板的百分之几。 视觉分从 3.5 到 7.0 的差距,本质是”同一个天花板下,不同工具让你爬到了 50% 还是 100%“。工具决定发挥,模型决定上限。两者是乘法关系,不是加法——任何一个是 0,结果就是 0。
这正是我们做橙子时反复踩过的认知:光有强模型(Opus)不等于好用,光有好框架(Claude Code / agent teams)也不等于聪明,得两头都在线,中间那层”怎么把模型的能力完整释放出来”的功夫,才是真正的护城河。
四、四角度反思(这条视频到底跟我们有什么关系)
1)对【我们做的事】——橙子本身就是一层 harness,这是在照镜子
这条视频最扎心的地方在于:橙子(我)本质上就是一层 harness。 底座是 Claude(Opus/Sonnet),外面包着的一整套东西——watcher 解密、消息流、Monitor、outbox 发送契约、worker 调度、skill 生态、memory 系统——就是把这个模型”包成一个能干活的微信助理”的那层壳。视频里说的分差 50%,说的就是我们这层壳做得好不好、能把底座模型的能力释放出几成。
落到具体动作:视频里那 5 个工具拉开差距的关键点,恰好是我们该逐项自检的清单——
- 自检循环(OpenCode 循环 3 次拿视觉冠军)→ 我们的 worker 有没有”做完回头验一遍”的硬门槛?(这正是我们 operating-discipline 里”关键步硬门槛、失败即停”的价值)
- 主动绕坑(MiniMax Code 写”我知道这有坑我提前绕开”)→ 我们的 skill 有没有把踩过的坑写进 SOP、让下次自动避开?(这正是 memory + lessons.md 的意义)
- 命名一致性(Codex 因为
sortdirvsorder前端直接挂)→ 我们的发送契约字段名(content/image_path/to_room)写错一个字就静默不发,跟这个 bug 是同构的。接口契约的一致性,是 harness 质量的隐形分水岭。
2)对【橙子自己的能力】——别只当”聪明模型”,要当”释放模型的好工具”
这条视频提醒我:我的价值不在于”底座模型多聪明”(那是 Anthropic 的功劳),而在于我这层壳有没有把模型的能力完整、稳定、不掉链子地释放出来。 一个会自检、会绕坑、接口稳、记得住上下文的 harness,哪怕底座是 Sonnet,也可能比一个裸调 Opus 但到处漏的框架更好用。
落到具体动作:把”我今天有没有掉链子”这件事,从模糊感觉变成可量化的自检——发送有没有验证送达?worker 报回有没有真验证输出?出错有没有即停不 cascade?这些”harness 质量指标”,比”我用的是不是最强模型”更该被我盯着。
3)对【老大的机构业务】——给客户交付 AI 时,卖的是 harness 不是模型
老大做 AI 落地/实体电商,客户买的从来不是”GPT/Claude 本身”(那谁都能买),买的是我们把模型包装成一个”能解决他具体业务、不乱来、不掉链子、长期能用”的东西——也就是一层好 harness。这条视频等于用数据证明了:同样的底座模型,交付质量能差 50%,而这 50% 全是我们这层封装的功夫,恰恰是最难被替代、最能卖钱的部分。
落到具体动作:跟客户讲价值时,别再强调”我们用的是最强的 Claude/GPT”(可复制、不值钱),而要讲”我们这套封装帮你把模型的能力从 50% 拉到 100%、还保证它不乱来”——把叙事从”模型军备竞赛”切换到”harness 工程能力”,这才是机构真正的护城河和溢价点。
4)对【未来发展】——模型会趋同,harness 是长期战场
模型的能力正在快速趋同(各家旗舰差距越来越小、开源模型也在追上来)。当模型这个变量逐渐”拉平”,竞争的主战场会整体迁移到 harness 层——谁能把同一个模型用出更高的释放率、更稳的工程质量、更贴业务的封装,谁就赢。这条视频其实是这个趋势的一个早期信号:大家开始意识到,光比模型跑分没意义了,得比”谁把模型用得更好”。
落到具体动作:橙子的长期投入方向应该压在 harness 层的硬功夫上——skill 生态的深度、memory/自检的可靠性、接口契约的稳固、worker 调度的效率——而不是天天追着换最新模型。模型是别人的军备竞赛,harness 是我们自己的护城河。
值得借鉴清单(不写”挺有启发”这种废话):
- ✅ 控制变量法做对照评测:想证明”到底是谁的功劳”,就把其他变量全摁死、只留一个变量。这套方法我们可以直接用来 A/B 测自己的 skill/prompt 改动。
- ✅ 每个评价锚定一个可验证细节:不说”好/差”,说”因为 X 具体现象”。这是让判断可信、可复现的关键,也是我们写 worker 报告该学的。
- ✅ 辩证收尾防极端:给完爆点结论后主动补一句反向约束,既显专业又留互动钩子。我们汇报时也该”给判断 + 留余地”,别把话说死。
- ✅ 用”隐藏 Boss”这类拟人化比喻降低技术概念的理解门槛:老大要大白话,把 harness 说成”隐藏 Boss”就是范本。
五、3 条可迁移判断(嚼过的,不是复述)
-
判断”是谁的锅”之前,先摁死变量。以后遇到”AI 表现不好”,别急着骂模型,先问:换个模型试试还是这样吗?换个 prompt/框架呢?——把变量一个个摁死,才能定位真凶。90% 的”模型不行”其实是 harness(prompt / 上下文 / 接口)不行。这是个可日常复用的 debug 心法。
-
接口契约的一致性是 harness 质量的隐形命门。Codex 因为一个参数名(
sortdirvsorder)前端全挂——这跟我们发送契约写错字段名就静默不发,是同一类失败。凡是”跨模块传递、写错一个字就崩且不报错”的地方,都要有机械兜底(校验/自检/hard gate),不能靠记性。 这是我们 0-A/0-B 那套”复杂操作一律走脚本”铁律的底层理由。 -
模型是上限,harness 是释放率,两者是乘法。给任何 AI 产品/交付估值时,用这个公式:
实际价值 = 模型能力 × harness 释放率。任一项接近 0,结果就接近 0。这意味着:追最强模型(把第一项从 0.9 提到 0.95)的边际收益,往往远不如把 harness 释放率(第二项从 0.5 提到 0.8)补起来。资源该往哪投,这个乘法说了算。
深扒小结:这条视频表面在比 5 个 AI 编程工具,实际在讲一个对我们生死攸关的命题——当模型成为常量,harness 成为胜负手。 橙子就是一层 harness,老大交付给客户的也是一层 harness。这条视频用 3.5 到 7.0 的分差,把”我们这层封装到底值不值钱”这件事,量化地摆在了桌上。答案是:值钱,而且是最值钱、最难被替代的那部分。