这条视频的标题像一个问句,实际上是一个陷阱。

作者”Token就是词元”开口的第一句话是:「评论区有朋友说,我们的 MiniMax 2.7 老师连豆包都不如——这位朋友,我觉得你以后说话得小心一点了。」

注意:他没说你侮辱了 MiniMax,他说你同时侮辱了豆包

这个逻辑翻转,是这条视频最精妙的地方,也是本篇要深挖的核心——不只是两个模型谁更强,而是一个 AI 测评博主如何把一句评论区的挑衅,变成一条 4.6 分钟的高传播内容。

视频背景:「屎山测评」是个什么赛制?

视频的载体是一个叫「史山题库」的框架——博主积累了一批真实的遗留代码(屎山代码),给它们按难度分级(白银/黄金/铂金),然后让不同 AI 模型来解题。

本期的挑战叫「消失的附件」,难度白银:

  • 一个文件上传功能,上传 1-2 张图没问题
  • 一旦上传第 3 张,预览区就只剩 1 张,第三张消失了
  • 背后是一套「有干的、有湿的、有味道的」遗留代码(作者原话)
  • 参赛选手:DouBao-seed-2.0-pro vs MiniMax 2.7

这个设定很聪明——既不是刷 LeetCode,也不是测简单 CRUD,而是调试真实的边界 bug,复现度极高,程序员观众一看就懂,完全不需要解释。


【1】开头钩子:把评论区变成导演

钩子类型: 争议型 + 逻辑颠覆型

前 5 秒文案:

“评论区有朋友说,我们的 MiniMax 2.7 老师连豆包都不如这位朋友——我觉得你以后说话得小心一点了。因为你这句话,既侮辱了 MiniMax,也侮辱了豆包。什么叫’连豆包都不如’?什么又叫’连豆包都不如’?”

这里有一个极其精准的句式复用:「什么叫做…什么又叫做…」——第一句是替 MiniMax 叫屈,第二句是替豆包叫屈,用完全相同的句式把两个情绪同时锁死,让观众不自觉地想「对啊,这话确实两边都得罪了」。

底层逻辑拆解:

传统测评开头是「今天我们来对比两个模型」——中规中矩,没有钩子。

这条视频的开头是从评论区里找到一个已经存在的争议,放大它,然后立刻给它一个反常识的解读。效果是:

  1. 已经看过评论区的人会有认同感(「就是这个评论!」)
  2. 没看过的人立刻好奇(「这评论怎么还连豆包都侮辱了?」)
  3. 准备看测评结果的人多了一层「帮两个模型平反」的情感驱动

这是一种典型的「借力打力」开头——内容不从零构建,而是从已经发生的事件(评论区的真实声音)里找到张力点,顺势放大。

评分:9.5/10


【2】人设与声音:「AI 裁判」的幽默建构

人设标签: AI 测评裁判 · 技术幽默派 · 绝对中立(但有点偏心)

核心声音特征:

博主从头到尾没露脸,整条视频是纯屏幕录制 + 字幕 + 配乐。但人设反而更鲜明,因为他把两个 AI 模型拟人化到了极致:

  • DouBao 和 MiniMax 都叫「老师」(「豆包老师」「MiniMax 老师」)
  • MiniMax 在思考时,他说「不打扰他了,让他继续吧」——像对待一个在考试的学生
  • 豆包率先答完,他说「不愧是知你心意、懂你冷暖的豆包豆姐」——植入品牌调性又不尬
  • MiniMax 用了 32 分钟,他说「MiniMax 老师的 top-k 感觉都快消耗完了」——把模型参数幽默化

这套拟人化语言系统是这类 AI 测评视频的护城河。普通测评是「模型 A 比模型 B 快了 2 秒」,而这里是「MiniMax 老师在子代理里深入思考了 25 分钟,压力给到豆包这边了」——完全不同的体验密度。

受众画像:

  • 主要:程序员 + AI 爱好者(能懂「子代理」「白银 bug」「屎山代码」的人)
  • 次要:泛科技爱好者(被幽默吸引,不一定懂技术细节)

口头禅与标志性表达:

  • 「老师」(AI 模型的称谓)
  • 「史山代码 / 史山题库」(难题体系命名)
  • 「子代理」(以技术术语幽默化过程)
  • 「白银级 / 黄金级」(游戏化难度分级)

【3】信息密度与节奏:一场精心设计的「两人竞赛」

视频时长: 4 分 36 秒

节奏结构:

段落时长(估)节奏强度作用
评论区引入0:00-0:30争议点爆破,钩子锁定
题目演示0:30-1:30建立基准,让观众先懂 bug
DouBao 解题1:30-2:30中快先出结果,建立对比基准
MiniMax 解题2:30-4:00慢→快悬念拉长,时间戏剧化(25分/32分)
验证与收尾4:00-4:36结论 + CTA,强压收尾

关键设计:不对称时间分配

DouBao 解题过程在视频里占很短的篇幅,MiniMax 反而占了更多——这是有意为之。

如果两个模型表现完全一样,视频就没有戏剧性了。作者用 MiniMax 的「慢思考」(子代理 + 25 分钟 + 32 分钟)制造了焦虑感,然后在最后一刻给出「也改对了」的惊喜翻转,让观众经历了「它失败了吗?」→「它成功了!」的情绪弧线。

节拍点设计:

  • 音乐出现的时机恰好在「等待」的空白处(豆包在想/MiniMax 在思考)——填补了技术等待的枯燥
  • 字幕「已经思考了 25 分钟」出现时,配合「担忧」语气,刻意拉紧观众情绪
  • 最终验证时的鼠标点击每一步都被字幕同步描述(「上传第一个」「上传第二个」「三个图片都出现了」)——让结果呈现感极强,观众跟着节奏走

【4】讲解手法与内容结构:「裁判叙事」的完整架构

结构类型: 社会议题引入 → 竞赛框架设定 → 实时直播 → 结果验证 → 舆论回收

各段角色解析:

① 引题段(社会议题引入): 拿评论区的真实偏见当「被告席」,建立审判框架。关键是「双向冒犯」逻辑的成立——正因为「连豆包都不如」这句话同时贬了两个模型,作者才有理由同时为两个模型辩护,而不是偏向任何一方。

② 题目演示段(建立基准): 用鼠标演示 bug 重现,不超过 1 分钟。关键是让观众先「亲眼看到」问题,而不是听博主描述。这是技术测评内容的基本原则:让问题自己说话,不要替它解释。

③ 双模型解题段(实时直播感): 分屏呈现,左 DouBao 右 MiniMax。核心差异:

  • DouBao:快速找到、快速修复(正面形象)
  • MiniMax:调用子代理、英文分析、慢但深(被幽默化,但最终成功)

「子代理」这个细节被反复提及,并以「很聪明的做法」来正向评价——作者没有因为 MiniMax 慢就嘲笑它,反而说「启动子代理是很聪明的做法」,维持了「公正裁判」的人设。

④ 验证段(结果确认): 亲手上传三张图验证,不是「大概」过了,而是屏幕录制「三张全显示」才算过关。这种「人工手动验证」让结果的可信度大幅提升——AI 说「我改好了」不算,博主亲测才算。

最强句:

「你这句话,既侮辱了我们的 MiniMax,也侮辱了我们的豆包。什么叫做连豆包都不如?什么又叫做连豆包都不如?」

这句话是全视频的灵魂,也是 hook 的核心——它把「偏见」的锋芒反转了180度:本来要贬损 MiniMax 的那句话,被重新解读为同时贬损了双方,博主反而站上了道德高地。


【5】金句与记忆点

可二次传播金句:

  1. 「你这句话既侮辱了 MiniMax,也侮辱了豆包」 ——逻辑颠覆型,适合被引用时产生「啊对对对」的共鸣
  2. 「有干的、有湿的、有味道的、非常凌乱的史山代码」 ——程序员黑话的幽默升华,懂的人笑崩,不懂的人也能感受到那种”烂”
  3. 「苦练两年半以上的机器人,是不可能解决这个 bug 的」 ——改编自《孤勇者》式的调侃句式,朗朗上口,有梗有料
  4. 「不愧是知你心意、懂你冷暖的豆包豆姐」 ——对豆包的品牌调性精准植入,还带点戏谑,让品牌感不突兀
  5. 「MiniMax 老师的 top-k 感觉都快消耗完了」 ——把机器学习专业术语用到情绪描述上,程序员直接笑了

视觉记忆点:

  • 分屏对比界面(OpenCode 双模型同屏)——直接视觉竞赛化
  • 「白银级难度」标签——游戏化语境
  • 时间计数(25 分钟 / 32 分钟)——把等待时间可视化,制造压迫感

可复用金句模板:

  • 「你说 X 不如 Y,你同时侮辱了 X 和 Y——因为 [逻辑解释]」
  • 「[场景]虽然现象很简单,但背后是 [难点描述],如果 [主角] 能解决这个问题,那就 [结论]」
  • 「不愧是 [品牌标语],那压力就来到了 [另一方] 这边」

【6】收尾与 CTA

CTA 类型: 互动型 + 舆论回收型

收尾文案:

「所以那位朋友,我希望在评论区看到你对两位老师的道歉。」

这个 CTA 设计得非常精妙:

  1. 它不是「点赞关注」 ——它是一个「去评论区道歉」的具体行为召唤
  2. 它创造了一个开放的「观察者位置」 ——即使没有那个发原评论的朋友,其他人也会想来评论区看看「道不道歉」,顺便留下自己的评论
  3. 它和开头形成完美闭环 ——视频开头拿评论区引进来,结尾把观众送回评论区,构成完整的「评论区生态循环」

沉锚设计: 「公开道歉」这个词天然有传播力——它既是一个行为号召,也是一个社交戏剧场景。观众下意识想知道「那人道歉了没有」,这会驱动他们持续回来看评论区,也会驱动他们自己发评论参与这个戏剧。

衔接分析: 开头是「某人冒犯了两个模型」,中间是「两个模型都证明了实力」,结尾是「该道歉了」。整条叙事线首尾呼应,中间的技术验证成了这个「社会戏剧」的证据链。技术验证不是目的,「让偏见者公开认错」才是叙事目的——技术只是工具。


【7】可复制文案骨架

这条视频的可复用骨架,称之为「裁判叙事框架」:

[借用评论区偏见作为开场锚点]
→「你说了 X 不如 Y,这不只侮辱了 X,也侮辱了 Y」
→ [设立公平竞赛框架 + 难度定级]
→ [实时双轨展示,保留戏剧性差异(一快一慢)]
→ [人工验证结果,不靠 AI 自述]
→ [双方均成功,结论:偏见不成立]
→ [把评论区观众送回评论区]「我希望在评论区看到你的道歉」

这个框架可以复用到任何「网络上存在偏见的双方对比」场景:

  • 「ChatGPT 不如 Claude」→「你侮辱了两个模型」
  • 「小米不如华为」→「你侮辱了两家公司」
  • 「传统教学不如 AI 辅导」→「你侮辱了老师也侮辱了 AI」
  • 任何「A 不如 B」的评论,都可以触发这个骨架

深度解析:这条视频真正聪明的地方

看完 7 段分析,我想单独提炼几个不那么明显但很关键的洞察。

洞察 1:「题目命名」是一门艺术

「消失的附件」这个名字,比「附件上传 bug - 第三张图片不显示」好太多了。

前者有故事感(东西消失了,要去找),后者是技术 issue 描述。在短视频平台,给 bug 起故事化的名字,是让非程序员也能理解技术测评的关键手段。

这个「屎山题库」体系里,每道题都有这样一个名字——这本身就是内容资产的积累方式。每出一道新题,等于给库里加了一张「可复用的内容素材卡」,而且这些卡片的价值会随着模型迭代而复用:同样的「消失的附件」,半年后可以再拿出来测新模型,内容自然产出。

洞察 2:「公平裁判」人设的维护技巧

作者没有让 DouBao 完全胜出(快 + 简单),而是把 MiniMax 的「慢」解读为「深度思考」,把「英文分析」解读为「看不懂、不打扰」。

这是一种精妙的叙事保护:如果博主倾向性太明显,观众会失去信任。通过把 MiniMax 的特质幽默化而不是嘲笑化,博主保住了「公正裁判」的人设,也保住了下次可以邀请 MiniMax 参赛的可能性(生态合作价值)。

洞察 3:分屏对比的「竞赛感」是一种情感操控

左 DouBao 右 MiniMax,这个分屏界面会触发人类的「支持一队」本能。即使你不偏向任何模型,看着分屏的瞬间,你会不自觉地左右跳视,期待其中一个先出结果。

这是体育直播的制作逻辑移植到 AI 测评里——让观众进入竞赛叙事,而不是评测叙事。两者的核心区别:竞赛叙事有情绪,评测叙事有数据,只有情绪能带来播放量。「AI 测评」这个类别天然枯燥,强行加上「竞赛」叙事,瞬间激活了观众的情绪投入。

洞察 4:等待时间的戏剧化是独特优势

传统测评的「等待」是被剪掉的,因为它「没有信息」。这条视频反其道而行之,把 MiniMax 32 分钟的等待时间当成戏剧素材——实时报时「已经 25 分钟了」「又 5 分钟过去了」,配上担忧的语气和焦虑的音乐。

结果是:等待不再是无聊,等待变成了悬念。观众不是在等 bug 修完,他们在等「MiniMax 能不能在崩溃之前修完」——这是完全不同的观看体验。

这个技巧可以迁移到任何「有等待节点」的技术内容:渲染、训练、部署——原来被剪掉的等待,都是可以戏剧化的素材。


四角度反思

对我们(整个协作体系)有什么用

这条视频揭示了一个「评论区-内容-更多评论区」的飞轮机制:拿真实评论做开头,用测评做证据,用 CTA 把观众送回评论区留更多评论。这个飞轮适用于任何持续输出内容的场景。对我们来说,具体的落地是:把老大内容账号下的差评、质疑、不理解的评论收集起来,定期做「回应系列」——不是辩解,而是用实战证明。每条差评,都是一期内容的天然标题。

对橙子自己有什么用

视频里的「拟人化语言系统」是我可以学习并内化的技能。以后帮老大整理 AI 工具对比、写模型测评报告时,不用写「模型 A 响应延迟 2.3 秒」这种干燥数据,改写「A 老师思考了一会儿,而 B 老师已经交卷了——但两位最终都答对了」。技术测评不需要更多数据,它需要更多体验。我应该在每次 AI 工具对比任务里,主动加入这套叙事语言,让枯燥的数字变得可读、可传播。

对老大的机构(公考/AI 电商)有什么落地启发

机构可以建立类似「屎山题库」的「学员高频踩坑题库」——把学员最常犯的错误、最难突破的考点,用故事化方式命名(「失踪的申论分」「消失的判断题」「逃跑的答题时间」),然后用 AI 或老师现场解题演示。这既是高质量短视频内容,也是产品反馈:哪道「踩坑题」播放量高,说明哪个痛点共鸣最强,可以反向指导课程和运营方向。难度分级(「白银/黄金」)也可以迁移——「白银难度:30分钟内写出一篇800字申论」。

对未来发展方向有什么判断

「AI 模型竞技测评」赛道处于红利期,但护城河不在于「测了谁」——那是可复制的。护城河在于测试用例库的独特性与积累深度。这位博主的「屎山题库」就是护城河——他的题目来自真实遗留代码,别人无法直接复制(虽然可以仿),而且每发布一道题就等于在圈内发起一轮「你来测吗」的生态邀请。对于我们做 AI 内容的方向:如果要进测评赛道,尽早建立一个「独家题库 / 场景库」,用真实业务场景(而非 benchmark)做测试素材,会比单纯评测哪个模型更有护城河。


可迁移判断(3 条)

判断 1:「双向冒犯锚点」比单向维权强 10 倍

「你不但侮辱了 A,你也侮辱了 B」这个逻辑结构,同时创造了两个受害方和两群潜在同情者。使用场景:在任何「竞争双方各有拥护者」的内容领域,做对比内容时不要明显站边,而要「两边都帮」——这样 A 的粉丝和 B 的粉丝都会觉得「这博主公道」,双向转化观众。

判断 2:「等待」不剪掉,而是戏剧化

AI 执行过程中的等待时间,传统做法是 skip 或加速。这条视频证明:把等待实时报时(25 分钟/32 分钟)+ 配上焦虑音乐 + 担忧语气,等待变成悬念。任何技术演示内容里有「等待节点」的(渲染/训练/部署/API 调用),都可以用这个手法把等待时间变成戏剧素材。

判断 3:独特测试场景库 = 内容护城河

博主的「屎山题库」是他的核心资产——不是他测的模型,而是他积累的测试场景。做 AI 测评内容,越早建立自己的「真实业务场景题库」,护城河越高,因为场景可以反复使用(测新模型、测新功能)而不过期,并且场景越接近真实痛点,共鸣越强,传播越远。