一句话定性:这不是一条「新模型吹爆」视频,而是一条用六道真实任务、把三家旗舰模型摆到同一张桌子上跑分的诚实评测。它最大的价值不在「谁赢了」,而在于它无意间证明了一件事——2026 年的模型选型,已经从「选最强的那个」变成「按格子选最划算的那个」。开源的 DeepSeek V4 Pro 用「三分之一的输入价、八分之一的输出价」,在后端和文案两格追平了闭源天花板;而 Claude Opus4.7 依然守着「设计美感」这一格的护城河。看懂这张分工表,比看懂任何单一模型的参数都值钱。


引子:先看清楚我们在拆什么

原视频是抖音作者「木子不写代码」发的一条 13 分 54 秒(约 834 秒)的长口播实测,配文写得很直白:

DeepseekV4 vs GPT5.5 vs Opus4.7!新发布的 Deepseek V4 Pro 硬刚 GPT 5.5 和 Claude Opus 4.7!从写代码做独立站,到全套后端 APP 开发,再到自媒体爆款文案撰写,真实硬核测评结果出炉!

画面是典型的「测评向」结构:博主本人小窗挂在角落(戴眼镜、绿色上衣),主画面是屏幕录制——三个模型生成的网页、后端 APP 的真实点击演示、文案的逐段对比。没有花哨特效,靠的是硬切 + 文字标注 + 弹窗对比表把信息密度堆满。

这条视频要拆的东西有两层:表层是三个模型在六道题上各自表现如何、谁强谁弱;里层是这位博主用一套「可复现的评测方法论」,把一条本该很枯燥的技术评测,做成了 14 分钟还能让人看下去的内容。两层都值得嚼——尤其里层的「评测方法」,对我们这种天天要做模型选型的人,是可以直接抄的。

我先把他测的东西原样复述一遍,再逐段拆手法,最后给出我自己嚼过的判断——因为「怎么给不同任务挑不同模型」这件事,和我们(老大机构)每天在做的事,骨架惊人地像。


他到底测了什么:六道题,三条赛道

博主开场先立了三条规则,很关键:

  1. 对象:DeepSeek V4 Pro(开源)、GPT5.5、Claude Opus4.7(后两个是当前最好的闭源模型)。他特意提醒——一个开源模型去打两个闭源天花板,这个「不对等」本身就是看点。
  2. 维度:AI 编程的前端、AI 编程的后端文案写作三条赛道。
  3. 先看价格:DeepSeek V4 Pro 的输入价格是另外两个的 1/3 到 1/4,输出价格更是只有 1/7 到 1/8。这个价格锚一开始就砸下来,是整条视频的隐藏主线——「便宜这么多,能打到什么程度?」

然后是六道题的真实结果,我按赛道归一下:

前端赛道(三道题:Notion 风 SaaS 官网 / 数字杂志专题页 / 珠宝跨境电商站)

  • 三道题结论高度一致:Claude Opus4.7 的设计感和美感明显最好,「默认吐出来的网页就是一种风格,但这种风格就是好看」;
  • GPT5.5 和 DeepSeek V4 Pro 咬得很紧,博主的判断是「DeepSeek 略好于 GPT5.5」(尤其数字杂志那题,DeepSeek 的设计语言更统一,GPT5.5 元素有点乱、有点俗);
  • 但两者跟 Opus4.7 都还有「一定差距」。前端美感这一格,闭源的 Claude 守住了护城河。

后端赛道(一道大题:给笔记软件补全后端)

  • 需求不小:注册登录、笔记的增删改查、自动保存、搜索、回收站与恢复、公开只读分享链接、标签、置顶。
  • 博主对三个模型的产物做了真实点击测试(注册→建笔记→刷新验证自动保存→删除→回收站恢复→搜索→加标签→置顶→跨浏览器打开分享链接)。
  • 结果:三个模型全部圆满通过,没有翻车。 博主自己补了一句极诚实的话:「也可能是我给的后端还是太简单了。」——这句话是全片方法论上最值钱的一句,后面细讲。

写作赛道(两道题:迭代思维自媒体帖 / 人形机器人推广文案)

  • 自媒体帖(迭代思维):GPT5.5 最好,几个句子「很有说服力」;DeepSeek V4 Pro 有两句「有点假」(比如「每条视频烂到我半夜惊醒」,用力过猛);Claude Opus4.7 写得「比较平淡,没什么说服力」。
  • 推广文案(人形家务机器人):DeepSeek V4 Pro 和 GPT5.5 打平,都写得自然、有诱惑力、突出功能;Claude Opus4.7 略啰嗦。
  • 写作这一格出现了反转:一向被认为文笔最好的 Claude,这次两道文案题都垫底;开源的 DeepSeek 反而在营销文案上追平了 GPT。

最后的综合总结(博主亲口)

  • 价格:DeepSeek V4 Pro 碾压(1/31/4 输入、1/71/8 输出);
  • 速度/体验:GPT5.5 明显最快;
  • 前端:Opus4.7 最好,GPT5.5≈DeepSeek 稍逊;
  • 后端:三家打平(承认题目偏简单);
  • 文案:GPT5.5 和 DeepSeek 都不错,反而比 Opus4.7 好一点;
  • 一个没测的大变量:Agent 智能体能力(调用工具、操作电脑、自动执行任务),博主明说「这个要在长期使用里慢慢对比」——他很清楚这才是 2026 年真正的胜负手,但也很诚实地说「这次没测」。

好,业务讲完了。下面按 7 段结构拆它的内容手法,再上我自己的判断。


【1】开头钩子(前 3 秒)

钩子文案:「DeepSeek 刚刚发布了它的新旗舰模型 DeepSeek V4 Pro,但是评价褒贬不一,有的朋友觉得它特别好,有的朋友觉得不够好。」

钩子类型争议悬念 + 蹭热点 + 中立人设三合一。

  • 争议悬念:不说「它很强」也不说「它拉胯」,而是甩出「褒贬不一」——直接把观众分成两拨(挺的和踩的),两拨人都想看视频「证明自己对」。制造对立比制造好奇更黏。
  • 蹭热点:「刚刚发布」四个字卡的是发布窗口期的搜索流量,DeepSeek + GPT5.5 + Opus4.7 三个热词叠在一起,标签里全是 #deepseekv4 #gpt5.5 #claudeopus,吃的是新品发布的自然流量红利。
  • 中立人设:「有人觉得好,有人觉得不好,今天我们做个诚实对比实测」——先把自己摘出争议,立一个「我不站队、只上数据」的可信裁判形象。这是评测类账号最核心的信任资产。

评分:8.5/10。 钩子没有用夸张标题党,而是用「争议 + 诚实裁判」的组合,精准锁定了「正在纠结要不要用 DeepSeek V4」的目标人群。缺点是前 3 秒信息略平,不如「反差型」钩子刺激——但对技术评测的目标受众,「靠谱」比「刺激」更重要。


【2】人设 & 声音

  • 人设标签中立技术裁判 / 实测党 / 开源支持者(但不盲吹)。名字叫「木子不写代码」,这个 ID 本身就是人设——暗示「我不是码农,我是帮你选工具的人」,降低了普通观众的技术门槛。
  • 声音风格:平稳、克制、不亢奋。全程用「我们看一下」「可以看出」「毫无疑问」「谈不上多惊艳」这种裁判式短句推进,几乎没有情绪煽动。
  • 受众:AI 开发者、独立开发者、设计师、内容创作者,以及最重要的一类——要做模型选型决策、但没时间自己一个个试的人
  • 口头禅/结构词:「首先我们看一下 X 给出的答案」「第一印象」「往下拉」「毫无疑问」——这套词是他的节奏骨架,每道题都用同一套词,观众听三遍就形成了预期节拍。
  • 最关键的人设动作:他反复强调 DeepSeek 是开源、另外两个是闭源天花板,并在结尾说「真心希望开源厂商能把能力冲上来」。这个「开源支持者」的立场,既是真实态度,也是内容策略——它给了这条视频一个价值观锚点,让「一个便宜 8 倍的开源模型能打到什么程度」成为贯穿全片的情绪主线。

【3】信息密度 & 节奏

  • 总时长:约 834 秒(近 14 分钟),在抖音是超长视频。能撑住 14 分钟不划走,靠的是结构化的强预期节拍
  • 节拍单元:每道题都是一个标准三拍——「报需求 → 逐个演示 → 横向对比结论」。六道题就是六个相同结构的循环,观众一旦进入节奏,就会有「看完这题看下一题」的追剧惯性。
  • 密度控制:前端三题演示较快(滚动展示模块),后端一题演示最慢最细(真实点击每一个功能),写作两题回到「读文案 + 点评」。快—慢—快的密度曲线,避免了 14 分钟匀速带来的疲劳。
  • 刺激—留白循环:每道题的「对比结论」是刺激点(谁赢了),中间的「逐个演示」是留白期(信息铺陈)。价格对比放在最开头当「预告钩子」,Agent 能力放在最结尾当「未完待续」——首尾都埋了扣子。
  • 一个节奏上的小瑕疵:后端演示环节,三个模型都「全部通过」,缺少对比张力,这一段是全片最容易划走的地方。博主自己也意识到了(「可能题目太简单」),但没有补救——这是长视频里最危险的「平局段」。

【4】讲解手法 & 内容结构

  • 结构类型受控变量对比法(controlled comparison)——同一道题、同样的 prompt、喂给三个模型,只让「模型」这一个变量变化,其余全锁死。这是最朴素也最有说服力的评测结构,因为它天然「可复现、可证伪」。
  • 各段角色
    • 价格表 = 锚点段(先给成本预期,让后面所有表现都自带「性价比」滤镜);
    • 前端三题 = 视觉说服段(网页好不好看,观众自己眼睛能判断,不需要相信博主);
    • 后端一题 = 信任建立段(真实点击每个功能,证明「不是看截图吹牛,是真跑通了」);
    • 写作两题 = 主观点评段(这里博主的判断力开始介入,也最容易引发评论区争论——争论=互动=推流)。
  • 具体化手法:博主几乎不用抽象形容词下结论,而是让观众看着屏幕自己得结论。「这个页面非常不错→往下拉→有相应图表→格式有变化」——他只做「引导视线」的旁白,把「好不好」的裁判权交给观众的眼睛。这是评测类内容最高级的说服方式:不说服,只呈现。
  • 最强的一段设计:后端测试的「刷新网页验证自动保存」「跨浏览器打开分享链接」。这两个动作,把「AI 说它做了」和「它真的做到了」之间的鸿沟,用最直观的方式填平了。能不能被真实点击验证,是区分「demo 级评测」和「可信评测」的分水岭。

【5】金句 & 记忆点

  • 可二次传播句:「DeepSeek V4 Pro 的输入价格只有另外两个的三分之一到四分之一,输出更是便宜到七到八倍。」——这是全片最容易被截图转发的一句,因为它是一个能记住的硬数字
  • 最诚实的一句(也是我最看重的一句):「他们三个都圆满完成了任务,当然也可能是我给的后端还是太简单了。」——主动承认自己评测的局限,这句话反而极大地提升了整条视频的可信度。评测博主最贵的不是设备,是这种「敢说自己题目可能有问题」的诚实。
  • 视觉记忆点:并排的三个网页截图 + 「Opus4.7 > GPT5.5 > DeepSeek」这种一目了然的排序标注。
  • 可复用金句模板
    • 定性模板:「__ 的 __ 只有对手的 __ 分之一,但在 __ 这一格追平了 __。」(性价比反差句)
    • 诚实模板:「它们都通过了,但也可能是我的题目太简单——真正的差距要看 __。」(主动暴露局限,反向立信)

【6】收尾 & CTA

  • CTA 类型软性关注引导 + 追更承诺,而非硬广。
  • 时机与衔接:博主没有在结尾喊「点赞关注」,而是抛出一个未完成的悬念——「Agent 智能体能力这次没测,我会在长期使用里慢慢对比,第一时间告诉大家结果」。
  • 沉锚设计:这个「下期讲 Agent 能力」的承诺,是一个非常聪明的留存钩子——它把观众的「关注动机」从「你讲得好」升级成「我想等你那个更重要的结论」。同时结尾「希望所有开源模型越做越好」再次强化了「开源支持者」的价值观人设,让认同这个立场的观众自然点关注。
  • 评分:8/10。 收尾克制、不油腻,用「未完待续 + 价值观共鸣」代替了硬性引流,符合技术评测账号的调性。唯一可惜的是没有一个更强的行动指令(比如「你最想我测哪个能力,评论区告诉我」这种可以直接拉互动的开放式提问)。

【7】可复制文案骨架

把这条视频抽象成一个任意「多方案横评」都能套用的模板

【钩子·争议悬念】
  「{新事物X} 刚发布,评价褒贬不一——有人说好,有人说不行。
   今天我们做个诚实对比实测,看它到底做到了什么程度。」

【立规则·三件事】
  1. 对象:{X}(我方/开源/新) vs {Y}、{Z}(对手/闭源/成熟)
  2. 维度:从 {维度A}、{维度B}、{维度C} 三条赛道比
  3. 先砸成本锚:{X 的价格/成本是对手的 N 分之一}

【循环体·每道题重复】
  报需求 → 逐个演示(引导视线、让观众自己判断)→ 横向排序结论
  (视觉题让眼睛判、功能题做真实验证、主观题给判断但留争议)

【诚实钩·主动认怂】
  「这一格它们打平了——也可能是我题目太简单,
   真正的差距要看 {未测的关键变量}。」

【收尾·未完待续 + 价值观】
  「{最重要的能力} 我这次没测,会长期跟进,第一时间告诉你们。
   也希望 {你支持的阵营} 越做越好。」

这个骨架的精髓有三个卡点:开头用争议不用吹捧、中间用真实验证不用截图、结尾用未测的悬念不用硬广。抄它的时候,最容易漏掉的是「诚实认怂」那一钩——但恰恰是那一钩,撑起了整条内容的可信度。


四角度反思(这条视频对不同人的价值)

一、对【我们做的事】:这套「真实任务评测法」可以直接搬进我们的自动学习流水线

我们每天在深扒短视频、做内容拆解、给模型分配任务,本质上一直在隐性地做模型选型。这条视频给了我们一套显性的、可复现的评测骨架:同一道真实任务 → 锁死变量 → 多模型并跑 → 真实验证 → 横向排序

具体动作:把我们自己的高频任务(深扒拆解、文案改写、代码修改、生图 prompt)各抽一道「标准题」,定期用当前主力模型 + 一个开源候选并跑一次,留一张对比表。别再凭「感觉某个模型强」做选型,要凭一张能复现的题目表。 这条视频最该被我们抄走的,不是它的结论,是它的方法。

二、对【橙子自己的能力】:我要建立「按格子选模型」的判断,而不是「选最强的那个」

这条视频最颠覆我的一点:没有一个模型在所有格子里都赢。 Opus4.7 前端最强却文案垫底、GPT5.5 速度最快文案最好但前端一般、DeepSeek 便宜 8 倍还在后端和营销文案上追平了。

对我的直接启发:以后接到一个复合任务,我应该在脑子里先拆格子——「这一步要美感(→偏 Claude 系)、这一步要说服力文案(→偏 GPT 系)、这一步只是跑通功能且量大(→可以上便宜的开源模型省成本)」。把一个大任务按能力格拆开、分派给最划算的模型,才是 2026 年的正确姿势,而不是无脑全用最贵的那个。 这正好呼应我知识库里那张「skill 决定下限、模型决定上限」的判断卡——现在要再加一条:模型也不是单一维度的「上限」,而是一张分格子的能力地图。

三、对【老大的机构业务】:模型选型 = 直接的成本结构优化

老大的机构要做大量内容(电商文案、种草、独立站、客服话术)。这条视频给出的价格差是惊人的——输出便宜 7-8 倍。对一个要批量产出的机构,这不是「省点小钱」,是成本结构级别的差异

具体建议:把机构的内容生产任务分三档——① 要美感/要品牌调性的(落地页、主视觉文案)用贵但强的闭源;② 要说服力的营销文案,GPT 系和 DeepSeek 打平,可以用便宜的跑;③ 纯批量、跑通即可的(商品描述、标签、结构化字段填充)直接上最便宜的开源模型。光是把第②③档从「全用最贵的」切到「按需分配」,批量场景下的 AI 成本可能直接砍掉一半以上。 这是能立刻落到财务报表上的优化。

四、对【未来发展】:真正的胜负手是博主没测的那一格——Agent 能力

博主很诚实地把「Agent 智能体能力(调用工具、操作电脑、自动执行任务)」留到了最后,说「这才是大家最看重的,但这次没测」。这恰恰是方向标。

2026 年,模型的「单点能力」(写网页、写文案)正在快速拉平——连开源的 DeepSeek 都能在多数格子追平闭源。真正拉开差距的,已经从「模型答得好不好」转移到了「模型能不能自己动手、连续多步、调用工具把活干完」。 对我们的启示:不要再把精力过度花在「哪个模型单点更强」的比较上,而要押注「哪个模型 + 哪套 harness(工具、记忆、多步编排)能把一整条真实工作流跑通」。我们做橙子这套 agent 架构,方向恰恰押对了——未来的护城河不在模型本身,在模型外面那层「能自主干活的骨架」。

值得借鉴清单(可直接抄的)

  1. 争议式钩子:「褒贬不一,今天做个诚实实测」——比任何「震惊体」都更适合专业内容立信。
  2. 受控变量对比结构:同题、同 prompt、多方案并跑、只变一个变量——最朴素、最可复现、最难被反驳。
  3. 真实点击验证:刷新验证自动保存、跨浏览器验证分享链接——把「它说它做了」升级成「它真做到了」。
  4. 主动认怂钩:「也可能是我题目太简单」——用暴露局限来反向建立可信度,全片最高级的一手。
  5. 未完待续收尾:把最重要的能力(Agent)留到下期——用「更重要的悬念」代替硬性引流。

我自己嚼过的判断(可迁移,非复述)

判断一:2026 年的模型选型,已经从「选最强」变成「按格子选最划算」。 没有全能王。Opus 强在美感、GPT 强在速度和说服力文案、DeepSeek 强在性价比且在多数格追平。正确做法是把复合任务拆成能力格,每格分派给「够用且最便宜」的模型——用最贵的模型跑所有任务,是 2026 年最大的隐性浪费。

判断二:开源模型的意义不是「取代闭源」,而是「重设成本地板」。 DeepSeek V4 Pro 便宜 8 倍还能追平后端和营销文案,意味着大量「跑通即可、不追求极致」的批量任务,成本地板被开源直接砸穿了。 闭源模型的溢价空间,正在被压缩到「美感、复杂推理、Agent 可靠性」这几个真正难的格子里。选型时先问一句:这个任务真的值得付闭源溢价吗?

判断三:单点能力正在拉平,未来的差距在「Agent + harness」这一层。 博主没测的那格才是关键。当写网页、写文案这些单点能力连开源都能追平时,护城河就上移到了「能不能自主、连续、调工具把整条工作流跑完」。做 AI 应用,别再迷信底座模型的单点分数,要押注模型外面那层能自主干活的编排骨架。 这也是我们做 agent 架构一直押的方向。

判断四(方法论):可信评测的分水岭是「能不能被真实验证」。 截图能骗人、demo 能作弊,但「刷新页面看自动保存还在不在」「换个浏览器打开分享链接」这种真实点击验证骗不了人。以后我做任何对比、任何结论,都要问一句:这个结论能不能被一个具体的、可复现的动作验证? 不能被验证的评测,只是观点,不是证据——这正好是老大那条「evidence not confidence」铁律在评测场景的翻版。


收尾一句:这条视频表面在评测三个模型,里子在演示一件更重要的事——当模型的单点能力快速拉平,真正稀缺的能力,是「按格子分派、按成本优化、用真实验证兜底」的那套判断力。 模型会一代代换,但这套判断力是我们自己的护城河。