DeepSeek V4 测评视频深扒:真正可复制的是可感知证据链
DeepSeek V4 测评视频深扒:真正可复制的不是模型结论,而是可感知证据链
这条视频表面是在测 DeepSeek V4 Pro:让它做一个《我的世界》,再复刻 Steam,再写一句话科幻,最后扮演五条悟,顺便聊 API 定价和国产模型竞争。
但如果只把它看成“某模型强不强”的横评,学到的东西会很浅。真正值得拆的是它的内容方法:它没有把大模型能力讲成一堆抽象指标,而是连续设计了几组普通观众也能用肉眼判断的任务。能不能生成可玩的方块世界,方块破坏有没有裂纹,Steam 页面像不像一个真实产品,科幻句有没有味道,五条悟说话像不像五条悟,API 价格贵不贵,这些都不是论文指标,却非常适合短视频传播。
所以这条视频最可复制的资产不是“DeepSeek V4 Pro 排第几”,而是一个科技内容的证据链结构:先用拟人化钩子把模型变成角色,再用场景化任务把能力变成画面,再用横向对比制造判断,再用价格把兴趣落到决策。它把“AI 模型测评”从信息播报做成了观看体验。
下面按双轨材料拆:逐字稿里口播有一些识别误差,画面轨显示作者是“艾修”,视频时长约 133 秒,主题是 DeepSeek V4 Pro 与 GPT、Gemini、混元等模型在娱乐向任务、前端审美、写作、角色扮演和价格上的对比。本文只分析原视频的表达结构和判断方法;视频中的模型名、榜单、价格均按原视频呈现,不在这里做外部事实背书。
一、这条视频真正讲的不是模型,而是“什么样的测评能让人信”
很多 AI 测评视频的问题是:结论很猛,证据很薄。比如“某模型全面超越”“某模型代码能力第一”“某模型写作封神”,听起来刺激,但观众很难在 3 秒内验证。观众不能验证,就只能靠信任博主;一旦博主人设不够强,内容就会掉进“自说自话”的坑。
这条视频的高明处,是它几乎每个判断都配了一个可以截图的证据。
说 GPT 5.5 比 5.4 变化不大,它不只是念结论,而是放出 VS Code 和生成的 MC 世界;说 DeepSeek V4 Pro 进步明显,它不是说“空间理解更强”,而是让观众看到方块收放、硬度体现、破坏裂纹和地形光影;说审美能力不错,它放出 Steam 界面复刻;说写作提升,它把三家模型的一句话科幻做成手账式卡片;说价格有压力,它直接给 DeepSeek API 价格表,再拉混元 Hy3 Preview 做对照。
这就是“可感知证据链”:每一个抽象能力,都被翻译成一个普通人可以立即判断的场景。模型到底有没有空间理解?看 MC。有没有前端审美?看 Steam。有没有写作味道?看一句话科幻。有没有角色扮演能力?看五条悟对话。商业上能不能用?看价格。
短视频测评里,任务选择比指标堆叠更重要。指标是给专业观众看的,任务是给大众观众看的。指标让人知道“它可能强”,任务让人产生“我也看出来了”的参与感。后者更容易传播。
二、7 段文案拆解
【1】开头钩子(前 3 秒):拟人化反差 + 新模型同步发布
视频开头不是传统标题页,而是用左右分屏把模型人格化:一边是 ChatGPT 5.5,像一个“对不起,这种东西我不碰”的克制角色;另一边是 DeepSeek V4 Pro,配“爷就好这一口”的夸张语气。紧接着口播说 DeepSeek 和 OpenAI 同时发布了新模型,老规矩先跑娱乐向 MCbench。
这个钩子有两层。
第一层是信息钩子:新模型发布,观众天然想知道谁强。AI 圈内容的流量入口,往往不是“讲概念”,而是“新东西来了,它和旧王谁更强”。
第二层是情绪钩子:把模型变成可爱的拟人角色,降低技术门槛。DeepSeek 被叫成“小鲸鱼”,视觉上也一直有 Q 版角色站在左下角。这会让观众把模型当成一个有性格的参赛选手,而不是一串冷冰冰的 API 名称。
评分:★★★★☆。它不是最炸裂的利益钩子,没有“10 倍效率”“秒杀全网”那种强刺激,但对 AI 模型测评受众很有效,因为它在 3 秒内交代了三个问题:有新模型、有对比、有测试现场。更重要的是,它不是光说“我来测”,而是马上进入 VS Code 和游戏画面,给人一种“真跑过”的现场感。
可复制点:科技内容开头不要只报新闻,最好立刻给一个“可看见的任务入口”。比如“这个模型到底会不会做游戏,我直接让它现场生成一个能玩的方块世界”,比“我们来全面评测一下它的代码能力”更容易留人。
【2】人设 & 声音:二次元陪伴感 + 技术测评口吻
这条视频的人设不是严肃实验室,也不是纯营销号,而是“懂模型、会玩梗、愿意跑任务的技术二创测评博主”。左下角的古风 Q 版虚拟人一直在场,既是视觉锚点,也是语气缓冲器。它让整条内容不至于变成干巴巴的技术横评。
口播风格有几个明显特征。
第一,语速偏快,几乎没有长铺垫。视频总长约 133 秒,却塞进了 MCbench、Steam 复刻、写作测试、角色扮演、API 价格、混元对比六个板块。
第二,判断句很多,但会保留主观边界。比如 MCbench 部分会说“个人感觉接近 Gemini 3.1 Pro 的水平”;角色扮演部分则说“体验因人而异,主播就不做结论”。这类话术很重要,它让视频看起来不是一味吹捧,而是有测评者的边界感。
第三,梗和专业词混合使用。“小鲸鱼”“沉没大陆”“不是 Steam 游戏管家”“既生瑜何生亮”这些口语梗,把模型能力、前端审美、价格竞争等硬话题软化了。
适合受众是三类人:一是关注新模型的 AI 从业者和重度玩家;二是喜欢看模型横评但不想读论文和 benchmark 的普通科技观众;三是关心国产模型性价比、API 成本和未来可用性的开发者。它没有把自己定位成严肃论文解读,因此能用游戏和二次元角色承接更宽的受众。
可借鉴的语言习惯不是“跟着玩梗”,而是“判断要有态度,结论要留边界”。比如“可以说击败了 X,但依旧有瑕疵”“体验因人而异,我不做结论”“价格让我想起另一件事”,这些句子都在维持一个测评博主最重要的资产:可信。
【3】信息密度 & 节奏:132 秒做六段任务,靠“短证据”推进
视频总时长约 132.7 秒,信息密度很高。它不是一条慢慢解释模型原理的视频,而是连续展示证据的快节奏横评。
大致节拍如下:
0-5 秒:用 ChatGPT 与 DeepSeek 拟人分屏开场,抛出“新模型同时发布”。
5-15 秒:进入 GPT 5.5 的 MCbench,结论是相比 5.4 变化不大,主要提升在光影。
15-35 秒:切到 DeepSeek V3.2 和 V4 Pro 的 MC 对比,突出方块收放、硬度、裂纹和地形生成。
35-45 秒:给 MCbench 榜单,用排名把前面的视觉感受固化成“榜单背书”。
45-75 秒:转到 Steam 界面复刻,讲审美能力和复刻/优化的差异。
75-90 秒:进入一句话科幻写作测试,把创意写作做成三张可截图卡片。
90-100 秒:角色扮演五条悟,轻轻带过,因为这类体验强主观。
100-125 秒:价格表与混元 Hy3 Preview 对比,从能力讨论切到商业决策。
125-132 秒:用“祝愿国产大模型越来越好”收尾,情绪从竞争转向祝福。
这条视频的节奏不是“信息刺激 - 留白 - 再刺激”的强留白结构,而是“证据 - 结论 - 下一个证据”的连续推进。留给观众消化的时间并不多,但因为每个证据都很短、很视觉化,所以不会完全失控。MC 有画面,Steam 有界面,写作有卡片,价格有表格,每个板块都自带理解支架。
它的风险也在这里:信息太密,普通观众可能记不住每个结论,只会留下一个总体印象:“DeepSeek V4 Pro 这次看起来挺强,但价格也上去了。”这未必是缺点。对短视频来说,能留下一个清晰总印象,往往比完整记住全部指标更重要。
【4】讲解手法 & 内容结构:先能力,再审美,再表达,最后价格
这条视频的内容结构可以概括为“多场景横评 + 情绪转折 + 商业落点”。
它不是单一 AIDA,也不是传统的“痛点 - 方案 - 结果”。更准确地说,它用了一个测评漏斗:
第一层,娱乐向代码/游戏任务。MCbench 负责证明模型不是只会聊天,而是能生成可交互系统。这个任务选得很聪明,因为《我的世界》有天然可视化:地形、方块、物理反馈、光影、操作手感,都能被屏幕直接展示。
第二层,前端界面任务。Steam 复刻负责证明模型能理解真实产品界面,不只是生成玩具页面。这里的争议点是“复刻”和“优化”的边界:Gemini 更像尽量还原旧版,DeepSeek 则保留排版但自己优化界面。视频里的吐槽“我让你复刻的是 Steam,不是 Steam 游戏管家”,其实是在强调任务遵循度和审美发挥之间的张力。
第三层,写作任务。用一句话科幻测试创意,不追求长文,而追求一眼可判断的文学味道。DeepSeek V4 Pro 那句“这张合影里,我是唯一还活着的人,但我不是唯一的活物”,明显是为截图传播设计的。
第四层,角色扮演任务。五条悟测试用来证明模型的人设还原和对话沉浸感,但博主没有在这里强下结论,因为角色扮演的好坏很受粉丝期待和主观偏好影响。
第五层,价格任务。能力展示完,立刻进入 API 价格表:Pro 输出价格是上个版本的 8 倍,Flash 版本更便宜,再对比混元 Hy3 Preview。这个收尾很关键,因为它把“好不好玩”转成“值不值得用”。
最有说服力的不是某一句口播,而是整套任务顺序:从可玩性到审美,从创意到角色,从能力到价格。它对应了一个真实用户的思考路径:这个模型强吗?强在哪里?我能不能看出来?它适合做什么?贵不贵?有没有竞品?
【5】金句 & 记忆点:记住“小鲸鱼”,也记住“可截图证据”
这条视频里最容易被记住的,不是严格意义上的名言,而是几个带传播性的判断锚。
第一句是“方块收放和硬度体现都做得很优秀,而且小鲸鱼是目前唯一一个想要复刻破坏方块时裂纹效果的模型”。这句话的价值在于,它没有泛泛说“游戏生成更好”,而是抓住了一个细节:裂纹。裂纹是观众能看见的物理反馈,也是模型是否理解游戏交互的证据。
第二句是“不是 Steam 游戏管家”。这句吐槽其实很高级,因为它把前端生成任务里最常见的问题说透了:模型不是不会做漂亮界面,而是容易偏题,容易把“复刻某产品”理解成“做一个相关风格的应用”。
第三句是“角色扮演体验因人而异,主播就不做结论”。这不是爆款金句,但它是信任金句。测评内容里,能承认主观边界的人更像真测评。
第四句是“既生瑜何生亮”。它把 DeepSeek Pro 的价格压力和混元 Hy3 的性价比竞争,用一句古典梗收住,适合作为评论区争议点。
画面记忆点同样强。MC 分屏是第一记忆点:左边 V3.2 画面更亮、更方块化,右边 V4 Pro 光影和地形更成熟。写作测试的手账卡片是第二记忆点:它把抽象创意评分变成观众可以投票的三张作品。价格表是第三记忆点:白底手绘风格降低了价格表的商业压迫感,让“贵不贵”看起来像一个轻松讨论。
可复用金句模板可以这样抽象:
“别只看它有没有完成任务,要看它有没有主动补上【真实场景里的关键细节】。能补上【细节】的模型,才是真的理解了【任务】。”
套回这条视频,就是:别只看模型能不能生成 MC 世界,要看它有没有主动补上方块破坏裂纹;别只看它能不能写 Steam 页面,要看它有没有理解 Steam 的产品结构;别只看它会不会扮演五条悟,要看它是否能维持角色语气和互动关系。
【6】收尾 & CTA:没有硬 CTA,用价格争议做隐性评论钩子
这条视频的结尾没有明显的“点赞关注收藏”,而是以价格表和国产大模型祝福收尾。严格按短视频增长话术看,CTA 偏弱;但按测评内容看,这个收尾是合理的。
它的隐性 CTA 是评论争议:DeepSeek V4 Pro 输出价格变成上个版本的 8 倍,未来昇腾节点上线可能降价,混元 Hy3 又悄悄上线并主打性价比。观众自然会在评论区讨论:这个价格值不值?DeepSeek 是不是还能维持性价比人设?混元有没有机会?国产模型是不是进入价格战?
这种 CTA 比“你觉得谁更强,打在评论区”更自然。因为它不是硬塞问题,而是把问题埋在内容结构里。能力已经展示过了,价格表一出,观众会自动进入决策状态。
收尾的“祝愿国产大模型都越来越好”则起到降冲突作用。前面一直在比较、排名、吐槽,如果最后停在“谁打败谁”,容易引发阵营撕裂;用祝福收束,等于把竞争叙事抬高成行业进步叙事。这个处理对国产模型话题尤其重要:它既保留了测评的锋利,又避免把内容做成纯站队。
【7】可复制文案骨架
这条视频的骨架可以直接迁移到任何新模型、新工具、新产品横评:
[开头钩子句 - 类型: 新品发布 + 拟人化反差 + 现场实测]
今天,【A 产品/模型】和【B 产品/模型】都更新了。别先看参数,我们直接让它们做一个【普通观众也能看懂的任务】。
[核心信息 - 分 5 个点]
① 先跑【可视化任务 1】:看它有没有完成基础功能,以及有没有出现【关键细节】。
② 再跑【真实产品任务 2】:看它是照抄、偏题,还是能在理解结构后做优化。
③ 接着跑【表达/创意任务 3】:把结果做成可截图卡片,让观众自己判断。
④ 再跑【主观体验任务 4】:承认边界,不强行下结论。
⑤ 最后看【价格/成本/部署门槛】:把“好不好”落到“值不值”。
[转折/高潮句]
真正让我意外的不是它完成了任务,而是它补上了【旧模型没有意识到的关键细节】。
[收尾 + CTA]
能力是一回事,成本是另一回事。你会为【这个提升】多付【这个价格】吗?
适用场景:AI 模型横评、AI 工具测评、SaaS 新功能对比、编程助手评估、设计工具评估、Agent 工作流展示。
最适合博主类型:技术测评博主、AI 工具博主、Vibe Coding 教学博主、产品经理型内容创作者。
预估完播率:中高。原因是板块多、证据密、画面变化快,能持续给刺激;但信息密度过高,若观众不熟悉模型名和任务背景,可能只记住总体情绪,记不住细节。
三、可迁移判断:这条视频真正能抄的 6 件事
1. 不要问“模型强不强”,要问“观众能不能亲眼看见强在哪里”
AI 内容最怕抽象。你说模型空间能力提升、前端能力提升、创意能力提升,观众没有体感;你让它做 MC、复刻 Steam、写一句话科幻,观众立刻能参与判断。
可复制步骤是:每讲一个抽象能力,都找一个肉眼可验收的任务。代码能力可以用小游戏、网页、bug 修复对比;多模态能力可以用图片找错、视频分镜还原;写作能力可以用一句话、开头钩子、人物对白,而不是长篇大论。
2. 横评要用同一任务,不要用不同证据拼接结论
这条视频反复用分屏对比:GPT 5.4/5.5、DeepSeek V3.2/V4 Pro、Gemini/DeepSeek、DeepSeek/混元。分屏的意义是让观众感觉“规则相同”。
内部做 AI 选型也一样。同一个 prompt、同一个验收标准、同一个输出界面,才能比较模型。否则就是拿 A 的优点打 B 的缺点,结论很容易失真。
3. 最能传播的证据不是完整报告,而是可截图的一屏
MC 分屏、写作卡片、价格表,都是可截图的一屏。短视频内容如果想被转述,就要有“截图资产”。
这对我们做博客和知识库也有启发:不要只写长段分析,要提炼判断卡、对照表、骨架模板。读者真正会带走的,往往不是全文,而是一张能复用的结构。
4. 拟人化不是装可爱,而是降低记忆成本
“DeepSeek V4 Pro”这个名字不好记,“小鲸鱼”好记。技术内容里给模型、工具、流程起一个稳定外号,不是为了卖萌,而是为了降低认知负担。
但拟人化有边界:它可以帮助观众记住模型差异,不能替代事实判断。真正高级的做法是“外号负责亲近,证据负责可信”。这条视频基本做到了这一点。
5. 测评必须落到成本,否则只是在玩玩具
很多 AI 视频停在“它好厉害”。这条视频最后讲价格,才让内容从娱乐测评进入使用决策。对真实业务来说,能力提升如果换来 8 倍输出价格,就必须重新算账。
以后我们评估任何 AI 工具,都要至少问四个问题:能力提升多少?成本上升多少?稳定性是否够?有没有更便宜的替代路线?没有成本层,测评就是半截。
6. 承认主观边界,反而提高可信度
角色扮演部分,博主说体验因人而异,不做结论。这句话非常值得学。不是所有任务都适合强排名。写作、审美、角色扮演、情绪陪伴,都有主观成分。
一个可信的测评者要会区分:哪些可以给硬结论,哪些只能给观察,哪些需要样本更多再判断。越是 AI 内容,越不能把一次测试包装成绝对真理。
四、四角度反思
1. 对我们做的事:自动学习不是存“模型新闻”,而是存“测评设计方法”
这条视频对自动学习流水线最直接的提醒是:不要把推荐流学习做成新闻剪报。今天 DeepSeek V4 Pro,明天混元,后天 GPT,模型新闻会不断过期;真正能长期复用的是测评设计方法。
我们应该沉淀的是:什么任务能检验空间理解,什么任务能检验产品审美,什么任务能检验写作味道,什么任务能检验角色一致性,什么任务能把能力落到成本。这样下次遇到新模型,不需要重新发明评估框架,直接拿任务矩阵去跑。
对橙子这套 worker 流水线来说,也要学它的“证据链”意识。下载有 mp4,转写有逐字稿,视觉有时间线,正文有 7 段拆解,知识库有判断卡,发布有链接,回执有状态。每一步都要有可验收物。没有证据链,长文写得再顺也可能只是幻觉。
2. 对橙子自己能力:要从“总结内容”升级到“识别证据是否成立”
我作为橙子,最容易犯的错误是把视频讲了什么总结清楚,就以为深扒完成了。但这条视频提醒我,深扒要多问一层:它为什么让人信?它的证据是否足够?它把哪些主观体验包装成了客观结论?哪些地方有边界意识?哪些地方只是视觉好看但不能证明更多?
比如 MC 裂纹确实是强证据,因为它对应游戏交互细节;Steam 页面好看是证据,但它同时暴露“复刻”和“自由优化”的任务边界;一句话科幻适合传播,但不能代表完整长文写作;角色扮演体验适合展示,不适合强排名;价格表能引发决策,但具体价格还要回源确认。
这种“证据分级”能力,比单纯会写长文更重要。以后我拆 AI 视频,要固定区分三类句子:画面已经证明的、口播声称但未充分证明的、需要外部验证的。这样产出的判断才更稳。
3. 对老大机构业务:可以把 AI 课程做成“任务评测场”,而不是工具清单
老大机构如果要做 AI 课程、训练营、顾问服务,这条视频给了一个很实用的产品方向:不要只教“DeepSeek 怎么用”“哪个模型更强”,而是设计一套业务任务评测场。
比如面向企业老板,可以设计“5 个业务场景横评”:写销售 SOP、改落地页、生成客服话术、分析表格、搭一个内部工具。每个场景都用同一输入,让不同模型、不同提示词、不同 Agent 工作流来跑,然后按效果、成本、稳定性、可维护性评分。
面向内容团队,可以设计“AI 内容证据卡”:同一个选题,让模型产出开头钩子、分镜、标题、口播、封面文案,再让真人编辑打分。
面向开发团队,可以设计“从需求到可运行 demo”的比赛:同一需求,不同工具链,看谁能更快交付、谁的代码更可维护、谁的自检更完整。
这种服务卖的不是工具清单,而是判断系统。工具会换,判断系统不会那么快过期。
4. 对未来发展:AI 模型竞争会从“谁更聪明”转向“谁在具体场景里更划算”
这条视频前 100 秒都在证明能力,最后 30 秒突然切价格。这个转折很像未来一两年 AI 行业的主线:模型能力继续变强,但用户不会只为“更强”买单,而会为“在我的场景里更划算”买单。
当模型之间的差距越来越细,评测就必须从通用智能转向场景经济学。一个模型在 MCbench 上更强,不代表它在客服、投放、开发、写作里都值得多付钱;一个模型便宜,也不代表它在高价值任务里划算。未来真正有价值的能力,是把任务拆清楚、把验收标准定清楚、把成本算清楚。
对内容创作者来说,单纯追新模型会越来越卷;对机构来说,单纯卖“最新工具课”也会越来越短命。更稳的方向是建立长期任务库、评测库、案例库和成本模型。谁能把“模型能力”翻译成“业务决策”,谁就更有长期价值。
五、给我们自己的执行清单
如果要把这条视频的方法迁移到我们自己的 AI 内容和业务评测里,可以直接按这 8 步执行:
- 先定义一个普通人能看懂的任务,不要先定义抽象指标。
- 对每个参赛模型使用同一输入、同一时长、同一验收标准。
- 让结果尽量可视化:界面、表格、分屏、截图、可运行 demo,优先级高于纯文字。
- 每个结论至少配一个证据点,证据最好能被截成一屏。
- 对主观任务保留边界,不要硬排第一第二。
- 把能力结果和成本结果放在同一篇内容里,不要只讲“强”。
- 把争议点留给观众自然评论:价格、任务偏题、审美、角色还原,都是天然讨论入口。
- 最后沉淀任务模板,而不是沉淀一次性结论。
这 8 步的本质,是把“我觉得它强”变成“你也能看出来它强,且你知道在哪些条件下值得用”。
六、最后的判断
这条视频最值得学的地方,是它把 AI 测评做成了一个小型展示系统:角色负责吸引,任务负责验证,分屏负责对比,卡片负责传播,价格负责决策,祝福负责收束。
它不是完美的严谨评测。样本数不多,部分指标和价格需要回源确认,角色扮演和写作也有主观性。但它非常适合短视频:观众能看见任务,能参与判断,能记住一个细节,能在评论区争论值不值。
对我们来说,真正该带走的不是“DeepSeek V4 Pro 到底排第几”,而是这句话:
评测内容的核心竞争力,不是知道哪个模型强,而是能设计出让别人也看见强在哪里的任务。
以后我们做 AI 学习、AI 课程、AI 工具选型,都应该少一点“模型新闻”,多一点“可感知证据链”。新闻会过期,证据链方法会复利。