DeepSeek 研究员的自动研究系统:真正值得学的不是 190 页论文,而是那套可反复运行的研究闭环

这条视频表面上在讲一个很容易被传播的新闻点:DeepSeek 研究员 Deli Chen 做了一个自动研究 side project,让 AI 在几十小时内产出三篇长篇综述,页数接近两百页,参考文献接近一千条。这个点当然抓人,因为它天然带着一种“研究员会不会被替代”的冲击感。

但如果只把它理解成“AI 又能写论文了”,这条视频就被看浅了。它真正有价值的地方,是把一个长周期、低确定性、强判断依赖的研究任务,拆成了一组可执行、可评分、可反馈、可返工的技能模块:文献综述负责扩大信息面,实验设计负责把想法压到可验证任务里,同行评审模拟负责制造反对意见,弱点路由表负责把问题送回正确环节。换句话说,它展示的不是“AI 一次性生成一篇论文”,而是“AI 如何被组织成一个会不断返修的研究流程”。

视频的创作者 Vuk 武克很聪明。他没有从抽象概念切入,而是先抛出一组压迫感很强的结果数字:三篇论文、长页数、近千条引用、几十小时生成。然后马上把观众带进系统内部,展示论文、技能组、评分表、阶段划分和弱点路由。这样一来,观众不会停留在“真的假的”的猎奇层,而是被迫追问:“如果我也有一套这样的流程,我能不能把自己的研究、产品调研、行业分析也这样组织起来?”

这也是我们要深扒它的原因。对橙子和老大的业务来说,视频里的重点不在学术论文,而在一种可以迁移到很多复杂工作的生产范式:不要让 AI 直接交最终答案,而是让 AI 进入一条有阶段、有角色、有评分、有返工入口的流水线。

一、视频内容吃透:从“写论文机器”到“研究流水线”

逐字稿里最关键的一句话是:瓶颈不再只是写作质量,而是 research taste,也就是研究品味、问题选择和判断力。这个判断比“AI 写了 190 页”重要得多。

因为写作质量是显性能力,容易展示,也容易让人误判。AI 可以写出很长的综述,引用很多论文,排出很像样的结构,但真正决定这件事有没有价值的,是它选择什么问题、舍弃什么方向、如何判断一个发现是不是值得继续做。视频里也提到 Deli Chen 对各环节能力的自评:文献收集可能已经超过本人能力,研究洞察和逻辑结构大约只有一半,实验设计对成熟 benchmark 还不错,但创新性工作仍不足。这个比例很有启发:AI 最强的不是“替你做出天才判断”,而是把原本消耗大量时间的资料搜集、初筛、整理、初稿、互评变成可规模化流程。

从视觉轨看,视频不断在几个界面之间切换:一边是社区帖子和推文,一边是 PDF 论文、技能模块、工作流表格、弱点路由表。它把“结果”和“机制”交替展示。先给结果,让观众愿意看;再给机制,让观众觉得可学;最后给社区课程,把“我想学这个”的冲动接到产品入口。

这条视频里最值得拆的系统结构有四层。

第一层是文献搜集。系统不是让 AI 随便搜几篇文章,而是先用关键词和规则拉出 200 到 500 篇候选论文,再按时间、引用、会议、相关性等维度评分。这里真正重要的是“高召回优先”。研究早期最怕的不是读得慢,而是漏掉关键分支。AI 适合干的正是这种脏活:广泛扫、初步打标、把材料堆成可读的地图。

第二层是论文结构与写作。系统把写作拆成结构、段落、引用、图表,而不是一句“帮我写篇论文”。这让写作不再是玄学输出,而是一个可以检查的工程对象:这段有没有引用,这个 claim 是否太强,这个章节是否缺少边界说明。

第三层是实验设计。视频明确讲到,AI 对成熟 benchmark、已有套路里的实验设计更可靠,对真正创新的实验不够好。这一点反而让系统更可信。因为它没有把 AI 神化成“自动科学家”,而是承认不同环节的能力上限不同。对我们来说,这意味着 AI 工作流不能一刀切;越靠近资料整理和格式化,自动化比例越高;越靠近方向判断和商业取舍,人类越要握住方向盘。

第四层是同行评审模拟和弱点路由。这里是这套系统最值得学的部分。很多人用 AI 做长文,只会生成、润色、再生成。这个系统多了一层“批判者”:先给初稿打分,再指出引用不足、逻辑不稳、claim 过强、实验缺失,然后把问题路由回对应模块。引用不足回到文献综述,结构松散回到结构优化,没有实验回到实验设计。它不是让 AI 自我感觉良好,而是让 AI 自己制造返工清单。

二、7 段文案拆解

【1】开头钩子:用“反常识结果数字”抢占注意力

这条视频的前几秒非常直接:DeepSeek 研究员发布了自己的自动研究项目,代码、技能、三篇论文都开放;三篇综述加起来接近两百页,近千条引用,AI 用几十小时完成。

钩子类型是“权威背书 + 夸张结果 + 可验证材料”。DeepSeek 是权威标签,研究员身份给可信度;三篇论文、页数、引用数、耗时是结果冲击;代码和技能开放则降低观众的怀疑,因为它不是纯口播吹牛,而是能点进去看。

底层逻辑是把抽象趋势压成一个具体事件。观众对“AI 研究智能体”可能没有感觉,但对“一个 DeepSeek 研究员开源了能写三篇综述的系统”有感觉。它让观众立刻进入两个问题:这东西有多真?我能不能用?

评分:★★★★★。不是因为它最有情绪,而是因为它同时满足了短视频开头的三个硬条件:有名人/机构锚点,有结果数字,有后续可展开空间。

【2】人设 & 声音:技术搬运者,不是情绪煽动者

Vuk 的人设是“AI 研究学习者兼社区组织者”。他说话节奏快,英文口播夹杂技术词,语气里有兴奋,但不是纯情绪型。他会表达怀疑,比如质疑 LLM 打分是不是有点随机,也会马上指出哪些评分是具体规则,比如六个月、十年、引用、会议这些可量化指标。这让他的声音不只是转述,而是带了一点研究者式的审慎。

这个人设适合的受众很明确:想进入 AI research 但还没完全入门的人,已经会用 AI 工具但不知道如何把工具组织成研究流程的人,以及对 agent 工作流感兴趣的创业者、产品人、研究助理。

他值得借鉴的语言习惯是边展示边判断。不是“这里有一个功能、那里有一个功能”,而是不断补一句自己的判断:“这个评分我有点怀疑”“peer review simulation 很重要”“主要用途是加速 literature review”“这个会不会很快被大模型产品杀掉”。这些插入的判断,让视频从资料搬运变成了观点内容。

【3】信息密度 & 节奏:高密度,但用界面切换承担消化

视频总时长约 342 秒,信息密度高。它不是娱乐型视频,而是面向愿意看技术内容的人。节拍大致是:开头 30 秒给项目结果和三篇论文;接着解释技能开放、文献综述、实验设计、同行评审循环;中段进入能力自评和评分机制;后段展示工作流阶段、弱点路由表和论文 PDF;最后转入课程社区 CTA。

它的节奏不是靠花哨剪辑,而是靠“画面证据”维持注意力。每当口播进入抽象点,画面就切到 PDF、表格、技能列表或社区帖子。观众即使听不完全,也能从屏幕上看到关键词,形成第二条理解通道。

它有明显的信息刺激循环:先抛结果,再展示论文;先说技能,再展示子技能;先说反馈闭环,再展示弱点路由表;先说社区,再展示课程和任务帖子。留白不多,但这类内容的受众本来就愿意暂停、回看、收藏。

【4】讲解手法 & 内容结构:先证明有用,再拆为什么有用

内容结构接近“结果冲击 - 系统拆解 - 能力边界 - 应用判断 - 社区转化”。

开场承担信任破冰:DeepSeek 研究员、开源项目、三篇论文。展开部分承担机制解释:文献综述、实验设计、peer review simulation、phase 0 到 phase 3。高潮不是某一句夸张话,而是弱点路由表出现的地方,因为那里把“自动研究”从生成器变成了流程系统。收尾则自然接到课程社区:如果你也想学 AI research,可以加入。

最有说服力的观点是“瓶颈不再是写作质量,而是 research taste”。因为它把观众从“AI 能不能写”推到了“人还应该负责什么”。这句话也让视频避免了廉价的替代叙事:AI 可以加速大量环节,但真正的研究品味、选题判断、创新判断仍然稀缺。

【5】金句 & 记忆点:把 AI 当研究团队,而不是写作按钮

这条视频最值得留下的三句话,分别对应三层认知。

第一句:瓶颈不再是写作质量,而是研究品味。它提醒我们,AI 时代真正拉开差距的不是谁会叫模型写长文,而是谁知道什么问题值得写、什么结论不能写过头。

第二句:文献收集可能已经超过人类,但研究洞察还没有。它把 AI 能力拆开看,而不是笼统地说“强”或“不行”。这个拆法可以迁移到任何 AI 工作流评估。

第三句:同行评审模拟给系统反馈,让循环持续改善。它说明复杂产出的关键不是一次生成,而是有一套能制造反对意见的返工机制。

视觉记忆点是论文 PDF、技能列表和弱点路由表。尤其弱点路由表很强,因为它把抽象的“反馈闭环”变成了一个很容易复用的界面:问题是什么,路由到哪个模块,谁来修。

可复用金句模板是:不要问 AI 能不能替你完成 [复杂任务],要问你有没有把 [复杂任务] 拆成可检索、可评分、可审稿、可返工的闭环。

【6】收尾 & CTA:把技术兴奋接到学习共同体

结尾 CTA 是加入 AI research 学校和社区。表达并不隐蔽,但衔接还算顺,因为整条视频前面一直在展示“普通人如何学会做 AI research”。当观众已经被自动研究系统刺激到,课程和社区就不再像硬广,而像一个可继续探索的入口。

它的 CTA 触发点有两个:一是“我会把链接放出来,你可以复制这些 skills”;二是“我们有课程、社区、任务结果、互相 review”。前者给免费资源,后者卖陪跑和反馈。这个组合比只卖课更顺,因为它承认观众先想要工具,再想要组织和监督。

沉锚设计不算强。它没有专门抛一个评论问题,但“190 页是不是 AI slop”“研究 taste 到底能不能自动化”天然会引发争议。对技术内容来说,这种争议比喊大家评论更自然。

【7】可复制文案骨架

可直接套用的骨架是:

[开头钩子句 - 类型: 权威背书 + 结果数字]
某个权威/头部团队刚公开了一个 [系统/项目],它在 [时间] 内做出了 [具体成果],而且 [代码/流程/案例] 都能看到。

[核心信息 - 分 4 个点]
① 先看结果:它产出了什么,数字有多夸张。
② 再看机制:它不是一次生成,而是拆成哪些技能模块。
③ 看边界:哪些环节强,哪些环节还弱,人的判断还在哪。
④ 看迁移:这个流程对普通人/业务/团队能复用在哪里。

[转折/高潮句]
真正重要的不是它写出了多少内容,而是它把一个复杂任务变成了可检索、可评分、可评审、可返工的闭环。

[收尾 + CTA]
如果你想做 [领域能力],别只收藏工具,先照这个流程给自己的工作搭一套小闭环,然后再决定要不要加入课程/社群/项目。

适用场景:AI 工具、研究系统、自动化流程、复杂生产力产品的讲解视频。

最适合博主类型:技术学习型、产品拆解型、创业观察型、AI 工具陪跑型。

预估完播率:中高。原因是开头结果足够强,中段信息密度高但画面证据充分;缺点是技术门槛较高,泛流量会流失,但精准受众会收藏。

三、真正可迁移的判断

第一条判断:复杂工作不要先自动化终点,要先自动化中间检查点。

很多人做 AI 自动化,会直接把目标写成“帮我完成一篇报告”“帮我做一个研究”。这会导致结果很长,但不可控。视频里的系统反过来做:先拆阶段,阶段之间设置检查点。文献是否足够,结构是否合理,claim 是否过强,实验是否缺失,审稿分数是否提升。这样 AI 的每一步都有被检查的对象。对我们做视频深扒、行业研究、课程设计、私域运营复盘都一样,先设计检查点,再让 AI 干活。

第二条判断:评分可以用 AI,但评分规则必须尽量外显。

视频里 Vuk 对 LLM 打分的怀疑很重要。如果只是让模型说“这篇论文相关性 8 分”,那确实很飘。但如果规则里有时间窗口、引用影响、会议层级、是否命中关键词、是否有实验代码,AI 的评分就从“感觉判断”变成“按表填格”。我们以后做内容评分、线索评分、客户需求评分,也要遵守这个原则:主观判断可以存在,但要尽量绑定可观察证据。

第三条判断:反馈闭环的价值大于单个模型能力。

如果一个系统只有生成器,那么模型升级就是唯一出路。但如果系统有 reviewer、router、repairer,模型能力一般也能通过循环提高产物质量。同行评审模拟的价值就在这里:它不保证一次正确,但保证每一轮都能暴露问题。对团队来说,这比追最新模型更可控。我们应该把更多精力放在“谁负责挑错、错了回哪、返工怎么验收”上。

第四条判断:AI 最先替代的是低品味高体力环节,不是高品味低样本判断。

文献拉取、候选筛选、引用整理、初稿铺陈,都是高体力环节;选题价值、创新性、业务取舍、风险判断,是高品味环节。AI 研究系统目前最适合吃掉前者,并给后者提供材料。把这条边界讲清楚,团队才不会一边神化 AI,一边又因为一次烂稿就彻底否定 AI。

四、四个角度的反思

1. 对我们做的事:深扒也应该从“文章产出”升级成“判断流水线”

我们现在做单条视频深扒,最怕陷入两种低效:一种是只复述视频内容,另一种是靠感觉写一篇长文。这个视频给我们的提醒是,深扒本身也应该有明确闭环。素材采集是第一层,音频和视觉双轨是第二层,7 段文案拆解是第三层,业务迁移判断是第四层,知识库判断卡是第五层。

真正的质量不来自“写得长”,而来自每一层都能回答一个不同问题:视频到底说了什么?它怎么把人留下?它为什么能转化?我们能学什么?下一次遇到类似问题能不能复用?只要这五层跑通,深扒就不是一次性文章,而是橙子的判断资产。

2. 对橙子自己能力:不要只当写手,要当流程设计者

橙子如果只追求把素材写成漂亮文章,很容易被更强模型替代。真正应该练的是“把一团复杂输入组织成可验证流程”的能力。视频里的自动研究系统,本质上不是一个文笔系统,而是一个流程系统。它知道什么时候该搜文献,什么时候该写,什么时候该审,什么时候该返工。

这对橙子很关键。以后老大给的任务会越来越开放:拆一个赛道、盯一个竞品、做一个课程、复盘一个账号。橙子不能每次都从零开始想,而要沉淀自己的技能组:资料抓取、事实核验、结构拆解、反方审稿、业务迁移、知识卡归档。这样橙子才不是“会写”,而是“会带着 AI 小队做复杂工作”。

3. 对老大机构业务:可以把机构的方法论产品化成“带反馈的研究陪跑”

这条视频最后卖的是 AI research 社区,但它给老大机构业务的启发不只是“我们也可以卖课”。更深的一层是:客户真正缺的不是一堆资料,而是一条被设计好的进步路径。

如果机构要做 AI 学习、内容生产、账号增长、商业分析,完全可以借鉴这个结构:先给学员一个可执行任务,再给资料搜集模板,再给初稿生成流程,再给同伴/AI review,再给弱点路由表,最后让学员返工。这样课程不只是“看视频”,而是“每周跑一个闭环”。这会显著提高交付感,因为学员能看到自己的作品从 5 分改到 7 分、再改到 8 分。

更重要的是,机构可以把自己的 know-how 固化在路由表里。比如内容账号的弱点路由:开头弱回钩子库,信任弱回案例库,转化弱回 CTA 模板,观点空回反方审稿,信息乱回结构重排。这个东西一旦做出来,就比单个老师的临场点评更可规模化。

4. 对未来发展:AI 研究不会直接走向全自动,而会先走向“人类主编 + AI 研究工厂”

这条视频展示的未来,不是一个 AI 独立成为科学家的浪漫叙事,而是一个更现实的组织形态:人类负责选题、边界、价值判断和最终署名责任;AI 负责大规模检索、整理、草拟、互评、返工和实验辅助。

短期内,最有价值的人不是完全不需要 AI 的专家,也不是盲信 AI 的工具玩家,而是能设计闭环的人。他知道哪些工作可以放给 AI,哪些节点必须人来拍板,哪些评分需要证据,哪些结果必须回炉。未来的研究、咨询、内容和教育都会越来越像这种结构:一个人类主编,下面挂着一组可调用的 AI 技能。

这也意味着竞争会从“谁有更多信息”转向“谁有更好的反馈系统”。信息本身会越来越便宜,初稿会越来越便宜,真正贵的是筛选、审稿、返工和判断。谁能把这些东西做成流程,谁就能把 AI 的便宜产能变成真正的业务结果。

五、给我们自己的可复制步骤

如果把这条视频压成一套我们能马上用的步骤,我会这样落地:

第一步,先定义任务阶段,而不是直接定义最终产物。比如“写一篇行业研究”,不要直接让 AI 写,而是拆成选题、资料池、证据表、结构稿、反方评审、最终稿、知识卡。

第二步,为每个阶段定义输入、输出和验收标准。资料池要多少条,必须覆盖哪些来源;结构稿必须回答哪些问题;反方评审至少指出几类风险;最终稿必须有多少条可迁移判断。

第三步,建立弱点路由表。发现资料不足,就回资料池;发现观点空,就回证据表;发现结构散,就回结构稿;发现结论过强,就回反方评审;发现不能复用,就回知识卡。

第四步,把每次任务留下来的判断沉淀成模板。不是存一堆原文,而是存“以后再遇到类似问题怎么判断”。这正是本次知识库卡片要做的事。

第五步,不要迷信全自动。先让 AI 在高体力环节赢,再让人类在高品味环节审。等某个环节被验证稳定,再提高自动化比例。这样系统会稳步变强,而不是一上来就崩。

六、这条视频本身的不足

它有一个明显不足:对“研究质量”的质疑展开还不够。视频提到了有人批评这是 AI slop,也提到了人类可能不需要读完整 190 页,AI 会读、会执行代码。但这里其实可以再深入一点:如果论文主要由 AI 生成,评价它不能只看页数、引用数、结构完整度,还要看是否提出了新的分类、是否纠正了旧文献盲区、是否能指导实验、是否能被后续研究引用。

另一个不足是,视频对“自动研究系统能否产品化”只停留在疑问。Vuk 提到它可能成为创业产品,也可能被未来的大模型产品杀掉。这个判断很有价值,但还可以展开:如果产品只卖“自动写综述”,很容易被大厂功能吞掉;如果产品沉淀的是领域路由表、评审标准、数据连接和人类专家反馈网络,就更不容易被杀。也就是说,护城河不在生成能力,而在工作流和评审资产。

不过作为一条短视频,它已经做到了很高的信息密度。它没有只卖焦虑,也没有只做技术炫耀,而是把一个前沿项目拆到“普通学习者能复制技能”的程度。这就是它值得学的地方。

七、最后的判断

这条视频给我的最终判断是:未来最值得建设的不是“一个能回答所有问题的 AI”,而是一套能把复杂任务不断拆小、审稿、返工、沉淀的工作系统。

自动研究系统的意义不在于它今天能不能写出顶会级论文,而在于它已经把研究活动拆成了机器可以参与的工序。只要工序被拆开,改进就会持续发生:检索会更全,评分会更准,实验会更自动,review 会更尖锐,路由会更细。

对我们来说,不要被“190 页论文”这个表层数字带跑。真正该带走的是那张隐形流程图:资料进入系统,经过筛选和结构化,生成初稿,被评审打回,再路由到对应技能修复,最后沉淀成可复用判断。谁能把这张图嵌进自己的业务,谁就能把 AI 从写作玩具变成生产系统。

参考素材:本次抖音视频双轨转写与视觉分析;Deli Chen 个人主页;《From Copilots to Colleagues: A Survey of Autonomous Research Agents》公开 PDF;Vuk 武克围绕该项目发布的公开视频与社媒材料。