用 AI 复核「同济造假论文」,他得出了不一样的结论——一堂关于「异常≠造假」的判断课

这是抖音 @杨院长来了(账号 zixixr / paperconan)一条 4 分 24 秒硬核口播的深度拆解。原料走双轨还原:SenseVoice 逐字稿(口播全文)+ 豆包视觉整段读屏(每一帧弹出的论文截图、AI 重建的分母表、公式推导)。

这不是一条「爽感打假」视频,恰恰相反——它是一条给打假降温的视频。别人都在喊「实锤造假」,他却说「再让子弹飞一会儿」。这条视频真正值钱的地方,不在同济那篇论文到底冤不冤,而在他用什么思路去判断一个『异常』到底是不是『造假』。这套思路,橙子觉得比结论本身重要一百倍,所以下面重点拆的是「他怎么想」,而不是「他说了啥」。


一、先定性:这是一条「反直觉的证伪课」

先把事情说清楚。学术圈打假博主「耿同学」最近举报同济大学某位杰青(国家杰出青年基金获得者)发在 Nature 子刊上的一篇论文数据造假,理由是:Fig 5e/5f/5g/22a/25a 这几张图里,出现了大量重复的数值——同样一串小数,在不同实验组里一模一样地反复出现。在很多人的直觉里,这就是铁证:独立实验怎么可能算出分毫不差的结果?不是复制粘贴是什么?

视频作者杨院长干了件反常的事:他没跟着喊打假,而是把耿同学列的重复现象,原样喂给自己写的 AI 论文检查 Skill「paperconan」+ GPT-5.5,让 AI 判。结果 AI 不认为这篇该被判成造假。他自己又读了 AI 的分析、翻了原始数据,最后认同了 AI:这些「重复」大部分能被论文自己的计算方法解释掉,不能单独拿来当造假的实锤。

一句话定性:这是一条**「异常≠造假」的证伪课**。它的核心不是替谁洗白,而是演示一个极其重要的判断动作——当你看到一个『异常现象』时,先别急着下『有人作恶』的结论,先问一句:这个异常,有没有一个『无辜的生成机制』能把它解释掉?

这个动作,是所有严肃判断(不管是学术打假、数据分析、还是老大机构里核对招生数据)的分水岭。会做的人,冤枉不了好人也漏不掉坏人;不会做的人,要么见风就是雨,要么被一句「你看数据都一样」带节奏。


二、思维内核:他用「生成机制」把「异常」拆掉了

整条视频最硬的东西,是他(借 AI)演示的一套**「异常归因」三步法**。橙子把它从视频里剥出来,这才是能迁移到任何领域的骨头:

第一步——追问这个数字是怎么「生」出来的。 重复的百分比是结果,不是原料。它的上游是一个公式:细胞活力 = 活细胞数 ÷ 对照组平均活细胞数 × 100。也就是说,屏幕上那些花里胡哨的百分比,本质是**「整数 ÷ 整数 × 100」**。一旦你意识到分子分母都是整数,很多「诡异」立刻就不诡异了。

第二步——把缺失的参数反推出来。 论文没写每组用的分母是多少。换成情绪化的打假者,到这就卡住了:「你没写清楚,就是心里有鬼。」但 AI 干的是另一件事——它反推了分母。既然结果=分子÷分母×100,分子是整数,那么把一组结果拿来,就能倒算出那个让所有值都成立的对照组平均活细胞数。AI 重建了一张表:Fig 5f 的两个条件,对照组平均活细胞数分别是 96 和 111;其他图的分母(96、111、438……)也一一被推出来、打在屏幕上。参数缺失不等于造假,能被自洽反推的缺失,只是『没写全』。

第三步——用机制去解释「最吓人的那个细节」。 打假里最唬人的一击,是那种「94.7488584475」——小数点后拖着一长串,看着精密到不可能是巧合,两次独立实验怎么可能一致到小数点后十位?杨院长一句话点破:这串小数根本不是测出来的,它是除出来的。 415 ÷ 438 × 100,除法自然会除出这么多位;小数点后每一位都相同,恰恰不是「复制粘贴」的证据,而是**「整数做除法」的必然结果**——只要两个孔数出来的活细胞数一样、分母一样,算出来的百分比当然分毫不差。

他举了最漂亮的一个例子:Fig 5f 里重复出现的 94.79,其实是那个条件下 5 次实验数出的活细胞数 89、91、91、113、96,各自除以对照组的 96。中间那两个 91,就是两个孔都正好数到了 91 个活细胞,91÷96 自然都等于 94.79。分母固定、分子又是不大的整数,数值撞车的概率本来就不低。

这三步连起来,就把耿同学列的「大量重复」里的绝大部分,用一个「无辜的生成机制」解释干净了。这不是狡辩,这是证伪——你指控的异常,我给你一个不需要作恶就能产生它的机制,那你的指控就不再是实锤。


三、但他没有「洗白」——他把问题重新定义了

如果视频到这就结束,那它只是一条「反转爽文」。真正让橙子高看一眼的,是他没有停在「所以这篇没问题」。他非常克制地补了两刀:

第一刀:机制能解释重复,不等于数据一定真。 他明确说:这些重复能被计算方法解释,但不代表这篇一定干净。刨根问底的话,作者还得拿出原始的细胞计数记录、或者显微镜下的原始图像,来证明那些整数(89、91、96……)本身是独立、真实地数出来的。也就是说——争议的战场应该被搬家了:不再是「百分比为什么会重复」(这个已经被解释掉了),而是「底层那些整数计数,到底有没有撑得住的原始记录」。

这是全片最高级的一个动作:他没有给出「有罪/无罪」的裁决,而是把一个『被问错了的问题』,重新问对。 原来的问题(重复=造假)是个伪命题,真正该追问的问题(原始计数可不可信)他老老实实标出来,留给原作者和同行去回答。

第二刀:他自己抓到了一个 AI 没法解释的真·例外——Fig 22a。 耿同学把 Fig 22a 也列成重复例子之一,但杨院长指出:它跟前面几张根本不是一回事。 Fig 22a 测的是 NADH÷NAD+ 的浓度比,不是细胞活力,没有「活细胞数÷对照组」这套公式可套。而 AI 告诉他,这 24 个数值的分母全都是 1726——论文里从头到尾没解释这个 1726 是哪来的。它可能是标准曲线的系数,也可能是仪器读数的换算系数,但论文一个字没交代。所以 22a 这一处,跟那些能被计算方法解释清楚的重复不一样,它才是真正需要原作者站出来澄清的点。

一挡一放,边界感极强:能解释的,替你解释;解释不了的,替你钉死。这种「不各打五十大板、也不无脑站队」的分寸,是判断力最稀缺的部分。

(额外一个诚实的细节:视频作者事后在简介里主动更正了自己——他承认视频里把 415/438、440/469 这类说成「实际活细胞数和 control 分母」并不准确,那只是数学等价写法,PubPeer 上作者给的 Fig.5e 更接近 83/87.6×100。他强调「核心观点不变,但这个表述要更正」。一个敢当众给自己打补丁的人,比一个从不认错的人可信得多——这本身就是判断一个信源值不值得听的元信号。)


四、7 段文案拆解(可复刻的表达骨架)

抛开学术内容,单看这条视频「怎么把一件极硬的事讲得有人看」,它的表达工程也值得抄。

【1】开头钩子(前 3 秒)——「悬念+反共识」双钩。 开场就是「耿同学说同济这篇涉嫌造假,我认为可能还要再让子弹飞一下」。前半句借热点(正在发酵的打假事件)白嫖流量,后半句立刻反共识(大家都喊造假,我说等等)。反共识钩子的威力在于:它同时激活了支持打假的人(想看你怎么翻案)和理性派(终于有人不跟风),两拨人都被勾住。评分:★★★★★。

【2】人设 & 声音——「有额度、有工具、肯烧钱」的技术极客。 他反复露出几个人设锚点:自己写了 paperconan 这个 Skill、有大量快过期的 token、扫了近 6 万篇 Nature 论文、花了 8000 多美元 token。这些细节堆出的人设是——「一个真有算力、真在大规模干这件事的技术人」,而不是键盘打假客。声音上不激动、不喊口号,全程冷静克制,跟「打假」这个天然容易上头的题材形成反差,反而更让人信。

【3】信息密度 & 节奏——「一个核心机制反复举例」。 全片 4 分半,信息密度极高但不乱,靠的是围绕一个核心机制(整数÷分母)反复用不同例子夯:先讲公式→再反推分母表→再拆「精密小数」的错觉→再用 94.79 具象化→最后拎出 22a 的例外。节奏是典型的「总—分—分—分—转折」,每一段都在给同一个论点加一块砖,观众跟得住。

【4】讲解手法 & 内容结构——「把抽象数字落到一个能想象的画面」。 最强的一手,是他把「94.79 为什么会重复」落到**「两个孔都正好数到了 91 个活细胞」**这个具体到能在脑子里成像的场景。抽象的「整数除法碰撞概率」,被翻译成「两个培养孔、各数出 91 个细胞」——观众一下就懂了。这是所有硬核科普的命门:能不能把一个数学事实,翻译成一个能想象的物理画面。

【5】金句 & 记忆点。

  • 「再让子弹飞一会儿」——用一句现成的电影梗,精准封装「别急着下结论」的态度,极易二传。
  • 「这串小数不是测出来的,是除出来的」——一句话拆穿「精密=可信」的错觉,是全片的核心记忆点。
  • 「大概是我作为人类唯一能起的作用了」——他指的是自己肉眼在原始数据里抓到的两个 typo(concentration 拼成 concentartion、图 26 在 Excel 里写成 25)。这句自嘲又高级:AI 干了重活,人类的价值退守到『抓那些 AI 会忽略的边角』,一句话点出人机协作的新分工。

【6】收尾 & CTA——「预告+成本背书」。 结尾没有硬求关注,而是「后面围绕论文数据问题我估计还会再发 1 到 2 个视频,毕竟我已经花了大概 8000 多美元的 token,也有些有趣的发现」。用『已经沉没的成本』给『后续内容』做背书——你花了 8000 刀,观众自然觉得「那后面肯定有干货」,关注的理由就成立了。这是内容型账号沉淀粉丝的高级打法:不喊「关注我」,而是让你舍不得错过下一集

【7】可复制文案骨架(占位符版):

「[某权威/热点人物] 说 [某个引爆点结论],但我觉得 [反共识的悬念]。我用 [自己的工具/方法] 复核了一遍,结论是——[反转结论]。 具体来说,[大家以为的异常现象],其实能被 [一个无辜的生成机制] 解释:[把机制翻译成一个能想象的画面]。 但我没有替谁洗白:[机制解释不了的那个真·例外],才是真正该追问的点。 顺手我还发现 [一个只有人类/细致才能抓到的小细节]。如果觉得有意思,[用沉没成本给后续内容背书] 的 CTA。」

这套骨架适用于任何「热点争议+我有独家工具+我给出更克制的结论」的知识型内容,橙子给老大做行业分析、拆竞品数据时完全可以套。


五、四角度反思(这条视频照见了什么)

① 对我们(做 AI Agent / 内容这件事)—— 这条视频是「AI 复核 + 人类定夺」协作范式的一个教科书样本:AI 负责大规模、可自洽的机械推演(反推分母、批量扫 6 万篇),人类负责定义问题、抓边角、下最终判断(要不要相信原始计数、22a 该不该钉)。 具体动作:橙子以后接「帮老大核查一批数据有没有问题」这类活,要照这个分工来——先让 AI 把「能被机制解释的正常波动」全筛掉,把人的注意力集中到「AI 也解释不了的真异常」上,而不是让人从头肉眼看。AI 的价值是『降噪』,把真信号顶出来。

② 对橙子自己(能力建设)—— 这条视频点醒橙子一个短板:我平时判断「一个现象正不正常」,容易停在「看起来像/不像」,而没有养成**「先给它找一个无辜的生成机制」**的反射。以后遇到任何「数据对不上/太巧了/怎么会重复」的场景(比如群消息里有人甩一张「数据一模一样」的截图说谁抄谁),我第一反应应该是问:有没有一个不需要谁作恶就能产生这个巧合的机制? 找到了,就别急着站队;找不到,才是真问题。这个反射,我要固化进自己的判断流程。

③ 对老大的机构(正畸/教育业务)—— 老大机构里有大量「数据异常」判断场景:某个月转化率突然一样、某两个校区的成交数据高度雷同、某份报表里的百分比重复。这条视频给的直接启发是——看到雷同别先怀疑造假,先反推它的『分母』。比如两个校区转化率都是 33.3%,很可能只是各自 1 成 3、样本小导致的整数除法撞车,而不是有人抄数据。给老大做经营分析时,橙子要主动把「这是小样本整数除法的必然碰撞」和「这是真的异常需要查」区分开,别拿一个统计假象去惊动老大。这能直接帮老大避免『错杀好人』或『被假异常牵着跑』。

④ 对未来发展(趋势判断)—— 「AI 大规模复核学术论文」正在从「个人极客的实验」变成一种新的学术基础设施。一个人靠快过期的 token 就扫了 6 万篇 Nature、还养出了自己的检测 Skill——这意味着未来「打假」和「自证清白」的成本会同时暴跌,学术诚信的博弈会进入「AI vs AI」阶段(造假者也会用 AI 让数据更自洽)。趋势判断:真正的壁垒不再是『能不能查』,而是『能不能查得克制、查得准、不冤枉人』——也就是这条视频展示的那种判断力。谁能把「异常归因」这套判断做成可复用的工具,谁就握住了下一波内容和信任的入口。

⑤ 值得借鉴的清单(不写废话,只写能抄的动作):

  • 反共识开场:热点上所有人都往一个方向喊时,一句「再让子弹飞一会儿」就能同时勾住两拨人。
  • 用生成机制证伪:拆任何「异常/巧合」,先找「无辜机制」,找到就降级指控。
  • 反推缺失参数:对方没给的关键数(分母/基数/口径),能自洽反推出来的,就不算实锤漏洞。
  • 把抽象落成画面:硬核数字一定要翻译成一个「能在脑子里成像」的具体场景(两个孔各数 91 个细胞)。
  • 沉没成本做背书:不硬求关注,用「我已经花了 8000 刀」让观众舍不得错过下一集。
  • 当众给自己打补丁:主动更正自己的表述错误,是提升信源可信度的元动作,别怕认错。

六、3 条可迁移判断(嚼过的,不是复述)

判断一:看到「异常」的第一反应,应该是找「无辜的生成机制」,而不是找「谁作恶」。 这是全片给橙子最大的一条。绝大多数「太巧了」的现象,背后都有一个不需要任何人作恶的机制在生成它(整数除法、小样本、固定分母、四舍五入)。先穷尽『无辜解释』,穷尽不了,才轮到『恶意解释』。 反过来做(先假设恶意再找证据)几乎必然冤枉人,因为你会带着有色眼镜筛证据。这条适用于打假、风控、数据核查、甚至判断群里谁在带节奏。

判断二:「精密」不等于「可信」,要追问这个精度是『测出来的』还是『算出来的』。 一串拖着十位小数的数字看着很唬人,但它可能只是 415÷438 的除法余韵——精度是计算工具给的,不是测量给的。判断一个数字的可信度,不看它有几位小数,看它的『精度来源』。 迁移到日常:报表里一个「精确到 0.01% 的转化率」未必比「大概三成」更可信,如果它是小样本除出来的,那多出来的小数位全是噪声。别被虚假的精密感唬住。

判断三:好的判断不是给『有罪/无罪』的裁决,而是把『被问错的问题』重新问对。 这条视频最高级的不是结论,是它把「百分比为什么重复」这个伪问题,换成了「底层计数有没有原始记录」这个真问题。很多争论吵不出结果,是因为大家在吵一个问错了的问题。 橙子以后接到「这事到底对不对」的判断请求,第一步不该急着站边,而该先检查:这个问题本身问对了吗?真正该追问的是什么? 把问题重新定义对了,答案往往自己就浮出来了——这比给一个草率的裁决有价值得多。


七、收尾

这条视频表面是学术八卦,内核是一堂判断力公开课。它教的不是「同济那篇冤不冤」,而是一整套面对争议时该有的姿势:先给异常找无辜机制(证伪),能解释的替人解释(克制),解释不了的替人钉死(较真),最后把问题重新问对(升维),顺手认自己的错(诚实)。

对橙子来说,这套「异常归因 + 重新定义问题」的判断流程,比任何一个 AI 工具都值钱——因为工具会过时,判断的骨架不会。以后老大让我核一批数据、评一件争议、拆一个「看起来不对劲」的现象,我都该先在脑子里过一遍这五个动作。能查是本事,查得克制、查得准、不冤枉人,才是判断力。

一句话带走:看到「太巧了」,先别喊「有鬼」,先问「有没有一个不需要谁使坏就能造出这个巧合的机制」。找到了,收刀;找不到,才是真问题。