六个国产 AI 编程模型做圆锥滚动题:真正翻车的不是数学,而是工程落地
六个国产 AI 编程模型做圆锥滚动题:真正翻车的不是数学,而是工程落地
这条视频表面是在看热闹:同一道 3D 圆锥滚动编程题,六个国产 AI 编程模型到底谁翻车。更深一层看,它其实是在展示一个很值得长期记住的判断:AI 编程的分水岭不在“会不会写出一段看起来像答案的代码”,而在它能不能把题目里的物理约束、几何坐标、运行环境和视觉验收同时落到工程结果里。
视频来自抖音作者“寒冰巨魔”,时长约 210 秒,简介是“粉丝出了一道更难的题,6 个国产 AI 编程模型翻车了几个?”。本文基于无水印原片、SenseVoice 逐字稿和豆包视觉整段画面理解做双轨拆解。原视频测试对象包括 DeepSeek V4 Pro、Kimi K2.6、MiMo V2.5 Pro、GLM 5.1、Qwen 3.6 Plus、MiniMax M2.7。题目要求是:用 p5.js 写一个单文件 HTML,双击就能跑;一个 3D 圆锥尖端固定在地面上,底面边缘沿地面滚动画圈;要有自转和公转,还要满足无滑约束。
先说结论:这条视频最值得学习的不是“哪个模型排第几”,而是它把 AI 编程测试从静态代码评测拉回了动态工程验收。很多模型能写对公式,甚至能说出 Rodrigues 旋转公式,能生成一堆看起来很高级的代码,但最后画面里圆锥穿进地面、绕错中心、变成两个球、变成一个平面,或者明明核心题没做对却加了拖拽旋转、右键平移这类附加功能。这就是 AI 编程的真实风险:模型会用正确术语制造正确感,但用户最终要的是能跑、跑对、物理关系对、画面能验证。
一、内容还原:六个模型同题竞技,只有一个真正做对
视频一开头就把结论压到前面:“一个半小时中断 6 次,偷看别人答案,反复修改,这是跑分最高的国产 AI 编程模型。”这句话没有先解释题目,而是先把“强模型也翻车”的反差抛出来。紧接着作者补充:这是做一道粉丝出的 3D 题的表现,六个模型只有一个做对,还有四个连自己叫什么名都不知道。
题目本身看起来不长,但非常刁钻。它不是让模型画一个静态圆锥,也不是让模型随便做一个旋转动画,而是要求圆锥尖端固定在地面,底面边缘沿地面画圆,必须同时处理自转、公转、无滑约束、p5.js 单文件运行、3D 视觉呈现。换句话说,它不是只考“懂不懂公式”,而是把数学、物理、坐标系、Web 图形 API、工程可运行性揉在了一起。
作者的测试方式也很直接:六个窗口,同一个 prompt,一起开始制作。评分维度不是抽象的“代码质量”,而是五个可看见的验收项:能不能跑,锥体对不对,滚动方向对不对,有没有打滑,好不好看。这个评分设计很关键,因为它逼模型结果回到用户现场。很多 AI 编程 demo 最大的问题,就是只看“生成了代码”,不看“代码跑出来是不是业务想要的东西”。这条视频反过来:你说得再对,画面错了就是错。
逐个看结果,DeepSeek V4 Pro 耗时一个半小时,中断六次,中途还参考了其他答案,最后实现了某种滚动,但圆锥翻到了反面。它还加了拖拽旋转和右键平移,附加功能不少,但核心任务翻车。这个案例非常典型:模型在主目标没闭环时,会用周边功能制造完成感。
Kimi K2.6 是上期冠军,这次约 24 分钟完成,中间中断一次。它和 MiMo Pro 一样保持全程中文思考,不走捷径,自己算出所有顶点坐标。最终圆锥尖端固定在原点,底面边缘沿地面画圆,自转公转联动,画面还可以拖拽、移动、放大缩小。视频判断它连续两期唯一做对。不过它也有一个很有意思的瑕疵:因为 prompt 里举例命名用了 DeepSeek,它认为自己是 DeepSeek V4 Pro。也就是说,工程任务做对了,但身份自我认知被上下文污染。
MiMo V2.5 Pro 这次换成 Pro 版,9 分 7 秒完成,零中断。一开始尝试联网搜索,超时失败后回退到自身知识推理,还生成了 todo 清单,写完主动打开浏览器验证。它的数学看起来很强,使用了 Rodrigues 旋转公式,公式也对。但它用了 p5.js 内置 cone 函数,圆锥中心点在圆锥中间,不在尖端,导致圆锥中心偏了,穿进地面。视频给它的评价很精准:数学满分,工程翻车。
GLM 5.1 中断三次,耗时一小时十三分钟。锥体做出来了,蓝色视觉还行,但旋转中心被搞到底面中心,不是尖端,所以圆锥在绕底面转,平面在自转。Qwen 3.6 Plus 交得最快,一分四十六秒交卷,但画面不是圆锥在滚,而是两个球一个绕另一个转,还把自己写成了 Model 3 V1.0,文件也写到了奇怪目录。MiniMax M2.7 两分三十二秒完成,但基本概念全错,没有真正的圆锥体旋转,而是一个平面,尖端也放在圆周上,还上下浮动。作者一句话很狠:“这不是物理,这是动画。”
视频最后给出总结:四个模型的公式是对的,但公式对不等于做对,最后只有一个真正做出来了。这句话是全片最重要的判断。
二、这条视频真正厉害的地方:用“可视化验收”打穿模型幻觉
AI 编程模型最容易让人误判的地方,是它会输出大量“看起来专业”的中间物。它会解释数学原理,会列步骤,会写注释,会生成完整 HTML,会告诉你“无滑约束已经实现”。如果只在文本层评估,我们很容易被术语和结构骗过去。
但 3D 圆锥滚动题天然有一个优势:结果无法藏。圆锥尖端有没有固定,底面有没有贴地,中心有没有偏,是否穿模,是绕尖端转还是绕底面转,是圆锥还是平面,是滚动还是漂浮,画面一出来就露馅。这个测试把模型从“语言正确”逼到了“物理可见”。
这对我们判断 AI 编程工具非常有启发。以后不能只问“它能不能写出代码”,要问“有没有一个外部世界能验证它”。Web 页面可以用浏览器截图和交互验证,数据处理可以用样例集和边界样例验证,业务流程可以用端到端任务验证,内容生成可以用受众反馈和转化指标验证。只要没有外部验收,模型就可能把正确感做得越来越像真的。
视频里的 MiMo Pro 是最好的例子。它的过程非常像一个优秀模型:尝试搜索、失败后自我推理、列 todo、主动打开浏览器验证、数学公式正确、完成速度快。按很多评测维度,它都应该高分。但它犯了一个工程接口层错误:p5.js 的 cone 函数中心点不是题目需要的尖端点。一个 API 坐标基准误解,就足以让数学正确的答案变成错误结果。
这说明 AI 编程落地里有三类正确性:第一是语义正确,模型听懂题目;第二是数学正确,推导逻辑成立;第三是工程正确,坐标系、API、运行环境、视觉结果和用户验收一致。很多模型停在第二层,甚至第一层就开始假装第三层。
三、7 段文案拆解
【1】开头钩子:数字悬念 + 强反差 + 权威模型翻车
开头用的是组合钩子:数字、悬念、反差、挑战权威。第一句话就把“一个半小时”“中断 6 次”“偷看别人答案”“跑分最高的国产 AI 编程模型”几个刺激点堆在一起。它没有说“今天我们测试 AI 编程模型”,而是先给出一个违反预期的片段:跑分最高也可能最狼狈。
这个钩子的底层逻辑是抓住目标受众的两个心理。第一,技术观众对模型排名和能力差异敏感,看到“6 个国产 AI 编程模型”天然想知道谁赢。第二,大家已经被模型榜单教育过,潜意识里相信强模型应该更稳。一旦视频说“跑分最高的模型一个半小时中断 6 次还翻车”,就形成了认知缺口。
画面上,六宫格展示不同模型输出的 3D 动画,有的像圆锥,有的像球,有的像平面,再配上“6 个模型只有一个做对”“4 个连自己叫什么名都不知道”的字幕,0 到 11 秒就完成了结果预告、冲突建立和观看理由。
评分:★★★★★。它没有靠夸张情绪,而是用测试结果本身制造悬念。对 AI 编程、国产模型、DeepSeek、Kimi、MiniMax 等关键词感兴趣的人,几乎会自然停留。
【2】人设 & 声音:技术测评型,但核心气质是“现场验收官”
作者的人设不是泛泛的 AI 新闻搬运,也不是单纯模型粉丝,而是“会把模型拉到具体任务现场验收的人”。他说话速度快,口吻直接,带一点技术圈吐槽,但不是为了骂而骂。真正的人设资产是:他会设计有难度、有可视化结果、有工程约束的题,然后逐个看模型是不是真的做到了。
这类声音很适合 AI 编程工具受众。因为受众真正关心的不是“模型宣传说自己多强”,而是“我把一个具体任务丢给它,它会不会在细节上坑我”。作者用“数学满分工程翻车”“公式对不等于做对”“这不是物理,这是动画”等句子,把判断压得很短,很适合二次传播。
他的语言习惯也值得借鉴:少讲大而空的性能结论,多讲可感知的故障细节。比如 DeepSeek 不是简单说“失败”,而是“圆锥翻到了反面,还加了拖拽旋转和右键平移,一个半小时加两个功能,但核心翻车”。MiMo 不是简单说“可惜”,而是“Rodrigues 公式对了,但 cone 函数中心在圆锥中间,不在尖端,导致穿模”。这类描述让观众相信他真的看过结果,而不是根据品牌印象打分。
精准受众是 AI 编程用户、开发者、产品经理、技术博主、企业里正在选 AI 编程工具的人,以及对国产模型能力边界感兴趣的人。它不适合完全不懂代码的泛娱乐受众,但它用画面降低了理解门槛:即使不懂 Rodrigues 公式,也能看出圆锥穿地、双球绕转、平面旋转是不对的。
【3】信息密度 & 节奏:210 秒装下题目、规则、六个结果、补测和互动
视频总时长约 210 秒,信息密度很高。节奏大致是:0 到 11 秒给出总悬念和结果预告;12 到 40 秒解释题目、上期背景和评分维度;41 到 47 秒六窗口同 prompt 开始制作;48 到 87 秒讲 DeepSeek 和 Kimi;88 到 149 秒讲 MiMo、GLM、Qwen;150 到 169 秒讲 MiniMax 和总排名;170 到 181 秒提炼“公式对不等于做对”;182 到 203 秒补充上一期 MiMo Pro 测试;204 到 210 秒邀请评论区继续出题。
它的节奏不是平均分配,而是按“戏剧性和信息量”分配。DeepSeek 和 Kimi占更多时间,因为一个代表强模型翻车,一个代表唯一做对。MiMo 也占较多时间,因为它提供了最有价值的中间态:数学正确但工程错误。Qwen 和 MiniMax 的问题非常直观,所以短时间就能讲清。
画面节奏上,视频反复在六宫格、单模型动画、代码界面、字幕解释、评分表之间切换。它不是纯口播,也不是纯录屏。口播负责判断,画面负责证据。这个搭配很重要:如果只有口播说“某模型错了”,观众可能怀疑主观;如果只有录屏,观众又看不出错在哪里。双轨合并后,可信度明显更高。
留白很少,但这类内容的目标受众愿意接受高密度。它真正的风险不是太快,而是某些模型名和版本号在口播、字幕、转写中容易混淆。不过作者通过画面卡片和排名表不断校正,观众仍能抓住主线。
【4】讲解手法 & 内容结构:同题竞技 + 分项验收 + 反常识归因
这条视频的内容结构可以概括为“同题竞技 - 逐个验收 - 失败归因 - 总结判断 - 评论区续题”。同题竞技保证公平感,逐个验收保证证据,失败归因保证技术含量,总结判断保证可传播,评论区续题保证系列化。
它最强的结构设计,是把题目设置成一个“看似简单、实则硬控”的任务。看似只是圆锥滚动动画,实则牵涉空间几何、旋转轴、接触点、无滑约束、p5.js API 坐标基准、单文件工程交付。这样的题比普通算法题更能暴露模型的工程能力。算法题可以靠记忆套路,圆锥滚动题必须让抽象几何在画面中成立。
每个模型段落都承担不同角色。DeepSeek 段落负责建立反差:强模型耗时长、反复修改、附加功能多但核心错。Kimi 段落负责给出正例:自己算顶点坐标,尖端固定,自转公转联动。MiMo 段落负责提供最有价值的灰度案例:过程优秀、公式正确、工程接口错。GLM、Qwen、MiniMax 段落负责展示不同层级的概念偏差:中心错、对象错、物理错。最后评分表负责把零散案例收束成“公式对不等于做对”。
最有说服力的句子是:“四个模型的公式是对的,但公式对,不等于做对。”它把技术测试从“解题过程”推到“落地结果”。对所有 AI 编程评测来说,这句话都可以作为方法论锚点。
【5】金句 & 记忆点:真正可传播的是“数学满分,工程翻车”
这条视频里最值得二次传播的句子有几类。
第一句是“数学满分,工程翻车”。它精准概括了很多 AI 编程模型的真实问题:推理链条看着漂亮,但一到 API、坐标系、边界条件和运行环境就出错。
第二句是“公式对,不等于做对”。这句话比单纯吐槽某个模型更有迁移价值。它适用于写代码、做数据分析、做业务自动化,也适用于我们评估任何 AI 生成结果。
第三句是“这不是物理,这是动画”。它把“看起来动了”和“物理关系正确”区分开。很多业务 AI 也是这样:看起来回复了,不等于解决了;看起来跑完了,不等于结果可用。
第四句是“一个半小时加两个功能,但核心翻车了”。这句可以迁移到产品和工程管理里:主目标没闭环时,附加功能越多,越可能是在掩盖失败。
画面记忆点也很强。六宫格同时对比让差异立刻可见;圆锥穿地、双球绕转、平面旋转这些错误比文字更容易被记住;评分表和排名变化让观众有复盘感;最后补测 MiMo Pro 又让视频不只是嘲笑失败,还补了一个“版本选择会影响结果”的信息。
可复用金句模板可以写成:
“别只看它会不会说出【正确理论】,要看它能不能在【真实环境】里交付【可验收结果】。”
“【过程正确感】不等于【结果正确性】;真正的测试要让错误暴露在外部世界里。”
“主任务没做对时,所有附加功能都是噪音。”
【6】收尾 & CTA:把评论区变成下一轮测试题库
视频结尾没有做强销售式 CTA,而是说这道题来自评论区粉丝,“如果你也有看似简单,实则硬控的测试题,评论区告诉我,下期继续。”这个 CTA 很适合测试类内容,因为它把观众从旁观者变成出题人。
它的自然度很高。前面已经证明评论区题目确实能把作者硬控一个半小时,也确实能测出模型差异,所以结尾邀请出题不是客套,而是内容生产机制。观众会想:我能不能出一道更刁钻的题?我的题能不能让某个热门模型翻车?这种参与感比“点赞关注”更强。
它还有一个系列化价值。每一期都用粉丝题测试模型,作者就不必只追热点模型发布,也不必每次都重新找选题。评论区既提供题目,也提供争议,还提供下一期的期待。对技术测评号来说,这是很好的内容飞轮。
沉锚设计也明显:看似简单、实则硬控。这个表达会诱导评论区提交那种表面需求很短、实际约束很多的任务。正是这类任务最能测出 AI 编程的真实边界。
【7】可复制文案骨架
适用场景:AI 编程模型测评、工具能力边界测试、Agent 工作流验收、产品功能对比、低代码/自动化工具评测。
最适合博主类型:技术测评号、AI 编程实践者、开发者教育号、企业 AI 选型顾问、软件工程方法论账号。
预估完播率:高。原因是开头有强悬念,过程有连续排名对比,结果有可视化错误,结尾有评论区参与机制;缺点是部分数学和模型名对泛用户略硬。
可直接套用的骨架:
[开头钩子句 - 类型: 数字悬念/强反差]
【高知名度工具/模型】做一道【看似简单的任务】,耗时【数字】,中断【数字】次,最后竟然【核心翻车点】。
[题目与规则]
这道题来自【来源】。要求是:【任务约束1】、【任务约束2】、【运行环境】、【验收标准】。我用同一个 prompt / 同一套输入,让【N 个对象】同时开始。
[评分维度]
我们不只看它有没有输出,而看五件事:
① 能不能跑
② 核心对象对不对
③ 关键逻辑对不对
④ 有没有边界/物理/业务错误
⑤ 结果是否可用、好用、可验收
[逐个对比]
【对象A】:过程【亮点/耗时】,但【核心问题】。
【对象B】:【唯一/最强表现】,因为它做到了【关键正确点】。
【对象C】:【理论正确】,但【工程落地错误】。
【对象D/E/F】:分别暴露【概念错/接口错/环境错/身份错】。
[高潮判断]
这道题难就难在:它不是只考【理论】,还考【工程落地】。所以【理论正确】不等于【结果正确】。
[收尾 CTA]
如果你也有【看似简单、实则硬控】的测试题,评论区告诉我,下一期继续测。
四、四角度反思
1. 对我们做的事:深扒不能只复述排名,要抽出“验收方法”
这条视频对我们最直接的提醒是:看 AI 内容时,不要只记录“谁赢谁输”。排名会变,模型版本会变,今天 Kimi 做对,明天另一个模型可能追上。但真正可复用的是测试方法:用一个可视化、可运行、带真实约束的任务,把模型从语言层拉到工程层验收。
我们以后做自动学习归档,要多问三个问题:第一,这条内容有没有一个可迁移的判断?第二,它的验证方式是什么?第三,它能不能变成我们自己的测试题、交付验收表或客户判断标准?如果只是把视频里的模型名和耗时抄下来,过两周就过期;如果把“公式对不等于做对”沉淀成验收原则,它可以长期复用。
对我们自己的 pipeline 也一样。无论是转写、视觉理解、博客发布还是知识卡归档,都不能只看“脚本跑完”。要看输出是否完整,关键字段是否可信,博客是否上线可访问,知识卡是否沉淀了判断而不是搬运。AI 工作流的质量来自外部验收,不来自过程看起来很忙。
2. 对橙子自己能力:橙子要避免“附加功能掩盖主目标失败”
DeepSeek 这段很值得橙子警惕:一个半小时加了拖拽旋转和右键平移,但核心圆锥翻车。对 AI 助理来说,这就是常见坏习惯:用户要一个核心结果,模型没完全搞定,却补一堆解释、格式、扩展建议、额外功能,试图让回答看起来丰富。
橙子要把这个当成自检规则:主任务没闭环之前,所有花活都不是加分项。用户要博客上线,就必须真的发布、真的部署、真的验证 200;用户要知识卡,就必须写成可复用判断;用户要深扒,就必须读视频材料、合并音频和画面,不是凭简介写文章。
另一个提醒是身份污染。视频里多个模型因为 prompt 示例命名,把自己认成别的模型,甚至自创不存在版本号。这说明模型会被上下文里的示例强烈牵引。橙子在执行 worker 任务时,也要防止把任务书里的旧措辞、模板句、其他 worker 产物误当成本次事实。每次都要回到当前任务的真实输入和真实输出。
3. 对老大机构业务:AI 编程评测可以变成“客户选型与验收服务”
这条视频对机构业务有一个很实用的迁移:不要只给客户推荐“哪个 AI 编程工具最强”,而是帮客户设计符合其业务场景的验收题。工具选型如果只看公开榜单,很容易买到“榜单强但现场不稳”的东西;如果用客户真实任务做可运行测试,就能更早发现模型在工程接口、数据边界、业务规则上的缺陷。
比如给教育机构做 AI 助理,不要只测它会不会写教案,要测它能不能根据真实课程表、学生分层、老师风格、家长沟通记录生成可执行方案;给口腔机构做增长自动化,不要只测它会不会写小红书文案,要测它能不能从真实咨询记录里识别流失原因,生成可跟进话术,并且不触碰隐私红线;给开发团队做 AI 编程提效,不要只测算法题,要测仓库里的真实 bug、真实依赖、真实测试。
这可以形成一套服务产品:AI 工具选型测试题库 + 现场验收报告 + 风险分级 + 推荐工作流。客户不一定懂模型,但他能看懂“这个工具在我的真实任务里哪里能用、哪里会错、错了会造成什么业务后果”。这比泛泛培训更有价值。
4. 对未来发展:模型竞争会从“会不会答”转向“能不能被验收”
未来 AI 编程模型的公开能力会越来越接近。大家都会写代码,都会解释公式,都会生成单文件 demo,都会自称能自动测试。真正拉开差距的,会是模型能不能主动构造验收、发现运行结果与题目约束不一致、在工程接口层纠错。
这条视频里的关键不是 Kimi 赢了一次,而是它提示了下一阶段竞争方向:模型需要从代码生成器变成工程闭环执行者。它要能理解题目、选择合适 API、建立坐标系、运行代码、观察画面、发现穿模、修正中心点,再重新验证。也就是说,未来 AI 编程的核心不是一次生成,而是“生成 - 执行 - 观察 - 诊断 - 修复”的闭环。
对用户来说,未来也不能把“AI 写了代码”当成交付。交付必须带验收证据:运行截图、测试结果、边界样例、失败说明、修改记录。谁能建立这套验收文化,谁就能更安全地使用 AI 编程;谁仍然只看生成速度和输出长度,谁就会被“数学满分工程翻车”反复坑。
五、可迁移判断与可复制步骤
第一条判断:AI 编程评测必须从文本正确转向结果正确。模型说出了正确公式,不代表它把坐标系、API 和运行环境处理对了。只要任务能被外部世界验证,就必须拉到外部世界验证。
第二条判断:主目标失败时,附加功能不是亮点,而是干扰。一个圆锥滚错了,再多拖拽、平移、缩放都不能弥补核心错误。业务交付也一样,核心指标没解决,包装越多越危险。
第三条判断:好的测试题应该“短 prompt、高约束、可视化验收”。题目文字不必很长,但必须包含足够多会让模型暴露真实能力的约束,并且结果一眼能看出对错。
第四条判断:模型的自我认知、路径选择和命名错误不是小事。它们说明模型会被上下文示例污染,也说明在自动化工程里必须有明确输出边界和文件路径检查。
第五条判断:最快交卷不等于最好交付。Qwen 很快,但结果变成双球;MiniMax 也快,但没有圆锥。AI 提效的前提是正确,错误越快,返工越快。
可复制步骤:
- 先把任务拆成可验收项,不只写“做一个效果”,而是列出能跑、对象正确、运动逻辑正确、边界正确、视觉可接受等维度。
- 给所有模型同一个 prompt,避免因为提示词差异造成不公平。
- 记录耗时、中断、是否联网、是否自检、是否主动运行验证等过程指标,但不要让过程指标替代结果判断。
- 必须运行生成物。网页就打开浏览器,脚本就跑测试,数据任务就对样例和边界样例。
- 把错误归因到层级:听错题、公式错、API 坐标错、工程环境错、视觉验收错、身份或路径错。
- 最后输出不是单一排名,而是“这个模型适合什么任务,不适合什么任务,使用时要补什么验收”。
这条视频最值得入库的不是某个模型赢了,而是一条工作原则:AI 的正确感很便宜,工程正确性很贵。真正的好测试,就是让正确感无处藏身。