【深扒】博主拿 Claude Fable 5 连做 6 个工程实测:到底「离谱」在哪,又为什么说「很强但不通用」
【深扒】博主拿 Claude Fable 5 连做 6 个工程实测:到底”离谱”在哪,又为什么说”很强但不通用”
原视频:抖音 @布鲁歇一歇《Fable 5 超详细实测,只能说有点离谱了》· 时长约 9 分半 · 纯实机录屏 + 旁白解说,对标 GPT-5.5 / Opus 4.8 / Codex。 说明:博主口播里把”Fable”念成了”fibo/febo/vivo/bo5”,转写工具也跟着错,本文统一还原为 Fable 5(Claude 最近发布的新模型)。
这不是一条”震惊体”的吹捧视频,而是一份实测清单:博主连开 6 个工程,每个都让 Fable 5 真跑出可玩、可点、可交互的成品,再拉同题对手同台比。看完你能拿到的不是”它很强”这句空话,而是它强在哪一档、弱在哪一块、什么人不该买。
一句话结论
Fable 5 在复杂工程落地、前端可视化、长任务执行这三件事上,是肉眼可见的”第一档”;但它贵、偏复杂项目、且录制当天使用政策刚变动——对绝大多数人是”看得见摸不着”的强。
博主的原话很克制:很多任务”已经不是能不能做出来的问题,而是能做到什么完成度的问题了”。这句话是整条视频的题眼——前沿模型的竞争,已经从”能跑通”挪到了”完成度”。
6 个实测,逐个拆
测试 1 | 3D 开放世界游戏《真实都市》——从 2D 一路升到 3D
需求:参考某开放世界游戏,做一款从最初 2D 平面 → Minecraft 风格 → 最终 3D 世界加拓展玩法的游戏。博主是 Max 用户,直接开 Claude Code、上 Ultracode + 多 agent 并行跑(中途还翻车插了个”无奈流汗”表情包调节)。
成品是个能玩的 3D 城市《真实都市》:WASD 移动、跳跃、商店内购、Q 切武器(M4 / AK,连 AK 射速更慢、枪声不同都被准确还原),能开出租车 / 卡车 / 跑车、车速有差异;还塞了个隐藏玩法——广场中央一个仿魔兽世界的 Boss(满血 1000,血量低于 500 触发跑酷小游戏),角色死亡是 GTA 式的 WASTED 黑屏。
判断点:这一关真正”离谱”的不是画面,是细节的自洽——武器手感差异、载具速度差异、Boss 血量阈值触发新机制,这些都不是”贴个图”能糊的,是工程逻辑被认真实现了。当然也有翻车:Boss 战左右操作是反的,穿模、找不到送货光柱。博主没藏,照实演。
测试 2 | 横板融合游戏(马里奥 + 合金弹头)——Fable 5 对打 Codex
同一道题分别喂给 Codex 和 Fable 5,要求两种风格自然结合。
- Codex 版(《管道突击队》):生成更快(博主承认手滑开了快速模式),但没音效、交互平淡、旗子飘在半空,合金弹头元素几乎没融进去,基本还是马里奥的壳。
- Fable 5 版(《皮可突击 / PICO ASSAULT》):有音效、按 J 开火、能拿手雷,武器握在手里——合金弹头的味道真融进去了,关卡里还铺了小 Boss、隐藏关。
判断点:这一组是”速度 vs 完成度”的经典权衡。Codex 快,但交出来的是骨架;Fable 5 慢一点,交出来的是带血肉的成品。博主对 Fable 5 的总评是一句很重的话——执行过程里它”不断思考和反问,给人一种真的是人在思考的感觉”。这句指向的是 agentic 能力,不是单纯出代码。
测试 3 | 前端发布页特效——Fable 5 / GPT-5.5 / Opus 4.8 三方同台
同一道”给虚拟产品做一个产品发布首页”的题,三个模型各跑一版。
- Fable 5:流体动态、文字聚散、颜色变化、丝滑度全都拉满,博主原话”我去真的非常夸张”,直接判定可以当成熟产品的宣传首页用。
- GPT-5.5:前端能力稍逊一筹,动画”非常光污染”(堆特效但杂乱)。
- Opus 4.8(同门兜底对照):做了不少优化但整体偏卡,流体 / 粒子效果 OK,但离 Fable 5 仍有差距。
判断点:博主特意拉上自家 Opus 4.8 做对照,是为了堵”GPT 前端本来就不强、比赢不算数”这个嘴。结论是:Fable 5 的可视化能力已经摸到”直接生产落地”的线——这是这条视频里最硬的一个论断。
测试 4 | 人类文明进化宣传片《From Fire to Future》——对打 GPT-5.5
让两个模型各做一支”人类文明进化史”宣传片。
Fable 5 用火柴人风格,分段叙事完整:远古狩猎 → 农业 → 城市 → 工业革命 → 信息时代 → 探索宇宙,动态过渡自然。GPT-5.5 同样火柴人,但几乎没有动画效果,更像 PPT,叙事感弱。博主一句”差的不是一点半点”。
测试 5 | 商业数据看板——唯一没拉开差距的一局
让两边各做一个商业数据分析驾驶舱看板。Fable 5 做得精细、维度多(营收 / 用户分层 / 转化漏斗);但这恰恰是 GPT 最擅长的部分,GPT 也做得不错。
判断点:这是全片最诚实的一笔——博主明说”这一点 Fable 5 并没有体现出很强的数据分析优势”。一个肯说自家测的模型”这局没赢”的测评,可信度比满屏吹的高一个量级。 也给了我们一条选型判断:纯数据看板类,GPT 仍是高性价比选项,不必为 Fable 5 的高价买单。
测试 6 | 城市灾害应急指挥沙盘 + AI 自动演示——压轴
最有意思的一题:做一个城市灾害应急指挥沙盘,支持 AI 自动化演示。
Fable 5 版:地图分区域、随机突发事件(暴雨 / 地震),关键是灾害会”蔓延”——只加几个暴雨、不及时处理就会慢慢扩散到其他城区,地震不处理也会引连锁灾害,带一种偏真实的动态系统感。GPT 版:城市布局粗,只有一个城区说明,没法手动加事件,纯 AI 自驱、颗粒度不够。
判断点:这局考的不是”画得好看”,是有没有把”系统的因果”模拟出来(事件→未处理→蔓延)。Fable 5 把一个静态看板做成了有时间维度的动态系统,这是工程理解力,不是美术能力。
横向战绩表(按博主实测口径)
| 测试场景 | Fable 5 | 对手 | 谁更强 |
|---|---|---|---|
| 3D 开放世界游戏 | 武器/载具/Boss 机制自洽,有翻车但能玩 | —(无对照) | Fable 5 |
| 横板融合游戏 | 有音效、融合到位、带关卡 Boss | Codex(快但骨架、无音效) | Fable 5 |
| 前端发布页特效 | 丝滑、可生产落地 | GPT-5.5(光污染)/ Opus 4.8(偏卡) | Fable 5 |
| 文明进化宣传片 | 分段叙事 + 动态过渡 | GPT-5.5(像 PPT) | Fable 5 |
| 商业数据看板 | 精细、维度多 | GPT-5.5(同样不错) | 打平 |
| 灾害应急沙盘 | 灾害会蔓延、可手动加事件 | GPT-5.5(颗粒粗、纯自驱) | Fable 5 |
一句话读表:5 胜 1 平,唯一平手在”数据看板”——也正是 GPT 的主场。
三个必须说清的限制(别只看强)
博主在收尾给了三条很关键的”冷水”,比前面的炫技更值得记:
- 贵:价格确实偏高,不是日常高频任务划算的选择。
- 偏复杂项目:它更适合复杂工程和系统级任务,日常用不到这么重的火力——拿它写个小脚本是杀鸡用牛刀。
- 使用政策变动:博主称”就在录这期视频的当天,它的使用政策出现变化,现在暂时用不了了”,视频简介还写了”昨天老美已经停用”。
⚠️ 编者注(诚实标注):第 3 条里”老美停用 / 美国政府限制访问”是博主的说法,本文未独立核实,很可能是使用额度/政策调整被戏剧化表述,不要当成已证实的政治事件传播。涉政治性论断,存疑、不放大。模型层面,Fable 5 确是 Claude 较新的模型,能力方向与视频展示一致。
这条视频凭什么”好看”:能抄的内容方法
抛开模型本身,这是一条结构极标准的 AI 测评视频,做内容的人可以直接拆来抄:
- 钩子(前 3 秒):多窗口闪过 3D 游戏 / 特效 / 看板一堆成品,配”只有自己上手跑过,才知道这个神话级模型多离谱”——用”已完成的震撼成品”+“离谱”情绪词做钩子,不解释、先砸视觉。
- 节奏:6 个测试全用同一个循环——需求提出 → 生成过程 → 成果演示 → 同题对比 → 一句点评。模板化的节拍让 9 分钟不闷。
- 对比是骨架:几乎每个测试都拉一个对手(Codex / GPT-5.5 / Opus 4.8),分屏或先后切换,强弱一眼可辨——对比本身就是最强的说服力。
- 真实感来自”敢露丑”:Boss 左右反了、穿模、找不到光柱、自家 Opus 没赢、数据看板打平……这些”翻车”和”没赢”才是可信度的来源,比满屏完美更让人信。
- 收尾给判断不给口号:不喊”快去买”,而是”很强但不通用 + 贵 + 偏复杂项目”,把决策权还给观众——这是高级测评和带货的分界线。
可复用的文案骨架(套谁都行):
开头:「这些 X 都是我用【新工具/新模型】跑出来的,上手才知道多离谱」(成品砸脸 + 情绪词) 主体 ×N:「我让它做一个【具体任务】」→ 演示 →「同样的题我让【对手】也做了」→ 对比 → 一句点评 收尾:「它在【A/B/C】确实是第一档,但【贵/偏某场景/有门槛】,不是所有人都需要」
编者判断(留余地)
- 看模型别看”能不能”,看”完成度”。前沿模型已经普遍能”跑通”,真正拉开差距的是细节自洽(武器手感、灾害蔓延、关卡机制)。选型时,把题目出得足够复杂,才测得出真实力。
- “敢说自家没赢”是测评可信度的金标准。这条视频在数据看板局明确说 Fable 5 没赢、还拉自家 Opus 做对照堵嘴——看任何测评,先找它”承认了什么短板”,没有短板的全是软广。
- 强 ≠ 该用。贵 + 偏复杂项目 = 大多数日常场景的负收益。模型选型是”匹配任务重量”,不是”无脑选最强”:小活轻模型,系统级重活才上 Fable 5 这一档。
- 政治性 / 政策性论断,存疑不放大。“老美停用”这类说法,没核实就只当”博主这么说”,绝不二次传播成事实——这是内容纪律,也是风控。
- agentic 感 = 过程会思考反问。博主反复强调 Fable 5”像人在思考”,这指向的是它在长任务里会自我修正、追问,而非一次性吐代码。这恰恰是把模型当”协作者”而非”代码生成器”的分水岭。
诚实声明:本文基于一条抖音实测视频的双轨(逐字稿 + 画面)拆解,所有结论是单个博主 demo 级实测口径,非标准 benchmark,未独立复现;“使用政策 / 老美停用”等说法未经核实,仅作博主表述记录。模型能力以官方为准。