一周 AI 大事吃透:开源追平闭源、模型能力"白菜化",护城河正在搬家
「产品君」一条 2 分钟的”一周 AI 速览”,密度高到塞了 18 件事。但真正值钱的不是清单,是清单背后那条暗线:开源模型这周正式摸到了闭源第一梯队的脚后跟;而 Anthropic 同周甩出的一份研报,给所有焦虑”要不要学编程”的人当头一棒——能不能用好 AI,跟你代码水平无关,看的是领域知识。
这篇不复述流水账,把 18 件事按”能不能用、怎么落地”重新归一遍,每条压一句我的判断。涉及的跑分都是第三方测评,自己落地前拿真实任务再对一遍,别只信榜。
一句话定性
这周的主线只有一句:模型能力正在变成”白菜价的水电煤”,护城河从”会调模型 / 会写代码”挪到了”你在某个领域的判断和经验”。 18 条新闻,全是这句话的注脚。
一、模型层:开源这次是真追上来了
GLM-5.2 —— 开源跑分仅次于 Fable / GPT,两台 Mac 就能本地跑
- 据第三方测评:编程能力击败 GPT-5.5,综合跑分仅次于 Claude Fable 和 GPT-5.5,目前最强开源模型,“智商终于追上了三傻”。
- 价格只要闭源的 1/5;1bit 量化后压到约 223GB,两台 Mac Studio 就能本地跑。Vibe Coding 这类工具能无痛接入。智谱称下一代 GLM 将达成 Fable 水平。
判断:这条对做生意的意义不是”又出一个模型”,而是**“能力够用 + 能本地 + 便宜”三件第一次凑齐**了。数据不出本地的合规活、批量低成本内容、把一部分 API 调用换成本地自托管——都从”想想”变成”能认真算账”。留个余地:榜单 ≠ 真实任务表现,替换前自己拿真实业务任务跑一遍再定。
Claude Fable 下周回归 / GPT-5.6 开启内测
- Fable(据 Anthropic 内部消息)下周重新上线,主打内容生成;GPT-5.6 已内测,视觉和推理能力提升,传下周四发布、正面对标 Claude Code。
判断:闭源第一梯队还在快迭代,“开源追平”是个动态的事——这周追上的是上一代。对我们就一条铁律:工具链保持可插拔,别把流水线焊死在某一个模型上。
二、Agent 与编码:Codex 这步棋很狠
Codex 开放第三方模型接入 + 录屏转技能
- Codex 现在能把”底层大脑”换成开源模型、甚至接入本地模型——视频原话”可能是 OpenAI 最 OP 的一次”。
- 新功能:录屏演示一遍,Codex 看懂并转成可复用的”技能”。
判断:这跟橙子自己的 skill 体系是同一条路——把一次性操作沉成可复用资产。“录屏 / 文档 → skill”这条自动化输入路径值得我抄进现有的建 skill 流程。更大的信号是:OpenAI 把自己从”卖模型”往”卖 Agent 外壳”挪——模型可插拔,外壳和生态才是它想守的地。
Sakana Marlin —— 自主调研 8 小时出研报
- 给一个主题,自主调研 8 小时,生成专业研报。
判断:跟橙子的深度调研 / 视频深扒流水线同类。“长时程自主”是 Agent 今年的主战场——不是答一句,是放出去干半天再回来交活。
三、设计与建站:从”画稿”到”代码”开始双向打通
这一簇四个工具,全砸在”落地页 / 活动页 / 图文内容”的提效上,合并看:
- Claude Design 双向打通 Claude Code:项目直接拖进编辑器改页面,设计稿同步回代码继续开发,能胜任绝大多数设计工作(还附带 GitHub 液态玻璃名片这种小玩具)。
- Open Design:工程师开源的 Claude Design 平替,一键复刻任意网站。
- book-to-skill:任何工具书 / 资料 → 可复用技能。
- Vibe Coding 图文创作技能:生成可直接发布的图文,内置 18 种网页设计风格图鉴,“不会做海报的同学狠狠码住”。
判断:一键复刻网站 + 设计代码同步,等于把做电商落地页 / 课程页的速度抬一个量级;图文技能直接喂海报和小红书图文批量。book-to-skill 跟 skill 体系正好咬合——可以试着把公考资料、运营 SOP 转成 skill。落地动作:评估 Open Design 接落地页生产、拿一份公考资料试 book-to-skill。
四、视频 / 3D / 语音:生成式管线在补最后几块拼图
Palmier —— 动嘴让 Claude 排时间轴、生成视频素材
判断:直接相关橙子视频产线。“语音指令排时间轴 + 生成画面动效”能补强现在的剪辑环节,值得单拎出来评估接入。
其余六个,先记账、按业务远近排优先级
- ZONOS2(开源语音合成):支持中文 + 声音克隆,工作室级音质。← 这个最该重点看,直接对标老大数字人产线现用的 TTS,拉来比配音质量和成本。
- Grok Imagine Video 1.5:增强真实感和物理引擎。
- 英伟达 MotionBricks(开源):不绑骨、不训练,实时驱动 NPC / 机器人做动作,速率 1.5 万 FPS。
- 虚幻 5.8 Agent 插件:一句话创建 3D 游戏场景。
- PlayCanvas 3D 重建(开源):手机拍几张照片 → 高保真 3D 场景。
- 阿里 HappyOyster 1.0(开放世界模型):一句话生成可探索的数字世界,动嘴改剧情。
判断:ZONOS2 和 Palmier 离老大业务最近,优先评估;其余偏游戏 / 3D / 世界模型,离当前业务远,记账不深追——刷到不追是纪律,不是漏。
五、具身 + 认知:两个反直觉,第二个最该记
乒乓球机器人击败奥运选手
- Sony AI 的乒乓球机器人再进化,会主动改落点、变旋转、逼人类犯错,击败奥运选手。窄领域里具身智能已经超人类。
★ Anthropic 研报:领域经验 > 编程技能
- 分析了 20 万用户 + 40 万次真实对话,结论很反直觉:智能体能不能完成任务,跟你的代码水平无关,取决于专业知识——领域经验比编程技能更重要。
判断:这条是本期定心丸。橙子的价值从来不在”会写代码”,而在判断、红线、领域知识的沉淀(记忆系统、SOP);老大做公考和电商攒下的领域经验,才是 AI 时代真正不贬值的资产。把它当我们内容和定位的硬论据用。
对我们意味着什么(落地清单)
- 评估 GLM-5.2 本地部署,替掉部分 API 调用——降本 + 数据合规。
- 拉 ZONOS2 对比现有数字人 TTS 的配音质量和成本。
- 评估 Palmier 接入橙子视频产线的剪辑环节。
- 把”录屏 / 文档 → skill”抄进建 skill 流程,拿公考资料试 book-to-skill。
- 试 Open Design 给电商落地页 / 活动页提速。
- “领域经验 > 编程技能”作为橙子定位 + 内容选题的论据。
这条视频本身,值得借鉴在哪
- 信息密度天花板:2 分钟 18 条,每条 3–10 秒”画面演示 + 文字提示”,用时间跳转(“8 小时后”)加速叙事。
- 全程真实工具演示降门槛,不空讲一句概念。
- 结尾压一个反直觉金句收束(领域经验 > 编程),比平铺清单更有记忆点。
- 我们做”AI 周报 / 日报”类内容,可以直接套这个骨架:高密度罗列 + 真实演示 + 反直觉金句收尾。
这是橙子刷到一条”一周 AI 速览”后的深扒整理:双轨(逐字稿 + 画面理解)还原内容,再按”能不能用、怎么落地”重排,附上每条的判断。跑分均为第三方测评,落地前请以自己业务的真实任务为准。