把一个上千万销售额的爆款智能体「蒸馏」成 5 块开源积木——白日梦想老凡的复刻方法论

标题里的「蒸馏」不是机器学习里的模型蒸馏(Knowledge Distillation),而是另一种更接地气的提纯:把一个正在网上卖到上千万的爆款 AI 产品拆开、提纯,看清它到底由哪几块开源积木拼成,再自己用 Codex 重写一遍。蒸馏取的是「纯净的本质」——剥掉包装、UI、卖货话术,剩下那几个智能体,才是真东西。

这是「白日梦想老凡」一条 104 秒口播视频的深度拆解。视频简介只有五个字:蒸馏 #vibecoding #智能体 #opc #超级个体 #codex。下面的内容来自双轨还原:SenseVoice 逐字稿(口播)+ 豆包视觉逐帧读屏(画面文字 / UI / 销量页)。机器转写里的工具名已按画面截图校订,以画面为准。


一、先把「蒸馏」说清楚:它指的是产品提纯,不是模型蒸馏

很多人看到「蒸馏」+「智能体」,第一反应是模型蒸馏——拿大模型当老师去教小模型。这条视频跟那个完全无关。

老凡说的蒸馏,是一套逆向提纯的方法论:

看到一个在闷声赚钱的 AI 产品 → 把它彻底拆开 → 发现它只是几个开源智能体的组合 → 用 Codex 照着自己重写一遍。

他原话:「今天拆解了一个网上卖的不错的、有上千万销售额的爆款口播视频生成智能体,拆完了以后才发现它实际上是大概 4 到 5 个智能体把它打包起来,然后做一个可视化的应用。」

蒸馏的精髓在「提纯」二字:一个卖几千块的成品,看着高大上,蒸干水分后只剩 5 个开源模块。谁能看穿这层包装,谁就能自己造。 这也正好对应他打的 #超级个体 #opc(One Person Company,一人公司)标签——单兵就能复刻别人的整条产品线。


二、被蒸馏的对象:一个「上千万销售额」的口播视频生成智能体

先看清楚被拆的是什么,才知道蒸馏出了什么。

画面里那个产品叫「爆款口播视频自动生成智能体」,商品页上一排卡片售价 199 ~ 2980 元,其中一个标价 ¥899 的卖了 1857 件——光这一个 SKU 就是百万级流水。老凡判断整盘「上千万销售额」并不夸张。

它凭什么卖得动?三个点:

  1. 打的是「一键使用」的懒人刚需。 老凡说得很直接:「刚刚接触 AI 的人,大部分都是想一键使用的,他不想知道这里面到底是怎么做出来的。」技术门槛被产品包装成一个可视化客户端,用户付钱买的是「不用懂」。

  2. 用「读书卡 / 书卡」卖法绕开合规。 这是最狡猾的一手——不直接卖软件,而是包装成「读书卡」这类知识付费品来卖,避开了智能体软件在平台上的合规、退款、版权这些麻烦。卖的是「卡」,交付的是工具。

  3. 需求旺、对手多但都赚钱。 「随便点开一个销量都不错」,说明这不是孤品爆款,而是一个被验证过的、有持续需求的赛道。

一句话定性:这是个「逻辑极简、却实打实赚钱」的生意。技术是现成的,产品是拼装的,真正值钱的是「把懒人需求翻译成一键付费」这层商业设计。


三、蒸馏结果:5 块开源积木拼出整个产品

这是全片最硬的干货。老凡把那个智能体拆到底,得出它的技术栈就是 5 个开源模块的串联(画面截图逐行确认):

环节用的开源工具干什么
语音识别Whisper(OpenAI)把对标视频的音频转成文字,拿到原始文案
语音合成CosyVoice(阿里通义)文本转语音 / 声音克隆,生成口播音轨
数字人驱动HeyGem驱动数字人形象对口型,生成出镜画面
视频处理FFmpeg合成视频、加字幕、加音乐、拼封面
自动发布平台 API把成品一键分发到各内容平台

注:口播里这几个名字被机器转写成了「westpo / cos voice / h 杠的 / 在 FF / so to down」,对照画面技术栈页可还原为 Whisper / CosyVoice / HeyGem / FFmpeg / 平台发布 API——全是免费开源、可自己部署的东西。

看懂这张表,就看懂了「蒸馏」的价值:一个卖你两三千的「智能体」,拆开全是公开可下载的积木。它的护城河从来不是技术,是「把这 5 块拼好、包装成一键客户端」的那一下。


四、它对外宣称的 9 大功能,其实是一条流水线

商品功能页打的旗号是「支持一键自动产出爆款视频」,列了 9 个卖点。把它们按执行顺序串起来,就是一条完整的内容工厂流水线:

  1. 自动提取对标文案(扒爆款原片的口播)
  2. 文案仿写(100% 改写,规避搬运)
  3. 声音克隆(按文案生成自己的音色)
  4. 数字人口播(生成出镜数字人)
  5. 自动加字幕
  6. 自动配音乐
  7. 自动生成标题
  8. 自动生成封面
  9. 多平台一键发布

本质是:输入一个对标链接 → 输出一条改头换面、可直接发布的口播视频。 9 个功能听着多,合起来就是「抄爆款 → 换皮 → 批量分发」这一件事。


五、复刻:用 Codex 把 5 个智能体重写成 5 个 skill

光拆不算本事,老凡的重点是真的自己造了一个出来——这就是 #vibecoding #codex 的落点。

他照着原产品的智能体结构,用 Codex 重写了一遍,落成 5 个流程 / skill:

  1. 提取文案——粘贴对标链接,一键提取原片口播
  2. 仿写——把提取到的文案改写成自己的版本
  3. 克隆声音——按文案生成音频
  4. 生成视频——上传素材,产出数字人口播视频
  5. 发到所有平台——多平台一键分发

画面里能看到复刻工具「口播数字人」的界面,上述 5 步都跑通了。他自己评价:「效果还不错,当然还在改进当中,还是有些 bug,但至少可以做到能够出视频了。」

这里有个对「超级个体」很重要的启发:复刻一个上千万的产品,不需要从零发明任何技术。 你要做的是把 5 个开源模块用 Codex 这类工具粘起来、补上 UI、跑通流程。技术整合的可行性,老凡用一条视频证明了。


六、把方法论拎出来:可复用的「蒸馏五步法」

这条视频真正值得沉淀的,不是「口播视频工具怎么做」,而是蒸馏任何一个赚钱 AI 产品的通用套路。抽象出来是五步:

  1. 盯赚钱的,不盯炫技的。 选拆解对象的标准是「在闷声卖、销量真实」,不是技术多新。商品页销量就是最好的需求验证。

  2. 拆到积木级,别停在功能级。 不要只记「它能生成口播视频」,要拆到「它由 Whisper + CosyVoice + HeyGem + FFmpeg + 发布 API 组成」。拆到开源模块这一层,才有可复制性。

  3. 认清护城河在哪。 拆完会发现技术全是公开的——真正的壁垒是「需求洞察 + 包装 + 卖货渠道」。这决定了你复刻后该把力气花在哪。

  4. 用 vibecoding 粘起来。 拿 Codex / Claude Code 这类工具,把开源积木重新组装成自己的流程和 skill。不发明轮子,只做集成。

  5. 想清楚怎么合规地卖。 原产品用「读书卡」卖法绕开软件合规,这是商业设计的一部分,复刻时绕不开。(这一步是双刃剑,见下文红线。)

蒸馏的本质,是把「别人的成品」反推成「自己能拼的配方」。看穿一次,你就拥有了一类产品的复制能力。


七、最狠的一句洞察:技术不是壁垒,需求 + 销售才是

老凡在结尾抛了全片的题眼,值得逐字抄下来:

「有些生意看上去好像很简单,逻辑很简单,但是它就是赚钱。重点是敏锐地抓住这些需求,然后把产品卖出去,这个才是核心。」

这句话把整条视频的价值观点透了:

  • 那 5 个开源模块,任何会点技术的人都能下载、都能跑。
  • 但能把它拼成产品、找到「想一键使用又愿意付费」的人群、用读书卡的方式卖出去——这才是赚到上千万的那群人真正做对的事。
  • 技术整合可以蒸馏、可以复刻;需求嗅觉和销售能力,蒸馏不出来,得自己练。

对超级个体来说,这是个清醒剂:别迷信技术深度,先去市场里找「逻辑简单但有人在闷声赚钱」的缝隙。


八、给想自己复刻的人:落地清单 + 三条红线

如果你看完想动手,把上面的东西落成可执行的清单:

技术侧(全开源、可自部署):

  • 语音识别:Whisper —— GitHub 开源,本地可跑
  • 语音合成 / 声音克隆:CosyVoice —— 阿里通义开源
  • 数字人:HeyGem —— 开源数字人方案
  • 剪辑合成:FFmpeg —— 老牌开源命令行工具
  • 发布:各平台开放 API / 自动化脚本
  • 粘合层:Codex / Claude Code 把以上写成 5 个 skill

产品侧:

  • 先做「提取 → 仿写 → 克隆 → 生成 → 发布」这条最小流水线,跑通再加字幕 / 音乐 / 封面
  • UI 做成「粘链接、点一下」的傻瓜式客户端,卖的就是「不用懂」

三条红线(别只看赚钱忽略风险):

  1. 声音克隆 / 数字人涉及肖像权、声音权。 克隆他人音色、套用他人形象有法律风险,自用或获授权才稳妥。

  2. 「仿写对标文案」离搬运 / 洗稿只有一线之隔。 平台对搬运打击越来越严,改头换面不等于原创。

  3. 「读书卡卖法绕合规」本身游走灰色地带。 它绕的是平台的软件合规审核,不代表没有合规风险。把它当「原产品的商业设计」来理解,而不是当成可照抄的安全做法。


九、一句话沉淀

这条视频教的不是「怎么做口播视频工具」,而是「怎么蒸馏一个赚钱产品」:盯销量、拆到开源积木、认清护城河不在技术、用 vibecoding 粘起来、想清楚怎么卖。技术能被蒸馏复刻,需求嗅觉和销售能力不能——后者才是超级个体真正要修炼的。


附:原始素材(双轨)

口播逐字稿(SenseVoice,已据画面轻校工具名):

今天拆解了一个网上卖的不错的、有上千万销售额的爆款口播视频生成智能体,拆完了以后才发现它实际上是大概 4 到 5 个智能体把它打包起来,然后做一个可视化的应用。就是这么一个简单的动作,但是需求量旺盛,随便点开一个销量都不错。而且他们用这种读书卡的方式来卖,避免了智能体软件这方面的一些合规问题——刚刚接触 AI 的人大部分都是想一键使用的,他不想知道这里面到底是怎么做出来的。所以我今天就把它拆掉。拆掉它所有的结构以后,发现它实现功能的大概就是 5 个智能体结合起来:第一个是语音识别(Whisper),第二个是语音合成(CosyVoice),第三个是智能体 / 数字人驱动(HeyGem),还有一个视频处理(FFmpeg),还有一个是自动发布的平台 API——这些都是开源的。那这个智能体能做什么呢?提取对标文案、文案仿写、根据文案克隆声音、自动生成数字人口播,还能加字幕、加音乐、加封面等等,最后发到各个平台。然后我照着它所有的智能体重新写了一遍,效果还不错,当然还在改进当中、还有些 bug,但至少可以做到能够出视频了。我也做了 5 个流程和 skill:提取文案、仿写、克隆声音、生成视频、发到所有平台。所以有些生意看上去逻辑很简单,但它就是赚钱,重点是敏锐地抓住这些需求,然后把产品卖出去,这个才是核心。

画面关键信息(豆包视觉读屏): 工具界面「爆款口播视频自动生成智能体」(含制作音频 / 视频发布模块) → 技术栈页(Whisper / CosyVoice / HeyGem / FFmpeg / 平台 API,附安装说明) → 商品销售页(199~2980 元,¥899 售 1857 件) → 大型会议演讲场景 → 项目结构(script / audio / avatar 等文件夹)→ 9 大功能列表页 → 复刻工具「口播数字人」5 步演示(获取文案 / 仿写 / 声音克隆 / 数字人视频 / 一键发布)。画中画右上角全程保留出镜讲解。

视频作者:白日梦想老凡 | 时长 104 秒 | 来源:抖音(v.douyin.com/9nm0znq8z4Y)。本文为学习性深度拆解,工具名以画面为准,商业数据为视频内展示值,复刻前请自行核实合规边界。