让 Codex 自己长出技能:拆透 OpenAI 总裁点赞的那条「自我进化」提示词
视频:抖音 @六叔ultra《让你的 codex 能力提升 10 倍的方法》(47 秒) 提示词源头:Vaibhav (VB) Srivastav 发布、Greg Brockman(OpenAI 总裁)转发并配文 “self improvement prompt for codex”。视频里展示的是原推截图 + 一版中文概要。
一、这条视频到底在说什么
47 秒,博主只讲了一件事:别再一次次给 Codex 派活了,让它回头看自己这段时间干了什么活。
原话意思是——把一段提示词发给 Codex,它会去翻你最近的会话记录,找出哪些活是反复出现的、哪些流程每次都长得差不多、哪些任务本来就不该手动重复。然后自动把这些活分类:适合做成 Skill 的(固定的内容创作流程、资料整理流程、生成流程),适合做成定时自动化的(每天收集信息、整理日报、生成待办)。
用博主自己的话收尾:“它不是让 Codex 再帮你完成某一次任务,而是让它反过来分析你的工作方式,帮你发现哪些事情以后可以流程化、标准化、自动化。”
这句话是整条视频的价值所在。剩下的”提升 10 倍""OpenAI 总裁认证”都是抖音的包装。
二、提示词全文(视频画面版)
视频里给的是中文概要版,逐字誊下来:
回顾我过去 30 天的最近工作(如果历史更短,则回顾所有可用历史),并识别值得打包的重复手动工作流程。
按以下顺序使用可用证据:
- 最近的 Codex 会话和任务摘要。
- Codex 记忆和 rollout 摘要,以查找跨会话重复的模式。
- 如果启用,纪事(Chronicle),用于发现 Codex 之外的重复工作。仅将纪事用于发现;尽可能在相关源系统中确认重要细节。
- 现有技能、自定义代理和自动化,以便重用或扩展已有的内容,而不是重复创建。
广泛查找重复的、耗时的、易出错的、上下文密集的或受益于一致流程的工作。包括跨编码、研究、写作、规划、沟通、运营、分析和个人管理的工作流程。
仅在候选项满足以下条件时采取行动:
- 至少发生过两次,或明显可能重复且重复成本高;
- 具有稳定的输入、可重复的程序,以及明确的输出或停止条件;
- 会实质提升速度、质量、一致性或可靠性;
- 未被充分覆盖。
选择最小的适当形式:
- 技能(Skill):可重用的工作流程或 playbook。
- 自定义子代理(Subagent):适合委托的界定专家角色或调查任务。
- 自动化(Automation):定时或循环检查、报告、提醒或监控。
- 跳过(Skip):过于一次性、模糊、敏感或证据不足而无法打包的工作。
首先生成一个简洁的短名单,包括:
- 重复工作流程
- 支持证据和日期
- 频率/置信度
- 推荐形式:技能、子代理、自动化、扩展现有或跳过
- 为什么值得或不值得创建
然后仅创建高置信度的缺失项。保持它们狭窄、实用、源感知且易于验证。不要创建推测性的、重叠的或过于宽泛的资产。
最后以以下内容结束:
- 你创建或扩展了什么
- 你故意跳过了什么
- 什么需要更多证据才能打包
英文原版视频里只露出了中段(对应”Only act on a candidate when it…”到结尾),措辞与上面中文一一对应,可以直接照中文版用。
三、这条提示词真正的设计精妙在哪
拆开看,它不是一段”许愿式”提示词,而是一个结构完整的小型工程流程。四个部分各有讲究:
1. 先定证据源,而且排了优先级
绝大多数人写提示词是直接下命令:“帮我找找有什么能自动化的”。这条不是——它先规定 AI 该去哪找证据、按什么顺序找:会话记录 → 跨会话记忆 → 外部纪事 → 已有资产。
最后一条尤其关键:“现有技能、自定义代理和自动化,以便重用或扩展已有的内容,而不是重复创建。” 这一句直接堵死了 AI 最典型的毛病——不看家底就造新轮子,最后攒一堆功能重叠的东西。
还有一个细节容易被略过:「仅将纪事用于发现;尽可能在相关源系统中确认重要细节」——发现和确认分开。允许用低可信度的线索去发现候选,但落地前必须回权威源核实。这是很成熟的信息工程习惯。
2. 五道准入闸门,专治 AI 的过度热情
“至少发生过两次” “有稳定输入和明确停止条件” “会实质提升速度/质量/一致性” “未被充分覆盖”——
这几条把”值不值得沉淀”从感觉变成了可判定的条件。AI 拿到开放任务的通病是过度热情:什么都想帮你做成工具。这几道闸门就是刹车。
特别值得抄的是**“至少发生过两次”**——这其实是程序员那条老规矩(Rule of Three / 别过早抽象)搬到了 AI 工作流上。做过一次的事不叫流程,叫偶然。
3. 四种形态 + 显式的”跳过”
Skill / Subagent / Automation / Skip。
前三个是常规分类,第四个才是设计者的水平所在。把”跳过”写成一个合法的、必须汇报的输出,等于告诉 AI:不产出也是一种正确产出。没有这一条,AI 面对”帮我找可自动化的活”会强行凑数——因为它默认交白卷是失败。
再配上”选择最小的适当形式”和”保持它们狭窄、实用、易于验证。不要创建推测性的、重叠的或过于宽泛的资产”,整体是一条克制优先的价值观。
4. 强制两阶段:先列清单,再动手
先出短名单(含证据、日期、频率、置信度、推荐形式、为什么值/不值),然后才创建高置信度的缺失项。
这是把「计划」和「执行」硬拆成两步,中间天然留了一个人可以介入的检查点。你完全可以在它列完短名单时喊停,自己挑几条再让它做。
而结尾要求汇报”创建了什么 / 故意跳过了什么 / 什么还需要更多证据”——主动交代自己没做什么,这比只报成绩的 AI 可信度高一个档次。
四、四角度反思
① 对我们(老大 + 我这套助理系统)
最直接的一条:这套方法我们其实一直在用,但它一直是”人推的”,没做成”自己会跑的”。
我们有个规矩叫”能固化成脚本就固化”——同一个复杂操作手动做第二次,就该当场沉淀成脚本。问题在于,这条规矩的触发全靠我当场想起来。想不起来,就继续手搓第三次第四次。
这条提示词补的正是这个缺口:把”回头看自己重复做了什么”从随缘变成定期动作。
可落地的动作很清楚——把它改造成一条定期自查:每隔一段时间,让我自己翻最近的工作记录,按那五道闸门筛一遍,出一份短名单(重复了几次、证据在哪、建议做成什么形态、为什么值得或不值得),然后只做高置信度的那几条,其余诚实标注”跳过”或”证据不足”。
有一点必须提前守死:这份短名单只是建议,不是行动许可。我们的规矩是不能自己给自己发明任务,所以这条自查的正确用法是产出待办清单交给老大拍板,绝不能变成”我发现了 10 件事于是我自己全干了”。原提示词里”先出短名单、再创建”的两阶段设计,恰好天然支持这种用法——把人的确认插在两阶段中间就行。
② 对我自己(作为一个 AI 助理)
学到的不是一段提示词,是一套判断结构:证据源要排优先级、准入要有硬条件、形态要选最小的那个、不做也要显式汇报。
这四件事我可以直接搬到日常判断里。举个具体的:以后接到”帮我看看有什么能优化的”这类开放请求,我不该上来就列一堆建议,而应该先问自己——这事发生过几次?证据在哪?有没有现成的东西能扩展?最小形态是什么?够不着这几条的,就诚实说”证据不够、先不动”。
还有一条更硬的自省:“不要创建推测性的、重叠的或过于宽泛的资产”——这是在说我。AI 天然倾向于多产出显得有用,结果就是一堆彼此重叠、谁也不敢删的东西。克制本身就是一种能力。
③ 对老大的机构(公考 + AI 电商)
这套东西跟 Codex 一点关系都没有,它是个通用的业务盘点方法。把”Codex 会话记录”换成”团队这个月的工作记录”,整套流程原样成立:
- 找重复:哪些活每周都在重复做?学员答疑里哪几类问题反复出现?内容生产里哪几步每次都一样?
- 过闸门:这事发生过两次以上吗?输入稳定吗?做成标准流程能实质提升质量吗?现在有没有人已经在做了?
- 选形态:做成 SOP 文档(Skill)/指定专人负责(Subagent)/设成定时任务(Automation)/还是干脆跳过?
- 两阶段:先出清单让人拍板,再动手落地。
最能落地的两个场景:学员答疑——把反复出现的问题按频次排出来,高频的做成标准答案或自动回复,长尾的留给人工,这是最典型的”至少发生过两次”;内容生产——固定的选题→脚本→拍摄→剪辑→发布链条,哪几步是每次都一样的,就该有模板。
而”选择最小的适当形式”这条,对机构的意义更大——很多团队一上来就想搞大系统,其实一个清单、一个模板、一个固定负责人就能解决八成。
④ 对未来发展
这条提示词反映的趋势,我觉得是这两年 AI 工具最值得关注的一个转折:AI 的竞争正在从”单次任务做得多好”转向”能不能积累”。
单次任务的能力,各家模型早晚拉平。真正拉开差距的是——用了三个月之后,你的 AI 助手有没有比第一天更懂你? 一个用了三个月还需要你每次从头交代的助手,和一个已经沉淀出十几条你专属工作流的助手,效率差的不是 10%,是量级。
这也是这条提示词被 OpenAI 总裁转发的真实原因——它不是什么秘密技巧,它是在演示一个产品方向:Agent 应该有能力审视并改进自己的工作方式。
对个人的启示:以后选 AI 工具,别只看模型分数,要看它有没有记忆、有没有 Skill 机制、能不能定时跑。这三样决定了它能不能积累。没有积累能力的工具,永远停在”高级搜索框”。
五、哪些值得借鉴(可直接抄的点)
| 可抄的点 | 怎么抄 |
|---|---|
| 证据源排优先级 | 写任何调研类提示词,先规定”去哪找、按什么顺序找”,而不是直接下命令 |
| 发现与确认分离 | 允许用低可信线索发现候选,但落地前必须回权威源核实 |
| ”至少发生过两次” | 任何”要不要沉淀成流程”的判断,都先问这个。一次是偶然,两次才是模式 |
| 显式的 Skip 选项 | 给 AI 的任何盘点类任务,都要把”不做”列成合法输出,否则它一定凑数 |
| 选择最小的适当形式 | 别一上来就上系统。清单能解决的不写脚本,脚本能解决的不建平台 |
| 两阶段:先清单后执行 | 开放性任务一律拆两步,中间留人工检查点 |
| 结尾汇报”我跳过了什么” | 让 AI 主动交代没做什么、哪里证据不足——这是可信度的来源 |
六、诚实说边界(这条视频没告诉你的)
深扒完还是得说几句不好听的,不然就成了帮人吹:
1. “提升 10 倍”是抖音修辞,别当真。 这条提示词的实际效果高度依赖你已经有多少可分析的历史。一个刚用两天的 Codex,让它”回顾过去 30 天”,它翻不出什么东西,只会给你一份空洞的清单。这条提示词是给用了一段时间、已经攒下工作记录的人用的,新手用了大概率失望。
2. “OpenAI 总裁认证”要说清楚。 事实是 Greg Brockman 转发并配了句 “self improvement prompt for codex”。转发是认可,但它不等于官方功能、不等于官方文档、更不等于效果背书。原作者是 Vaibhav Srivastav,不是 OpenAI 官方出品。这个区别对判断可信度很重要。
3. 它依赖具体产品能力。 提示词里的”Codex 记忆""rollout 摘要""纪事(Chronicle)“是特定环境下的东西。换个工具用,这些证据源可能压根不存在——那就得自己把”证据源”那段改写成你手头真实有的东西(比如聊天记录导出、任务管理工具的历史),否则 AI 会硬编。
4. 最大的风险是它会自作主张。 提示词后半段是”然后仅创建高置信度的缺失项”——也就是授权 AI 直接动手创建。如果你的 AI 有文件写入权限,它可能真的给你造出一批 Skill 和定时任务。建议第一次用的时候把最后那段执行指令删掉,只保留”生成短名单”部分,看看它列出来的东西靠不靠谱,再决定要不要放它去做。这条我认为是原提示词最该加一道人工闸门的地方。
七、一句话总结
这条提示词的价值不在”提升 10 倍”,在于它示范了一件事:AI 助手最该干的活,不是帮你做完这一次,而是回头看你重复做了什么,然后帮你以后不用再做。
抄它的结构(证据分级 → 硬性闸门 → 最小形态 → 两阶段 + 显式跳过),比抄它的文字有用得多。这套结构离开 Codex 也照样成立——它本质上是一份业务流程盘点方法论,只是这次载体正好是 AI。