结论先说:大多数 AI 工程师都会构建智能体,但很少有人会构建在第一次尝试之后变得更好的系统。区别在于——智能体是工人,循环让这个工人不断进步。

我之前写过《Loop Engineering 循环工程》,讲的是框架层:为什么顶尖工程师不再一句句写提示词、而是改写循环,一个循环由哪六块积木搭成(触发器、目标、动作、验证、记忆、硬闸),以及四个会反噬你的坑。

这篇是它的姊妹篇,往下钻一层:具体有哪些循环可以搭。素材来自一篇在圈子里流传的英文清单(ThinkInAI 社区有译介),我按自己的框架重新嚼了一遍——不是搬运 20 个名词,而是讲清每一类在解决什么问题、关键判断是什么、以及按什么顺序装

先给一句总纲:这 20 个模式共享同一个母结构——

行动 → 观察 → 评估 → 调整

输出从来不是第一次就完成的。输出只是起点,循环才是把起点变成生产级成果的东西。

类别 1 · 质量改进循环:在输出离开系统前让它变好

这一类五个模式,其实是同一招的五档加保险:让一个独立的评估者盯着生成者,风险越高、保险加得越厚。

1. 生成 → 批判 → 重写。 AI 工程里最重要的循环。生成器出草稿,批判者挑毛病(“第 3 段模糊、缺证据、语气不对”),生成器照着改,重复到过质量线。关键洞察:生成内容的模型,不是判断自己输出质量的最佳裁判——一个真正独立的批判者(自己的指令、自己的评分标准),往往能看到生成器看不到的东西;如果批判者跟生成器同一套提示词同一个视角,那只是自言自语加了个回声。这就是上一篇说的”干活的和验活的分开”,批判者不用更聪明,只要不一样

2. 打分并重试。 生成、打分、低于阈值就重来,到上限就交最好的那版。简单、强大、被低估。适合质量可衡量的场景:抽取准确率、格式合规、事实正确性。精髓在生成和评估分离——打分的标准握在评估器手里,不由生成器自己说了算。

3. 多批判者。 一个批判者有盲点,那就上四个,各自独立评,全过才放行。适用医疗、法律、金融这类受监管内容。

4. 对抗式批判。 批判者的唯一任务不是改进答案,是击穿答案:哪些假设可能不成立?缺什么证据?哪里自信但错误?生成器辩护或重写。最好的答案是经受住攻击的答案。适合研究综合、投资论点、风险分析。

5. 评审集成。 一个评审的分数有噪声,五个评审把噪声平均掉,只有共识度高的输出才进下一步。前提是评审彼此真独立——五个同源同偏置的评审,平均掉的只是随机噪声,平均不掉系统性偏差。适合单模型评估不可靠、错一次代价大的场景。

怎么选档:日常内容用 1 或 2 就够;输出错了会赔钱、会上监管的,才值得 3、4、5 的成本。别给低风险任务上五重保险,那是烧钱不是严谨。

类别 2 · 记忆循环:从发生过的事里学,让下次更聪明

这一类回答的是上一篇那句话的落地问题:“agent 会忘,仓库不会忘”——具体存什么、怎么存、存多了怎么办

6. Reflexion。 最经典的自我改进模式。失败 → 分析自己为什么失败 → 把教训存下来 → 带着教训重试。它追求的目标是把系统从”会失败”升级成”只在同一个问题上失败一次”。当然,反思也可能归因错、存下错误的教训——所以教训本身最好也过一遍验证,别让反思变成给错误盖章。

7. 记忆更新。 每完成一个任务存三件事:做了什么决策、结果如何、下次会怎么做不同。第 6 个月的系统已经不是第 1 个月的系统——它读过自己 6 个月的历史。

8. 错误库。 存下每一次失败。接新任务前先搜错误库,有类似失败就先应用已知修法。这是生产级 AI 里最被低估的模式——而且注意,它的关键动作不在”存”,在”动手前先查”。存了不查,等于没存。

9. 成功模式库。 大多数人只存失败。成功也要存:什么方法、什么上下文、什么因素让它成了。遇到类似任务先检索成功模式。从胜利里学,不只从错误里学。

10. 记忆压缩。 记忆会无限增长,而无限的记忆就是不可用的记忆。积累到一定量就压缩:把”任务 A 因 X 失败、任务 B 因 X 失败、任务 C 因 X 失败”三条,压成一条”模式:X 导致失败,动手先查 X”。上下文可控、模式可查、系统不变慢。

这五个是一条流水线:6 产教训、7 定格式、8 和 9 分库存放、10 定期清库。只装 6 不装 10 的系统,迟早被自己的记忆拖慢——多久拖垮取决于任务量,但方向是确定的。

类别 3 · 规划循环:当现实变化时调整计划

11. 计划 → 执行 → 重新规划。 智能体设计最常见的错误是把计划当固定的东西——计划一接触现实就崩。正确姿势:定计划、走一步、看结果、改计划、继续。不是瀑布,是螺旋,每转一圈方法收紧一点。

12. 动态工作流。 固定流水线是”步骤 1→2→3 永远如此”;动态工作流根据结果变形:输出 A 走分支 X、输出 B 走分支 Y、输出 C 直接跳步骤 5。流水线在运行时决定自己的形状。

13. 目标分解。 大目标 → 子目标 → 任务 → 步骤,持续拆到每个单元小到一次调用能执行为止。拆不动了才动手,这是防止”接了个大活就闷头乱做”的结构化解法。

14. 进度评估。 每 N 步停下来问一句:“我们真的更接近目标了吗?“是就继续,不是就换策略、换工具、换计划。系统监控自己的进展,而不是盲目执行。这个模式值得加粗——它就是上一篇三道硬闸里”no-progress 杀停”的巡逻版,是防止长任务循环闷头烧 token 的第一道刹车。

15. 约束满足。 持续迭代直到所有业务约束通过:预算内、质量线上、延迟达标、语气对味、事实核查过线(注意”无幻觉”没法完全验证,能写进约束的是可检验的事实检查)。只有每条规则都过,输出才算完成。这是把”验收标准”从人脑搬进循环的做法。

类别 4 · 探索循环:靠多条路径找到更好的答案

这一类最贵,也最容易被滥用。判断标准一句话:决策价值 > 计算成本才用。

16. 分支探索。 别押单一路径——同时生成保守版、激进版、创意版,分别打分,取最好的,扔掉其余。适合内容变体、架构选型、多假设调试。

17. 树搜索。 分支探索只深一层,树搜索深到需要的层级:扩展有希望的节点、剪掉弱的、持续到找到解。计算成本高,但能稳定找到单次调用基本碰不到的解决方案。适合复杂推理链、多步规划、深度调试。

18. 辩论。 两个智能体、一个主题、相反立场。A 支持答案、B 反对,每轮挑战假设、要证据、暴露弱逻辑。最终答案通过分歧浮现,而不是通过一致意见——对抗压力能发现单个自信答案遗漏的东西。适合投资决策、战略规划、风险评估。

类别 5 · 系统优化循环:循环改进循环本身

19. 提示词优化。 大多数人写一次提示词就再也不碰。这个模式让提示词在测试集上跑分、根据失败样本自动重写自己、直到达标。很多生产级系统里最好的提示词不是一次写出来的,是在测试集上演化出来的——人定标准和测试集,循环负责迭代措辞。

20. 工作流优化。 真正有意思的地方:系统衡量自身的延迟、成本、质量,然后修改自己的工作流——太慢就并行化、太贵就把某步换小模型、质量掉就在出口前加个批判者。不只是输出在改进,是系统在重新设计自己。

但这一类要配一句警告:它也是认知投降的入口。当系统能重写自己的提示词和工作流,人最容易彻底撒手。上一篇的态度在这里最要紧——审结果的人必须还在,19 和 20 的每次”自我修改”都该留痕、可回滚、有人过目。

怎么装:一个务实的顺序

20 个全装是行为艺术。按这个顺序来:

  1. 先装 2(打分重试)和 1(生成批判重写)——最便宜、回报最快,一天能上线。
  2. 有长任务就立刻装 14(进度评估)——它是防烧钱的刹车,优先级高于一切花哨模式。
  3. 接着上记忆三件套 6 + 8 + 9——系统开始”只在同一个问题上失败一次”,复利从这里开始。记得预约 10(压缩),别等记忆库不可用才想起来。
  4. 高风险场景才加 3 / 4 / 5 / 17 / 18——按错误代价定保险厚度。
  5. 19 / 20 最后装,而且人要留在环里。

还有一个看清全局的角度:这 20 个模式没有一个是新积木,全是上一篇那六块积木的排列组合——质量类是 Verification 的五种花样,记忆类是 Memory 的五种花样,规划类是 Goal + Actions 的动态版,探索类是 Actions 的并行版,系统优化类是 Loop 优化 Loop。看懂积木,清单就不用背了。

收尾

这波 AI 工程里最值得押注的转变,不是等更好的模型,是把工作方式从”提示词 → 响应”换成”生成 → 评估 → 学习 → 改进”——模型再强,也只是让这个循环的每一圈转得更好。

掌握循环设计的团队,构建的不是更好的提示词,是部署后每天都在变好的系统。但请带着上一篇那句话去装这 20 个模式:

把循环建起来。但要像一个打算继续当工程师的人那样去建,而不是只想按下”开始”就走人的人。

模式给你杠杆,态度决定这根杠杆撬的是复利,还是一张敞口的发票。