Hello-Agents 音频课第四章 智能体经典范式构建(站点第 3 章) · EP 02
第 3 章 · EP 02

Plan-and-Solve 与 Reflection:先规划,再反思

时长 16:25音色 云健 · 男声
§4.3Plan-and-Solve§4.4Reflection

同步字幕

章节导航(点击跳转)

0:00开场0:52
0:52侦探与建筑师2:14
3:07规划阶段怎么设计1:12
4:19执行器与状态管理1:40
6:00一个算苹果的例子1:22
7:22反思机制 执行 反思 优化2:24
9:47记忆模块与三种提示词1:54
11:41优化代码的实例1:43
13:25成本收益与收尾2:59
要点全文

Plan-and-Solve 与 Reflection:先规划,再反思

一句话概要:ReAct 像侦探走一步看一步,Plan-and-Solve 像建筑师先出蓝图再施工;而 Reflection 给智能体装上事后复盘回路,用「执行—反思—优化」把合格方案迭代成优秀方案,代价是调用开销、延迟和提示工程复杂度。

本章要点

一、侦探与建筑师

Plan-and-Solve 把任务明确分成两阶段。ReAct 像经验丰富的侦探,根据现场蛛丝马迹随时调整方向;Plan-and-Solve 像建筑师,动工前先画完整蓝图,再严格按图施工。它于二零二三年提出,动机是解决思维链处理多步骤复杂问题时容易「偏离轨道」的问题。

  • 规划阶段:接收完整问题,先分解并制定清晰分步骤的行动计划,计划本身就是一次模型调用的产物;
  • 执行阶段:严格按计划逐一执行,每一步可能是一次独立的模型调用或对上一步结果的加工。

形式化地:规划模型根据原始问题生成含若干步骤的计划;执行阶段每一步的生成同时依赖原始问题、完整计划与此前所有步骤的结果。

二、适用场景

结构性强、可清晰分解的任务:多步数学应用题(先列计算步骤再逐一求解)、整合多信息源的报告撰写(先规划结构再填充内容)、代码生成(先构思函数与模块结构再逐一实现)。

三、规划阶段的提示词三要点

角色设定(如「顶级的规划专家」)、任务描述(清晰定义分解问题的目标)、格式约束(强制输出结构化列表,极大简化后续解析)。格式约束最易被忽略,却决定了代码能否稳定解析——很多人翻车就翻在模型回了一整段自然语言。

四、执行器与状态管理

执行器不只是调用模型,更承担状态管理:记录每步结果并作为后续步骤的上下文。其提示词必须包含四项:原始问题(始终了解最终目标)、完整计划(知道当前步骤的位置)、历史步骤与结果(作为当前步骤的直接输入)、当前步骤(明确这轮要解决什么)。缺任一项信息链都会断。

五、算苹果的例子

周一十五个,周二是其两倍,周三比周二少五个,三天共卖出多少。规划阶段分解为四步:周一十五 → 周二十五乘二得三十 → 周三三十减五得二十五 → 三天相加得七十。执行阶段逐步引用历史结果,最终准确得出七十。相比让模型一路心算,拆成显式步骤后每步可验证,出错能立刻定位。

六、Reflection:执行—反思—优化

灵感来自人类的校对与验算。三步循环:

  1. 执行:用既有范式产出初步方案,即「初稿」;
  2. 反思:调用独立的或带特殊提示词的模型扮演评审员,从事实性错误、逻辑漏洞、效率问题、遗漏信息四个维度评估,生成结构化反馈;
  3. 优化:把初稿与反馈作为新上下文再次调用模型,产出修订稿。

循环重复直到不再发现新问题或达到迭代上限。三条价值:提供内部纠错回路(不再只依赖外部工具反馈,能修正更高层的逻辑与策略错误);把一次性执行转为持续优化;构建短期记忆(迭代轨迹本身即经验记录)。

七、记忆模块与三种提示词

短期记忆模块是必需品:用列表按序存储每次行动与反思,提供添加记录的方法,核心的「获取轨迹」方法把记忆序列化成可插入提示词的文本,另有方法取出最新初稿。工程要点是记忆模块决定了评审员看什么——给太多稀释注意力,给太少看不出问题。

三种角色提示词:初始执行提示词(直接要求完成任务)、反思提示词(机制灵魂,要求扮演严格评审员并给出可操作反馈,关键是「极其严格」且「专注」某一维度)、优化提示词(据反馈修正产出)。

八、素数函数的优化实例

任务「编写函数找出一到 n 之间所有素数」是绝佳场景:存在明确优化路径、反思点清晰、优化方向明确。第一轮反思精准指出初版 n 乘以根号 n 的复杂度瓶颈,建议改用埃拉托斯特尼筛法;第一轮优化实现筛法,复杂度降到 n 乘以 log log n;第二轮反思肯定当前效率并提及分段筛法等方向,但判断「一般情况无需改进」,触发终止条件收敛。这说明好的反思不只是修错,更能驱动阶梯式提升,且必须能判断「够好了」。

九、成本收益与选型

成本:每轮迭代至少额外两次模型调用(反思+优化),成本成倍增加;串行导致延迟显著提高,不适合实时场景;需要为执行、反思、优化三阶段分别设计调试提示词,复杂度上升。

收益:解决方案质量跃迁(从合格到优秀);鲁棒性增强(修复逻辑漏洞、事实错误、边界处理不当)。

反思是典型的「以成本换质量」,适合关键业务代码与技术报告、科研复杂推演、深度分析决策支持;需要快速响应或大致正确即可时,用更轻量的 ReAct 或 Plan-and-Solve 更划算。

音频章节时间戳

时间章节
00:00开场
00:52侦探与建筑师
03:07规划阶段怎么设计
04:19执行器与状态管理
06:00一个算苹果的例子
07:22反思机制 执行 反思 优化
09:47记忆模块与三种提示词
11:41优化代码的实例
13:25成本收益与收尾

总时长 16 分 25 秒。

原书对应小节

Datawhale《Hello-Agents:从零开始构建智能体》第四章「智能体经典范式构建」,第 4.3 节「Plan-and-Solve」(4.3.1 工作原理、4.3.2 规划阶段、4.3.3 执行器与状态管理、4.3.4 运行实例与分析),以及第 4.4 节「Reflection」(4.4.1 核心思想、4.4.2 案例设定与记忆模块设计、4.4.3 编码实现、4.4.4 运行实例与分析、4.4.5 成本收益分析)。

更完整的图文内容请直接阅读原书,本页仅为音频配套要点。

授权

本内容改编自 Datawhale《Hello-Agents:从零开始构建智能体》,采用 CC BY-NC-SA 4.0 授权,为二次演绎配音版。