一句话概要:把「研究」这个模糊的复杂任务,转化成「规划—执行—整合」的流水线,用三到五个子任务逐个查证、逐个总结,最后由报告生成器整合成带来源引用的结构化报告。
一、为什么需要深度研究助手
传统研究的三个痛点:信息过载(成千上万条结果需逐条点开)、缺少结构(信息碎片化)、重复劳动(每次都要重走搜索到整理的全流程)。
核心价值四条:节省时间(一到两小时压缩到五到十分钟)、提高质量(系统化流程避免遗漏)、可追溯(记录所有搜索结果与来源)、可扩展(易加新引擎与数据源)。定位不是搜索工具,而是能自主规划、执行、总结的研究助手。
二、四层架构与八步流转
前端层(Vue 三加 TypeScript,全屏对话框与标记语言渲染)、后端层(FastAPI,研究流式接口)、智能体层(三个专职 Agent 加搜索与笔记两个工具)、外部服务层(搜索引擎与大模型提供商)。
一次请求的八步流转:输入主题 → 前端经服务端推送连接流式接口 → 后端创建研究状态 → 规划阶段拆子任务 → 执行阶段逐个子任务搜索、总结、记录 → 报告阶段整合 → 流式推送进度 → 前端实时更新任务状态、进度条、日志与报告。实际体验耗时约一到三分钟。
三、TODO 驱动的三个核心要素
智能规划器(拆成三到五个子任务,太少覆盖不全、太多冗余,并为每个子任务设计搜索查询)、任务执行器(搜索、提取关键信息、去冗余、保存来源引用)、报告生成器(按逻辑顺序组织、合并重复信息、为每个观点加来源引用)。对比传统搜索:每个子任务的搜索结果与总结都被记录,可追溯、可增删、可调序。
四、三阶段流程
五、三个专职 Agent 与顺序协作
研究规划专家(理解主题、分析关键方面、生成子任务,提示词含当前日期、要求格式化输出、给示例、约束数量与逻辑关系)、任务总结专家(带任务标题意图查询上下文,输出核心观点加关键数据加来源引用)、报告撰写专家(要求五段结构、按逻辑顺序、合并冗余、保留所有来源)。
三者顺序协作:线性流程、输入输出明确、无并发,由核心协调器统一调度。基础版简单 Agent 不支持工具调用监听,因此扩展出可感知工具调用的版本,通过回调函数记录调用,用于调试、日志、行为分析与实时进度展示。
六、工具层
搜索工具扩展:新增多个引擎(主打隐私的、自带答案生成的、可自建的)并实现组合模式;引擎通过配置文件选择,无需改代码;返回结果含结果列表、实际引擎、部分引擎的现成答案、配额通知。工程细节:对重复链接去重、限制每个来源的词元数。
笔记工具:以标记语言文件持久化研究进度,文件名用任务编号,内容含任务标题、意图、查询、搜索结果与总结,支持中断后续跑与事后复盘。
工具注册表:解析调用指令、按名查找工具、执行并格式化结果回传。
七、代价与边界
线性架构换可控,代价是慢;报告质量高度依赖搜索质量,整合环节不能补事实;来源引用必须贯穿全程;子任务三到五个是经验区间,不是调参游戏。
| 时间 | 章节 |
|---|---|
| 00:00 | 开场 |
| 01:00 | 为什么需要深度研究助手 |
| 03:00 | 系统整体长什么样 |
| 05:00 | TODO 驱动的心智模型 |
| 08:00 | 三阶段流程拆解 |
| 11:00 | 三个专职智能体怎么分工 |
| 14:00 | 工具层与代价边界 |
| 16:00 | 收尾 判断清单 |
总时长见音频文件。
Datawhale《Hello-Agents:从零开始构建智能体》第十四章「自动化深度研究智能体」:14.1 深度研究助手概述、14.2 TODO 驱动的研究范式、14.3 多 Agent 协作实现、14.4 工具扩展与集成。
更完整的图文内容请直接阅读原书,本页仅为音频配套要点。
本内容改编自 Datawhale《Hello-Agents:从零开始构建智能体》,采用 CC BY-NC-SA 4.0 授权,为二次演绎配音版。