1
00:00:00,100 --> 00:00:02,105
你好，欢迎收听。

2
00:00:02,105 --> 00:00:09,230
这一集我们来聊一个看起来很基础，但其实最容易被讲错的问题，到底什么是智能体。

3
00:00:09,230 --> 00:00:18,617
本内容改编自 Datawhale《Hello-Agents：从零开始构建智能体》，采用 CC BY-NC-SA 4.0 授权，为二次演绎配音版。

4
00:00:18,617 --> 00:00:27,475
授权再说一遍，本内容改编自 Datawhale《Hello-Agents》，采用 CC BY-NC-SA 4.0 授权，为二次演绎配音版。

5
00:00:27,475 --> 00:00:32,632
你可能已经在前几期里听过这个词，也可能在各种地方见过它。

6
00:00:32,632 --> 00:00:42,175
有人说它是能自动干活的脚本，有人说它就是给大模型套了个壳，还有人把任何接了接口的聊天机器人都叫智能体。

7
00:00:42,175 --> 00:00:45,600
这些说法都沾点边，但都不够准。

8
00:00:45,600 --> 00:00:50,516
这一集我想做的，是给你一个能长期用的心智模型。

9
00:00:50,516 --> 00:01:05,833
听完你会知道，判断一个东西是不是智能体，要看哪几个要素；传统智能体是怎么一步步演化过来的；大语言模型出现以后，到底改变了什么；以及最重要的，什么时候你不该上智能体。

10
00:01:05,833 --> 00:01:07,443
我们开始。

11
00:01:07,588 --> 00:01:08,956
先给定义。

12
00:01:08,956 --> 00:01:20,072
在人工智能领域，智能体被定义为任何能够通过传感器感知其所处环境，并自主地通过执行器采取行动，以达成特定目标的实体。

13
00:01:20,072 --> 00:01:22,488
这句话里有四个要素。

14
00:01:22,488 --> 00:01:26,718
第一个是环境，也就是智能体所处的外部世界。

15
00:01:26,718 --> 00:01:36,081
对一辆自动驾驶汽车来说，环境是动态变化的道路交通；对一个交易算法来说，环境是瞬息万变的金融市场。

16
00:01:36,081 --> 00:01:40,096
环境不一样，智能体的设计就完全不一样。

17
00:01:40,096 --> 00:01:42,788
第二个是传感器，负责感知。

18
00:01:42,788 --> 00:01:50,817
摄像头、麦克风、雷达，或者各类应用程序编程接口返回的数据流，都是感知能力的延伸。

19
00:01:50,817 --> 00:01:56,081
智能体不是和环境隔离的，它得持续不断地感知环境状态。

20
00:01:56,081 --> 00:01:58,810
第三个是执行器，负责行动。

21
00:01:58,810 --> 00:02:07,079
它可以是物理设备，比如机械臂、方向盘；也可以是虚拟工具，比如执行一段代码、调用一个服务。

22
00:02:07,079 --> 00:02:11,165
感知之后不行动，那只是监控，不是智能体。

23
00:02:11,165 --> 00:02:16,490
第四个，也是真正赋予智能体智能的那个要素，是自主性。

24
00:02:16,490 --> 00:02:27,764
智能体不是被动响应外部刺激的程序，也不是严格执行预设指令的脚本，它能够基于自己的感知和内部状态独立做决策，去达成设计目标。

25
00:02:27,764 --> 00:02:33,209
从感知到行动，形成一个闭环，这就是所有智能体行为的基础。

26
00:02:33,209 --> 00:02:41,394
你可以拿这四个要素去卡任何一个自称智能体的东西，缺一个，它就更接近普通的自动化程序。

27
00:02:41,548 --> 00:02:48,998
在大语言模型热潮出现之前，人工智能的先驱们已经对智能体这个概念探索了几十年。

28
00:02:48,998 --> 00:02:54,488
这条路线非常清晰，从简单到复杂，从被动反应到主动学习。

29
00:02:54,488 --> 00:02:56,628
我们一级一级往上走。

30
00:02:56,628 --> 00:02:59,344
第一级，简单反射智能体。

31
00:02:59,344 --> 00:03:03,647
决策核心就是工程师写好的条件与动作规则。

32
00:03:03,647 --> 00:03:08,755
经典的自动恒温器就是这样，室温高于设定值就启动制冷。

33
00:03:08,755 --> 00:03:19,789
它完全依赖当前的感知输入，没有记忆，也不会预测，像一种数字化的本能，可靠、高效，但处理不了需要理解上下文的复杂任务。

34
00:03:19,789 --> 00:03:26,616
这就引出一个问题，如果环境当前的状态不足以作为决策的全部依据，该怎么办。

35
00:03:26,616 --> 00:03:29,777
第二级，基于模型的反射智能体。

36
00:03:29,777 --> 00:03:38,298
研究者引入了状态这个概念，给智能体装了一个内部的世界模型，用来追踪那些无法被直接感知的东西。

37
00:03:38,298 --> 00:03:41,724
它要回答，世界现在到底是什么样子。

38
00:03:41,724 --> 00:03:53,479
比如一辆在隧道里行驶的自动驾驶汽车，即便摄像头暂时看不见前方的车，它内部的模型仍然会维持对那辆车存在、速度和预估位置的判断。

39
00:03:53,479 --> 00:03:59,464
这个内部模型让智能体有了初级的记忆，决策不再只依赖瞬时感知。

40
00:03:59,464 --> 00:04:02,193
第三级，基于目标的智能体。

41
00:04:02,193 --> 00:04:05,246
光理解世界还不够，还得有目标。

42
00:04:05,246 --> 00:04:12,036
它的行为不再是被动反应，而是有预见性地选择能够导向某个未来状态的行动。

43
00:04:12,036 --> 00:04:15,738
它要回答，我应该做什么才能达成目标。

44
00:04:15,738 --> 00:04:26,916
典型例子是导航系统，你的目标是到公司，它基于地图数据通过搜索算法规划出最优路径，核心能力体现在对未来的考量与规划上。

45
00:04:26,916 --> 00:04:29,777
第四级，基于效用的智能体。

46
00:04:29,777 --> 00:04:37,637
现实里的目标往往不止一个，我们不只想到公司，还希望时间最短、最省油、还要避开拥堵。

47
00:04:37,637 --> 00:04:43,887
这时就给每个可能的世界状态赋予一个效用值，代表满意度的高低。

48
00:04:43,887 --> 00:04:49,416
智能体追求的不再是达成某个状态，而是最大化期望效用。

49
00:04:49,416 --> 00:04:53,611
它要回答，哪种行为能给我带来最满意的结果。

50
00:04:53,611 --> 00:04:58,238
这让智能体学会在相互冲突的目标之间做权衡。

51
00:04:58,238 --> 00:05:00,798
第五级，学习型智能体。

52
00:05:00,798 --> 00:05:09,548
到这里要问，前面四级的决策逻辑，不管是规则、模型还是效用函数，都还依赖人类设计师的先验知识。

53
00:05:09,548 --> 00:05:15,113
如果智能体能不靠预设，而是通过与环境互动自主学习呢。

54
00:05:15,113 --> 00:05:21,712
这就是学习型智能体的核心思想，强化学习是实现它最具代表性的路径。

55
00:05:21,712 --> 00:05:28,755
它包含两部分，一个是性能元件，也就是前面说的各类智能体；另一个是学习元件。

56
00:05:28,755 --> 00:05:36,207
学习元件观察性能元件在环境中的行动带来了什么结果，再不断修正它的决策策略。

57
00:05:36,207 --> 00:05:38,695
想象一个学下棋的程序。

58
00:05:38,695 --> 00:05:45,149
开始时它可能只是随机落子，当它最终赢下一局，系统会给出一个正向奖励。

59
00:05:45,149 --> 00:05:51,111
通过大量自我对弈，学习元件逐渐发现哪些棋路更可能导向胜利。

60
00:05:51,111 --> 00:05:59,957
当年在围棋上取得里程碑式突破的那套系统，就是通过强化学习发现了许多超越人类既有知识的策略。

61
00:05:59,957 --> 00:06:09,585
从恒温器，到有内部模型的汽车，到会规划的导航，到懂权衡的决策者，最后到能靠经验自我进化的学习者。

62
00:06:09,585 --> 00:06:16,556
这条路走下来，你就理解了传统人工智能是怎么一步步构建机器智能的。

63
00:06:16,684 --> 00:06:20,239
好，接下来是大语言模型带来的变化。

64
00:06:20,239 --> 00:06:28,879
以生成式预训练模型为代表的大语言模型出现之后，智能体的构建方法和能力边界都在被显著改变。

65
00:06:28,879 --> 00:06:33,122
它和传统智能体的核心决策机制有本质区别。

66
00:06:33,122 --> 00:06:41,559
简单说，传统智能体的能力来自工程师的显式编程和知识构建，行为模式是确定的、有边界的。

67
00:06:41,559 --> 00:06:53,879
而大语言模型驱动的智能体，通过在海量数据上的预训练，获得了隐式的世界模型和强大的涌现能力，能以更灵活、更通用的方式应对复杂任务。

68
00:06:53,879 --> 00:07:02,821
这个差异带来一个直接结果，就是它可以直接处理高层级的、模糊的、充满上下文信息的自然语言指令。

69
00:07:02,821 --> 00:07:06,283
我们用一个智能旅行助手来感受一下。

70
00:07:06,283 --> 00:07:18,495
在大语言模型智能体出现之前，规划一次旅行意味着你要在天气应用、地图应用、预订网站之间来回手动切换，自己扮演信息整合和决策的角色。

71
00:07:18,495 --> 00:07:25,273
而现在，当你给出规划一次厦门之旅这样一句模糊指令时，它会这样工作。

72
00:07:25,273 --> 00:07:27,401
首先是规划与推理。

73
00:07:27,401 --> 00:07:37,136
它把这个高层级目标分解成一系列逻辑子任务，确认出行偏好，查询目的地信息，制定行程草案，预订票务住宿。

74
00:07:37,136 --> 00:07:41,163
这是一个内在的、由模型驱动的规划过程。

75
00:07:41,163 --> 00:07:43,098
然后是工具使用。

76
00:07:43,098 --> 00:07:48,723
执行规划时它识别到信息缺口，会主动调用外部工具去补全。

77
00:07:48,723 --> 00:07:57,257
比如它调用天气查询接口拿到实时天气，发现预报有雨，于是后面的规划就倾向于推荐室内活动。

78
00:07:57,257 --> 00:07:59,240
最后是动态修正。

79
00:07:59,240 --> 00:08:02,365
它会把你的反馈当成新的约束。

80
00:08:02,365 --> 00:08:09,853
你说这家酒店超出预算，它就据此调整后续行动，重新搜索并推荐符合新要求的选项。

81
00:08:09,853 --> 00:08:17,389
查天气，调行程，订酒店，整个流程展现了它根据上下文动态修正行为的能力。

82
00:08:17,389 --> 00:08:24,745
一句话总结这个转变，我们正从开发专用自动化工具，转向构建能自主解决问题的系统。

83
00:08:24,745 --> 00:08:31,391
核心不再是编写代码，而是引导一个通用的大脑去规划、行动和学习。

84
00:08:31,540 --> 00:08:36,429
讲完范式切换，我们从三个互补的维度给智能体分类。

85
00:08:36,429 --> 00:08:43,327
第一个维度是内部决策架构，这其实就是刚才那五级阶梯的另一种说法，这里不重复。

86
00:08:43,327 --> 00:08:45,839
我们重点说后两个维度。

87
00:08:45,839 --> 00:08:47,846
先说时间与反应性。

88
00:08:47,846 --> 00:08:54,889
这个维度关注的是，智能体收到信息后是立刻行动，还是深思熟虑规划完再动。

89
00:08:54,889 --> 00:09:02,677
这里藏着一个核心权衡，追求速度的反应性，和追求最优解的规划性，两者之间怎么平衡。

90
00:09:02,677 --> 00:09:14,276
反应式智能体对环境刺激做出近乎即时的响应，决策延迟极低，通常遵循从感知到行动的直接映射，不做或者只做极少的未来规划。

91
00:09:14,276 --> 00:09:19,456
前面说的简单反射智能体和基于模型的智能体都属于这一类。

92
00:09:19,456 --> 00:09:26,139
优势是速度快、计算开销低，在需要快速决策的动态环境里至关重要。

93
00:09:26,139 --> 00:09:35,478
比如车辆的安全气囊系统，必须在碰撞发生的毫秒内做出反应；高频交易机器人也依赖它捕捉稍纵即逝的机会。

94
00:09:35,478 --> 00:09:43,242
代价是短视，缺乏长远规划，容易陷入局部最优，做不了需要多步骤协调的复杂任务。

95
00:09:43,242 --> 00:09:45,995
规划式智能体正好相反。

96
00:09:45,995 --> 00:09:59,901
它行动前会先做复杂的思考，不马上对感知做出反应，而是用内部的世界模型系统地探索未来的各种可能性，评估不同行动序列的后果，找到通往目标的最佳路径。

97
00:09:59,901 --> 00:10:04,396
基于目标和基于效用的智能体都是典型的规划式。

98
00:10:04,396 --> 00:10:12,834
可以类比成一位棋手，他不只看眼前一步，而是预想对手可能的应对，规划出后面几步甚至十几步。

99
00:10:12,834 --> 00:10:17,990
这让它能处理需要长远眼光的任务，比如制定商业计划。

100
00:10:17,990 --> 00:10:27,942
优势是决策有战略性和远见，代价是高昂的时间和计算成本，在瞬息万变的环境中，等它想完，最佳时机可能早过去了。

101
00:10:27,942 --> 00:10:31,440
现实世界的复杂任务往往两者都要。

102
00:10:31,440 --> 00:10:40,586
旅行助手既要能根据你即时的反馈调整推荐，这是反应性；又要能规划出为期数天的完整方案，这是规划性。

103
00:10:40,586 --> 00:10:43,014
于是就有了混合式智能体。

104
00:10:43,014 --> 00:10:54,084
一种经典的混合架构是分层设计，底层是快速反应模块处理紧急情况和基本动作，高层是审慎的规划模块负责长远目标。

105
00:10:54,084 --> 00:11:01,295
而现代的大语言模型智能体更灵活，它们在一个思考、行动、观察的循环里运作。

106
00:11:01,295 --> 00:11:13,579
思考阶段，模型分析当前状况，规划下一步的合理行动，这是审议；行动和观察阶段，智能体与外部工具或环境交互，立刻拿到反馈，这是反应。

107
00:11:13,579 --> 00:11:25,033
这样一来，一个宏大任务被分解成一系列规划与反应的微循环，既能灵活应对即时变化，又能通过连贯的步骤完成长期目标。

108
00:11:25,180 --> 00:11:33,158
第三个维度更根本，它问的是，智能体用来决策的知识，究竟以什么形式存在于它的思想之中。

109
00:11:33,158 --> 00:11:40,837
这个问题是人工智能领域持续半个多世纪的辩论核心，塑造了两种截然不同的技术文化。

110
00:11:40,837 --> 00:11:47,459
符号主义，也叫传统人工智能，核心信念是智能源于对符号的逻辑操作。

111
00:11:47,459 --> 00:11:53,685
符号是人类可读的实体，比如词语、概念，操作遵循严格的逻辑规则。

112
00:11:53,685 --> 00:12:01,017
这好比一位一丝不苟的图书管理员，把世界知识整理成清晰的规则库和知识图谱。

113
00:12:01,017 --> 00:12:10,668
优势是透明、可解释，推理步骤明确，决策过程能被完整追溯，这在金融、医疗这类高风险领域至关重要。

114
00:12:10,668 --> 00:12:23,493
但软肋是脆弱，它依赖一个完备的规则体系，而现实世界充满模糊和例外，任何一个没被覆盖的新情况都可能导致系统失灵，这就是所谓的知识获取瓶颈。

115
00:12:23,493 --> 00:12:27,483
亚符号主义，也叫连接主义，是另一幅图景。

116
00:12:27,483 --> 00:12:40,224
知识不是显式规则，而是内隐地分布在一个由大量神经元组成的复杂网络里，是从海量数据中学到的统计模式，神经网络和深度学习是它的代表。

117
00:12:40,224 --> 00:12:54,575
如果说符号主义是图书管理员，亚符号主义就像一个牙牙学语的孩童，他不是靠规则来认识猫的，而是在看过成千上万张猫的图片之后，自然能辨识出猫这个概念的视觉模式。

118
00:12:54,575 --> 00:13:03,349
它的强大之处在于模式识别能力和对噪声数据的鲁棒性，能轻松处理图像、声音这类非结构化数据。

119
00:13:03,349 --> 00:13:21,586
代价是不透明，它通常被视为一个黑箱，能以惊人的准确率认出图片里的猫，但你问它为什么认为这是猫，它很可能给不出合乎逻辑的解释；而且在纯粹的逻辑推理任务上表现不佳，有时会产生看似合理却事实错误的幻觉。

120
00:13:21,586 --> 00:13:37,888
于是就有了第三种思路，神经符号主义，目标是融合两者，创造一个既能像神经网络一样从数据中学习，又能像符号系统一样进行逻辑推理的智能体，弥合感知与认知、直觉与理性之间的鸿沟。

121
00:13:37,888 --> 00:13:45,941
诺贝尔经济学奖得主丹尼尔·卡尼曼在《思考，快与慢》里提出的双系统理论，能帮我们理解它。

122
00:13:45,941 --> 00:13:59,066
系统一是快速、凭直觉、并行的思维模式，类似亚符号主义强大的模式识别能力；系统二是缓慢、有条理、基于逻辑的审慎思维，恰如符号主义的推理过程。

123
00:13:59,066 --> 00:14:06,686
人类的智能正来自这两个系统的协同，一个真正鲁棒的智能体也需要兼具二者之长。

124
00:14:06,686 --> 00:14:11,758
大语言模型驱动的智能体就是神经符号主义的一个极佳范例。

125
00:14:11,758 --> 00:14:26,217
它的内核是一个巨大的神经网络，具备模式识别和语言生成能力；而它工作时会生成一系列结构化的中间步骤，思想、计划、接口调用，这些都是明确可操作的符号。

126
00:14:26,217 --> 00:14:32,419
通过这种方式，它实现了感知与认知、直觉与理性的初步融合。

127
00:14:32,548 --> 00:14:37,834
最后，也是我觉得最值钱的部分，什么时候你不该上智能体。

128
00:14:37,834 --> 00:14:41,594
第一，任务边界清晰、规则稳定的时候。

129
00:14:41,594 --> 00:14:47,195
如果你的需求是一组能写清楚的固定步骤，那传统脚本就够了。

130
00:14:47,195 --> 00:14:55,957
智能体的价值在于处理模糊和变化，规则越稳定，它带来的增益越小，反而多了一层不确定性和成本。

131
00:14:55,957 --> 00:14:58,673
别为了用智能体而用智能体。

132
00:14:58,673 --> 00:15:02,652
第二，对结果的可解释性有硬性要求的时候。

133
00:15:02,652 --> 00:15:08,661
如果决策必须能被完整追溯，比如某些金融和医疗场景，那就要谨慎。

134
00:15:08,661 --> 00:15:17,460
大语言模型那套隐式世界模型本质上还是不容易解释清楚，这时候符号主义的显式规则反而更合适。

135
00:15:17,460 --> 00:15:20,344
第三，延迟预算极紧的时候。

136
00:15:20,344 --> 00:15:31,041
规划式智能体的思考需要时间，如果你的场景要求毫秒级响应，比如安全气囊那样的控制，那就不该指望一个需要深思熟虑的系统。

137
00:15:31,041 --> 00:15:38,301
第四，也是我觉得最容易被忽略的一条，容错成本极高且无法设置兜底的时候。

138
00:15:38,301 --> 00:15:43,649
智能体会调用工具、会动态修正，行为路径不是完全确定的。

139
00:15:43,649 --> 00:15:51,282
如果一次错误就造成不可逆的损失，而你又没法加一层校验或回滚，那就先别上。

140
00:15:51,436 --> 00:15:56,470
好，我们把这一集收一下，给你几条能直接带走的判断依据。

141
00:15:56,470 --> 00:16:03,956
第一，判断一个东西是不是智能体，就看四要素，环境、传感器、执行器、自主性。

142
00:16:03,956 --> 00:16:09,629
缺了自主性，它就只是自动化；缺了执行器，它就只是监控。

143
00:16:09,629 --> 00:16:18,319
第二，理解传统智能体，就沿着五级阶梯往上走，反射，加模型，加目标，加效用，加学习。

144
00:16:18,319 --> 00:16:24,737
每一级解决的都是前一级回答不了的问题，这个顺序本身就是最好的记忆线索。

145
00:16:24,737 --> 00:16:32,634
第三，理解大语言模型带来的变化，抓住三个关键词，规划与推理，工具使用，动态修正。

146
00:16:32,634 --> 00:16:38,848
传统智能体靠工程师显式编程，新范式靠预训练出来的隐式世界模型。

147
00:16:38,848 --> 00:16:46,311
第四，给智能体分类，用三个互补维度，内部决策架构、时间与反应性、知识表示。

148
00:16:46,311 --> 00:16:54,533
时间维度上你要权衡的是反应速度和规划质量，知识维度上你要权衡的是可解释性和泛化能力。

149
00:16:54,533 --> 00:16:59,629
第五，也是最重要的一条，先问该不该上，再问怎么上。

150
00:16:59,629 --> 00:17:10,001
任务边界清晰就用脚本，解释性有硬要求就偏向符号主义，延迟预算极紧就别用规划式，容错成本极高就先加兜底。

151
00:17:10,001 --> 00:17:12,141
这一集我们就到这里。

152
00:17:12,141 --> 00:17:19,268
下一集我们会沿着这条线继续往下走，看智能体到底是怎么一步步被搭建出来的。

153
00:17:19,268 --> 00:17:22,261
感谢你的收听，我们下期见。
