1
00:00:00,100 --> 00:00:02,105
你好，欢迎收听。

2
00:00:02,105 --> 00:00:08,882
上一集讲了符号主义怎么靠规则撑起早期智能体，也讲了它最后撞在哪堵墙上。

3
00:00:08,882 --> 00:00:13,545
这一集接着讲，规则走不通之后思路是怎么转向的。

4
00:00:13,545 --> 00:00:22,932
本内容改编自 Datawhale《Hello-Agents：从零开始构建智能体》，采用 CC BY-NC-SA 4.0 授权，为二次演绎配音版。

5
00:00:22,932 --> 00:00:31,790
授权再说一遍，本内容改编自 Datawhale《Hello-Agents》，采用 CC BY-NC-SA 4.0 授权，为二次演绎配音版。

6
00:00:31,790 --> 00:00:33,665
这一集有两条线。

7
00:00:33,665 --> 00:00:42,379
一条是明斯基的心智社会，它放弃了造一个全能大脑的想法，改问一堆笨家伙凑在一起会不会变聪明。

8
00:00:42,379 --> 00:00:48,978
另一条是学习范式的演进，从联结主义到强化学习再到大规模预训练。

9
00:00:48,978 --> 00:00:50,588
我们开始。

10
00:00:50,740 --> 00:01:02,865
符号主义的探索和早期聊天机器人的实践，共同指向了一个问题，靠预设规则构建的、单一的、集中的推理引擎，似乎难以通向真正的智能。

11
00:01:02,865 --> 00:01:10,567
不管规则库多庞大，系统面对真实世界的模糊性和无穷变化时，总显得僵化而脆弱。

12
00:01:10,567 --> 00:01:15,916
这个困境促使一些顶尖的思考者反思最底层的设计哲学。

13
00:01:15,916 --> 00:01:34,357
其中马文·明斯基没有继续给单一推理核心添加规则，而是在《心智社会》一书里提出了一个革命性的看法，让我们变聪明的并不是什么神奇的戏法，根本就没有戏法，智能的力量来自极其丰富的多样性，而不是某个单一的、完美的原则。

14
00:01:34,357 --> 00:01:39,213
二十世纪七十到八十年代，符号主义的局限日益明显。

15
00:01:39,213 --> 00:01:56,993
专家系统在高度垂直的领域取得了成功，却没法拥有儿童般的常识；那个积木世界的项目能在封闭环境里表现出色，却无法理解这个世界之外的任何事情；早期聊天机器人能模仿对话，却对对话内容本身一无所知。

16
00:01:56,993 --> 00:02:06,993
这些系统都遵循同一种自上而下的思路，一个全知全能的中央处理器，根据一套统一的逻辑规则来处理信息、做出决策。

17
00:02:06,993 --> 00:02:12,162
面对这种普遍的失败，明斯基开始提出一系列根本性的问题。

18
00:02:12,162 --> 00:02:14,481
第一个，理解是什么。

19
00:02:14,481 --> 00:02:18,352
我们说理解一个故事，这是一种单一的能力吗？

20
00:02:18,352 --> 00:02:27,594
还是说，它其实是视觉化、逻辑推理、情感共鸣、社会关系常识等数十种不同心智过程协同工作的结果？

21
00:02:27,594 --> 00:02:30,070
第二个，常识是什么。

22
00:02:30,070 --> 00:02:34,614
它是一个包含数百万条逻辑规则的庞大知识库吗？

23
00:02:34,614 --> 00:02:40,443
还是一种由无数具体经验和规则片段交织而成的分布式网络？

24
00:02:40,443 --> 00:02:43,255
第三个，智能体该怎么构建。

25
00:02:43,255 --> 00:02:54,049
是继续追求一个完美的、统一的逻辑系统，还是承认智能本身就是不完美的，由许多功能各异甚至彼此冲突的简单部分组成？

26
00:02:54,049 --> 00:02:57,919
这些问题直指单一整体智能模型的弊端。

27
00:02:57,919 --> 00:03:07,138
这类模型试图用一种统一的表示和推理机制解决所有问题，和我们观察到的自然智能的运作方式相去甚远。

28
00:03:07,138 --> 00:03:16,188
明斯基认为，强行把多样化的心智活动塞进僵化的逻辑框架，正是早期人工智能停滞不前的根源。

29
00:03:16,324 --> 00:03:20,600
基于这样的反思，明斯基提出了一个颠覆性的构想。

30
00:03:20,600 --> 00:03:28,555
他不再把心智看成一个金字塔式的层级结构，而是看成一个扁平化的、充满互动与协作的社会。

31
00:03:28,555 --> 00:03:34,048
在他的理论框架里，智能体这个词的含义和我们平时说的不太一样。

32
00:03:34,048 --> 00:03:39,901
这里指的是一个极其简单的、专门化的心智过程，它自身是无心的。

33
00:03:39,901 --> 00:03:45,142
比如一个只负责识别线条的过程，或者一个只负责抓握的过程。

34
00:03:45,142 --> 00:03:50,418
这些简单的智能体被组织起来，形成功能更强大的机构。

35
00:03:50,418 --> 00:04:02,233
一个机构是一组协同工作的智能体，用来完成更复杂的任务，比如一个负责搭积木的机构，可能由看、找、取、放等多个下层智能体组成。

36
00:04:02,233 --> 00:04:08,844
它们之间通过去中心化的激活与抑制信号相互影响，形成动态的控制流。

37
00:04:08,844 --> 00:04:11,728
涌现是理解这套理论的关键。

38
00:04:11,728 --> 00:04:22,449
复杂的、有目的性的智能行为，并不是由某个高级智能体预先规划的，而是从大量简单底层智能体的局部交互中自发产生的。

39
00:04:22,449 --> 00:04:25,983
我们拿搭建积木塔这个经典例子来说明。

40
00:04:25,983 --> 00:04:32,269
当一个高层目标出现，比如我要搭一个塔，它会激活一个叫搭塔的高层机构。

41
00:04:32,269 --> 00:04:39,505
搭塔机构并不知道怎么执行具体动作，它唯一的作用就是激活下属机构，比如建造者。

42
00:04:39,505 --> 00:04:47,257
建造者同样简单，它可能只包含一个循环逻辑，只要塔还没搭完，就激活加积木这个机构。

43
00:04:47,257 --> 00:04:54,913
加积木则负责协调更具体的子任务，依次激活找积木、取积木和放到顶上这三个子机构。

44
00:04:54,913 --> 00:05:04,493
每一个子机构又由更底层的智能体构成，比如取积木会激活视觉系统里的看形状，以及运动系统里的伸手和抓握。

45
00:05:04,493 --> 00:05:09,865
在这个过程中，没有任何一个智能体或机构拥有全局规划。

46
00:05:09,865 --> 00:05:16,776
抓握只负责抓握，它不知道什么是塔；建造者只负责循环，它不知道怎么控制手臂。

47
00:05:16,776 --> 00:05:28,159
然而当这个由无数无心智能体组成的社会，通过简单的激活和抑制规则相互作用时，一个看似高度智能的行为就自然而然地涌现出来了。

48
00:05:28,300 --> 00:05:37,204
心智社会理论最深远的影响，在于它为分布式人工智能、以及后来的多智能体系统提供了重要的概念基础。

49
00:05:37,204 --> 00:05:50,387
它引出一个思考，如果一个心智内部的智能是通过大量简单智能体的协作涌现的，那么多个独立计算实体之间，是不是也能靠协作涌现出更强大的群体智能？

50
00:05:50,387 --> 00:05:59,185
这个问题直接把研究焦点从「如何构建一个全能的单一智能体」，转向了「如何设计一个高效协作的智能体群体」。

51
00:05:59,185 --> 00:06:04,161
心智社会在三个方面直接启发了多智能体系统的研究。

52
00:06:04,161 --> 00:06:06,325
第一是去中心化控制。

53
00:06:06,325 --> 00:06:19,522
理论的核心是不存在中央控制器，这一思想被多智能体系统领域完全继承，怎么设计没有中心节点的协调机制和任务分配策略，成了这个领域的核心课题之一。

54
00:06:19,522 --> 00:06:21,469
第二是涌现式计算。

55
00:06:21,469 --> 00:06:34,906
复杂问题的解决方案可以从简单的局部交互规则中自发产生，这启发了大量基于涌现思想的算法，比如蚁群算法、粒子群优化，用来解决复杂的优化和搜索问题。

56
00:06:34,906 --> 00:06:37,394
第三是智能体的社会性。

57
00:06:37,394 --> 00:06:51,120
明斯基强调智能体之间的激活与抑制，后来的研究进一步扩展，系统研究通信语言、交互协议、协商策略、信任模型乃至组织结构，构建起真正的计算社会。

58
00:06:51,268 --> 00:06:59,367
心智社会在哲学层面为群体智能和去中心化协作指明了方向，但实现路径还不清楚。

59
00:06:59,367 --> 00:07:09,004
与此同时，符号主义在应对真实世界复杂性时暴露的问题也表明，仅靠预先编码的规则无法构建真正鲁棒的智能。

60
00:07:09,004 --> 00:07:16,396
这两条线索共同指向了一个问题，如果智能无法被完全设计，那它是不是可以被学习出来。

61
00:07:16,396 --> 00:07:19,966
这个设问开启了人工智能的学习时代。

62
00:07:19,966 --> 00:07:27,874
核心目标不再是手动编码知识，而是构建能从经验和数据中自动获取知识与能力的系统。

63
00:07:27,874 --> 00:07:34,220
作为对符号主义局限性的直接回应，联结主义在二十世纪八十年代重新兴起。

64
00:07:34,220 --> 00:07:45,374
和符号主义自上而下、依赖明确逻辑规则的设计哲学不同，联结主义是一种自下而上的方法，灵感来自对生物大脑神经网络结构的模仿。

65
00:07:45,374 --> 00:07:48,475
它的核心思想可以概括成三点。

66
00:07:48,475 --> 00:07:51,023
第一，知识的分布式表示。

67
00:07:51,023 --> 00:08:04,677
知识不是以明确的符号或规则存在某个知识库里，而是以连接权重的形式，分布式地存储在大量简单处理单元的连接之间，整个网络的连接模式本身就构成了知识。

68
00:08:04,677 --> 00:08:07,237
第二，简单的处理单元。

69
00:08:07,237 --> 00:08:17,213
每个神经元只做非常简单的计算，接收其他神经元的加权输入，经过一个激活函数处理，再把结果输出给下一个神经元。

70
00:08:17,213 --> 00:08:20,050
第三，通过学习调整权重。

71
00:08:20,050 --> 00:08:25,470
系统的智能不来自设计者预先编写的程序，而来自学习过程。

72
00:08:25,470 --> 00:08:33,836
系统接触大量样本，根据学习算法自动迭代地调整连接权重，让网络输出逐渐接近期望目标。

73
00:08:33,836 --> 00:08:42,213
在这种范式下，智能体不再是被动执行规则的逻辑推理机，而是能通过经验自我优化的适应性系统。

74
00:08:42,213 --> 00:08:50,422
符号主义试图把人类知识显式编码给机器，联结主义则试图造出能像人类一样学习知识的机器。

75
00:08:50,422 --> 00:09:03,884
联结主义的兴起，特别是深度学习在二十一世纪的成功，为智能体赋予了强大的感知和模式识别能力，让它能直接从图像、声音、文本这些原始数据里理解世界。

76
00:09:04,036 --> 00:09:09,334
但联结主义主要解决的是感知问题，比如这张图片里有什么。

77
00:09:09,334 --> 00:09:14,921
智能体更核心的任务是决策，比如在这种情况下我应该做什么。

78
00:09:14,921 --> 00:09:19,645
强化学习正是专注解决序贯决策问题的学习范式。

79
00:09:19,645 --> 00:09:29,176
它不是从标注好的静态数据集里学，而是通过智能体与环境的直接交互，在试错中学习如何最大化长期收益。

80
00:09:29,176 --> 00:09:32,024
以那个下围棋的著名系统为例。

81
00:09:32,024 --> 00:09:38,984
它观察棋盘当前布局，也就是环境状态，决定下一步的落子位置，也就是行动。

82
00:09:38,984 --> 00:09:46,315
一局棋结束后根据胜负收到明确信号，赢了就是正向奖励，输了则是负向奖励。

83
00:09:46,315 --> 00:09:55,089
通过数百万次这样的自我对弈，它不断调整内部策略，逐渐学会在什么棋局下选什么行动最可能导向胜利。

84
00:09:55,089 --> 00:09:59,440
这个过程完全自主，不依赖人类棋谱的直接指导。

85
00:09:59,440 --> 00:10:03,671
强化学习的框架可以用几个核心要素来描述。

86
00:10:03,671 --> 00:10:31,503
智能体是学习者和决策者；环境是它外部的一切，是交互对象；状态是对环境在某一时刻的特定描述，是决策依据，比如棋盘上所有棋子的当前位置；行动是它根据状态能采取的操作，比如在某个合法位置落子；奖励是环境在行动后反馈的一个标量信号，用来评价这个行动在这个状态下的好坏，比如一局棋结束，胜利给正一，失败给负一。

87
00:10:31,503 --> 00:10:37,489
基于这些要素，智能体在一个感知、行动、学习的闭环里持续迭代。

88
00:10:37,489 --> 00:10:58,538
在某个时间步，它观察到环境当前的状态，根据内部的策略选择一个行动并执行，策略本质上是从状态到行动的映射；环境接收到行动后转移到新状态，同时反馈一个即时奖励；智能体利用这个反馈更新和优化内部策略，这个更新过程就是学习。

89
00:10:58,538 --> 00:11:08,070
这里有个关键点，学习目标不是最大化某一个时间步的即时奖励，而是最大化从当前到未来的累积奖励，也叫回报。

90
00:11:08,070 --> 00:11:16,988
这意味着智能体需要有点远见，有时为了未来更大的奖励得牺牲即时奖励，就像围棋里的弃子策略。

91
00:11:17,116 --> 00:11:28,135
强化学习赋予了智能体从交互中学习决策的能力，但这通常需要海量且针对特定任务的交互数据，学习之初缺乏先验知识。

92
00:11:28,135 --> 00:11:36,619
符号主义想手动编码的常识、人类决策依赖的背景知识，在强化学习智能体里都是缺失的。

93
00:11:36,619 --> 00:11:41,727
怎么让它在学具体任务之前，先具备对世界的广泛理解？

94
00:11:41,727 --> 00:11:47,665
答案最终在自然语言处理领域浮现，核心就是基于大规模数据的预训练。

95
00:11:47,665 --> 00:12:04,087
在预训练范式出现之前，传统语言模型通常是为单一特定任务在专门标注的数据集上从零训练的，知识面狭窄，难以把一个任务学到的知识泛化到另一个任务，每个新任务还要耗费大量人力标注。

96
00:12:04,087 --> 00:12:07,344
预训练与微调范式改变了这一切。

97
00:12:07,344 --> 00:12:16,671
第一步，先在一个包含互联网级别海量文本的通用语料库上，通过自监督学习训练一个超大规模的神经网络。

98
00:12:16,671 --> 00:12:28,005
这个阶段的目标不是完成任何特定任务，而是学习语言本身的规律、语法结构、事实知识和上下文逻辑，最常见的目标就是预测下一个词。

99
00:12:28,005 --> 00:12:37,368
第二步，预训练完成后，针对特定的下游任务，只需用少量该任务的标注数据做微调，就能让它适应这个任务。

100
00:12:37,368 --> 00:12:53,117
通过在数万亿级别的文本上预训练，大语言模型的神经网络权重实际上构建了一个关于世界知识的、高度压缩的隐式模型，用一种全新的方式解决了符号主义时代最棘手的知识获取瓶颈问题。

101
00:12:53,117 --> 00:13:01,182
更令人惊讶的是，当模型规模跨越某个阈值后，它们开始展现出没有被直接训练过的涌现能力。

102
00:13:01,182 --> 00:13:10,833
比如上下文学习，不需要调整权重，仅在输入里提供几个示例甚至一个示例都不给，模型就能理解并完成新任务。

103
00:13:10,833 --> 00:13:22,324
再比如思维链推理，引导模型在回答复杂问题前先输出一步步的推理过程，就能显著提升它在逻辑、算术和常识推理上的准确性。

104
00:13:22,324 --> 00:13:26,915
回过头看，主导不同时期的主要有三大思潮。

105
00:13:26,915 --> 00:13:37,420
符号主义认为智能的核心在于符号操作与逻辑推理，催生了积木世界项目、专家系统和在国际象棋上大获成功的深蓝。

106
00:13:37,420 --> 00:13:44,235
联结主义模拟大脑神经网络，靠反向传播算法复苏，最终成为当前主流。

107
00:13:44,235 --> 00:13:51,603
行为主义强调通过与环境互动和试错学习最优策略，现代化身就是强化学习。

108
00:13:51,603 --> 00:13:56,002
进入二十一世纪二十年代，这些思潮深度融合。

109
00:13:56,002 --> 00:14:08,309
大语言模型本身是联结主义的产物，却成了执行符号推理、进行工具调用和规划决策的核心大脑，形成了神经与符号结合的现代智能体架构。

110
00:14:08,452 --> 00:14:14,159
讲完这段演进，我们说点实在的，这些范式各自的边界在哪。

111
00:14:14,159 --> 00:14:17,678
第一，别指望一种范式解决所有问题。

112
00:14:17,678 --> 00:14:37,117
符号主义的可解释和精确推理，在风控、医疗、合规这类场景里至今无可替代；联结主义的感知能力在图像、语音上很强，但给不出可追溯的推理链；强化学习擅长序贯决策，但样本效率低、训练成本高，奖励设计本身也是个坑。

113
00:14:37,117 --> 00:14:39,966
第二，去中心化不是免费的。

114
00:14:39,966 --> 00:14:48,800
涌现的魅力在于自发产生复杂行为，代价是行为难以预测，出问题时很难定位是哪个环节的责任。

115
00:14:48,800 --> 00:14:53,476
需要明确归因的场景，别一上来就搞完全去中心化。

116
00:14:53,476 --> 00:14:58,331
第三，预训练解决的是知识获取瓶颈，不是理解本身。

117
00:14:58,331 --> 00:15:04,161
模型有大量隐式知识，也会产生看似合理却事实错误的幻觉。

118
00:15:04,161 --> 00:15:09,173
把「它知道很多」等同于「它想明白了」，是今天最常见的误判。

119
00:15:09,173 --> 00:15:12,754
第四，规模带来涌现，也带来成本。

120
00:15:12,754 --> 00:15:18,536
跨过阈值才出现的能力，意味着你想要它就得承担那个规模的开销。

121
00:15:18,536 --> 00:15:22,358
很多场景用个小得多的模型就够了。

122
00:15:22,516 --> 00:15:27,550
好，我们把这一集收一下，给你几条能直接带走的判断依据。

123
00:15:27,550 --> 00:15:31,298
第一，明斯基的贡献是把问题换了个方向。

124
00:15:31,298 --> 00:15:38,617
与其继续给单一推理核心加规则，不如问一堆无心的小过程凑在一起会不会涌现出智能。

125
00:15:38,617 --> 00:15:44,615
他的三个根本问题是，理解是什么，常识是什么，智能体该怎么构建。

126
00:15:44,615 --> 00:15:49,567
第二，心智社会的三个关键词是无心、机构、涌现。

127
00:15:49,567 --> 00:16:00,613
简单智能体组成机构，机构之间通过激活与抑制相互影响，复杂行为从局部交互里自发产生，没有任何一个个体拥有全局规划。

128
00:16:00,613 --> 00:16:09,603
第三，从心智社会到多智能体系统，继承了三样东西，去中心化控制、涌现式计算、智能体的社会性。

129
00:16:09,603 --> 00:16:15,577
研究焦点因此从造一个全能个体，转向设计一个高效协作的群体。

130
00:16:15,577 --> 00:16:18,978
第四，学习范式这条线是三步走。

131
00:16:18,978 --> 00:16:44,270
联结主义解决感知，知识分布式存在连接权重里靠学习调整；强化学习解决序贯决策，五要素是智能体、环境、状态、行动、奖励，目标是最大化累积奖励；预训练解决先验知识，用自监督学习在互联网级文本上学出隐式世界模型，跨过规模阈值后涌现出上下文学习和思维链推理。

132
00:16:44,270 --> 00:16:50,208
第五，也是最能指导选型的一条，先判断你的问题缺的是哪一块。

133
00:16:50,208 --> 00:17:02,503
需要可追溯的推理，看符号主义；需要从原始数据里感知，看联结主义；需要做序贯决策，看强化学习；需要广博的背景知识，靠大模型。

134
00:17:02,503 --> 00:17:09,294
今天的大模型智能体不是某一条路线的胜利，而是这几块拼图拼在一起的结果。

135
00:17:09,294 --> 00:17:11,434
这一集我们就到这里。

136
00:17:11,434 --> 00:17:14,811
下一集我们继续沿着发展史往前走。

137
00:17:14,811 --> 00:17:17,804
感谢你的收听，我们下期见。
