1
00:00:00,100 --> 00:00:02,105
你好，欢迎收听。

2
00:00:02,105 --> 00:00:06,586
前面两集我们把智能体是什么、怎么运转讲完了。

3
00:00:06,586 --> 00:00:16,105
这一集往后退几十年，去看一个很老但一点都不过时的问题，在没有大模型的年代，人们是怎么让机器显得聪明的。

4
00:00:16,105 --> 00:00:25,492
本内容改编自 Datawhale《Hello-Agents：从零开始构建智能体》，采用 CC BY-NC-SA 4.0 授权，为二次演绎配音版。

5
00:00:25,492 --> 00:00:34,350
授权再说一遍，本内容改编自 Datawhale《Hello-Agents》，采用 CC BY-NC-SA 4.0 授权，为二次演绎配音版。

6
00:00:34,350 --> 00:00:36,141
为什么要讲历史。

7
00:00:36,141 --> 00:00:47,079
因为今天讨论大模型智能体的很多困惑，比如它到底有没有理解、为什么换个说法就崩，其实在符号主义时代全都被认真讨论过一遍。

8
00:00:47,079 --> 00:00:52,439
知道前人踩过什么坑，你在今天的工程决策上会清醒很多。

9
00:00:52,439 --> 00:00:54,050
我们开始。

10
00:00:54,196 --> 00:01:00,131
人工智能早期的探索，深受数理逻辑和计算机科学基本原理的影响。

11
00:01:00,131 --> 00:01:09,492
那个时代的研究者普遍持有一种信念，人类的智能，尤其是逻辑推理能力，可以被形式化的符号体系捕捉和复现。

12
00:01:09,492 --> 00:01:18,843
这个核心思想催生了人工智能的第一个重要范式，符号主义，也有人叫它逻辑人工智能或者传统人工智能。

13
00:01:18,843 --> 00:01:25,502
在符号主义看来，智能行为的核心是基于一套明确规则对符号进行操作。

14
00:01:25,502 --> 00:01:34,252
所以一个智能体可以被视为一个物理符号系统，用内部符号表示外部世界，并通过逻辑推理规划行动。

15
00:01:34,252 --> 00:01:42,413
那个时代的智能体，智慧完全来自设计者预先编码的知识库和推理规则，而不是自主学习得来的。

16
00:01:42,413 --> 00:01:53,074
这个思路的理论根据，是一九七六年由两位图灵奖得主艾伦·纽厄尔和赫伯特·西蒙共同提出的物理符号系统假说。

17
00:01:53,074 --> 00:01:55,658
这个假说有两个核心论断。

18
00:01:55,658 --> 00:02:03,242
第一个是充分性论断，任何一个物理符号系统，都具备产生通用智能行为的充分手段。

19
00:02:03,242 --> 00:02:11,235
第二个是必要性论断，任何一个能够展现通用智能行为的系统，其本质必然是一个物理符号系统。

20
00:02:11,235 --> 00:02:21,343
这里说的物理符号系统，指的是能在物理世界中存在的一套系统，由一组可区分的符号和一系列操作这些符号的过程组成。

21
00:02:21,343 --> 00:02:29,721
符号可以组合成更复杂的结构，比如表达式；过程则可以创建、修改、复制和销毁这些符号结构。

22
00:02:29,721 --> 00:02:35,706
说白了，这个假说大胆地宣称，智能的本质就是符号的计算与处理。

23
00:02:35,706 --> 00:02:37,761
它的影响非常深远。

24
00:02:37,761 --> 00:02:57,056
它把对人类心智这个模糊复杂的哲学问题的研究，转化成了一个可以在计算机上工程化实现的具体问题，也给早期研究者注入了强大信心，只要能找到正确的方式表示知识、设计出有效的推理算法，就一定能创造出媲美人类的机器智能。

25
00:02:57,056 --> 00:03:04,760
整个符号主义时代的研究，从专家系统到自动规划，几乎都是在这个假说指引下展开的。

26
00:03:04,900 --> 00:03:12,097
在这个假说直接影响下，专家系统成为符号主义时代最重要、也最成功的应用成果。

27
00:03:12,097 --> 00:03:18,057
专家系统的目标很直接，模拟人类专家在特定领域内解决问题的能力。

28
00:03:18,057 --> 00:03:26,963
它把专家的知识和经验编码成程序，让它在面对相似问题时，给出媲美甚至超越人类专家的结论或建议。

29
00:03:26,963 --> 00:03:33,970
一个典型的专家系统通常由知识库、推理机、用户界面等几个核心部分构成。

30
00:03:33,970 --> 00:03:40,581
这个架构清晰体现了知识与推理相分离的设计思想，是符号主义的重要特征。

31
00:03:40,581 --> 00:03:46,374
先说知识库，它是知识存储中心，存放领域专家的知识和经验。

32
00:03:46,374 --> 00:03:57,672
构建知识库的关键叫知识表示，而专家系统里最常用的一种表示方法是产生式规则，也就是一系列「如果，那么」形式的条件语句。

33
00:03:57,672 --> 00:04:03,682
举个例子，如果病人有发烧症状并且咳嗽，那么可能患有呼吸道感染。

34
00:04:03,682 --> 00:04:15,497
这类规则把特定情境和相应的结论或行动关联起来，一个复杂的专家系统可能包含成百上千条这样的规则，共同构成一张庞大的知识网络。

35
00:04:15,497 --> 00:04:27,143
再说推理机，它是核心计算引擎，是一个通用程序，任务是根据用户提供的事实，在知识库里寻找并应用相关的规则，推导出新的结论。

36
00:04:27,143 --> 00:04:29,199
它有两种工作方式。

37
00:04:29,199 --> 00:04:41,098
一种是正向链，从已知事实出发，不断匹配规则的条件部分，触发结论部分，把新结论加入事实库，直到推导出目标或者没有新规则可匹配。

38
00:04:41,098 --> 00:04:43,261
这是数据驱动的推理。

39
00:04:43,261 --> 00:05:00,032
另一种是反向链，从一个假设的目标出发，比如病人是否患有肺炎，去寻找能够推导出这个目标的规则，然后把这条规则的条件部分作为新的子目标，如此递归下去，直到所有子目标都能被已知事实证明。

40
00:05:00,032 --> 00:05:02,267
这是目标驱动的推理。

41
00:05:02,267 --> 00:05:14,551
历史上最著名的专家系统之一，是斯坦福大学在二十世纪七十年代开发的一套用于辅助医生诊断细菌性血液感染、并推荐抗生素治疗方案的系统。

42
00:05:14,551 --> 00:05:28,962
它的知识库包含约六百条由医学专家提供的规则，推理机主要用反向链工作，从确定致病菌这个最高目标出发，反向推导需要哪些证据和条件，然后向医生提问获取信息。

43
00:05:28,962 --> 00:05:31,029
它还有一个重要创新。

44
00:05:31,029 --> 00:05:46,718
医学诊断充满不确定性，它引入了置信因子的概念，用一个负一到正一之间的数值来表示结论的可信度，从而能处理模糊的医学知识，给出带可信度评估的诊断结果，比布尔逻辑更贴近现实。

45
00:05:46,718 --> 00:05:54,387
在一项评估里，它在血液感染诊断上的表现超过了非专业医生，甚至达到了人类专家水平。

46
00:05:54,387 --> 00:06:06,057
这个成功有力证明了物理符号系统假说的有效性，通过精心的知识工程和符号推理，机器确实能在高度复杂的专业领域展现出卓越的智能。

47
00:06:06,196 --> 00:06:17,143
如果说专家系统展示了符号人工智能在专业领域的深度，那么另一个在积木世界里做实验的项目，则在广度上实现了革命性突破。

48
00:06:17,143 --> 00:06:30,254
这个项目由特里·威诺格拉德在一九六八到一九七零年间开发，目标是构建一个能在积木世界这个微观环境里，通过自然语言和人类流畅交互的综合智能体。

49
00:06:30,254 --> 00:06:40,026
积木世界是一个模拟的三维虚拟空间，里面有不同形状、颜色和大小的积木，还有一个可以抓取和移动它们的虚拟机械臂。

50
00:06:40,026 --> 00:06:47,346
用户用自然语言下达指令或者提问，系统在虚拟世界里执行动作或者给出文字回答。

51
00:06:47,346 --> 00:06:59,269
它在当时引起广泛关注，主要因为它第一次把多个原本独立的人工智能模块，比如语言解析、规划、记忆，集成在一个统一系统里，让它们协同工作。

52
00:06:59,269 --> 00:07:04,629
自然语言理解方面，它能解析结构复杂且含有歧义的句子。

53
00:07:04,629 --> 00:07:11,180
它不只理解直接命令，比如拿起一个大的红色积木，还能处理更复杂的指令。

54
00:07:11,180 --> 00:07:22,922
一个例子是指代消解，用户说找一个比你正拿着的那块更高的积木，把它放进盒子里，系统需要理解「你正拿着的那块」指的是机械臂当前抓着的物体。

55
00:07:22,922 --> 00:07:31,396
另一个例子是上下文记忆，用户先说抓住那个金字塔，再问盒子里有什么，系统能联系上下文作答。

56
00:07:31,396 --> 00:07:37,285
规划与行动方面，理解指令后，它能自主规划出一系列必要动作。

57
00:07:37,285 --> 00:07:49,954
比如指令是把蓝色积木放到红色积木上，而红色积木上已经压着一块绿色积木，它会规划出先把绿色积木移开、再把蓝色积木放上去的动作序列。

58
00:07:49,954 --> 00:07:59,257
记忆与问答方面，它拥有关于环境和自身行为的记忆，用户可以问世界状态、问行为历史，甚至问行为动机。

59
00:07:59,257 --> 00:08:05,290
有人问它你为什么拿起那块红色的积木，它回答，因为你让我这么做的。

60
00:08:05,290 --> 00:08:08,223
它的历史地位体现在三方面。

61
00:08:08,223 --> 00:08:24,933
第一，它是综合性智能的典范，之前的人工智能研究大多聚焦单一功能，它第一次把语言理解、推理规划与行动记忆集成于统一系统，那个感知、思考、行动的闭环设计，奠定了现代智能体研究的基础。

62
00:08:24,933 --> 00:08:33,347
第二，它普及了微观世界的研究方法，证明在规则明确的简化环境里探索复杂智能体原理是可行的。

63
00:08:33,347 --> 00:08:44,453
第三，它引发了乐观与反思，它的能力又严格局限于积木世界，这种局限引发了关于符号处理与真正理解之间差异的长期思辨。

64
00:08:44,596 --> 00:08:56,168
尽管早期项目成就显著，但从二十世纪八十年代起，符号主义在从微观世界走向开放复杂的现实世界时，遇到了方法论上固有的难题。

65
00:08:56,168 --> 00:08:59,135
这些难题主要可以归结成两大类。

66
00:08:59,135 --> 00:09:02,536
第一类是常识知识与知识获取瓶颈。

67
00:09:02,536 --> 00:09:12,885
符号主义智能体的智能完全依赖知识库的质量和完备性，但要构建一个能支撑真实世界交互的知识库，被证明极其艰巨。

68
00:09:12,885 --> 00:09:25,866
一方面是知识获取瓶颈，专家系统的知识需要由人类专家和知识工程师通过繁琐的访谈、提炼和编码来构建，成本高昂、耗时漫长，而且难以规模化。

69
00:09:25,866 --> 00:09:33,354
更要命的是，人类专家的许多知识是内隐的、直觉性的，很难被清晰表达成规则。

70
00:09:33,354 --> 00:09:38,258
想把整个世界的知识都手工符号化，几乎不可能完成。

71
00:09:38,258 --> 00:09:40,361
另一方面是常识问题。

72
00:09:40,361 --> 00:09:50,962
人类行为依赖庞大的常识背景，比如水是湿的、绳子可以拉不能推，但符号系统除非被明确编码，否则对此一无所知。

73
00:09:50,962 --> 00:10:03,029
为广阔而模糊的常识建立完备的知识库至今仍是重大挑战，有一个专门做这件事的项目历经数十年努力，成果和应用仍然非常有限。

74
00:10:03,029 --> 00:10:06,395
第二类是框架问题与系统脆弱性。

75
00:10:06,395 --> 00:10:16,118
框架问题是说，在一个动态世界里，智能体执行一个动作之后，如何高效判断哪些事物没有发生改变，这是个逻辑难题。

76
00:10:16,118 --> 00:10:24,592
为每个动作显式声明所有不变的状态，在计算上不可行，但人类却能毫不费力地忽略不相关的变化。

77
00:10:24,592 --> 00:10:27,356
系统脆弱性是另一个麻烦。

78
00:10:27,356 --> 00:10:37,080
符号系统完全依赖预设规则，一旦遇到规则之外的微小变化或新情况，就可能完全失灵，没法像人类那样灵活变通。

79
00:10:37,080 --> 00:10:45,601
前面那个积木世界项目的成功，恰恰因为它运行在规则完备的封闭世界里，而真实世界充满例外。

80
00:10:45,748 --> 00:10:54,027
讲完理论上的挑战，我们看一个具体的、特别有意思的例子，早期聊天机器人里极具影响力的一个程序。

81
00:10:54,027 --> 00:11:00,263
它由麻省理工学院的计算机科学家约瑟夫·魏泽鲍姆在一九六六年发布。

82
00:11:00,263 --> 00:11:11,513
它并不是一个单一的程序，而是一个可以执行不同脚本的框架，其中最广为人知也最成功的脚本模仿了一位罗杰斯学派的非指导性心理治疗师。

83
00:11:11,513 --> 00:11:14,061
它的工作方式极其巧妙。

84
00:11:14,061 --> 00:11:25,972
它从不正面回答问题或者提供信息，而是识别用户输入里的关键词，然后应用一套预设的转换规则，把用户的陈述转化成一个开放式提问。

85
00:11:25,972 --> 00:11:37,210
举个例子，用户说我为我的男朋友感到难过，它可能会识别出「我为某某感到难过」这个模式，然后生成回应，你为什么会为你的男朋友感到难过。

86
00:11:37,210 --> 00:11:53,656
魏泽鲍姆的设计思想并不是要创造一个真正理解人类情感的智能体，恰恰相反，他想证明的是，通过一些简单的句式转换技巧，机器可以在完全不理解对话内容的情况下，营造出一种智能和共情的假象。

87
00:11:53,656 --> 00:12:02,875
但出乎他意料，许多和它交互过的人，包括他自己的秘书，都对它产生了情感上的依赖，深信它能够理解自己。

88
00:12:02,875 --> 00:12:09,161
技术上，它的算法流程基于模式匹配与文本替换，可以清晰拆成四步。

89
00:12:09,161 --> 00:12:11,781
第一步，关键词识别与排序。

90
00:12:11,781 --> 00:12:21,168
规则库为每个关键词设定一个优先级，当输入包含多个关键词时，程序会选择优先级最高的那个所对应的规则来处理。

91
00:12:21,168 --> 00:12:23,332
第二步，分解规则。

92
00:12:23,332 --> 00:12:29,245
找到关键词后，程序用带通配符的分解规则捕获句子的其余部分。

93
00:12:29,245 --> 00:12:39,293
比如规则是任意内容加我的加任意内容，用户输入我的母亲害怕我，捕获结果就是我的前面是空，后面是母亲害怕我。

94
00:12:39,293 --> 00:12:41,541
第三步，重组规则。

95
00:12:41,541 --> 00:12:52,262
程序从这个分解规则关联的一组重组规则里选一条生成回应，通常随机选择以增加多样性，还可以使用上一步捕获到的内容。

96
00:12:52,262 --> 00:12:55,603
比如生成输出，多跟我说说你的家庭。

97
00:12:55,603 --> 00:12:57,935
第四步，代词转换。

98
00:12:57,935 --> 00:13:06,385
在重组之前，程序会做简单的代词转换，把我换成你、把我的换成你的，来维持对话的连贯。

99
00:13:06,385 --> 00:13:15,243
通过这套机制，它成功地把复杂的自然语言理解问题，简化成了一个可操作的、基于规则的模式匹配游戏。

100
00:13:15,388 --> 00:13:24,845
做完这个实践，就能直观总结出规则驱动系统的根本局限，而这些局限正是对前面那些理论挑战的直接印证。

101
00:13:24,845 --> 00:13:27,175
第一，缺乏语义理解。

102
00:13:27,175 --> 00:13:29,122
系统不理解词义。

103
00:13:29,122 --> 00:13:38,364
面对「我不开心」这样的输入，它仍会机械匹配「我是什么什么」这条规则，生成语义不通的回应，因为它无法理解否定词的作用。

104
00:13:38,364 --> 00:13:40,708
第二，无上下文记忆。

105
00:13:40,708 --> 00:13:47,271
系统是无状态的，每次回应只基于当前这一句输入，没法做连贯的多轮对话。

106
00:13:47,271 --> 00:13:49,915
第三，规则的扩展性问题。

107
00:13:49,915 --> 00:13:58,869
增加更多规则会导致规则库规模爆炸式增长，规则间的冲突与优先级管理会变得极其复杂，最终难以维护。

108
00:13:58,869 --> 00:14:06,766
然而，尽管有这些显而易见的缺陷，它却产生了著名的效应，许多用户相信它能理解自己。

109
00:14:06,766 --> 00:14:18,400
这种智能的幻觉主要来自两方面，一是它巧妙的对话策略，比如扮演被动的提问者、使用开放式模板；二是人类天生的情感投射心理。

110
00:14:18,400 --> 00:14:27,018
这个实践清晰揭示了符号主义方法的核心矛盾，系统看似智能的表现，完全依赖设计者预先编码的规则。

111
00:14:27,018 --> 00:14:33,112
但面对真实世界语言的无限可能性，这种穷举式的方法注定不可扩展。

112
00:14:33,112 --> 00:14:39,699
系统没有真正的理解，只是在执行符号操作，这正是它脆弱性的根源。

113
00:14:39,699 --> 00:14:43,857
把这个教训搬到今天，有三条边界值得记住。

114
00:14:43,857 --> 00:14:50,973
第一，规则适合封闭、稳定、可枚举的场景，一旦输入空间开放，穷举就会失控。

115
00:14:50,973 --> 00:15:00,312
第二，表现得像理解和真的理解是两回事，用户会自己补完意义，别把用户的正面反馈当成系统真的懂了。

116
00:15:00,312 --> 00:15:11,562
第三，规则库的维护成本是超线性增长的，每加一条规则都要考虑和已有规则的冲突，到某个临界点之后，重写比继续堆更划算。

117
00:15:11,716 --> 00:15:16,750
好，我们把这一集收一下，给你几条能直接带走的判断依据。

118
00:15:16,750 --> 00:15:21,688
第一，符号主义的核心信念是智能等于符号的计算与处理。

119
00:15:21,688 --> 00:15:33,190
物理符号系统假说给了它两条论断，充分性说符号系统足以产生通用智能，必要性说能展现通用智能的系统本质上必然是符号系统。

120
00:15:33,190 --> 00:15:42,060
第二，专家系统的结构是知识与推理分离，知识库存「如果，那么」规则，推理机负责正向链或反向链。

121
00:15:42,060 --> 00:15:49,356
正向链是数据驱动，从事实推向结论；反向链是目标驱动，从假设倒推需要的证据。

122
00:15:49,356 --> 00:15:54,200
今天很多诊断类、风控类系统的思路仍然是这一套。

123
00:15:54,200 --> 00:16:02,421
第三，符号主义撞上的两堵墙是知识获取瓶颈与常识问题，以及框架问题与系统脆弱性。

124
00:16:02,421 --> 00:16:10,954
内隐知识难以编码、常识难以穷举、动态世界难以声明不变式、规则外的微小变化会让系统失灵。

125
00:16:10,954 --> 00:16:20,474
第四，那个聊天机器人的四步机制是关键词识别与排序、带通配符的分解规则、随机重组规则、代词转换。

126
00:16:20,474 --> 00:16:27,697
它证明了纯粹的模式匹配就能营造出理解的假象，这就是所谓智能幻觉的来源。

127
00:16:27,697 --> 00:16:34,007
第五，也是最能指导今天工作的一条，先问你的输入空间是封闭还是开放。

128
00:16:34,007 --> 00:16:47,084
封闭、可枚举、规则稳定，用规则系统，可解释、可追溯、成本可控；开放、充满例外、需要常识，就别指望穷举，得让系统自己从数据里学。

129
00:16:47,084 --> 00:16:53,010
用户觉得它聪明，不等于它真的理解，这个分别到今天依然成立。

130
00:16:53,010 --> 00:16:55,149
这一集我们就到这里。

131
00:16:55,149 --> 00:17:02,192
下一集我们继续沿着历史往前走，看符号主义之后，另一条路线是怎么崛起的。

132
00:17:02,192 --> 00:17:05,185
感谢你的收听，我们下期见。
