在由上海创智学院、上海交通大学人工智能学院与Openmind研究院联合主办的“强化学习暑期学校”结业仪式上,图灵奖得主、强化学习领域奠基人之一理查德·萨顿教授发表了关于人工智能发展的深刻见解。作为Openmind研究院首席科学家,萨顿首次在中国系统、完整地讲授其强化学习学术体系,引发了广泛关注。
萨顿对“智能”的定义与人工智能术语创立者约翰·麦卡锡不谋而合,认为智能是实现目标所需能力的计算层面。他特别指出,人工智能是通过技术手段获得这种能力,而非生物自然演化的结果。在他看来,人类心智与机器心智本质上同属一个范畴,尽管当前机器心智尚显初级,但应以长远眼光看待其发展潜力。他重申了之前的预判:到2040年,人类仅有五成把握能完全理解心智的本质。
萨顿强调,心智的核心在于与真实世界的交互体验,而当前主流人工智能范式却忽视了这一点。他将“体验”定义为与真实环境的互动,认为心智存在的意义在于从现实世界中获取反馈。然而,现有系统往往将反馈简化为“奖励信号”,目标仅是最大化这一数值,这种简化逻辑与真实心智相去甚远。他直言,大语言模型虽能模仿人类文本,却并不真正理解人类需求,既无明确目标,也缺乏真实体验。真正的心智应能主动掌控、理解自身经历,并预测和干预外部世界。
“人工智能无需复制生物形态,但必须掌握实现目标、预测环境、主动调控世界等核心能力。”萨顿特别澄清,不应使用“复刻模仿”这一带有贬义的词汇,而应强调提炼底层通用原理,甚至通过机器实现超越生物的性能。
关于如何赋予人工智能系统目标,萨顿提出了独特视角:目标是人类为解释行为结果而主观赋予的解读,而非系统固有属性。他以恒温器为例说明,人们从结果出发会认为其目标是“维持室温恒定”,但维修工人拆解机械原理后,只会看到金属片受热形变触发锅炉启停的过程。他指出,这一逻辑同样适用于人类——既可从神经生理层面分析行为,也可构建目标叙事(如追求财富或安稳生活),两种方式均准确,只是适用场景不同。由此,他得出结论:智能并非非黑即白的二元概念,而是程度问题,取决于观察者的视角与目的。
基于上述观点,萨顿提出两大研究方向:一是为人工智能系统赋予内在目标,使其能主动与真实环境交互,而非依赖虚拟环境;二是借鉴动物的自然智能。他观察到,动物行为均有明确导向(如觅食、避险),而当前AI缺乏这种原生驱动力。
萨顿与深度学习之父杰弗里·辛顿均拥有心理学研究背景,他特别强调心理学对人工智能研究的重要性。自然生物心智是现存最优质的智能样本,心理学家通过长期观测动物学习行为,从外在表现到大脑解剖,总结出大量基础学习规律,强化学习正源于此。“相比其他研究者,心理学是我的独家优势——我能将百年理论转化为算法思路。”他建议人工智能领域从业者学习心理学知识。
在暑期学校开课仪式上,萨顿曾以“雄心”与“谦逊”寄语学员。他认为,远大志向与谦逊态度并不矛盾,但需平衡:过度谦逊会安于现状,雄心过盛则易滋生傲慢。他分享了在阿尔伯塔大学时的经验:“对待理论要像探索玩具一样,放开思路推演各种可能性,永远对基础问题保持好奇。”他坚信,人类终能破解心智本质等难题,只是需要时间与耐心。












