十年ICML,十次思想浪潮,当AI开始问“为谁而算”|ICML2026
作者|吴思梦 编辑|岑峰 引言: 2016年6月,纽约。David Silver站到了ICML的讲台上,用66页幻灯片,从Q-Learning一路推到AlphaGo。他传递出一种信念:把深度网络嫁接到强化学习上,通用智能的涌现就只是算力和工程问题。彼时距AlphaGo在首尔4∶1击败李世石仅三个月。 十年后的2025年7月,温哥华。Anca Dragan——Google DeepMind Gemini后训练的联合负责人,在现场播放了一段视频:一个机器人机械臂举起杯子,太高了。一只手伸进画面把它压下来。手松开。机器人又举上去了。“不是机器人笨,”她说,“是奖励函数在逼它做它认为‘正确’的事。只是我们定义的‘正确’和人类想的‘正确’,根本不在一个频道上。” 从Silver到Dragan,作为机器学习领域历史最悠久的顶级会议,ICML历经十年变迁,每年的重磅演讲都像是一粒时间胶囊。它们记录的不仅是算法的迭代,更是整个学科对“什么才是真正的问题”的思想倒带。AI科技评论对10年演讲精华进行打捞,发现一条清晰的行业轨迹: AI从盲目相信算法能摆平一切,走向了对“解决”本身的自我质疑;从把目标函数当成从天而降的既定真理,到终于撞向了最核心的现实——谁在写规则、为了谁的利益、又付出了谁的代价。 技术高举十年后,行业兜兜转转,最终回到了问题的起点:人本身。 以下,是这十年的十个声音。 一、2016·纽约——David Silver:深度强化学习的黎明 2016年6月19日,ICML在纽约召开。三个月前,AlphaGo刚在首尔以4:1击败李世石。这场比赛在亚洲的收视人数超过2.8亿。David Silver——AlphaGo的首席架构师,在ICML上讲 “Deep Reinforcement Learning” 时,整个会场人满为患,Silver在ICML讲台上展示的,是这台机器背后的全部数学。 视频链接: https://videolectures.net/videos/rldm2015_silver_reinforcement_learning David Silver的演讲本质上是一张路线图。从Q-Learning到Policy Gradient,从Actor-Critic到Experience Replay,再到AlphaGo的蒙特卡洛树搜索与深度价值网络的融合。66页幻灯片干净利落,核心逻辑像数学定理一样清晰:深度网络负责“看”,强化学习负责“决策”,合在一起就是一个通用问题求解器。 他传递的核心观点是,如果奖励函数定义得足够好,强化学习就能在任何任务上超越人类。他在讲台上展示了AlphaGo的技术架构,他认为,智能的本质是最大化累积奖励。棋盘上的“赢”是无需质疑的目标,物理世界中的一切问题,诸如自动驾驶、机器人控制、蛋白质折叠等都可以被归约为同一形式。 今天回看,
说明:本站展示中文整理摘要,便于快速判断价值;完整内容和版权归原站所有。