首页 / 资讯详情
ASU 魏华:大模型智能体正在重蹈强化学习的覆辙,如何跨越「仿真到现实」的鸿沟? | IJCAI 2026
摘要
当大语言模型化身为智能体走向真实世界,它们面临的困境,与十年前在十字路口指挥交通的强化学习模型如出一辙。 作者丨岑峰 幸丽娟 编辑丨岑峰 在通往 AGI 的浪潮中,基础模型智能体(Foundation Model Agents)正以前所未有的速度接管各种任务。业界曾普遍乐观地认为,凭借大模型海量的预训练知识,智能体可以无缝适应各种真实场景。但在现实中,当我们将一个在英文语境下表现完美的智能体,切换到中文或低资源语言环境中时,其错误率往往会呈现断崖式上升。这种环境切换带来的“智力降级”,真的是大模型时代特有的新问题吗?在正在进行的 2026 年的德国不莱梅 IJCAI大会的 Early Career Spotlight(早期职业焦点)环节,亚利桑那州立大学(ASU)助理教授魏华给出了一个极具启发性的“降维”视角:今天大模型智能体所面临的脆弱性,本质上与传统强化学习(RL)在物理世界中遭遇的“仿真到现实(Sim-to-Real)”差距如出一辙。作为长期深耕强化学习与真实世界决策的学者,魏华教授早年曾在腾讯 AI Lab 担任研究员,后于新泽西理工学院和 ASU 任教。早在2017 年,魏华团队就通过一系列 KDD论文证明了强化学习能够完美复现传统的“绿波”优化解,甚至能找到更优的调度策略。但随着研究从实验室走向中国杭州等真实复杂路网,他发现,完美的模拟器是不存在的。天气、摄像头视角、甚至奖励函数的定义,在真实世界中都存在着致命的偏差。实验室中取得的完美结果一旦部署到真实的街头,面对大雨、大雾以及穿行的行人,AI 的决策就会瞬间崩溃。在此次 IJCAI 的演讲中,魏华巧妙地将“交通信号灯”与“大语言模型”连接了起来。他指出,无论是机器人、强化学习还是今天的大模型智能体,只要涉及决策与执行,就必然面临动态差距、观察差距和奖励差距。更为重要的是,他提出,既然问题的本质相同,我们完全可以将机器人领域成熟的“域随机化(Domain Randomization)”等技术,直接“平移”到大模型智能体中。最新的实验证明,通过对智能体的提示词、动作和奖励空间进行随机化扰动,一个仅 30 亿参数(3B)的模型,在应对跨语言等“仿真到现实”难题时,其表现甚至能击败 320 亿参数(32B)的庞然大物。此外,魏华强调了“不确定性量化”与“人类在环(Human-in-the-loop)”的终极价值:智能体可以无限扩展,但不能增加人类的监督负担。机器必须知道自己“何时不知道”,并精准地向人类求助。以下是魏华教授的演讲分享,演讲题目为《Towards Reliable Agents》。AI科技评论根据其英文演讲内容进行了不改原意的深度编辑与精简:▎Towards Reliable Agents(迈向可靠智能体)演讲者: 亚利桑那州立大学助理教授 魏华(Hua Wei)大家好。我是亚利桑那州立大学计算与人工智能学院的助理教授魏华。非常荣幸能来到 IJCAI的讲台,分享我过去研究的一些反思,探讨我们曾尝试的不同视角,以及对未来工作的展望。我们团队一直以来的一个核心命题是:我们能否为现实世界的复杂决策,构建真正可靠的智能体(Agents)?01完美的模拟器,与混乱的物理世界为了说明这个问题,我们回到 2017 年,从我最初研究的“交通信号控制强化学习”说起。我们希望通