首页 / 资讯详情

从完成任务到自主发现,Agent后训练寻找下一个Scaling Law

雷锋网 2026-09-12 08:40 中文

摘要

当大模型开始调用工具、执行复杂任务,衡量其能力的标准也在发生变化:不仅要看能否给出正确答案,更要看能否在真实环境中持续行动、检查结果,并根据反馈调整策略。从模型能力到任务价值,这一转变需要怎样的训练方法与基础设施?智能体能否在工作中积累经验、不断进化,进而打开新的能力增长空间?9月12日上午2026 Inclusion·外滩大会上,以“Agent Post-Training:智能本质与下一个 Scaling Law”为主题的见解论坛正式举行。论坛围绕智能体后训练的算法、环境、基础设施及自我进化等议题展开交流,邀请到模型研发与Agent领域的研究者、产业实践者,共同探讨智能体能力发展的关键问题。嘉宾们的分享呈现出一条逐步深入的探索路径:让Agent能够完成复杂任务,进一步让它从任务中积累经验、发现新知识,并将这些成果用于下一轮能力提升。围绕这一过程,环境如何构建、信息如何管理、成果如何验证,成为贯穿多场演讲的重要问题。谢钰溱:从数量、环境与进化,探索Agent的Scaling Law在题为《通往agent时代的范式跨越》的开场分享中,CAMEL AI 创始成员谢钰溱介绍,探索Agent的Scaling Law一直是CAMEL AI的重要方向。她将这一问题拆解为三个相互关联的维度:智能体的数量、智能体所处的环境,以及智能体自身的进化。CAMEL AI 创始成员谢钰溱在数量维度,研究重点并非简单增加参与任务的Agent,而是解决多智能体之间如何通信、达成共识,以及在没有中心化控制的情况下实现自组织等问题。从少量智能体的协作分工,到大规模智能体群体行为的模拟,数量的扩展也对协作机制提出了新的要求。在环境维度,谢钰溱提出,环境之于Agent,如同数据之于模型。智能体需要通过与不同环境交互,学习相应的能力,而这类训练条件往往需要专门构建。随着任务从简单推理走向跨设备操作、长流程工作乃至机器学习研发,环境的复杂度不断提高,结果验证与防止奖励机制被利用,也变得更加重要。这进一步引出了进化问题:当Agent已经能够独立完成越来越复杂的任务,它能否在工作的过程中发现自身不足、积累经验,甚至提出人类尚未想到的新思路?谢钰溱认为,利用当前模型加速研发、推动下一代模型训练,是这一方向的重要实践,智能体的进化也可能成为探索下一个Scaling Law的关键。周俊:让模型走出实验室,在真实任务中生长专业能力在《Agent后训练的产业化全景:让模型走出实验室》演讲中,蚂蚁百灵大模型负责人周俊指出,大模型的真实任务并不限于编程,还包括医疗、金融、法律等领域的大量专业工作。蚂蚁百灵3.0(Ling-3.0)希望构建的,是一套能够在可控成本下持续发展专业能力、服务真实任务的基础模型体系。蚂蚁百灵大模型负责人周俊围绕真实任务,周俊提出高质效、可专业化与可信执行三个关键词。高质效需要综合考察任务质量、成本、等待时间与成功率;可专业化意味着模型不仅要掌握行业知识,还要理解专业语境、使用专业工具,并遵循工作流程;可信执行则要求模型能够及时发现问题、限制错误影响,在证据不足、风险过高或权限不够时主动请求人工接手。“一个好的agent,他不是知道下一步应该做什么,他更加重要的是知道下一步哪些不能擅自去做。”周俊强调,现阶段的目标并非假设模型不会犯错,而是建立能够识别风险、明确边界的执行体系。在医疗领域,团队关注模型能否识别缺失信息、开展循证检索,并审慎表达判断中的不确定性。在金融投研领域,模型则需要完成资料检索、多文档分析、计算建模与报告生成,同时说明数据来源、统一统计口径、区分事实与假设,使输

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。