首页 / 资讯详情

对话 COBRA-Skills 一作卢平琛:仅用 50 个样本,重构 Agent 技能降本路线

雷锋网 2026-09-22 07:55 中文

摘要

当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。 作者丨张 璐 编辑丨马晓宁 过去,智能体的技能(Skill)大多依赖人类专家手动撰写,不仅耗时费力,更难以覆盖海量复杂的真实场景。为此,借助大模型“自动化生成与优化技能”,成了让 Agent 迈向自主进化的新范式。然而,摆脱了人工编写的束缚,却撞上了高昂的 Token 账单。要验证一个自动生成的技能到底管不管用,必须让智能体带入真实任务中落地执行。每一次试错,都是实打实的 Token 消耗与多轮交互的时间成本。更棘手的是,许多候选技能在刚生成时就自带缺陷。但在现有框架下,我们缺乏“事前筛选”的能力,只能任由大量预算被这些低质候选无意义地吃掉。同时,后续的精炼流程也在频繁调用高阶 LLM,哪怕缺乏有效的新证据,这种“反思—重写”的流水线依然在机械重复。评估贵,精炼也贵,两笔账算下来,技能优化的效率就成了绕不开的瓶颈。针对这一痛点,来自香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队,在论文《COBRA-SKILLS: Contextual Bandit-Guided Evolution for Agent Skill Optimization》中提出了一种全新的破解思路。论文链接:https://arxiv.org/abs/2609.11682COBRA-Skills 摒弃了盲目堆叠 Token 的演化路线,巧妙地将技能优化转化为一个带预算控制的情境多臂老虎机(Contextual Bandit)问题。它在真实评估前增加了一道“收益预判”机制,确保只有最具潜力或探索价值的候选技能才会进入实际演练,并结合精细化算子迭代种群。凭借这套高效的筛选策略,COBRA-Skills 仅用 50 个优化样本,就将优化成本降低了 55%~58%,并在 6 个跨领域 Benchmark 上实现了对现有主流方法的全面超越。雷峰网AI 科技评论近日独家对话了论文第一作者卢平琛。在交谈中,他向我们还原了团队如何将“情境多臂老虎机”引入 Agent 技能演化,以及这套低成本范式背后的真实踩坑经历与工程抉择。01双轮闭环:经典算法“筛选” + 进化算子“重构”COBRA-Skills 的设计可以概括成:老虎机负责“选”,进化负责“改”,两者形成一个持续运转的闭环。具体而言,系统维护着一个固定规模的技能种群。在日常迭代中,流程分为三步:1.筛选评估。由老虎机算法为种群中的每个技能打分,挑选出得分最高者;2.实战检验。目标智能体搭载该技能在优化集上执行任务,并返回对应的奖励与执行轨迹;3.反馈更新。将评估结果写入历史数据,用于更新打分模型。此外,种群会定期触发进化更新,淘汰低分技能并生成新技能填补空缺。这两大机制紧密结合。老虎机依据历史数据预测技能潜力,而进化生成的新技能则会回流至老虎机的候选池;反过来,进化机制所依赖的改进证据,来自执行老虎机精细挑选后的技能后留下的执行轨迹。02引入“老虎机”,将 Token 消耗拦在评估之前论文第一作者卢平琛在接受AI科技评论采访时透露:在最开始复现同类工作时,我们发现总 Token 量看似还好,但账单却高得吓人。团队深入分析后发现,核心瓶颈在于教学模型(Teaching Model,如 GPT-5.5 类高阶模型)调用

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。