首页 / 资讯详情
深度拆解 MiMo-V2.6:1M 上下文只是表面,2.5 万条轨迹才是底牌
摘要
代码、视觉、安全共用一套 RL,奖励机制也被重新设计。 作者丨郑佳美 编辑丨岑 峰 刚刚,小米正式发布并开源 MiMo-V2.6。Pro 拥有 1.02T 总参数、42B 激活参数,Flash 为 309B 总参数、15B 激活参数,两款模型支持 1M token 上下文,并覆盖文本、图像、视频和音频输入。如果只看这些数字,第一反应或许会觉得这又是一次模型规模升级。但这次小米投入更多篇幅讨论的,其实是模型完成预训练之后,能力还能怎样继续往上推。这也是为什么后训练成了 MiMo-V2.6 的核心部分。小米把代码、通用 Agent、视觉和网络安全任务放进同一套强化学习系统,单次 RL 更新使用 1568 个 prompt,每个 prompt 生成 16 条 rollout。和普通问答不同,Agent 在这些任务里不是生成一段文本就结束,而是要不断读取环境、搜索信息、调用工具、执行操作,再根据返回结果调整下一步行动。训练对象因此不再只是最终答案,而是一整条包含状态、决策和反馈的行为轨迹。雷峰网当强化学习开始围绕这种长轨迹展开,问题自然也变了。模型不仅要承担更长上下文和持续生成带来的计算开销,还要同时处理大量执行时间完全不同的任务,等轨迹数量真正上来以后,单纯依靠成功或失败这样的奖励,又很难判断两条都完成任务的路径,哪一条更值得模型学习。所以 MiMo-V2.6 后面的架构、异步训练和奖励设计,基本都是从这些实际问题里一步步长出来的。011M 上下文背后Agent 一旦开始长期停留在环境里,模型面对的计算形态就发生了变化。以软件工程任务为例,模型可能先读取大量代码,随后搜索文件、修改函数、运行测试,再根据 terminal 返回继续行动。早期读取的内容需要留在上下文里,但当前一次决策真正频繁使用的,往往只是正在处理的代码、最近几轮工具结果以及局部状态。MiMo-V2.6-Pro 的注意力结构正好利用了这种特征。70 层 Transformer 中,60 层采用 Sliding Window Attention,窗口只有 128 token,另外 10 层使用 Global Attention。也就是说,绝大多数层只处理附近信息,隔一段距离再由全局层完成长距离通信。这样设计之后,1M 上下文并不意味着每一层、每一个 token 都要重新和完整上下文进行交互。当前操作需要的局部信息可以高频流动,远处的信息则通过少量全局层重新汇合。对于长时间运行的 Agent,这比把完整注意力铺满整个网络更符合实际工作负载。参数侧采用了类似思路。Pro 虽然拥有 1.02T 总参数,每个 token 实际只激活约 42B 参数,每个 MoE 层有 384 个 routed expert,其中只调用 8 个。模型因此可以维持较大的专家容量,又不需要让每个 token 穿过全部参数。这里的意义放到 RL 阶段会更明显。一次回答多算几个 token,成本差异有限,一次训练里同时生成数万条 rollout,每条轨迹又持续几十轮,任何单 token 计算量的增加都会被迅速放大。MiMo-V2.6 还加入了 5 层 MTP speculative decoder,drafter 一次前向可以尝试给出后续多个 token,再交给主模型并行验证。官方模型卡给出的设计是一次前向