首页 / 资讯详情
英伟达开源 IMO 金牌配方:不仅是「人海战术」,1.5TB 显存做实 AI「 推恩令」?
摘要
用三套 checkpoint 完成多轮证明搜索,用过程透明平息学术怒火,用 1.5TB 显存门槛锁定算力霸权。名为代码平权,实则算力集权。 作者丨郑佳美 编辑丨岑 峰 9 月 9 日,NVIDIA 公布了 Nemotron 3 Ultra 在 2026 年 IMO 上使用的整套数学推理系统。这套系统最终拿到 30/42 分,超过当届 29 分的金牌线。整个比赛过程中,模型只用自然语言写证明,没有调用 Lean 等形式化证明器,也没有借助外部工具或联网检索。但这次发布的重点不只是成绩。NVIDIA 还把支撑这 30 分的两个数学专家 checkpoint、SFT 与 RL 训练数据、推理代码、训练配方、比赛提交证明,以及 200 道新的 Nemotron-IMO-Bench 一起开放了出来。换句话说,这次公开的是一整套从训练到比赛推理的系统,而不是单独放出一个更强的数学模型。Nemotron 3 Ultra 只是底座,后面两个专家模型、大规模证明搜索、模型验证和多轮改写,共同组成了把成绩推到 IMO 金牌线的完整链路。两天后的 9 月 11 日,陶哲轩、Peter Scholze、Maryna Viazovska 等 25 位菲尔兹奖得主联合发声,批评 AI 数学成果发布越来越快,而证明检查、方法梳理和复现往往没有足够时间展开。放在这样的背景里,NVIDIA 这次开源比较少见的一点,是把一个 IMO 金牌级结果背后的模型、数据、推理流程和计算成本都留了下来。而这套系统的技术起点,是 NVIDIA 没有继续对同一个 Nemotron 3 Ultra 反复采样,而是先训练了两个行为明显不同的数学专家。01两个专家 checkpointNemotron 里面一个比较核心的设计,是让后训练直接服务于后面的搜索。SFT 数据里除了完整证明,还加入了大量证明修改、验证和再次验证的轨迹。这样训练出来的模型,学到的不只是从题目生成证明,还包括拿到一份已经写了一半、甚至局部存在错误的证明以后,怎样判断哪里出了问题,再沿着原来的路线继续修。雷峰网放进搜索系统以后,这种能力会直接影响计算资源的利用方式。高难数学题很少只有会做和不会做两种状态,大量候选其实处在中间区域,主体结构已经接近可用,只在某个引理、边界条件或者推导闭环上出了问题。一个只会重新作答的模型,每次失败后都要重新进入整个证明空间;接受过修改训练的模型,则可以把已有证明当成中间状态继续推进,相当于保留前一次计算里已经找到的有效结构。RL 专家处理的是另一层问题:怎样改变这些证明路线被抽中的概率。IMO 级题目的证明空间非常稀疏。模型可能已经具备解决某类问题所需的局部能力,但正确组合只占生成分布里很小的一部分。继续增加采样当然可能碰到这条路线,但如果大多数样本仍集中在相似区域,算力增加以后,实际覆盖范围扩大得并不会太快。雷峰网强化学习在这里做的,是根据成功和失败轨迹重新调整生成分布。那些能够把证明完整闭合的思路获得更高权重,反复把模型带进死路的选择被压低。它并没有凭空增加新的数学知识,而是在重新安排模型已有能力出现的频率。于是通用版、SFT 和 RL 三份 checkpoint 形成了三种不同的解题偏好。这个差异对后面的搜索很重要,因为搜索效果取决于有效样本量,而不只是表面上生成了多少份答案。如