英伟达Nemotron 3微调系统在IOI与IMO 2026模拟赛中达金牌水平
摘要
英伟达Nemotron团队基于Nemotron 3模型,通过监督微调、强化学习及反馈驱动推理三种方法,分别构建出在IOI 2026和IMO 2026中达到金牌水平的系统,展示了该系列模型在竞赛级推理任务上的潜力。
英伟达旗下Nemotron团队近日披露了一项针对竞赛级推理能力的进展:以Nemotron 3为基座模型,团队通过不同训练路径构建出两套系统,分别在IOI 2026与IMO 2026的评测中达到金牌水平。
具体而言,团队采用了三条技术路线——监督微调(SFT)、强化学习(RL)以及反馈驱动推理,并将它们分别应用于上述两个竞赛场景。其中,IOI 2026对应信息学奥赛,IMO 2026对应数学奥赛,两者均对模型的逻辑推理与问题求解能力提出极高要求。
值得注意的是,此次成果并非单一方法的胜利,而是展示了多种后训练手段在Nemotron 3上的适配效果。SFT、RL与反馈驱动推理各自独立支撑起一个达到金牌线的系统,说明该基座模型在复杂推理任务上具备较强的可塑性与泛化基础。
对于AI行业而言,这一进展意味着开源或可商用模型在竞赛级基准上正逐步逼近人类顶尖选手水平。Nemotron 3的此次表现,也为后续模型在数学与编程等垂直推理领域的优化提供了可参考的训练范式。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗