面向Google编程CHARLES ZHANG

AI DAILY / 2026-10-07

Nemotron的专门化训练:解题数据为何还要包含验证与改写

One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO

模型训练与推理NVIDIA / Hugging Face · 2026-10-07

原创中文正文 · 基于公开原文核对与分析

事实与来源

NVIDIA在2026年10月7日发布技术总结,介绍如何把Nemotron基础模型改造成编程竞赛和数学证明专用系统。相关论文已于9月公开;本次值得阅读的是训练数据、后训练方法与推理流程之间的配合,不能把文章日期当作比赛发生日期。

按团队报告,IOI 2026系统得535.4/600分,但属于未受赛事方监督、未纳入官方排名的非官方实验;IMO系统的提交经官方阅卷者评分为30/42,超过当年29分的金牌线。两个任务使用不同专门化方案,不能概括成一个模型单次回答就获得两枚正式金牌。

技术机制

数学系统的监督微调数据覆盖15,818道题、414,890条样例,包含生成证明、改写、验证,以及检查评审是否合理的“元验证”。其中验证轨迹有236,360条,占了一半以上。模型要学习的不只是交出答案,还包括识别缺口、给出可操作的反馈;这是数据配方中容易被总规模掩盖的一点。

推理时,通用、监督微调和强化学习三个模型版本共同生成候选。每题首轮预算按三版本、八种提示、每种十六次采样合计384次尝试;两个专用版本合计给每份证明十六次评审,全部通过才满足内部接受条件。未通过的有希望候选会携带批注进入改写,最终候选还要经过单独的高预算评分。元验证训练样例并不意味着推理阶段另有一个元验证器。

例子与用途

对应用开发者,这提供了一种整理训练数据的思路。假设团队要训练一个处理边界条件的代码助手,可以把历史修复整理成“需求、原候选、失败输入、具体批注、修正版本和检查结果”,而不是只保留最后通过的代码。这是本文构造的用例,并非论文验证过的企业应用。

例如,一个函数在空输入时崩溃,批注应指向缺失的前置检查;模型改写后,还要重跑原有正常输入测试,确认没有修好一处却破坏另一处。将候选、反馈与最终检查关联起来,才能分析提升来自更好的生成、准确的批评,还是反复试错。语言模型提供的批注仍需可执行检查或人工审查支持。

限制与不确定性

十六次评审一致也不等于数学证明已经成立。论文报告,竞赛截止时模型评估约为32分,官方结果却是30分,第三、六题出现共同高估。这说明多个模型版本和多次采样仍可能共享判断盲点;系统中的“接受”只是内部规则,不是独立正确性保证。

算力成本同样不能省略:IMO论文记载完整竞赛运行约生成23.1亿token,消耗4,784.6个GB200 GPU小时。找到提交答案时的消耗较低,但不能用它替代整次运行成本。论文中的结果依赖大模型、专门训练和大量推理计算,不能据此承诺普通助手加入循环后就能复制竞赛水平。

开发者启示

更可执行的起点,是先用少量代表性任务检查训练样本质量:错误是否真实、批注是否指出原因、修正是否通过独立检查。再在相同推理预算下比较单次生成、多候选筛选和带反馈改写,观察成功率与误接受率,而不只看最终最好的一次答案。

公开的NeMo-Skills配方保存候选、评分、批注和配置,并按请求身份恢复未完成步骤,便于追查结果由哪些尝试产生。借鉴这种记录方式时,也应固定任务集和停止条件,避免把追加预算误当模型进步。本文未训练或运行这些模型;上述应用与对照实验是工程建议,不是已复现的结论。

基于NVIDIA官方博客全文、IMO及IOI论文和NeMo-Skills公开配方整理的原创中文分析;结果与算力数据归属作者。明确区分10月技术总结与9月论文、非官方IOI实验与IMO评分;代码助手案例为假设,实验建议属于推演,未训练模型或复现竞赛。

本期收录日:2026-10-07;主来源发布日期:2026-10-07。收录日不等于发布日期。