AI AI工具情报站
国内AI动态 ai-models

小红书 dots 模型获 IMO 2026 满分金牌

📰 公众号:小红书技术(dots.llm) 📅 2026-07-21

核心亮点

小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届国际数学奥林匹克(IMO 2026),六道题目全部满分,以 42/42 的成绩拿下满分金牌。全球范围内,仅有 7 位人类选手取得同样成绩。这意味着国产大模型在形式化推理与复杂数学解题上,已经站到了世界最前列。

具体能力或事件经过

与许多依赖形式化语言(如 Lean、Coq)辅助证明的参赛系统不同,dots-note 3.0 不依赖形式化语言,而是直接读取原始 LaTeX 题目,通过“递归自我批判”能力端到端完成解题。也就是说,模型在生成解答后,会反复审视自己的推理步骤,发现并修正错误,直到给出完整且正确的证明。这种“自己出题、自己验证、自己纠错”的闭环,是它能在高难度赛题上稳定满分的关键。dots-note 3.0 属于 dots3 系列中最轻量的版本,却展现出与其体量不相称的推理深度。

技术细节

“递归自我批判”可以理解为模型在推理链中不断回溯:每写出一个子结论,就尝试从反例、边界条件和逻辑一致性角度去攻击它,若发现漏洞则重写对应段落。相比一次性输出答案,这种多轮自我对话显著降低了幻觉与跳步的概率。值得注意的是,该版本并不追求参数规模,而是以高效架构换取实时可部署性,团队预期将把模型开源,让社区在其基础上继续打磨。

与竞品对比

在 IMO 这类顶级数学竞赛中,此前表现突出的系统多依赖大规模形式化验证工具链,部署成本高、通用性弱。dots-note 3.0 选择“原生 LaTeX + 自我批判”的轻量路线,不需要配套的形式化环境,降低了使用门槛。与动辄数百 B 参数的通用大模型相比,它用更小的体量实现了更强的专项推理,验证了“小而专”路线在数学场景的可行性。

行业影响或适用场景

说白了,IMO 满分不是终点,而是大模型推理能力成熟的里程碑。这类能力可迁移到自动定理证明、科学计算辅助、编程验证、金融建模等对逻辑严谨性要求极高的场景。若 dots-note 3.0 如期开源,将显著降低科研与教育领域使用高级推理模型的门槛,也可能推动更多团队探索“递归自我批判”这一范式。对中国 AI 而言,这证明我们在前沿推理架构上已具备与国际顶尖实验室同台竞技的实力。