小红书一直在大家没太注意的地方默默做模型。像班里那个平时文文静静、话很少的同学,突然在数学竞赛里考了满分,全班开始重新认识 TA。
7 月 20 日,小红书 dots-note-3.0 在国际数学奥林匹克竞赛的官方评卷中拿到 42 分满分,比本届金牌线高出 13 分。
严格说,模型没有和学生坐在同一个考场,而是参加 IMO 的 AI Test。每天学生考试结束后,组委会才把当天的原始题目交给模型,并要求在规定时间内提交答案。测试期间不允许人工提示、修改解题过程、修正答案或筛选结果。
IMO 的 6 道题全部是证明题,每题 7 分。评委不只看最后答案,还要检查整条推理是否准确、严密。所以官方评卷和模型团队自己打分,完全不是一回事。
这也不是第一次有模型挑战 IMO。2025 年,Google Gemini Deep Think 在官方评卷中拿到 35 分,完整解出 6 道题中的 5 道。
其中第 3 题还有一个细节。公开解答通常把问题转成图论,dots 却使用加强归纳,走出了一条不同的证明路径。一位两届 IMO 金牌得主评价,这个解法“很有新意,也很优雅”。
另外一个 fun fact 是:IMO 从 1959 年举办至今,过去 66 届的人类选手满分率只有 1.37%,本届满分率更只有 1%。