OpenAI 开源 722 篇数学手稿:一个未发布模型产出的 372 个结果族
10 月 6 日,OpenAI 在 GitHub 上建了一个叫
openai/math的仓库,一次提交推了 722 篇数学手稿,归为 372 个结果族。产出这些手稿的模型没有开源,也没有命名。 > > 比规模更该注意的,是两处细节:722 篇手稿里只有 162 篇附了 Lean 形式化证明;形式化目录自己标注的审查状态是unchecked。README 也写明”部分未形式化的结果可能有问题”。
一、一次没有发布会的发布
仓库地址:<https://github.com/openai/math
| 项目 | 情况 |
|---|---|
| 建仓时间 | 2026 年 10 月 6 日 |
| 提交记录 | 只有 1 次提交(Initial commit),提交者显示为 Anonymous |
| 热度 | 8.2k star、787 fork、147 watching(GitHub API 查询时点) |
| 许可 | Apache-2.0 |
| 内容规模 | 722 篇手稿,372 个结果族 |
| 官方配套 | 研究帖《Sharing AI progress in mathematics》,2026-10-06 |
OpenAI 同步发了一篇研究帖说明这次公开:<https://openai.com/index/sharing-ai-progress-in-mathematics>(该页面有访问验证,命令行与无头浏览器都拿不到正文;本文涉及的官方口径均以仓库内文件和 OpenAI 官方 RSS 元数据为准)。
翻过来就是:结果来自一个内部前沿模型,OpenAI 把 Lean 证明形式化和研究细节放上了 GitHub。模型本身既不发布,也没具名。
二、仓库里有什么:四样东西
[

四样东西的用法,README 里交代得很清楚:
](https://openai.com/index/sharing-ai-progress-in-mathematics)
- 先看 overview.pdf —— 372 个结果族的描述都在这里,41 页。
- 用 CONTENTS.md 找单篇论文 —— 手稿地图,9169 行、约 625 KB,每条结果后面跟它下属的各篇手稿、摘要和 PDF 直链。
- preprints/ 放正文 —— 每篇论文一个目录,含 PDF、LaTeX 源码、BibTeX 引用块和编译说明。
- lean/ 放形式化证明 —— 见 Lean 库说明 和 形式化目录;验证方式见 Comparator 说明。

三、372 个结果族,分布在哪
overview.tex 把这批结果按 17 个数学分支分类,每族给出标题、一段摘要和论文链接:

| 数学分支 | 结果族数 |
|---|---|
| 理论计算机科学 | 40 |
| 组合数学 | 37 |
| 代数与复几何 | 36 |
| 数论 | 31 |
| 微分几何 | 29 |
| 概率与统计力学 | 29 |
| 数学物理 | 25 |
| 算子代数 | 19 |
| 拓扑学 | 18 |
| 代数学 | 18 |
| 偏微分方程 | 16 |
| 实分析与复分析 | 16 |
| 凸几何与度量几何 | 15 |
| 群论 | 14 |
| 动力系统与遍历论 | 12 |
| 泛函分析 | 11 |
| 数理逻辑 | 6 |
覆盖面确实广,从数论一路铺到偏微分方程;重心则偏向能构造、能反证的方向——理论计算机科学、组合数学、代数与复几何三块加起来有 113 个结果族。
四、可以直接点开看的结果
下面这些结果,标题和描述都取自官方目录,链接是仓库里的论文原文:
| 编号 | 结果 | 一句话说明 |
|---|---|---|
| 003 | The quasi-Riemann hypothesis | 证明包括 ζ(s) 在内的所有 Dirichlet L 函数在 Re s > 7/8 无零点 |
| 032 | CM 阿贝尔簇上的有理 Hodge 猜想 | 任意维数、任意余维数的复 CM 阿贝尔簇有理 Hodge 猜想;经 Milne 定理还能推出有限域上所有阿贝尔簇的 Tate 猜想 |
| 002 | 低 Selmer 余秩下的完整 BSD 公式 | 对 Q 上所有 q 幂 Selmer 群余秩为 0 或 1 的椭圆曲线,证明完整 BSD 主项公式,含 Tate–Shafarevich 群的有限性 |
| 287 | 所有非阿贝尔自由群因子同构 | L(F₂) ≅ L(F₃),进而所有内插自由群因子同构,公共因子的基本群是 R 的正半轴 |
| 017 | π 的无理性指数为 2 | 给出 π 的无理性指数恰好为 2 的论证,不依赖此前 62/25 逼近界 |
| 362 | 相对论性 Vlasov–Maxwell 的整体光滑性 | 三维单组分相对论性 Vlasov–Maxwell 系统的大初值整体存在唯一性 |
| 376 | 外力驱动 Navier–Stokes 流中的通用计算 | 构造由静止启动的黏性不可压流,在光滑外力下实现通用计算,把图灵机编译成有限外力程序 |
| 348 | 非负曲率 Einstein 四流形与拓扑间隙 | 正 Einstein 常数、非负截面曲率的闭 Einstein 四流形,万有覆叠只可能是圆球、复射影平面或等半径双球之积 |
偏 Erdős 的一组结果另有一批,官方目录里至少包括:短埃及分数(025)、连续整数最大素因子的独立性(012)、倒数和发散的整数集必含任意长等差数列(159)、van der Waerden 数的超指数下界(160)、高维 Erdős 距离猜想(166)、超立方体 Ramsey 猜想(171)、Erdős–Gallai 圈分解(181)、Erdős 相似猜想的几何情形(084)。
五、一个绕不开的特征:反例比证明更醒目
翻这批结果,会碰到不少”构造反例、推翻既有猜想”的工作。在 overview.tex 里按 counterexample / disprove / refute 一类关键词扫一遍,372 个结果族里有 66 个命中(约 18%),只看标题则是 50 个。随手列几个:
- Kaplansky 零因子猜想被推翻 —— 构造出有限表示的无挠群 G,使 F₂[G] 存在非零零因子(196)。 - Kaplansky 拟迹猜想被推翻 —— 构造可分单位复 C\*-代数,其归一化 2-拟迹全不可加(294)。 - Hadwiger 猜想被推翻 —— 甚至对分数染色也不成立(157)。 - Kuznetsov 有理性猜想被推翻 —— 足够大的容许 Hassett 判别式下,非常一般的复三次四维体是无理的(054)。 - 投影 Lax 猜想被推翻 —— 存在不是谱面体投影的双曲锥(095)。 - Baum–Connes 与 Kadison–Kaplansky 的反例 —— 约化 Baum–Connes 的单射性与满射性分别失效(285)。
反例有个好处:它是构造性的,别人拿去复算的入口比较明确。相比之下,“证明某定理”类的结果,验证成本要高不少——这也是形式化对两类结果价值不同的原因。
六、“形式化”到底覆盖了多少
这是读这个仓库时最容易看错的地方,几个数字要分清楚:

- 722:手稿总数。
- 372:结果族数量(一个族可以包含主结果、伴随论证、推论或替代证明)。
- 162:lean/formalization.yaml 里列出的论文条目数,都指向 preprints/ 下不同的手稿,也就是官方说的”许多但并非全部手稿已有形式化”。
- 185:形式化目录里登记的主结果声明条数(有的论文登记了不止一条,所以 185 大于 162)。
- 10:公开的推理摘要篇数。

形式化库自身的状态标注,比任何二手解读都更值得看。formalization.yaml 文件里写着:
- status.scope: "Partial progress."
- review.status: unchecked
- automation.methods: [agent]
也就是说,这份目录自认覆盖的是部分进展,审查状态是未审查,生成方式是 agent 自动完成。仓库还引入了多个社区 Lean 库作为基础,包括 mathlib4、AlexKontorovich 的 PrimeNumberTheoremAnd、TauCeti、carleson 等。
想自己动手验证,Comparator 配置都在 lean/ComparatorChallenges/ 下。lean/README.md 还给了一条容易踩坑的技术提示:整个库一次性编译可能因为 Linux 的 vm.max_map_count 太低而失败,解决办法是用 -DMMAP=OFF 编译 Lean,或在运行 Lean/Lake 时设置 GLIBC_TUNABLES=glibc.malloc.mmap_max=0:glibc.malloc.arena_max=1。
七、OpenAI 自己的说法
README 里关于产出过程的那一段,是全文最关键的一段,直接引用:
The vast majority of results were obtained with the same procedure using an unreleased internal OpenAI model. On average, each result used three hours of ChatGPT Pro thinking compute with that model. Over the course of the evaluation, the model was posed approximately 4,000 problems.
要点是三条:绝大多数结果用的是同一个流程、同一个未发布的内部模型;平均每个结果消耗约 3 小时 ChatGPT Pro 的思考算力;整个评测过程中一共给模型投了约 4000 道题——最终的 722 篇/372 族,是从这约 4000 道题的输出里,经过归族、成稿和显著性筛选留下来的。
另外两个例外流程,README 也写明了:黎曼 ζ 函数无零点区域的工作,和 CM 阿贝尔簇 Hodge 猜想的证明,不套用上述固定流程;其中 Re(s) > 11/12 那个无零点区域结果的文稿经人工编辑以提高可读性。
注意这里的数字:README 提到的界限是 Re(s) > 11/12,而目录第 003 条的表述是 Re s > 7/8,两处并不相同。引用时建议直接落到对应论文上,别拿目录摘要当 README 那句话的注脚。
关于模型本身,README 提到的是:这些产出属于模型开发过程中的评测副产品——原有数学评测饱和之后,OpenAI 把评测范围扩展到开放研究问题,一些输出还建立在模型此前的结果之上。至于”是否会发布这个模型”,README 没有承诺,只提到正在探索社区托管的仓库来存放这批材料。
推理摘要这部分,仓库公开了 10 篇,覆盖的结果族是 007、017、087、102、159、197、221、271、287、362,对应目录在 <https://github.com/openai/math/tree/main/reasoning_traces>。
[

](https://github.com/openai/math/tree/main/reasoning_traces)
八、这不是孤立事件:5 月到 10 月的一条线
把 OpenAI 官方发布记录排一排,这次开源的位置会清楚很多:
| 时间 | 官方发布 |
|---|---|
| 2026-05-20 | An OpenAI model has disproved a central conjecture in discrete geometry —— 宣称推翻离散几何中的一个核心猜想 |
| 2026-08-01 | Ten advances in mathematics and theoretical computer science —— 挑出十项结果集中发布 |
| 2026-09-08 | On the Navier–Stokes Millennium Prize Problem —— 关于 Navier–Stokes 千禧年问题,外媒报道称其宣称已解决 |
| 2026-09-21 | Advisory Group on Mathematics and Artificial Intelligence —— 成立数学与 AI 顾问组 |
| 2026-10-06 | Sharing AI progress in mathematics + openai/math 仓库 |
再往前,还有 2025-11-24 的 GPT-5 and the future of mathematical discovery 和 2026-02-20 的 Our First Proof submissions。这条线是:先零散公布单项结果,再集中公布”十项进展”,然后成立顾问组,最后一次性放出 722 篇手稿。
九、数学界的态度
这批结果落地在一个并不平静的背景里。
2026 年 9 月 11 日,25 位菲尔兹奖得主联署了一份声明《A Severe Misalignment of AI in Mathematics》。Terence Tao 把它贴在了自己的博客上:<https://terrytao.wordpress.com/2026/09/11/a-severe-misalignment-of-ai-in-mathematics>。声明的核心意思是:大模型的数学能力近几个月提升明显、确实能解决多个领域的重大问题,但 AI 公司把”解出题目”当作基准来推动发展,对数学这门学科和数学共同体有害,两家机构的目标”严重错位”。
法国《世界报》和《科学美国人》都做了报道,可参见:Le Monde 报道、Scientific American 报道。
所以读到”AI 一次性解决了 372 个数学结果族”这种说法时,最好同时记住两件事:这批手稿没有经过同行评审,形式化覆盖只有一部分且审查状态是 unchecked;而数学共同体对”用未公开模型刷开放问题、再选择性公布结果”这种做法,已经公开表达过反对。
十、想自己上手,从这几步开始
# 1. 克隆仓库(约 780 MB,含全部 PDF 与 Lean 源码)
git clone https://github.com/openai/math.git
cd math
# 2. 先读官方目录,建立全局印象
# overview.pdf —— 41 页,逐条介绍 372 个结果族
# CONTENTS.md —— 手稿地图,按族列出论文、摘要与 PDF 直链
# 3. 想验证而不是只读结论,走 Lean 这条路
# 依赖安装与编译说明:lean/README.md
# 验证配置:lean/ComparatorChallenges/
# 若整库编译报 vm.max_map_count 相关错误,参考 lean/README.md 的 mmap 一节
# 4. 引用单篇论文
# 每个 preprints/<论文目录>/ 下都有 BibTeX 引用块,直接用
几点补充:
- 许可:仓库整体 Apache-2.0,二次使用、转载、编译都按这个许可来。
- 版本策略:README 明确会保留公开发布历史,改动和修订以新版本记录,旧版本继续可访问——如果你想引用某个结论,最好把版本号一起记下来。
- 看结果的顺序建议:先 overview.pdf 定位感兴趣的分支,再回 CONTENTS.md 找对应族的论文和摘要,最后才点 PDF。直接翻 preprints/ 的 722 个目录会迷路。
十一、几条必须写清楚的提醒
1. 结论都来自自述。 本文所有结果描述都取自仓库和官方目录,凡未标注”已形式化”的,都属于 OpenAI 单方声明,未经同行评审。
2. README 自己承认有风险。 原文:Some of the unformalized results could have issues. We will endeavor to fix any such issues quickly.——未形式化的结果可能有问题,这是官方说的,不是外界揣测。
3. 审查状态是 unchecked。 有 Lean 形式化,不等于已被独立审查通过。
4. 算力口径别转述错。 “约 3 小时”指的是平均每个结果的 ChatGPT Pro 思考算力,不是整个项目耗时,也不是全部 722 篇的总量;约 4000 道题是评测投题总量。
5. 争议是这件事的一部分。 25 位菲尔兹奖得主的声明和 OpenAI 成立顾问组,都发生在这次发布之前,写这个话题不提它们,会失真。
来源
- 仓库:<https://github.com/openai/math>(Apache-2.0) - README:<https://github.com/openai/math/blob/main/README.md> - 官方目录:<https://github.com/openai/math/blob/main/overview.pdf> / <https://github.com/openai/math/blob/main/overview.tex> - 手稿地图:<https://github.com/openai/math/blob/main/CONTENTS.md> - Lean 形式化目录:<https://github.com/openai/math/blob/main/lean/formalization.yaml> - 推理摘要:<https://github.com/openai/math/tree/main/reasoning_traces> - OpenAI 研究帖《Sharing AI progress in mathematics》:<https://openai.com/index/sharing-ai-progress-in-mathematics> - Terence Tao 博客《A Severe Misalignment of AI in Mathematics》:<https://terrytao.wordpress.com/2026/09/11/a-severe-misalignment-of-ai-in-mathematics
文中图表由本文作者根据仓库文件 overview.tex、formalization.yaml 的原始数据绘制;仓库页面截图与目录 PDF 页面来自公开仓库,遵循其 Apache-2.0 许可使用。