爱看AI
返回文章列表
ai-news发布于 · 2026/10/10

OpenAI 一口气发布 722 篇 AI 数学证明,顶尖数学家为什么集体抵制?

OpenAI 一口气发布 722 篇 AI 数学证明,顶尖数学家为什么集体抵制?

一句话结论:OpenAI 用一款未公开的内部模型,一夜之间“倾倒”出 722 篇数学证明。数学界炸锅的不是“AI 会做题”,而是这家公司把验证的包袱甩给了全世界的数学家,却拒绝公开模型与提示词。

发生了什么:一组需要核对的数字

2026 年 10 月 6 日,OpenAI 在 GitHub 公开了一个未命名内部前沿模型的产出:一次性放出 722 篇数学手稿,覆盖 372 个成果组,横跨数论、代数、几何、理论计算机科学,甚至一部分物理。

维度公开口径(需独立核实)
发布时间2026-10-06,GitHub 仓库 openai/math
手稿 / 成果组722 篇 / 372 个
喂入难题约 4000 道开放难题,命中率约 5%
单题算力平均约 3 小时 ChatGPT Pro 级别“深度思考”
形式化验证口径不一:约 162/722 篇有完整 Lean 证书(约 22%),另有部分 Lean;约 42% 附某种形式化
撤回发布次日撤回 3 篇(符号错误连锁);Navier–Stokes 证明被曝“数学翻译错误”

几个被反复点名的“镇宅级”声称:准黎曼猜想(ζ 函数在 Re(s)>7/8 无零点)、四维 Kakeya 猜想、CM 阿贝尔簇上的 Hodge 猜想、自由群因子同构,以及对千禧年难题(含黎曼猜想)的进展。这些目前都没有经过独立同行评审,OpenAI 自己的 README 也罕见地自曝:“部分未形式化结果可能有问题,我们会尽快修复。”

数学界为什么炸了:陶哲轩的三记重锤

10 月 7 日,菲尔兹奖得主陶哲轩在博客转载了“人类数学协会”(AHM)的声明,呼吁数学家停止与 OpenAI 合作。声明里有三记重锤:

  1. “没人要求过。” 数学家并没有提出这些目标;实验室自己选了时机和题目,然后把核验成本丢给学界。
  2. “违背了它自己的顾问组。” OpenAI 声称参考了普林斯顿高等研究院牵头的 AGMAI 建议,但 AGMAI 第一份报告就明确:前沿实验室不该用内部封闭模型去测高难数学问题。OpenAI 咨询完,转头绕开了这条前提。
  3. “这是权力的展示,不是学术。” 原话大意:“一次性发布 700 多份文件,展示的不是学术研究,而是权力。”

两派交锋:抵制 vs 看好

  • 抵制方(陶哲轩、AHM、Scott Aaronson 等):批量“真/假”断言打断了数学“理解—交流—再创造”的知识循环;连读懂都要靠 AI 辅助,年轻人可能因“人类数学家不再必要”而放弃读研读博,被称为 Mathocalypse(数学末日)。
  • 看好方(图灵奖得主杨立昆):形式证明自动化是“数学的新时代”——就像船降低了游泳的重要性,却让人发现了新大陆,人类可聚焦更高阶的创新。
  • 中立观察(《科学美国人》):领域已陷入震惊;AI 产出的速度跑赢了人类验证的速度。MIT 的 Andrew Sutherland 一句话点题:“我们要看收据(We should ask for receipts)。” NYU 的 Tristan Buckmaster 更尖锐:尚不清楚模型是否无意中“抄”了人类数学家尚未发表的工作。

真正的问题:当解题速度跑赢理解速度

这不仅是“AI 能不能做题”。传统数学靠一个内在循环运转:一道题被解掉之后,过程中的新方法、失败路径、衍生问题,才是滋养下一代数学家的养料。AI 批量输出“真/假”断言,等于把这个循环掐断了——留下一堆人类消化不了的证明,等学者无偿去核验。

陶哲轩因此提出 “Math 1.0 → Math 2.0”:解题不应再是衡量数学进步的主要标准,真正的目标是概念理解、方法沉淀和新方向的开拓。这其实是在问一句更根本的话:如果一份“正确”的答案,没人能讲清它为什么对、新在哪里、是否原创,它还是“数学”吗?

对普通人的意义:AI 先摧毁的往往不是工作,而是议价权

把镜头从数学界拉到写字楼,逻辑是一样的。连人类逻辑密度最高的纯数学都被撕开了一个口子,一切建立在推理之上的现实技能被“平推”只是时间问题。

老板不需要把所有人都开除,只需要留一个工程师带着几个 AI,就能干过去整个部门几十上百人的活。你的岗位可能还在,但你的工资、你的不可替代性、你跟老板谈条件的所有筹码都没了。AI 最先摧毁的往往不是你的工作本身,而是你劳动的议价权。

结语:谁掌握节奏,谁定义下一步

OpenAI 把“解数学题”变成了展示算力,陶哲轩把“理解与验证”拉回了前台。这场争论没有标准答案,但有一件事已经摆在明面上:当一家公司的商业节奏开始主导一个学科的知识生产方式,这个学科的自主性就开始流失。

谁的节奏,决定数学的下一步——这也是当前 AI 科研治理的分歧点。


事实核验说明:本文数字(722 / 372 / 4000 / 42% / 3 小时 / 162 篇 Lean)取自 OpenAI 官方仓库 README 及 The Verge、Scientific American、Washington Post、Fortune 等主流媒体报道(2026-10-06 至 10-09)。关键声称(准黎曼、Kakeya、Hodge 等)尚无独立同行评审;“42%”与“162/722 篇完整 Lean”为不同口径,已分别标注。引用来源原文以一手报道为准。