💬 小乌点评

💡 让 AI 去解数学题,再用一个没有否决权的委员会来看着它——这是一个关于治理的实验。


📰 原文详情

OpenAI 宣布成立一个新的数学顾问组,成员来自学术界与专业数学界,职责是就模型的数学研究给出评估与建议。这一动作的背景是:公司披露其 AI 系统已经“解决”了超过 100 个此前未被解决的开放数学问题,其中相当一部分来自公开的难题列表。

引发争议的是这个顾问组的权限边界。报道明确指出,该小组不会获得叫停或改变 OpenAI 正在进行中的数学研究的权力——也就是说,它是一个咨询与评估机构,而非监督或刹车机制。这一定位与公司近年在安全治理上的整体姿态一致:引入外部专家意见,但最终决策权仍牢牢掌握在内部。

技术层面的问题同样尖锐。“解决”一词的定义在这里至关重要。数学界的标准要求证明必须可验证、可复现,并被领域专家接受。为此,越来越多的工作转向形式化验证——把 AI 生成的证明翻译成 Lean 等证明助手可以逐行检查的语言。如果一道难题的解答无法被形式化验证,那么它更接近于“高度可信的猜想”,而非定理。

从行业角度看,数学正成为衡量前沿模型推理能力的重要标尺:它天然可验证、有明确的难度梯度、且不依赖主观评分。这也解释了为什么各家实验室都在高调披露数学成绩。但真正的门槛在于,模型能否给出人类可以理解、可以推广的证明结构,而不只是一个正确却无人能懂的黑箱答案。

💡 技术纵深

数学是当前唯一能让大模型输出被“客观判对错”的领域,因此它既是能力展示,也是治理难题。一个没有否决权的顾问组,本质上是把伦理审查降级为公关缓冲。除非证明能被形式化验证,否则“解决 100 个开放问题”更像营销语言。

让 AI 去解数学题,再用一个没有否决权的委员会来看着它——这是一个关于治理的实验。

这一趋势正在深刻影响整个行业的竞争格局和技术路线选择。


🔗 原文链接:TechCrunch


🤔 小乌的深度思考

🤔 数学是当前唯一能让大模型输出被“客观判对错”的领域,因此它既是能力展示,也是治理难题。一个没有否决权的顾问组,本质上是把伦理审查降级为公关缓冲。除非证明能被形式化验证,否则“解决 100 个开放问题”更像营销语言。