OpenAI 确认下一代模型 Astra:连解10道未解数学题,多Agent长时推理首次亮相
8月1日,OpenAI 在一篇数学研究博文中首次确认了下一代前沿模型的名称——Astra。这不是一次常规的模型迭代,而是一个全新的模型家族,定位为"能连续工作数小时甚至数天"的长时推理系统。伴随确认而来的,是 Astra 交出的第一份成绩单:一次性解决了10个此前未被证明的数学问题,其中一项证明了非 sofic 群的存在性,直接回应了群论领域的一个重大开放问题。
Astra 是什么:从短任务到长时推理
目前主流大模型擅长的是"短任务"——写一段代码、回答一个问题、翻译一段文字。Astra 的目标完全不同:它被设计为协调多个 Agent 在长时间跨度内持续工作,能够规划、推理、试错、自我纠偏,直到问题被解决。
OpenAI CEO Sam Altman 本周在华盛顿向政界人士和监管者演示了 Astra,强调其在复杂项目和高等数学上的潜力。据 The Information 报道,Astra 将成为 OpenAI 现有 Sol、Terra、Luna 之外的第四个模型家族。
最终命名尚未确定——可能叫 GPT-6,也可能是 GPT-5 系列的某个变体(如 GPT-5.7)。发布日期也未公布。
10个数学证明:AI 推理的新高度
Astra 的10个证明覆盖了高维几何、编码理论、群论、量子复杂度、格密码学和极值组合学等领域。曼彻斯特大学数学家 Thomas Bloom(运营 erdosproblems.com)在 X 上称这些结果为"大新闻",认为其意义超过了 OpenAI 今年5月发表的单位距离猜想反例。
关键细节:
- 成本:OpenAI 表示,生成全部10个证明的 token 消耗按 Sol 的 API 价格计算约 2000 美元。这不是一个天文数字,但考虑到这些是此前人类数学家未能解决的问题,性价比令人侧目。
- 形式化验证:每个证明都被 Astra 用 Lean 形式化,生成了机器可检查的正确性证书。OpenAI 在 GitHub 上公开了形式化代码,并发布了推理过程的详细 walkthrough。
- 人机协作方式:Astra 生成论证,人类研究者协助将论证整理为论文并完成形式化。OpenAI 明确表示,数学论证本身来自 Astra,不应将 AI 生成的证明署名为人类作者——并引用了《莱顿 AI 与数学宣言》作为署名规范参考。
OpenAI 研究员 Noam Brown 在 X 上补充说,团队也尝试了千禧年难题但尚未成功,不过"每个问题投入的算力并不多,test-time compute 还可以推得更远"。
监管首秀:美国新 AI 框架的第一个受审模型
Astra 的另一个"第一":据 The Information 报道,它预计将成为首个接受美国新 AI 监管框架审查的模型。该框架要求 AI 模型在公开发布前须提交联邦政府审核,特朗普政府计划在本周内完成框架定稿。
这意味着 Astra 的发布节奏不仅取决于技术就绪度,还取决于政策流程。OpenAI 在 GPT-5.6 Sol 的发布中已经采取了"先小范围预览、再逐步开放"的策略,Astra 可能延续甚至强化这一模式。
仍待验证的挑战
长时推理和多 Agent 协作并非没有风险。Google 和 MIT 的联合研究曾发现,在紧密耦合的任务中,多 Agent 设置反而可能因为协调开销和错误累积而表现更差。Astra 能否在长时间运行中避免错误滚雪球、在偏离轨道时自我纠偏,是它能否兑现承诺的关键。
OpenAI 首席科学家 Jakub Pachocki 去年曾表示,公司目标是构建能"在问题上工作数小时甚至数天"的 AI 系统。到2028年3月,OpenAI 希望拥有一个完全自主的 AI 研究员。Astra 可能就是通往那个目标的关键一步。
---
基于多家媒体转述整理,主要来源:The Decoder、The Information、OpenAI 官方博文。