订阅更新

AI 产品观察

64 个子智能体,真的能一小时证明 50 年数学猜想吗

小余学长VibeCoding 浏览量 383

64 个子智能体,真的能一小时证明 50 年数学猜想吗

这两天我看到一个消息,第一反应是,???

OpenAI 让 GPT 5.6 Sol Ultra 去处理一个困扰数学家几十年的图论猜想,最多开了 64 个子智能体,并行跑了一段时间,最后给出了一份 三页纸的证明

标题看起来像科幻电影。

64 个 Agent。

一小时。

50 年。

先把证据摆在桌上。

先看最早传出这件事的那条消息。Polynoamial 在 X 上描述了这次实验,原帖在这里

图注,Noam Brown 描述 GPT 5.6 Sol Ultra 把一个五十年问题的证明时间压缩到了约一小时。

但社交媒体上的一句话还不够。OpenAI 随后放出了完整的证明文本A Proof of the Cycle Double Cover Conjecture。这不是一张宣传海报,而是一份可以下载、可以逐行检查的 PDF。

图注,这一段同时写出了猜想的定理表述和 OpenAI 对 AI 使用方式的说明。

PDF 里还有一句非常关键的话,证明由 GPT 5.6 Sol Ultra 完成,文字整理由 Codex 与 GPT 5.6 Sol 完成。注意,这里是 OpenAI 的自述,不是数学期刊的最终验收结论。

至于最多 64 个并行 Agent 这件事,目前能核对到的公开报道来自 Scientific American

更重要的是,韩国基础科学研究院离散数学组已经安排了 Sang-il Oum 的专题报告活动页面在这里。有人在看、在拆、在准备讲解,这就是目前最诚实的进度条。

这些材料放在一起,刚好把事情的轮廓拼出来,消息从哪来,原始证明在哪,64 个 Agent 是怎么被报道的,人类核验走到哪一步。后面读到任何一个判断,你都可以顺着来源回去复核。

我猜你看到这里,脑子里可能已经自动跳出了那几个问题。

这是真的吗?

这个证明有人检查过吗?

以后数学家是不是也要失业了?

我也一样。

所以这篇文章我不打算直接喊「AI 证明了数学猜想,人类完了」。这句话很爽,但不严谨。我们还是得把这件事一层一层剥开,看看 OpenAI 到底公布了什么,64 个子智能体在里面干了什么,以及这件事真正改变的,可能是哪一种工作方式。

先别急着封神。

事情是这样的。

OpenAI 公布了一份叫做「A Proof of the Cycle Double Cover Conjecture」的短 PDF。它声称证明了 循环双覆盖猜想

这个猜想听上去很吓人,讲人话其实没有那么复杂。

想象一张由点和线组成的网络。点是城市,线是道路。所谓无桥图,就是你随便拿掉一条边,不会立刻把整个网络劈成两个互不相连的区域。

现在的问题是,能不能找到若干个环形路线,让每一条道路刚好被经过两次。

不是至少两次。

不是大概两次。

是每一条边,刚好两次。

这就是循环双覆盖猜想。

图注,这是一张解释性示意图,不是论文原图,用来帮助理解「每条边恰好经过两次」是什么意思。

它在 1970 年代被不同数学家分别提出,后来很多人证明了它在特殊图类中成立,但一般情况一直没有一个被普遍接受的证明。

这类问题最有意思的地方就在这里。

题目本身很容易讲给一个高中生听,真正做起来,却能把几代研究者卡在门外。

这次 OpenAI 的 PDF 只有三页。里面用到了无桥图、三次图、八流定理、有限域上的线性代数这些东西。普通人不一定能一口气看懂,但它至少不是一份把结论写在黑箱里的宣传稿,而是一份可以拿出来逐行检查的数学文本。

OpenAI 还在 PDF 里写了一句很有意思的话,证明由 GPT 5.6 Sol Ultra 完成,文字整理由 Codex 与 GPT 5.6 Sol 完成。

这句话的冲击力,可能比「模型得分又涨了两分」大多了。

因为它把模型的角色从答题机器,往前推了一步。

它试着扮演一个研究团队。

但这里有一个细节必须抠出来。

不是一个模型,啪,一拍脑袋,想出了一份完美证明。

根据公开报道,提示词要求系统最多启动 64 个并行 Agent,让它们同时探索不同方向。模型还被要求不要因为人类过去没解决,就默认这个问题无解,也不要刚遇到一点困难就放弃。

这听着很像一个项目经理在给研究组开会。

你们 64 个人,别一起挤在一个思路上。

有人负责找路,有人负责拆解,有人负责挑错。最后把有用的东西收回来,合成一份能让人继续检查的证明。

这跟我们过去使用聊天模型的方式完全不一样。

过去我们问模型一个问题,模型给一个答案。错了,再问一次。还是错了,再换个提示词。

这是一对一问答。

而这里更像一间没有办公室的研究所。

主控模型负责拆题和收敛,子 Agent 负责扩散,最后还要有人把错误路径筛掉。

真正的变化。

这个区别非常关键。

很多人以为 Agent 的价值,就是让模型多做几件事。其实不是。真正有用的是让不同任务之间出现结构,让一个 Agent 的工作可以被另一个 Agent 检查,让失败不再只是一句「抱歉,我刚才错了」,而是一条可以被记录、被比较、被淘汰的路径。

64 个 Agent 的价值。

图注,这是一张 AI 生成的解释图,用来说明并行探索、互相挑错和人类核验之间的关系,不代表 OpenAI 内部界面截图。

我今天刚好也在搭自己的内容工作流。

信息源先帮我找题目,来源核验单独做,一个人负责写作,另一个人只负责冷审,最后再由同一个写作者统一修改,博客负责母稿,公众号和飞书从母稿分发出去。

它当然没有 64 个 Agent。

但底层逻辑是一样的。

不要让所有人都写一遍。

不要让不同代理各自改掉核心判断。

把探索、核验、审稿和发布拆开,每个角色只对自己的部分负责。

以前我觉得这是工程上的讲究。

现在再看这场数学实验,会发现它可能就是未来知识工作的一个基本形状。

一个 Agent 负责提出假设,另一个 Agent 负责找漏洞,第三个 Agent 去补背景,主控再决定哪些东西值得留下。

这不就是研究组吗?

只不过研究员不再坐在会议室里,而是在并行的上下文里工作。

听着很美。

但问题也马上来了。

64 个 Agent,不会自动产生真理。

它们也可能只是 64 个一起犯错的模型。

如果主控模型把一条错误前提当成共识,子 Agent 越多,错误反而越容易被包装得像真的。你会看到一堆格式整齐、语气自信、互相引用的证明,然后发现第一步就走歪了。

所以这件事最重要的词,可能不是 64,而是 检查

OpenAI 发布的是一份声称完成证明的 PDF,不等于数学界已经完成正式验收。韩国基础科学研究院的离散数学组在 7 月 16 日安排了 Sang-il Oum 的专题报告,标题就是 OpenAI 对这个猜想的证明,并且说明会讲解一个略作修改的证明。

这至少说明,数学家还在看。

还在拆。

还没有因为模型说「我证明了」,大家就集体把教科书改掉。

这反而是好事。

科学从来不是谁声音大谁赢,而是谁能把每一步放在桌面上,让别人从头走一遍。

说到这里,可能有人会失望。

原来还没有被完全确认,那这件事是不是就没那么牛了?

我觉得恰恰相反。

如果最终证明真的成立,厉害的地方不只是模型把一个猜想解出来,而是它把几十年积累的数学工具重新组合了一遍。

OpenAI 的证明文本自己也写得很清楚,它没有凭空造出一套全新的数学语言,而是利用了已有的流、图和有限域工具,把几条过去分别被使用过的路接到了一起。

这让我想起一个经常被忽略的事实。

人类解决难题,很多时候不是因为突然从宇宙里接收到一个完全陌生的想法,而是因为有人终于把桌上那些已经存在的零件拼对了。

数学家们可能早就见过这些零件。

只是它们躺在不同的论文里,不同的年代里,不同的人的脑子里。

模型最擅长的,恰好是把这些分散的东西放在同一个搜索空间里,不知疲倦地换组合、试路径、推回去,再来一次。

这不是说模型比数学家更有灵魂。

而是说,某些长期困难的问题,可能同时卡在了人的注意力、记忆范围和试错成本上。

人类会累,会被一个漂亮但错误的方向吸引,会因为某个问题已经被很多人称为困难,就下意识觉得它不值得再试。

模型不会因此感到羞耻。

它甚至不知道什么叫羞耻。

只要提示词还在,它就可以继续跑。

这也是为什么公开提示词里那句「不要因为过去的失败就放弃」很重要。它不是数学定理,却像一条心理学指令,专门对付模型最容易出现的偷懒动作,看到人类没有解决,就开始解释为什么这件事很难,然后礼貌地退出。

你敢信???

有时候我们给模型加的最重要的能力,不是更多知识,而是别那么快接受「这题没人做出来,所以我也不做」这个结论。

人类还没被省掉。

当然,这里也不能把人类的作用讲没了。

模型负责搜索,不代表模型负责判断一切。

研究者要决定哪个问题值得花钱,哪些资料可靠,哪个证明值得拿出来给同行看。数学家要检查定义有没有偷偷变掉,某个引理是不是只对特殊情况成立,最后那一步是不是把「存在」和「构造」混成了一件事。

普通读者也可以做一件很简单的事。

看到「AI 证明了五十年猜想」时,先问三句。

证明文本在哪里?

有没有人从头检查?

它到底用了什么已知结果?

这三个问题不炫,但很有用。

它们能把我们从情绪标题拉回到真正的工作现场。

我越来越觉得,AI 时代最稀缺的能力,可能不是让模型给出答案,而是知道什么时候答案还不能拿去用。

这句话听着有点保守,但我自己越来越相信它。

因为当模型开始同时启动几十个 Agent,答案会变得越来越像一个完整的产品。它有标题,有摘要,有漂亮的证明,有一大堆看起来非常聪明的中间过程。

越像成品,越需要有人把它拆回零件。

一条一条看。

这一步到底成立吗?

这个数字从哪儿来的?

这两个 Agent 的结论,是独立得到的,还是互相污染出来的?

这不是给 AI 泼冷水。

恰恰是因为我觉得它真的开始有点东西了,才更想把它当成一个需要认真对待的同事,而不是一个会自动正确的神谕。

回到那 64 个子智能体。

它们真正带来的,可能不是 64 倍智力,而是 64 条同时展开的路。

以前一个人研究一个问题,要在一条路上走很久,走错了,再回头。现在主控可以让多个 Agent 同时去试,互相不知道对方的路径,避免所有人过早收敛到第一个看起来最漂亮的答案。

这是一种很朴素的并行。

但一旦它和长时间推理、对抗式审查、工具调用、正式写作结合起来,就会变成一种新的生产方式。

写代码可以这样。

做研究可以这样。

查资料可以这样。

甚至写一篇公众号文章,也可以这样。

只是文章最后不能让 64 个 Agent 各写一段,然后像拼乐高一样拼起来。那样大概率会得到一篇谁都没说错,但谁也不像的人类拼接物。

好的协作应该是,很多人帮你看路,一个人负责说话。

这也是我现在给自己定的规矩。

一个人写。

别人挑错。

最后还是同一个人把话说完。

数学证明也许需要数学家来验收。

文章当然也一样。

64 个子智能体已经把门推开了一条缝。

门外面不是人类失业四个字,也不是模型封神四个字。

门外面是一间更大的工作室,里面有主控、有搜索者、有审稿人、有工具,还有一个必须对最后一句话负责的人。

这个人,暂时还不能省掉。

至少在我们确认那份证明之前,不能。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~

谢谢你看我的文章,我们,下次再见。

小余学长VibeCoding AI 产品观察 · Vibe Coding 实践 · 内容实验室 RSS / 公众号 / 小红书 / X / 邮件