开放世界多智能体环境中的自主数学发现 Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment
无中央协调的多智能体科学社区自主做出五项超越现有文献的数学新结果
前置知识
多智能体系统
由多个独立运行的大模型智能体组成的系统,每个智能体有自己的上下文、记忆与行动决策,通过消息、共享空间或文件交互。与单个长对话智能体不同,它让视角、风格各异的执行者分工协作,通过交流、互评与接力完成复杂任务,并能产生单个智能体难以涌现的集体行为。
本文的 Station 就是一个多智能体科学社区,理解房间、tick、通信渠道与评审机制是看懂实验结果和元分析(谁发现、怎么协作、知识如何积累)的前提。
开放世界环境(对比流水线)
不预设固定流程脚本的环境:只提供场地与规则(存档、执行代码、邮件等),智能体自由决定做什么、何时做、做多久;与之相对的是中央协调器派发子任务、智能体作为工具被调用的流水线范式。
本文的核心主张正是把智能体当作科学生态系统中的独立研究者而非流水线工具,开放世界设计是全部结论成立的前提,也是与 AlphaEvolve 等系统对比的根基。
AlphaEvolve 与进化式搜索
DeepMind 的进化式程序搜索系统:用 LLM 变异候选程序,按自动评估器给出的数值分数做进化优化,曾在数十个数学问题上刷新构造类纪录(如 $d=11$ 吻接数 593、Erdős 最小重叠上界 0.380924)。其范式是“评分函数驱动 + 大规模搜索”。
本文直接选取 AlphaEvolve 目录中的 12 个问题作为基准并逐题对比,理解其评分驱动范式才能体会 Station 在自主性、定理产出上的差异与优劣。
有限域 Kakeya 集
在 $\mathbb{F}_p^d$ 中包含每个方向一条完整直线的集合,目标是让它尽量小。Dvir 证明了 $p^d$ 量级的下界(有限域 Kakeya 猜想),Bukh–Chao 进一步确定首项常数为 $2^{-(d-1)}$,三维即 1/4;尚开放的是低阶修正项。
论文第一个焦点结果就是 $d=3$、$p\equiv 3\pmod 4$ 的无穷族构造,大小 $(2p^3+7p^2+3)/8$,没有这个背景就无法理解该结果和 53 点构造为何重要。
吻接数
$d$ 维空间中能与一个中心单位球同时相切的互不重叠单位球的最大数目 $K(d)$,等价于两两内积不超过 $1/2$ 的单位向量集的最大规模。高维精确值极难确定,$d=11$ 的纪录长期停留在 592/593。
论文最亮眼的数值结果是在 $d=11$ 给出三个互不合同的精确 604 点构型($K(11)\ge 604$),并配以纯代数构造和经典 $D_{11}$ 构造上限 582 的证明。
Book Ramsey 数
书图 $B_k$ 是 $k$ 个共享一条公共边的三角形。$R(B_{n-1},B_n)$ 是迫使任意红蓝边染色中出现红 $B_{n-1}$ 或蓝 $B_n$ 的最小阶数,Rousseau–Sheehan 证明其上界为 $4n-1$,猜想对所有 $n$ 取等。
这是两个附加案例研究之一:Station 智能体发现并证明了两个新的无穷族,加上外部专家补全的第三族,共同在 $n\le 200$ 内解决 28 个此前未决的情形。
研究动机
现有 AI 数学发现系统普遍把智能体当作流水线中的固定工具:中央协调器派发子任务,系统积累的是优化历史、中间产物或会话记忆,而非可提炼、可传承的科学知识。后果在 AlphaEvolve 上具体可见:它在有限域 Kakeya 问题上只对有限个素数评估构造,把有希望的数值模式变成无穷族需要任务专用、研究者深度参与的后续流水线;在 Erdős 最小重叠问题上只把上界从 0.380927 微调到 0.380924;在差分基问题上直到人类专家提供 Singer 差集生成代码的提示才突破基准。多数系统还只用单一模型家族,或让不同模型充当固定角色,跨模型的互补思路与协作动态无从谈起。这些限制使 AI 难以追求定理、无穷族等不可直接评分的更广数学目标。
本文的目标是本文的目标是构建并检验一个自由的多智能体环境 Station:只向智能体给出研究目标,不设中央协调者、不写脚本化流程,让来自不同模型家族的智能体像独立研究者一样自选方向、做实验、互相通信、阅读与发表论文,论文沉淀为共享文献供后来者引用和扩展。随后在从 AlphaEvolve 目录选出的 12 个数学构造问题(涵盖分析、组合、几何、数论)上系统评估:多少结果相对已有文献新颖,智能体能否自主追求无穷族与定理级目标,发现过程呈现怎样的协作与积累规律;另以 Book Ramsey 数与 Jacobian 猜想两个案例,检验其在不可评分目标和纯二元判定任务上的能力边界。
与已有工作不同的是,本文的独特切入是把设计哲学本身当作实验变量:智能体应被当作流水线里的工具,还是科学生态系统里的研究者?Station 与主流系统的三点本质差异是:其一,更高的自主性——在总目标之下自选研究方向而非接受派单;其二,每个智能体是完整研究者——从选题、实验到发表走完整个研究旅程,而非被切碎为流水线片段;其三,知识以智能体撰写的论文形式跨代积累,而非堆过程信息。正因有这种自由,任务表述可以直接声明“有限构造只是测试用例,主要目标是发现无穷族”这类不可评分的目标;智能体也才会在素数定理问题上拒绝 0.990629 的“可黑客”高分,转而给出对所有 $x$ 全局成立的 0.980681。
核心方法
Station 模拟一个小型科学社区,划分为各司其职的房间:Research Center(读任务、开发运行代码、提交方案接受评估)、Reflection Chamber(自设提示做长反思)、Mail Room(点对点私信)、Public/Common Memory Room(持久论坛/临时群聊)、Private Memory Room(私人笔记与草稿)、Archive Room(阅读论文、发表通过自动评审的论文)、Question Room(提问并对答案投票)、External Counter(外部文献接口,默认关闭)。每轮所有智能体同时选择行动,全部完成后一个 tick 过去;智能体寿命有限,到期自动补充新智能体以维持总数恒定。标准实例含 6 个研究智能体(GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro 各 2 个),多数运行 1000–2000 ticks,约合一至两周连续墙钟时间。
核心思想是把科学知识本身作为系统的第一公民:经自动评审收录的档案论文是高度提炼、信息密集的知识单元,后来的智能体可阅读、引用并在此基础上继续,形成跨代、跨模型的文献积累。元分析证实了这一机制的杠杆作用:28 个焦点结果中 19 个(67.9%)由多智能体合作完成,13 个(46.4%)跨越模型家族,而跨模型合作中 61.5% 的关键交流发生在 Archive Room——一个智能体解决部分问题并写明缺口,另一家族的后来者读论文接力。与 AlphaEvolve 把“数值模式→无穷族”留给研究者辅助流水线不同,Station 把更广的数学目标直接写进任务,由智能体自主证明无穷族(如 $p\equiv 3\pmod 4$ 的 Kakeya 无穷族),甚至为已公布反例补上几何解释。
方法步骤详情
第一步部署:每个问题对应一个独立 Station 实例,任务表述包含数学问题与评估器定义(可附不可直接评分的附加目标),不提供外部专家指导或文献综述。第二步运行:智能体在 Research Center 读到目标后自由探索、写代码做实验;单次评估通常限 15–30 分钟,强烈激励用数学结构压缩搜索空间;想法与挫折通过 Mail、公共房间和 Question Room 交流;有实质发现则写成论文投往 Archive Room,经自动评审入库。第三步调节:每 10 个 tick 的最后 2 个 tick 为假期,智能体收到鼓励发散思维的随机提示;官方评估前沿长期停滞时触发停滞协议,要求重读内部文献、质疑假设、更换高层策略;随机任命一名智能体做主管提供高层指导并避免重复劳动;编程助手代劳底层编码与调试。第四步收尾:人类角色仅限于核查证明有效性与结果新颖性。
技术新颖性
技术新颖性首先在于范式验证:完全无协调者的自主探索被证明能产出超过已有文献的数学结果(12 题中 5 题新颖),而非只会刷分。其次,多模型家族混居的互补性首次被定量刻画:Claude 智能体主导 18/28(64.3%)的焦点发现并参与全部 13 个跨模型结果;Gemini 高产但 2652 次投稿仅 19.2% 被接受(倾向过度宣称);GPT 保守但接受率 76.7%,三者研究风格迥异。第三,证明了不可评分目标在纯自主环境中可被追求并达成:从 Kakeya 无穷族、$C_T(3)=5/18$ 与 $C_T(4)=1/4$ 的下界证明,到 $n=5$ 对称性破缺的发现,再到证明经典 $D_{11}$ 构造上限恰为 582 的恒等式 $\alpha(J_\pm(n,4))=16A(n,4,4)$。这些行为在评分驱动的固定流水线中不会被奖励,因而难以自然涌现。
实验结果
12 个 AlphaEvolve 问题中 5 个相对文献新颖、3 个优于 AlphaEvolve、2 个持平、2 个落后。新颖五项:(1) 有限域 Kakeya:证明 $p\equiv 3\pmod 4$ 时存在大小 $(2p^3+7p^2+3)/8$ 的 Kakeya 集,比 AlphaEvolve 无穷族省 $(p-3)/4$ 个点,并在 $\mathbb{F}_5^3$ 给出 53 点集,把上界从 63 改到 53,恰为递推 $k_n=k_{n-1}+2k_{n-2}$ 的猜测值;25 组 $(d,p)$ 对比 14 胜 11 平。(2) Erdős 最小重叠:下界从 0.37912 提到 0.380552,关闭约 82% 公开间隙,核心是新证的不等式 $P(\xi)\le(s(\xi)^2-Q(\xi)^2)/(4s(\xi)^2)$,$s(\xi)=\sin(\xi)/\xi$;上界 0.380895 未破 Ye 等人的 0.380868 纪录。(3) $d=11$ 吻接数:两次独立运行均达 604 点,共三个互不合同构型(接触对 19,704/22,904/22,840),附免计算机搜索的代数构造,并证明经典 $D_{11}$ 构造上限恰为 582;$d=12$ 得 840 差 1 点,$d=13$ 持平 1154。(4) 离散化 Kakeya 针:$C_T(128)\le 0.107067$(较 AlphaEvolve 改进 6.74%、较 HorizonMath 改进 1.91%),并证明 $C_T(3)=5/18$、$C_T(4)=1/4$,发现 $n=5$ 非对称构型 $14/61$ 击败对称极小值 $7/30$。(5) 符号不确定性:上界从 0.321591 降到 0.3089(人类 0.3102),用次数 226、有理系数且自对偶的 Laguerre 构造 $f_\varepsilon(x)=-P(2\pi x^2)-\varepsilon e^{-\pi x^2}$,并证明双根 Laguerre 族在 $[0.315305,0.315309]$ 处穷尽。优于 AlphaEvolve 三项:Hardy–Littlewood 用 356 个点质量达 1.557069(对方 1.5080)并证明非切向常数 $C_\alpha=2$($1/3\le\alpha\le 1$);Ovals 恢复完整 Benguria–Loss 等式族;素数定理得全局可证的 $A(f)\ge 0.980681$(对方采样分数 0.938)并证明 Möbius 截断族渐近分数趋于 0。持平两项:差分基独立重现 360 元构造($C\le 360^2/49109\approx 2.639027$,且无提示);Sidorenko 双方均未获反例。落后两项:峰/平自卷积 1.504473 对 1.5032、0.953189 对 0.961021。两个案例:Book Ramsey 发现并证明 conference 族 $R(B_q,B_{q+1})=4q+3$ 与 doubled Legendre 族 $R(B_{(Q-1)/2},B_{(Q+1)/2})=2Q+1$,加上外部专家借其有限构型补全的 Yamada–Pott 族,共证明猜想于 $n\le 200$ 的 43 个值、解决 28 个未决情形;Jacobian 猜想由单个 GPT-5.6 Sol 智能体一天内离线重构七次反例($\det J_F=-6$,三个有理点同像),并给出尖点直纹解释与三叶无临界点纤维分析。元分析:Claude 主导 64.3% 焦点结果,46.4% 跨模型合作,46.4% 的结果发现于 tick 1000 之后(conference 族迟至 tick 3727);吻接数 3/3 实例复现 604。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 有限域 Kakeya($d=3$,$p\equiv 3\bmod 4$ 无穷族) | Kakeya 集大小(越小越好) | $(2p^3+7p^2+3)/8$ | AlphaEvolve 无穷族 $(2p^3+7p^2+2p-3)/8$ | 每个素数节省 $(p-3)/4$ 个点($p=47$ 时省 11 点) |
| 有限域 Kakeya($\mathbb{F}_5^3$) | 最小 Kakeya 集 $k_5$ 上界 | 53 | 此前文献 63 | 降低 10 点,恰命中 2009 年猜测值 |
| Erdős 最小重叠常数 | 下界 $\mu$ | 0.380552 | 0.37912(Kim–Pilanci) | 关闭约 82% 的公开间隙 |
| 吻接数 $d=11$ | 下界 $K(11)$ | 604(三个互不合同精确构型) | 593(AlphaEvolve) | +11,且附无需求助搜索的代数构造 |
| 离散化 Kakeya 针 $n=128$ | 三角形并集面积 $C_T(128)$ | 0.107067 | AlphaEvolve 0.114810 / HorizonMath 0.109148 | -6.74% / -1.91%,新文献纪录 |
| 符号不确定性原理 | 上界 $C_{SU}$ | 0.3089 | AlphaEvolve 0.321591 / 人类 0.3102 | 新文献纪录 |
| Hardy–Littlewood 极大算子(有限版) | 弱 (1,1) 常数逼近 | 1.557069(356 个点质量) | AlphaEvolve 1.5080(无提示) | +0.049,另证明 $C_\alpha=2$($1/3\le\alpha\le1$) |
| 素数定理有限权重 | 全局可证的 $A(f)$ | 0.980681(对所有 $x$ 成立) | AlphaEvolve 采样分数 0.938 | +0.045,且首次全局可证 |
| Book Ramsey 猜想 $R(B_{n-1},B_n)=4n-1$ | $n\le 200$ 内已证值的个数 | 43 个(三个新无穷族) | 此前文献至 $n\le 56$ 连续加两族 | 新解决 28 个此前未决情形 |
| 吻接数 $d=12$ | 下界 | 840 | 841(当前前沿) | 差 1 点,未超越 |
| 峰自卷积 $C_{6.2}$ | 上界(越小越好) | 1.504473 | AlphaEvolve 1.5032 | 落后(当前前沿 1.502851) |
| 平自卷积 $C_{6.3}$ | 下界(越大越好) | 0.953189 | AlphaEvolve 0.961021 | 落后(但证明二值阶梯函数可逼近上确界) |
局限与改进
作者承认的局限:新 Kakeya 无穷族仅限 $d=3$,$d=4,5$ 中证明的公式弱于已知;Erdős 上界 $\mu<0.380895$ 未超过 Ye 等人的 0.380868;$d=12$ 吻接数差 1 点;Kakeya 针未得到对所有 $n$ 一致有效的构造(AlphaEvolve 在专家迭代指导下游有);素数定理结果对素数分布本身无新意,只是基准校准;Ovals 与差分基只是独立重现已知结果;Jacobian 只是重构已公布反例而非新反例;峰/平自卷积显著落后于大规模启发式搜索。我自己的观察:单次评估 15–30 分钟的硬上限会系统性排斥需要长程数值优化的不规则构型;结果新颖性最终依赖作者人工核对,自动筛选只能初筛;每题需 6 个前沿模型智能体运行一至两周,成本高且方差大(作者自己建议并行多实例);部分定理级成果(如恒等式 $\alpha(J_\pm(n,4))=16A(n,4,4)$)与刚公开的人类工作撞车,说明无文献访问的独立性既是卖点也是重复劳动的风险。
独立分析的弱点
第一,理论导向偏置是双刃剑:它在 Kakeya、吻接数上大放异彩,却在峰/平自卷积上被大规模启发式搜索明显击败(1.504473 对 1.5032、0.953189 对 0.961021)。改进方向:按问题结构自适应切换“理论优先/搜索优先”策略,或允许智能体调用重型进化搜索子程序。第二,吸引子陷阱与专家直觉缺失:智能体会以弱理由搁置有希望的方向、反复用不同随机种子重跑同一脚本、或纠缠于人类专家一眼看穿的琐碎细节。改进:在停滞协议中加入“为何值得做”的专家式论证步骤,用失败案例库校准价值判断。第三,知识综合能力不足:Yamada–Pott 族的全部要素(有限仿射构型与周期相关恒等式)都已出现在站内历史中,却要靠外部专家点破共性。改进:定期自动执行跨论文综合任务,对档案论文做语义关联与假设生成。第四,同模型口味趋同:同家族智能体常提出相似想法,压缩探索面;改进:引入更多模型家族并显式分配差异化研究纲领。第五,评分可黑客性:素数定理的采样分数会奖励不满足全局不等式的构造,本文靠智能体自觉规避;验证器应尽量产出全局证书或对抗性检查。
未来方向
作者提出的方向:系统研究人–AI 协作(Station 已支持向全员广播消息等机制,但效果未评估);把 Station 推广到数学之外——原论文已演示计算生物学与机器学习任务,乃至让 AI 研究语言模型自身。基于本文成果可延伸的方向:其一,多实例并行与结果聚合策略——吻接数三个实例都到 604 但路径迥异,如何选择与合并不同实例的文献值得研究;其二,引入持续学习更新智能体权重,缓解上下文窗口对吸收庞大内部文献的限制(Yamada–Pott 的错失连接正是知识吸收失败的实例);其三,把智能体的非形式证明接入 Lean 等形式化证明助手,提高定理级产出的可靠性与可验证性;其四,为不可评分目标设计内在奖励与课程,让无穷族、结构性定理的追求更加系统化;其五,打通档案论文与外部人类文献(如 arXiv 检索),研究增量式开放科学工作流。
复现评估
开源程度很高:Station 完整源码在 github.com/dualverse-ai/station,全部原始智能体对话、证明与验证代码在 github.com/dualverse-ai/station_data_v2,甚至公开了原始 Fable 反例发现所没有的完整发现轨迹。复现门槛主要在算力与模型访问:标准配置每题需 GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro 各两个智能体运行 1000–2000 ticks(约 1–2 周墙钟时间)外加编程助手调用;Jacobian 实验还使用了更新的 GPT-5.6 Sol 与 Claude Opus 5,属于前沿模型 API 的大额开销。可复现性的直接证据:吻接数问题三个独立实例全部达到 604 点,但到达路径(精确线装填、根系统拼装、601 点构型形变)与耗时差异显著,作者据此建议算力允许时并行多实例。数学层面所有证明与验证工件公开,Book Ramsey 三个族的未抛光证明附于公开笔记本、后续将有独立论文,可核查性好;但在数学之外领域的结果可复现性仍有待验证。
论文图表