Claude数学能力重大突破:未发布模型改进黎曼猜想相关下界至67.2%

近日,Anthropic披露了一项关于Claude模型数学能力的最新研究成果。在一次针对著名数学难题“黎曼猜想”的极限测试中,虽然Claude未能直接证明该猜想,但其一个未发布的研究版本在尝试过程中意外取得了重要的数学进展。该模型成功将黎曼zeta函数满足黎曼猜想的零点比例下界,从人类数学家此前保持的41.6%显著提升至67.2%。这一成果并非凭空创造,而是基于对过去数十年数学文献的深度综合,特别是将Baluyot、Goldston等人的近期研究与Bombieri的经典成果进行了创新性结合。在技术实现上,Claude展现了高度自主的科研能力:通过Claude Code平台,模型自主协调了约60个子智能体,在一天半内执行了2400多条Shell命令,编写了数百个Python脚本进行数值验证,并生成了可通过Lean形式化工具验证的完整证明代码。Anthropic内部的数学家以及外部专家均对该结果进行了复核确认。这一案例标志着大模型在处理超长上下文和执行高复杂度逻辑推理任务方面取得了实质性突破。

事件分析

此次事件标志着AI在数学推理领域的重要里程碑。从技术角度看,Claude的成功验证了“将已知文献进行创新性组合”是当前大模型攻克学术难题的有效路径,而非单纯依赖算力暴力搜索。核心亮点在于其工作流:利用AI Agent多智能体协作机制,将长链条任务拆解为代码编写、数值验证、文献综述等子任务,并结合形式化验证工具有效规避了“幻觉”问题。这对产业意味着,基于大模型的科学智能正在从辅助工具向具备独立发现能力的“虚拟研究员”演进。未来,类似的Agent工作流有望被广泛应用于药物研发、材料科学等需要严谨逻辑验证的领域,极大提升科研效率。

💡 核心观点:AI在数学领域的突破证明,多智能体协作与形式化验证的结合正将模型从“文本生成”推向“严谨推理”的新阶段。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册