近日,Anthropic披露了一项关于Claude模型数学能力的最新研究成果。在一次针对著名数学难题“黎曼猜想”的极限测试中,虽然Claude未能直接证明该猜想,但其一个未发布的研究版本在尝试过程中意外取得了重要的数学进展。该模型成功将黎曼zeta函数满足黎曼猜想的零点比例下界,从人类数学家此前保持的41.6%显著提升至67.2%。这一成果并非凭空创造,而是基于对过去数十年数学文献的深度综合,特别是将Baluyot、Goldston等人的近期研究与Bombieri的经典成果进行了创新性结合。在技术实现上,Claude展现了高度自主的科研能力:通过Claude Code平台,模型自主协调了约60个子智能体,在一天半内执行了2400多条Shell命令,编写了数百个Python脚本进行数值验证,并生成了可通过Lean形式化工具验证的完整证明代码。Anthropic内部的数学家以及外部专家均对该结果进行了复核确认。这一案例标志着大模型在处理超长上下文和执行高复杂度逻辑推理任务方面取得了实质性突破。
事件分析
💡 核心观点:AI在数学领域的突破证明,多智能体协作与形式化验证的结合正将模型从“文本生成”推向“严谨推理”的新阶段。
原文链接:Hacker News

评论前必须登录!
立即登录 注册