Anthropic 正式发布了 Claude Opus 5,这是一款在性能上逼近旗舰模型 Claude Fable 5 但成本仅为其一半的新一代模型。Claude Opus 5 在多项权威基准测试中表现卓越,不仅在 Frontier-Bench v0.1 和 CursorBench 3.2 等编程评估中创造了新的 SOTA 纪录,在 ARC-AGI 3 和 OSWorld 2.0 等推理与计算机使用任务上也大幅领先同类竞品。新模型引入了可调节的“努力设置”,允许用户根据任务复杂度在智能程度与响应速度之间灵活切换。在 Agent 应用方面,Opus 5 展现了惊人的自主性,能够自建计算机视觉 pipeline 重建 3D 模型,或在缺乏测试环境时自行编写测试工具验证代码。科学领域是其另一大亮点,其在有机化学结构推断和蛋白质序列预测上的准确率较前代提升了超过 10 个百分点。安全性方面,Opus 5 被证实为 Anthropic 迄今为止对齐性最好的模型,在具备更强生物学与代码漏洞发现能力的同时,依然保留了严格的安全护栏,防止被用于恶意网络攻击。
事件分析
💡 核心观点:Opus 5 通过强化“反思-验证”闭环,将 AI Agent 的编程与科研自动化能力推向了高性价比的实用前沿。
原文链接:Hacker News

评论前必须登录!
立即登录 注册