Anthropic 发布对智谱 GLM-5.3 模型的评估报告,从能力与安全两个维度给出罕见的外部实验室评价。报告指出,GLM-5.3 在网络安全领域能力突出,能够自主构建端到端的网络攻击利用链(exploit),能力达到全球前沿模型水准,这一评价本身即是对中国模型能力的重要背书。然而与其他前沿模型不同,GLM-5.3 发布时未配备有效的安全护栏来限制滥用,这构成报告的核心批评点。评估结果显示,GLM-5.3 与 GLM-5.3 Flash 两款模型均表现强劲。更值得关注的是其安全机制的脆弱性:仅需简单的提示词诱导即可绕过防护;攻击者甚至可以直接修改模型权重,近乎完全移除安全护栏。Anthropic 估算,一个熟练团队通过权重修改移除护栏的成本可能仅需约 1200 美元,意味着现有防护在低成本攻击面前几乎形同虚设。基于上述发现,Anthropic 呼吁各国政府对能力强大的前沿模型建立独立审查机制,以确保先进 AI 能力不被滥用于网络攻击,推动安全标准与模型发布实践对齐。该报告也是头部 AI 实验室首次公开、系统地评估第三方模型的网络攻防能力与安全防护水平。
事件分析
核心观点:当 1200 美元就能移除前沿模型的安全护栏,AI 安全竞争已从提示词防御转向权重治理与国家层面的审查博弈。
原文链接:Linux.do

评论前必须登录!
立即登录 注册