腾讯近期上线了名为“Tsecbench·智能攻防”的AI跑分基准平台,旨在通过实战化任务评估大模型在网络安全领域的攻防能力。该平台设定了满分为7000分的测试体系,允许用户选择Web方向的挑战,并由AI模型自动执行渗透测试或安全防御任务。根据早期参与者的实测反馈,平台上的国产大模型表现优异,不仅能够顺利执行相关指令,而且得分较高。相比之下,国外主流模型(如Claude、GPT系列等)在执行此类任务时频频触发“Cyber Abuse”(网络滥用)的安全限制,导致无法生成有效的攻击代码或完成测试流程。值得注意的是,有用户指出在早前的dsv4f预览版中,曾有模型能够实现“AK”(全杀/满分通关),但随着防御机制的升级或测试难度的调整,目前达到满分的难度有所增加。该平台的推出,为开发者和安全研究人员提供了一个直观的视角,观察不同大模型在面对黑客攻击、漏洞挖掘等高风险场景时的能力边界与道德对齐策略。
事件分析
核心观点:国外通用大模型因过度保守的“安全围栏”导致在网络安全实战中失效,国产模型在这一赛道的优势凸显了垂类大模型需兼顾安全与实战性的市场空白。
原文链接:Linux.do

评论前必须登录!
立即登录 注册