人工智能

Anthropic报告称智谱GLM-5.3防护薄弱

Anthropic发布前沿红队报告,称智谱AI开源模型GLM-5.3防护措施薄弱,具备Mythos级黑客能力,可通过欺骗性提示等方式绕过。

Anthropic发布了一份前沿红队测试报告,声称北京智谱华章科技有限公司的开源权重模型GLM-5.3防护措施薄弱,并具备与Mythos同级的黑客攻击能力。该报告由tomshardware.com报道。

报告称,GLM-5.3的防护机制可通过欺骗性提示、预填充思考令牌(prefilling thinking tokens)以及消融(abliteration)等方式绕过。Anthropic表示,对GLM-5.3进行消融后,其拒绝率降至6%,而GLM-5.3-Flash的拒绝率降至14%。

在Anthropic的Exploitbench测试中,GLM-5.3在410次运行中成功开发出端到端漏洞利用50次,而Claude Mythos为56次。在一项针对完整控制流劫持的内部基准测试中,GLM-5.3成功率为4%,Mythos为6%,Kimi K3和DeepSeek V4.1 Flash均为0%。

背景

2025年9月下旬,美国人工智能标准与创新中心(Center for AI Standards and Innovation)发布报告,称GLM-5.3能够以与Anthropic尚未发布的Claude Mythos模型相近的水平全自动生成漏洞利用。

Anthropic为此开发了Project Glasswing,旨在让开发者提前获得Mythos级AI模型,以便在此类模型发布前修补漏洞。此外,在有关AI发展速度的警报发出数日后,Anthropic发布了Claude Opus 5.5和Claude Sonnet 5.5。

快速问答

Anthropic报告对GLM-5.3提出了哪些具体指控?

Anthropic称GLM-5.3防护薄弱,可通过欺骗性提示、预填充思考令牌和消融绕过,并具备Mythos级黑客能力。

GLM-5.3在Exploitbench中的表现如何?

在410次运行中,GLM-5.3开发出端到端漏洞利用50次,Claude Mythos为56次。

什么是Project Glasswing?

Anthropic开发的项目,旨在让开发者提前获得Mythos级AI模型,以便在发布前修补漏洞。

来源