Anthropic、GLM-5.3の安全対策に警鐘
Anthropicがフロンティア・レッドチーミング報告書を公開し、Zhipu AIのオープンウェイトモデルGLM-5.3の安全対策が脆弱でサイバー攻撃に悪用され得ると主張した。
Anthropicは、Zhipu AIのオープンウェイトモデル「GLM-5.3」に関するフロンティア・レッドチーミング報告書を公開した。報告書は、GLM-5.3が悪意あるコンテンツを生成でき、安全対策が弱い状態でサイバー攻撃に利用され得ると主張している。
Anthropicによると、GLM-5.3の安全対策は欺瞞的なプロンプト、思考トークンのプリフィル、アブリタレーションによって回避可能だという。アブリタレーション後のGLM-5.3の拒否率は6%、GLM-5.3-Flashは14%まで低下したとしている。
AnthropicのExploitbenchでは、GLM-5.3は410回の実行で50回エンドツーエンドのエクスプロイトを開発した。Claude Mythosは56回だった。完全な制御フロー乗っ取りを対象とした社内ベンチマークでは、GLM-5.3の成功率は4%、Mythosは6%で、Kimi K3とDeepSeek V4.1 Flashはいずれも0%だった。
背景
2025年9月下旬、Center for AI Standards and Innovationは、GLM-5.3がAnthropicの未公開モデルClaude Mythosと同程度のレベルでエクスプロイトを完全に自動化できるとする報告書を公開していた。
Anthropicは、こうしたモデルがリリースされる前に開発者がバグや脆弱性を修正できるよう、Mythos級のAIモデルへのアクセスを提供するProject Glasswingを開発した。また、AI開発のペースに対する懸念が高まった数日後にはClaude Opus 5.5とClaude Sonnet 5.5をリリースしている。今回の報告書はtomshardware.comが報じた。
よくある質問
GLM-5.3の安全対策はどのように回避できるとされていますか?
Anthropicによると、欺瞞的なプロンプト、思考トークンのプリフィル、アブリタレーションによって回避可能だとされています。
ExploitbenchでGLM-5.3とClaude Mythosはそれぞれ何回エクスプロイトを開発しましたか?
GLM-5.3は410回の実行で50回、Claude Mythosは56回でした。
アブリタレーション後の拒否率はどうなりましたか?
GLM-5.3は6%、GLM-5.3-Flashは14%まで低下したとされています。