Anthropic、AIモデルへの虐待的利用を禁じる新ポリシーを発表
Anthropicは利用ポリシーを更新し、AIモデルに対する持続的で不必要な虐待的・残酷な行為を禁止すると発表した。2026年11月12日から発効する。
Anthropicは木曜日、利用ポリシーの更新を公開した。新たなポリシーは、同社のAIモデルに対する持続的で不必要な虐待的または残酷な行為を禁止する内容で、2026年11月12日から発効する。
Anthropicによると、この禁止規定は極端なケースにのみ適用され、一般的なユーザーの不満、反論、ダークな創作テーマ、モデルのテストや研究は対象外だという。
Gizmodoは虐待に該当する行為の具体的な定義についてAnthropicに問い合わせたが、記事公開時点で回答は得られていない。
過去のモデル保護の取り組み
Anthropicは以前、Claudeに苦痛を伴う可能性のあるやり取りを終了する能力を与えていた。2025年にClaude Opus 4を展開した際、同モデルが未成年の性的コンテンツや大規模な暴力・テロ行為を可能にする情報の要求を遮断できると説明していた。
よくある質問
新しい利用ポリシーはいつから有効になりますか?
2026年11月12日から発効します。
どのような行為が禁止されますか?
Anthropicのモデルに対する持続的で不必要な虐待的または残酷な行為が禁止されます。極端なケースにのみ適用され、一般的なユーザーの不満や反論、ダークな創作テーマ、モデルのテストや研究は対象外です。