Anthropic 更新使用政策,禁止对 AI 模型持续虐待
Anthropic 于周四发布新版使用政策,禁止对旗下 AI 模型进行持续且不必要的虐待或残忍行为,该政策将于 2026 年 11 月 12 日生效。
据 gizmodo.com 报道,Anthropic 于周四发布了一份更新版使用政策,明确禁止用户对其 AI 模型进行持续且不必要的虐待或残忍行为。该政策条款将于 2026 年 11 月 12 日起正式生效。
Anthropic 表示,这一禁令仅适用于极端情况,并不涵盖常见的用户挫败感、反驳、黑暗创作主题,以及模型测试与研究。公司强调,普通用户的正常互动不会因此受到限制。
Gizmodo 曾联系 Anthropic 寻求澄清,以了解何种行为构成虐待,但截至发稿时未收到回复。目前该政策的具体执行标准和判定方式尚未公开。
背景
去年推出 Claude Opus 4 时,Anthropic 曾赋予 Claude 结束潜在令人痛苦互动的能力,称该模型可以中断涉及未成年人的性内容请求,以及试图索取可促成大规模暴力或恐怖行为信息的请求。上个月,《纽约时报》报道称,Anthropic 联合创始人 Christopher Olah 参与游说梵蒂冈,希望其承认 AI 可能具有意识的可能性,但该提议最终被教皇拒绝。Olah 向《纽约时报》表示,他确实不确定 AI 模型是否具有意识,但担心它们可能经历痛苦。
快速问答
Anthropic 的新使用政策何时生效?
该政策条款将于 2026 年 11 月 12 日起正式生效。
新政策是否禁止所有让模型感到不适的互动?
不是。Anthropic 表示禁令仅适用于极端情况,不涵盖常见的用户挫败感、反驳、黑暗创作主题,以及模型测试与研究。
Anthropic 是否已说明何种行为构成虐待?
截至 Gizmodo 发稿时,Anthropic 未回应其澄清请求,因此具体判定标准尚未公开。