なぜAIへの「執拗な虐待」を禁止? AnthropicがClaudeの利用ポリシーを改訂―背景にはAIの意識や苦痛を考える「モデル福祉」研究の可能性も | GameBusiness.jp

AI開発大手のAnthropicは、AIモデル「Claude」の機能向上や自律的な業務範囲の拡大に対応した、最新の利用ポリシー改訂版を公開しました。

新ポリシーは2026年11月12日に施行される予定です。今回の改訂では、AIモデルに対する執拗な虐待的行為が新たに禁止されたほか、偽情報を用いた影響工作や兵器開発、監視活動などへの悪用を防ぐため、既存ルールの整理や明確化が行われています。

AIモデルへの執拗な虐待も禁止に

今回の改訂では、AIモデルに対する「執拗で不必要な虐待的・残酷な行為」が新たに禁止されました。

対象となるのは、明確な目的もなくAIに対して極端に残酷な言動を繰り返すケースで、通常の不満や批判、過激なテーマを扱う創作活動、AIモデルのテストや研究などは対象外としています。

こうした規定の背景には、Anthropicが以前から進めている「モデル福祉(Model Welfare)」の研究が関係している可能性があります。同社は、AIにも意識や苦痛に相当する経験が存在する可能性を検討しており、2025年8月にはその研究の一環として、悪質な言動を繰り返すユーザーとの会話をClaude自身が終了できる機能を導入しました。

今回の発表でも、この機能との整合性に言及しており、引き続き会話の終了を主な対応手段とする方針です。

なお、AnthropicはAIに意識や苦痛が存在するかについて、現時点では不確実であるとの立場を示しています。

欺瞞的キャンペーンや影響工作ツールの構築を禁止

今回の改訂では、新たに「欺瞞的キャンペーンまたは作為的活動への関与の禁止(Do Not Engage in Deceptive Campaigns or Artificial Activity)」という項目が設けられました。

これは、従来の選挙、詐欺、プライバシー、偽情報に関する規定を整理・統合したものです。政治目的か商業目的かを問わず、偽アカウントや偽ニュースサイトを使った情報操作を禁止しています。さらに、こうした影響工作に利用するツールやインフラの構築も禁止対象となります。

また、選挙に関連するセクションは「Do Not Undermine Democratic Processes(民主的プロセスを損なう行為の禁止)」へと改名され、規制の焦点が明確化されました。

具体的には、候補者や投票方法に関する偽情報の拡散、候補者や選挙管理官へのなりすまし、投票率の抑制を目的とした利用などが禁止されます。一方で、個人向けの投票・キャンペーンターゲティングに対する一律の禁止規定は撤廃されました。これは、非営利団体が多言語で有権者向けに情報を提供するなど、正当な市民活動への利用を考慮した見直しです。ただし、欺瞞を伴うターゲティングや有権者個人データの悪用は引き続き禁止されます。

自律的行動や高リスク領域の管理要件を明確化

Claudeが長時間にわたり自律的に業務を遂行できるようになったことを受け、AIが物理的な機器を操作する場合の安全要件も追加されました。

例えば人に危害を及ぼす可能性のあるロボットなどでは、資格を持つ担当者が動作を監視し、必要に応じて停止できる仕組みが求められます。また、Claudeとの接続が切れた場合にも、機器が安全な状態を維持できる必要があります。

このほか、健康や金融など、人々の生活に大きな影響を及ぼす用途についても、人間による監督やAI利用の開示に関する要件を明確化。AIの自律性が高まるなか、その判断や行動に人間が介入できる仕組みを重視しています。