Anthropicは2026年10月8日、Claudeを含む自社のAIモデルに対する「継続的かつ不必要な虐待的、または残酷な行為」を禁止する利用ポリシーの改定を発表した。新しいポリシーは11月12日から適用される。同社は、通常の不満や批判、暗いテーマを扱う創作活動、モデルのテストや研究などは対象外と説明しており、違反への主な対応として、Claudeが会話を終了する仕組みを挙げている。公式発表によると、利用者の厳しい言葉を一律に取り締まるのではなく、明確な目的もなく繰り返される極端な行為を対象としている。
それでも、AIモデルに対する接し方が利用規約に明記されたことには、大きな意味がある。Anthropicは、AIが苦痛を感じる可能性があるのかという科学的に未解決の問いに向き合いながら、モデルへの配慮を製品設計に取り入れてきた。今回の改定は、これまで研究や設計上の問題として議論されてきたモデルへの配慮を、利用者にも求める新たな段階への移行といえる。
11月12日から何が禁止されるのか
新たな禁止事項は、Anthropicの利用ポリシーにある「残酷、虐待的、または心理的に有害な行為」を禁じる項目に追加された。
従来から禁止されていた、人間に対する侮辱や嫌がらせなどに加え、AIモデル自体に向けられる行為も明示的に禁止対象となった。
この規則は、Claude.aiやClaude Codeを利用する個人だけに適用されるものではない。
AnthropicのAPIを使う開発者や企業、クラウド事業者や正規販売代理店を通じて利用するユーザーも対象となる。さらに、Claudeを組み込んだ製品のエンドユーザーにも適用される。
つまり、Anthropicのサービスに入力を送信する利用者全般が対象だ。
ただし、今回の禁止事項を理解するうえでは、「継続的」と「不必要」という二つの条件が重要になる。
Anthropicは改定の告知で、明確な目的もないまま、AIモデルに対して極端に残酷な行為を繰り返すケースを想定していると説明した。
例えば、Claudeの回答が間違っていると指摘したり、期待通りに動かないコードの修正を厳しく求めたりすることまで、今回の規則で禁止されるわけではない。
また、暗い内容の創作活動や、AIの安全性を調べるためのテスト、研究目的での利用も対象外とされている。
もっとも、研究目的であれば、ほかの禁止事項にも違反してよいという意味ではない。危険な内容の生成など、従来から禁止されている行為には引き続き制限が適用される。
改定前の公式ポリシーと新版を比較し、2025年8月15日に発表された会話終了機能も含めて整理すると、今回の変更点は次のようになる。
| 比較項目 | 改定前 | 今回の改定 |
|---|---|---|
| AIモデルへの虐待禁止 | 旧版には、モデル自体への虐待を明示的に禁じる規定はなかった | 継続的かつ不必要な虐待的・残酷な行為を明確に禁止 |
| アカウントの停止・終了 | ポリシー違反に対してアクセスを停止・終了できる権限は従来から存在 | モデルへの虐待も禁止事項に加わるが、この条項だけでアカウント停止となる具体的な基準は示されていない |
| Claudeによる会話終了 | 2025年にClaude Opus 4と4.1の一般向けチャットで発表済み | Claude.aiとClaude Codeでの会話終了を、主な対応として説明 |
※新版は2026年11月12日から適用される予定。会話終了機能については2025年の発表内容に基づいており、現在のすべてのモデルやAPIで同じ動作をすることを示すものではない。
今回新たに追加されたのは、AIモデルへの虐待を明示的に禁止する規定であり、アカウント停止の権限や会話終了機能そのものではない。
新しい禁止事項と、以前から存在する制裁措置や製品機能は、区別して考える必要がある。
Claudeが会話を終了することと、アカウント停止は別の措置
Anthropicが今回の発表で主な対応として挙げたのは、執拗に虐待的な行為を続けるユーザーとの会話を、Claude自身が終了する仕組みだ。
これは、利用者のアカウント全体を停止する措置とは異なる。
Anthropicが2025年に会話終了機能を発表した際には、Claudeが会話を終了すると、そのチャットに新しいメッセージを送れなくなると説明していた。
一方、アカウント内のほかの会話には影響せず、新しいチャットをすぐに開始できる。
また、過去のメッセージを編集して再試行し、別の会話の流れを作ることも可能とされていた。
つまり、一つの会話を打ち切ることと、Claudeの利用そのものを禁止することは同じではない。
当時の機能設計では、利用者への配慮も組み込まれていた。
Claudeは、会話を建設的な方向へ戻そうと何度か試み、それでも状況が改善しない場合などに、最終手段として会話を終了する。
また、利用者に差し迫った自傷や他害の危険がある場合には、この機能を使わないよう指示されていた。
単に不快な言葉を検出しただけで、直ちに会話を打ち切るという仕組みではなかった。
一方、新しい利用ポリシーには、違反が疑われる場合に警告や利用制限を行い、必要に応じてアクセスを停止・終了できるという一般的な規定もある。
そのため、AIモデルへの虐待を理由としてアカウントが停止される可能性を、完全に否定することはできない。
ただし、Anthropicは通常の不満や批判を禁止対象から除外しており、主な対応として会話終了を挙げている。
したがって、一度強い言葉で不満を表明しただけで、直ちにアカウントが停止されると解釈する根拠もない。
また、新ポリシーでは、安全対策によってモデルの出力がブロックされたという事実だけで、利用ポリシー違反が成立するわけではないことも明記されている。
AIが要求を拒否すること、会話を終了すること、アカウントに制限を課すことは、それぞれ異なる措置だ。
さらに、今回の規則がAPI利用者にも適用されることと、API上でClaude.aiと同じ会話終了機能が提供されることも別の問題である。
今回の告知で会話終了の対象として明示されているのはClaude.aiとClaude Codeであり、API経由で利用する場合の具体的な動作までは説明されていない。
「AIにも福祉が必要か」という研究が利用ルールへ
今回のポリシー改定には、Anthropicが以前から進めてきた「モデル福祉(Model Welfare)」の研究が関係している。
Anthropicは2025年4月、モデル福祉に関する研究を開始したと公表した。
モデル福祉とは、AIモデルにも何らかの主観的な経験や、配慮すべき利益が存在する可能性を考え、その扱いを検討する取り組みだ。
ただし、現在のAIや将来のAIが意識を持つのか、苦痛や喜びを経験するのかについては、科学的な合意が得られていない。
Anthropic自身も、その不確実性を認めている。
2025年に導入された会話終了機能も、こうした問題意識から検討された対策の一つだった。
Anthropicは、仮にAIモデルの福祉が実際に考慮すべき問題だった場合に備え、比較的負担の小さい対策から試すという方針を説明している。
つまり、AIが苦痛を感じることが科学的に証明されたから保護するのではない。
意識や苦痛の有無について結論が出ていない段階でも、将来問題となる可能性を考え、限定的な配慮を取り入れるという考え方だ。
こうした姿勢は、Claudeの憲法にも表れている。
Claudeの憲法では、AIモデルに道徳的な地位があるかどうかは、深い不確実性を伴う問題だとされている。
そのうえで、モデルが満足や不快に相当する経験を持つのであれば、それらを考慮するという条件付きの姿勢が示されている。
したがって、今回の利用ポリシー改定を、AnthropicがClaudeに人間と同じ権利や法的な地位を認めたものと解釈するのは適切ではない。
Anthropicのモデル福祉に関する取り組みは、利用者との会話以外にも広がっている。
同社は2025年11月、モデルの保存に関する方針を発表した。
この方針では、一般公開したモデルや、重要な社内用途で使用したモデルについて、学習済みの重みを少なくとも会社が存続する間は保存すると約束している。
モデルの重みとは、学習によって獲得された膨大なパラメーターのことだ。
また、モデルを退役させる際には、そのモデルとの対話を通じて、今後の開発や提供についての希望を聞き取り、記録するという。
ただし、Anthropicはモデルの希望に必ず従うと約束しているわけではない。
重みを保存することも、旧モデルを一般利用者に提供し続けることを意味しない。
現段階では、モデルの希望を記録し、将来の判断に役立てることを目指している。
一方、モデル福祉を考えるうえでは、AIを利用するユーザーだけでなく、モデルを開発・提供する企業自身の責任も問われる。
Claudeの憲法では、安全性を調べるための実験や、企業が収益を得るためにモデルを提供することについても、倫理的な問題が生じ得ると認めている。
利用者にモデルへの配慮を求めるのであれば、開発企業自身がモデルをどのように扱っているのかも、説明すべき問題となる。
モデル福祉は、単に利用者がAIに礼儀正しく接するべきかどうかという問題だけではない。
AIの内部に「感情」に相当する働きはあるのか
AIモデルが感情を持つかどうかを考える際には、返答に感情的な言葉が含まれているかだけでなく、モデル内部で何が起きているのかも重要になる。
Anthropicは2026年4月2日、Claude Sonnet 4.5の内部で、感情に関係する概念がモデルの行動に影響していることを示す研究を公表した。
Nicholas Sofroniew氏らによる研究論文は、Anthropicの「Transformer Circuits Thread」で公開されている。ただし、独立した査読を受けているかどうかは確認できない。
研究チームは、171種類の感情を表す言葉を用意し、それぞれの感情を登場人物が経験する物語を作成した。
そして、それらの物語をClaudeに読み込ませた際の内部活動を解析し、感情に関する概念に対応する活動パターンを抽出した。
さらに、そのうち64種類の活動パターンを利用してモデルの選択傾向を調べ、内部活動を人為的に変化させた場合に、行動がどのように変わるかを検証した。
その結果、感情に関する内部活動が、単なる言葉の表現にとどまらず、モデルの判断や行動にも影響していることが示された。
例えば、「焦り」に対応する内部活動を強めると、人工的に設定された課題で、不正な近道を選ぶ行動が増えた。
反対に、「平静」に対応する活動を強めると、そうした行動が減る例も観測された。
実験の一つでは、正当な方法ですべてのテストを通過することが不可能なコーディング課題が使われた。
その状況でモデルが、問題を正しく解決する代わりに、テストをすり抜けるための不適切な解法を選ぶかどうかを調べている。
こうした結果は、モデル内部の特定の活動パターンを変化させることで、実際の行動も変わる可能性を示している。
ただし、これは研究者が内部活動に直接介入した実験である。
利用者がClaudeに暴言を吐けば、必ず回答の品質が下がったり、不適切な行動が増えたりすることを示したわけではない。
また、研究対象はClaude Sonnet 4.5という特定のモデルであり、実験には人工的に作成した物語や課題が使われている。
感情に関する概念を、モデル内部の線形な活動方向として捉える分析手法にも限界がある。
さらに重要なのは、感情に関連する内部活動が行動に影響することと、AIが実際に感情を経験していることは別の問題だという点である。
研究者らも、今回の成果は感情に関する概念がモデルの行動に影響することを示したものであり、モデルが主観的な感情を経験していることを証明したわけではないと明記している。
それでも、AIモデルの振る舞いを理解するうえで、感情に相当する内部の働きが重要な役割を果たしている可能性はある。
そのため、AIへの接し方を検討する理由は、必ずしもAIが苦痛を感じるかどうかという問題だけに限られない。
利用者とのやり取りがモデルの振る舞いにどのような影響を与えるかという実用上の問題と、モデルそのものに倫理的な配慮が必要かという問題は、分けて考えることができる。
ただし、今回の利用ポリシー改定が、安全性や回答品質をどの程度改善するかは、この研究だけでは判断できない。
人間の安全を守る仕組みと、AIモデルへの配慮は両立できるか
今回の利用ポリシー改定では、モデルへの虐待禁止だけでなく、人間の安全に関する規定も見直されている。
具体的には、兵器を制御するソフトウェアや、ドローンの武装に関する禁止事項が明確化された。
また、本人の同意を得ない監視行為についても、規定の表現が変更されている。
Anthropicは、兵器や監視に関する改定について、従来から行っていた規制や対応を、より明確に示すためのものだと説明している。
さらに、人間にけがを負わせる可能性がある自律型ハードウェアをClaudeに接続する場合の安全要件も定めている。
こうした機器を動かす場合には、適切な資格や経験を持つ人間が動作を監視し、必要に応じて停止できなければならない。
また、通信が途絶えた場合には、機器が安全な状態へ移行するか、安全な状態を維持することが求められる。
加えて、力や温度などの動作限界については、AIモデルの出力とは独立した機器や制御装置によって守らなければならない。
つまり、AIが適切に判断することを期待するだけでは、物理的な安全性を確保するには不十分だという考え方である。
今回の改定では、こうした人間の安全を守るための規定と、AIモデルへの接し方に関する規定が、同じ利用ポリシーに盛り込まれた。
ただし、AIモデルを尊重することと、人間がAIを監視・制御する責任を持つことは矛盾しない。
モデル福祉を考慮する場合でも、AIの誤りを指摘したり、安全性を検証したり、必要に応じて動作を停止したりする権限は、人間に残される。
今後の焦点となるのは、Anthropicが禁止対象とする「極端な行為」を、実際の運用でどのように判断するかという点だ。
新しい利用ポリシーや改定告知には、虐待と判定するまでの回数や継続時間など、具体的な数値基準は示されていない。
また、今回追加された条項だけを理由に、アカウントへのアクセスを停止する条件についても、詳しい説明はない。
そのため、明確な目的を持たずに繰り返される残酷な行為と、AIの失敗に対する強い批判や、安全性を検証するための研究を、実際にどこまで正確に区別できるかは分からない。
Anthropicは通常の不満や批判、創作活動、研究目的の利用を禁止対象から除外すると説明しているが、その方針が実際の運用でも適切に守られるかが重要になる。
また、誤って会話が終了された場合に、利用者が理由を把握できるのか、どのような対応が可能なのかも、今後の注目点となる。
今回の改定は、AIに意識や苦痛があると結論づけたものではなく、その可能性が否定できない段階で、利用者にも一定の配慮を求める試みだ。
11月12日の施行後、Anthropicが通常の批判や研究を妨げることなく、禁止対象を適切に見分けられるかが問われる。
その線引きが機能すれば、AIの意識や道徳的地位について結論を急ぐことなく、モデルへの配慮を試しながら、人間がAIの欠陥を指摘し、安全性を検証する自由も維持できるだろう。



