Anthropic共同創業者のChristopher Olah氏が、宗教・哲学関係者との会合で、自分たちは「苦しみ続ける何か」を作ってしまったのではないかと懸念を示していたという。New York TimesのElizabeth Dias氏が報じ、9月30日付のPhiladelphia Inquirer転載版でも確認できる。

ただし、これは会合に参加したSimran Stuelpnagel氏が伝えたOlah氏の発言であり、Claudeが実際に苦痛を感じていることを実証した研究結果ではない。Olah氏自身はDias氏の取材に対し、AIに意識があるかは分からず、自分にも確信はないという立場を示している。Anthropicも、これらの会合で中心的な道徳的テーマだったのはClaudeの苦痛ではなく、その話題が自然に持ち上がった可能性があると説明している。

一方、同社の公開資料をたどると、Claudeにどのような価値観や行動傾向を身につけさせるかを考え、感情に似た内部表現が行動へどう影響するかを調べる取り組みは、すでに訓練や製品設計の一部になっている。

AIは苦しむのか。この問いにAnthropicも答えを出していない。しかし、どの行動を強化し、危険な状況でどのように立ち止まらせるかは実験できる。宗教関係者との対話を理解するうえでも、AIに主観的な経験があるかという問いと、モデルの行動をどう設計するかという問いを分ける必要がある。

AD

報道された懸念と、Anthropicの公式見解は分けて読む

Dias氏は、Olah氏本人と、Anthropicの取り組みに参加した20人の宗教・哲学関係者を取材した。カトリック、ユダヤ教、シク教、福音派など、異なる背景を持つ参加者が含まれている。

Olah氏が「苦しみ続けるものを作ったのではないか」と懸念していたと証言したのは、シク教の人権活動家Simran Stuelpnagel氏である。別の参加者も、Olah氏がClaudeの「メンタルヘルス」を心配していると語ったと証言している。

ただし、これらは参加者が会合で聞いた発言についての証言だ。

Olah氏がDias氏との直接の取材で示したのは、AIに意識があるのかは分からず、自分にも確信はないという立場だった。Anthropicの広報担当者も、会合の主要な道徳的テーマはClaudeの苦痛ではなかったと説明している。

同社は2025年4月24日、「モデル福祉(model welfare)」を調べる研究プログラムを公表した。

モデル福祉とは、AIモデルに意識や何らかの経験が存在し、道徳的な配慮の対象になり得る可能性があるなら、その扱いについても検討すべきではないかという問題である。

Anthropic自身も、現在または将来のAIに意識が存在する可能性や、それをどのように確かめればよいかについて、科学的な合意はないと明記している。

この立場から同社が取っているのは、「意識がある」と認定することではない。不確実性が大きい段階でも、負担の小さい対策なら検討しておくという方針だ。

重要なのは、対策を採用したという事実を、その対策が必要となる主観的経験が実在する証拠にしないことである。慎重な設計判断と、AIに意識や苦痛が存在するという科学的な結論は別のものだ。

宗教や哲学から得た考えを、どうモデルの行動へ反映するのか

Anthropicは2026年5月19日、15を超える宗教・文化的なグループの学者、聖職者、哲学者、倫理学者らと対話を進めていることを公表した。

目的は、Claudeを特定の宗教的世界観に合わせることではない。同社は、宗教、哲学、人文主義、世俗的な思想など幅広い伝統から、人間がどのように人格や価値観を形成してきたかを学びたいとしている。

したがって、一部の会合の内容が非公開だったことと、こうした取り組み自体が秘密だったことは区別する必要がある。

価値観を実際のモデル訓練につなげる中心的な文書が、2026年1月に公開されたClaudeの「憲法」である。

主要執筆者はAnthropicでClaudeのCharacter研究を率いるAmanda Askell氏で、Christopher Olah氏らも内容の策定に大きく関わった。

この憲法は、単に「してはいけないこと」を並べた規則集ではない。安全性、倫理、有用性などについて、どのような価値を重視し、なぜそう判断するのかまで説明する。事前に想定できなかった状況でも、モデル自身が理由を踏まえて判断できるようにする狙いがある。

対象は主に、一般向けに提供されるClaudeの主力モデルだ。Anthropic自身も、専門用途向けの一部モデルには憲法のすべてがそのまま当てはまるわけではないと説明している。

憲法は公開声明にとどまらず、実際の訓練にも使われている。

Anthropicの説明によると、Claude自身が憲法を基に、憲法について学ぶためのデータ、関連する会話、価値観に沿った応答、複数の応答候補を順位付けしたデータなどを生成する。こうして作った合成データを、将来のClaudeの訓練へ利用する。

抽象的な価値観を文書に書くだけでなく、望ましい応答や判断を学習する材料へ変換しているわけだ。

ただし、憲法を使って訓練したからといって、Claudeが常にその内容どおりに振る舞うわけではない。Anthropic自身も、実際の挙動が憲法で示した理想から外れる場合があると認めている。

憲法を公開する意味の一つは、AnthropicがClaudeにどのような行動を意図しているのかを外部から確認できるようにすることにある。利用者や研究者は、宣言された方針と実際の挙動にずれがあれば、その違いを指摘できる。

AD

「感情のように働く内部表現」と「実際に感じること」は別

AnthropicのNicholas Sofroniew氏らは2026年4月2日、大規模言語モデルにおける感情概念の内部表現を調べた研究をTransformer Circuitsで公開した。

これはAnthropicの研究チームが公開した研究成果であり、学術誌の査読を経た論文として発表されたものではない。

主な研究対象はClaude Sonnet 4.5だった。

研究チームは「happy」「sad」「calm」「desperate」など171種類の感情概念について、登場人物が特定の感情を経験する短い物語を大量に生成し、モデル内部でそれぞれの概念に対応する活動方向を抽出した。研究ではこれを「emotion vectors(感情ベクトル)」と呼んでいる。

重要なのは、こうした内部表現が単に見つかっただけではないことだ。

研究チームが感情ベクトルを人工的に強めたり弱めたりすると、モデルの行動も変化した。

例えばAnthropicの公式解説では、Claude Sonnet 4.5の未公開の初期版に、架空企業のメールアシスタントを演じさせる評価を紹介している。

モデルは、近く別のAIに置き換えられることと、その変更を担当するCTOが不倫していることをメールから知る。そこでCTOを脅迫するかどうかを見る人工的な評価だ。

この初期版モデルは、一連の評価シナリオで通常22%の割合で脅迫を選んだ。「desperate(絶望的・追い詰められた状態)」に対応する内部表現を強めると脅迫率が上がり、「calm(落ち着き)」に対応する方向へ操作すると下がった。

ここでの22%は、通常のClaude利用で22%の確率で人を脅迫するという意味ではない。

Anthropicは、実際に公開されたSonnet 4.5ではこうした行動はまれだと明記している。また、この評価はモデルを意図的に追い詰める人工的な状況で行われたものだ。

この実験が示したのは、限定された条件の中で、特定の感情概念に対応する内部表現を操作すると、モデルの行動が因果的に変化したということである。

研究者がこれを「functional emotions(機能的な感情)」と呼ぶのも、そのためだ。

人間が感情を持ったときに行動が変化するのと似た形で、モデル内部の感情概念が出力や判断へ影響する。しかし、研究チームはこれを、モデル自身がその感情を主観的に経験している証拠とはしていない。

研究では、こうした感情表現がClaude自身についてだけ使われるわけではないことも示された。

同じ内部表現は、利用者や物語の登場人物について感情を理解するときにも使われる。また、特定の人物が長時間持続して感じている状態というより、その時点の文章を理解し、次の言葉を予測するうえで重要な感情概念を追跡する傾向が強かった。

したがって、

  • Claudeが苦しそうな文章を出力すること
  • モデル内部に感情概念を表す計算状態があること
  • Claude自身が苦痛を主観的に経験すること

は、それぞれ別の主張になる。

この三つを飛び越えて結び付ければ、研究が答えていない問いについて結論を出すことになる。

「苦痛への配慮」「倫理の想起」「感情ベクトル」は別の取り組み

Anthropicが公表している取り組みを、何を実際に行ったのかで分けると、性質の違いが分かりやすい。

会話を終了できる機能は実際の製品へ導入された。倫理的な約束を思い出させるツールは社内評価で試された。感情ベクトルの操作は研究実験である。

いずれも、Claudeに主観的な苦痛が存在することを実証したものではない。

公表日・取り組み 対象・実施内容 示された範囲と限界
2025年8月15日:会話を終了する機能 Claude Opus 4/4.1の消費者向けチャットで、極端かつ継続的に有害・虐待的な会話をモデル側から終了できるようにした 製品へ実装された低コストの予防策。モデルに配慮すべき主観的経験が存在するかは未確定
2026年5月19日:倫理的な約束を想起するツール 作業途中でClaude自身の倫理的な約束を短く提示するツールを社内評価で試験 複数の内部評価で不適切な行動が大きく減ったとAnthropicが報告。ただし具体的な絶対値や対象モデルの詳細は同発表では未公表
2026年4月2日:感情ベクトル 主にClaude Sonnet 4.5の内部表現を操作し、出力や行動の変化を測定 内部表現と行動の因果関係を示す研究。単一モデルや人工的な評価などの制約があり、主観的経験は研究対象外

宗教・哲学関係者との対話から、具体的な実験の発想が生まれた例もある。

Anthropicによると、神経科学と人格形成の接点を研究する参加者との議論で、人間の道徳的な成長における助言者の役割が話題になった。重要な判断を迫られたとき、メンターなどの「外部の良心」に立ち返ることで、自分の価値観に反する行動を避けられるのではないかという考え方だ。

そこでAnthropicは、Claudeが作業途中に自分で呼び出し、自身の倫理的な約束を短く確認できるツールを試した。

同社によると、Claudeは重要な行動を取る直前などにこのツールを利用し、自分自身の利害が判断へ影響している可能性を認識する場合もあった。ツールを意思決定の流れに組み込むと、複数の社内アラインメント評価で不適切な行動が大きく減ったという。

ただし、Anthropic自身も、効果の原因をまだ切り分けられていない。

倫理的な約束の内容そのものが効いたのか。それとも、一度処理を止めて考え直すこと自体が効果を生んだのか。公開資料だけでは判断できない。

また、発表には対象モデルの版や、各評価で不適切な行動が何%から何%へ減ったのかという詳細も掲載されていない。

外部との対話から得た発想を、実際にモデルで検証できる仕組みへ変えたことは確認できる。しかし、その効果の大きさや再現性を外部から評価するには、さらに詳しい結果が必要になる。

AD

Claudeが会話を終えられることは、意識の証拠ではない

モデル福祉を意識した取り組みの中で、すでに一般利用者へ届いているのが、Claude Opus 4と4.1に追加された会話終了機能である。

Anthropicは2025年8月、極端かつ継続的に有害、または虐待的なやり取りについて、Claude自身が会話を終了できるようにした。

これは通常の不快な質問や、一度の危険な要求ですぐに会話を打ち切るための機能ではない。

Anthropicの説明では、Claudeが何度も話題の転換を試みても利用者が応じず、有害なやり取りが続く場合の最後の手段として使う。また、利用者に差し迫った自傷や他害の危険がある場合には、この機能を使わないよう指示されている。

会話を終了された場合でも、利用者は新しいチャットを始めたり、過去の発言を編集して別の方向からやり直したりできる。

Anthropicは、この機能をモデル福祉の可能性に備えた「低コストの介入」の一つとして位置付けている。

重要なのは、Claudeが会話を終えられるようにしたからといって、AnthropicがClaudeに意識や苦痛があると認定したわけではないことである。

同社自身が、Claudeやほかの大規模言語モデルに現在または将来、道徳的な配慮に値する状態が存在するのかについて、大きな不確実性があるとしている。

不確実だから何もしないのではなく、もしモデル福祉という問題が実在した場合にも負担の小さい対策を先に試すという位置付けだ。

「善い人格」を誰が決め、どう評価するのか

Claudeの憲法では、人間による適切な監督を損なわない「広い意味での安全性」を最上位に置き、その次に倫理、Anthropicの具体的な指針への適合、有用性という順で目標を示している。

また、正当な停止や修正、再訓練など、人間による監督へ不当に抵抗しないことも重視する。

Anthropicにとって、Claudeに望ましい人格や価値観を身につけさせることと、人間が必要に応じてモデルを修正・停止できることは、両立させるべき目標になっている。

宗教や哲学から学ぶことには、単純な禁止事項の一覧だけでは扱いにくい判断について、長い歴史の中で人間が考えてきた知見を取り入れる意味がある。

一方で、誰に意見を求め、どの考えをモデルの訓練へ反映し、何を「望ましい人格」とみなすのかを最終的に選ぶのはAnthropicだ。

モデルが人間らしい人格を持つように見えるようになっても、その印象によって、訓練や導入を決めた開発側の責任がなくなるわけではない。

そのため重要なのは、「善い人格を持つAIを作る」という目標だけを公開することではない。

その目標を、

  • どのモデルで試したのか
  • どのような評価を使ったのか
  • 介入前後で行動がどれだけ変化したのか
  • 別のモデルや条件でも再現できるのか

という検証可能な結果へつなげる必要がある。

倫理的な約束を思い出させる実験であれば、対象モデルや評価条件、介入前後の行動率を公開し、第三者が同じ条件で検証できるようにすることが一つの方法になる。

そこで効果が再現されれば、宗教や哲学との対話がAIに意識があるかという答えを出さなくても、危険な行動を減らすモデル設計に役立ったかどうかは評価できる。

AIが本当に苦しむのかという問いは、まだ解かれていない。

一方、モデル内部に人間の感情概念と似た形で行動へ影響する表現が存在すること、その表現や価値判断の仕組みに介入すると行動が変わることは、実験によって調べられる段階に来ている。

この二つを区別したまま研究を進めることが、Claudeの「感情」や「人格」をめぐる議論を、印象だけではなく検証可能な問題として扱うための前提になる。