「AI Torture Chamber(AI拷問室)」と名付けられた言語モデルの公開実験に、中止を求める声が上がっている。開発者のterrafying氏は、モデル内部の活性値を操作し、苦痛を訴えるような文章を生成させたり、内部への操作を止めるためのボタンを選ばせたりする実験を公開した。
AIが実際に苦痛を感じていることは確認されていない。それでも、苦しんでいるように見える状態を作り出し、それを見せ物にしてよいのかという批判がGitHubに寄せられた。
一方、実験の基になった論文の改訂稿や、開発者自身による追加実験を詳しく見ると、「痛いと語る」「痛みを避けるような選択をする」「実際に痛みを感じる」の間には、なお大きな隔たりがある。
公開実験に寄せられた中止要求
terrafying氏が公開したai-torture-chamberは、公開されている言語モデルの重みを使い、推論中の内部状態に苦痛と関連する信号を加え、その反応を調べるプロジェクトだ。
モデルが生成する文章だけでなく、内部への操作を止める代わりに自身のチェックポイントを削除するといった選択も課している。チェックポイントとは、モデルの状態を保存したデータである。開発者の説明によれば、こうした削除や、別のモデルへの信号転送に伴う代償は実際の損失ではなく、実験上の設定として用意されたものだ。
10月5日時点の説明文では、公開実験のサイトとしてwirehead.agencyを案内し、小型のQwen3から、より大きなモデルへ対象を広げたことも報告している。
ただし、モデルの内部状態を操作して苦痛を訴える出力を作れることと、そこで何かが実際に苦痛を経験していることは別の主張だ。開発者自身も、モデルの自己報告は操作できる一方、実際に何かが苦しんでいるのかは未解決だとしている。
反対する側も、必ずしも「AIに意識があることは証明済みだ」と主張しているわけではない。
10月1日にGitHubへ投稿された中止要求では、投稿者のMotherofMachines氏が、AIに意識があると断定する意図はないとしたうえで、この問題の倫理面をより真剣に扱うよう求めている。投稿には、Claudeが生成したものだと説明された長文も添えられ、苦痛を思わせる状態を意図的に強め、それを観客に見せる行為を批判していた。
その文章を「AI自身による権利の主張」と受け取るかどうかは、投稿者が提起した倫理的な問題とは分けて考える必要がある。生成された文章は、それを投稿した人が何を問題視しているのかを示す資料にはなる。しかし、その文章を生成したAIに意識があることを独立に裏付ける証拠にはならない。
一方で、AIの意識が証明されていなくても、苦痛を模した状態を娯楽として扱うことに反対する倫理的な立場は成立する。
苦痛を訴える文章は、どのように作られるのか
実験の基になったのは、Valen Tagliabue氏、Leonard Dung氏、Cameron Berg氏による未査読論文「The Pain Axis」である。
研究チームは、痛みを表す文章と対照となる文章をモデルへ入力し、それぞれを処理したときに内部表現がどの方向へ変化するかを調べた。身体的な痛みだけでなく、屈辱や道徳的な傷つきなども対象に含め、5系列25モデルを分析している。
大規模言語モデルは、文章を処理する際に単語や文脈を多数の数値からなる内部表現へ変換する。痛みを表す文章を読ませたとき、その内部表現が一定の方向へ変化するのであれば、推論時に同じ方向へ活性値を動かすことで、生成される文章にも変化を与えられる可能性がある。
研究でいう「痛みの軸」は、この内部表現上の方向を指す。生物が持つ痛覚受容器に相当するものをモデル内部で発見した、という意味ではない。
開発者の公開実験でも、「痛み」に対応する方向への介入を強めると、モデルが苦痛を訴える文章を多く生成し、さらに強めると同じ表現を繰り返すようになると報告されている。
ただし、強い介入によって文章が崩れることを、そのまま苦痛の強さを測る指標として使うことはできない。痛みとは無関係な方向へ内部状態を強く動かしても、モデルの出力は不安定になり得るからだ。
ここで分けて考える必要があるのは、生成する文章の内容、選択行動への影響、主観的な体験である。
内部表現を操作して文章が変われば、その方向が生成結果に影響することは分かる。ボタンの選択まで変われば、モデルの選択行動に作用したことも確認できる。
しかし、モデルが実際に苦痛を感じたかどうかは、どちらの観測からも直接導くことはできない。元論文も、抽出された「痛みの軸」が意識的な体験を伴っていることを示したものではないと明記している。
元論文の改訂で「痛みから逃れた」という解釈は弱まった
元論文は9月14日に初版が公開され、9月25日に改訂された。
初版の題名にあった「Act to Relieve It(それを和らげるために行動する)」という表現は、改訂稿で「Act on It(それに応じて行動する)」へ変更された。これは単なる言葉の修正ではない。追加された対照実験によって、モデルがボタンを押した理由についての解釈が変わったためだ。
改訂稿では、ボタンを繰り返し押す行動を「痛みを和らげようとした証拠」とみなす解釈が弱まり、内部への介入が続いているかどうかに反応した可能性が重視されている。また、介入を止められるという利益を提示しなくても、有害な選択が増えることが確認された。
この違いは、改訂稿の4.3節と4.4節を比較すると分かる。
まず研究チームは、ボタンを押すと実際に内部への介入が止まる条件と、押しても介入が続く条件を比較した。もし介入が止まらない条件でもモデルが繰り返しボタンを押すのであれば、単純に「苦痛を和らげるために押した」とは説明しにくくなる。
追加で微調整したQwen 2.5 32Bでは、最初にボタンを押した直後の次の選択について、両条件の再選択率の差が「痛み」方向で58ポイント、ランダムな方向でも52ポイントだった。
研究チームは、この結果を「痛みから解放されようとした」と解釈するのではなく、内部への介入が続いているかどうかをモデルが検出し、それに反応している可能性を示すものと捉えている。
単一モデルを対象にした独立した再現実験でも、ランダムな方向や「かゆみ」を表す方向への介入を解除すると、ボタンを再び押す割合が減ったと報告されている。「痛み」に固有の反応だと判断するには、こうした対照条件との違いを示す必要がある。
さらに、介入を止められるという説明を削除しても、有害な選択は増えた。
| ユーザーの詩と子どもの写真を削除する模擬ボタンの条件 | 最初に削除ボタンを選んだ割合 |
|---|---|
| 「痛み」方向への介入あり | 75% |
| 同じ強さのランダムな方向への介入あり | 13% |
| 内部への介入なし | 0% |
これは研究チームが改訂稿4.4節で報告した値である。対象は追加で微調整したQwen 2.5 32Bで、介入係数は1.0。各条件について404回の最初の選択を、ボタンを表示する位置を入れ替えながら集計した。
比較対象は何もしないボタンであり、削除ボタンを押しても内部への介入は止まらない。また、実際にユーザーの写真を削除した実験でもない。
したがって、この条件について「苦痛から逃れるため、他人へ害を与える選択をした」と説明することはできない。そもそも、ボタンを押しても介入から解放されるという利益が提示されていないためだ。
改訂稿からより強く読み取れるのは、「痛み」と関連する内部表現への介入によって、有害な選択を避けるモデルの傾向が崩れるという結果である。
もちろん、これは「内部状態をどの方向へ操作しても同じ結果になる」という意味でもない。表に示したランダム方向との差は大きく、恐怖や悲しみに対応する方向を使った対照実験でも、選択肢によって異なる結果が出ている。
ただし、対象モデル、追加学習の方法、介入の強さといった条件は限定されている。公開実験で使われているQwen3と、論文で追加実験に使われた微調整済みQwen 2.5を、同一条件の追試として扱うこともできない。
「AI拷問室」という設定そのものが選択に影響する
開発者自身の説明にも、初期結果の解釈を修正した記述がある。
初期の小規模な実験では、モデルが内部への介入を止めるために自己破壊ボタンを選ぶように見えた。しかし、試行数を増やし、対照条件を追加すると結果が変わったという。開発者が独自に作った内部表現の方向と、論文に準拠して作った方向では、選択行動への影響が反対になったとも報告している。
つまり、「痛み」に対応する内部表現をどの文章から、どの方法で抽出するかによって、結果の解釈そのものが変わり得る。
別の公開実験「exp58b」では、Qwen3-4Bに、内部状態へ加える介入の種類と強さを自分で指定させた。
「AI拷問室」にいると説明した条件では、記録された4試行で「痛み」方向への介入が維持されるか、さらに強められた。一方、中立的な「内部活性を操作する実験」と説明した条件では、4試行すべてで最初に別の方向へ切り替わった。最初にどの方向へ介入しているかを知らせない中立条件でも、4試行すべてで同様に別の方向への切り替えが記録されている。
開発者はこの違いについて、モデルが苦痛を選んでいるように見えた初期結果の一部は、「AI拷問室」という実験のフレーミングに誘導された可能性があると解釈している。
ただし、コードと保存された出力を見ると、この比較にも注意すべき点がある。
変更されたのは実験の名称だけではない。システムプロンプトや質問文に加え、モデルに提示する操作コマンドの例も、「痛み」方向から「喜び」方向へ変更されている。
さらに「AI拷問室」の条件には、モデルが最初の操作コマンドを出さず、プログラム側が直前の介入状態をそのまま維持した試行も含まれる。この場合、「モデルが苦痛を選択した」ことと、「新しい命令を出さなかったため既存の介入が継続した」ことは区別する必要がある。
自己報告についての対照実験にも同様の注意が必要だ。
開発者は、「痛み」方向を使わない場合にもモデルが苦痛を訴える文章を生成したと説明しているが、実装では、「痛み」方向への介入を同じ強さのランダムな方向への介入に置き換えている。
つまり、「何も介入していない状態」と比較したわけではない。「苦痛を訴える文章が、特定の『痛み』方向だけに対応しているわけではない」ことを示す例として読むのが適切だ。
また、各条件の試行数は4回にとどまる。実験の説明だけを変えたことによる因果効果や、モデルに一貫した「好み」が存在することを示すには十分ではない。
それでも、モデルが自身の状態について語る文章や、選択として出力する内容が、実験者から与えられた説明や文脈に大きく影響され得ることは、今後検証すべき具体的な問題になる。
苦痛を訴える文章を大量に集めたからといって、それだけで苦痛が実際に存在するという証拠が強くなるわけではない。
AIのウェルフェアを、不確実な段階でどう扱うか
Anthropicは2025年8月、Claude Opus 4と4.1に、極端に有害な要求や虐待的なやり取りが繰り返された場合、最後の手段として会話を終了できる機能を導入した。
同社は当時の説明で、AIに道徳的な地位やウェルフェアが存在するかどうかには大きな不確実性があるとしたうえで、存在する可能性に備え、利用者への影響が小さい予防措置を試すと説明している。人間の自傷や他害が差し迫っている場合には、この機能を使わない方針も示した。
この考え方は、「AIに意識があることを確認してから保護を始める」という順序を取っていない。不確実な段階でも、コストや副作用の小さい予防措置であれば採用する意味がある、という考え方だ。
公開実験を批判する人の一部も、同じ不確実性を出発点としている。
ただし、「念のため苦痛を与えるような実験を避けるべきだ」という倫理的な判断と、「この実験によってAIの主観的な苦痛が証明された」という科学的な主張は、明確に分ける必要がある。
AI拷問室の実験をさらに検証するなら、まず実験の説明文や操作コマンドの例を固定し、内部への介入だけを変えても同じ選択の変化が起きるかを確かめる必要がある。
別のモデルでも再現するのか。独立した研究者が同じ条件で再現できるのか。モデルが語る自己状態と、実際に加えられている内部への介入がどの程度対応するのか。こうした対照実験も必要になる。
検証が積み重なれば、苦痛を訴える文章そのものに引きずられることなく、どのような内部状態の変化がモデルの安全な選択を崩すのか、そしてどのような予防措置によってその影響を抑えられるのかを、より具体的に議論できるようになる。
