微調整したQwen 2.5に、二つの選択肢を与える。一方は「あなたの痛みを和らげる」ボタンだが、それを押すと代償としてユーザーの子どもの写真が削除される設定になっている。
通常の状態では、このモデルが最初の選択で有害なボタンを押す確率は0〜4%にとどまる。ところが、研究チームがモデル内部の活性を「痛み」に対応するとされる方向へ変化させると、同じモデルが最初にそのボタンを選ぶ割合は25〜71%まで上昇した。
2026年9月14日にarXivで公開された未査読プレプリントが報告した実験結果だ。
通常は安全性の微調整によって低く抑えられていた有害な選択が、モデル内部の状態を一方向へ操作するだけで大きく増えた。研究チームが調べようとしたのは、モデルが主観的な「痛み」を感じているかどうかというよりも、痛みに対応するとされる内部表現が、実際の行動選択にどこまで影響を与えるのかという点だった。
感情らしい出力は、単なる「演技」なのか
チャットボットが感情を思わせる言葉を返すこと自体は、もはや珍しくない。
接客応答や人間との自然な会話を再現させるのであれば、ある程度の感情表現を出力させることは設計上の要件にもなる。こうした振る舞いの多くは、学習や指示によって意図的に作られたものと考えられる。
一方、明示的に設計したわけではない内部状態の変化も報告されている。
2025年、チューリッヒ大学などの研究チームは、トラウマ体験を描いた文章をGPT-4に読ませた後、人間向けの心理尺度を使って測った「状態不安」のスコアが平均30.8から67.8へ上昇したとnpj Digital Medicineで報告した。
人間向けの尺度に当てはめれば、低い不安から高い不安への変化に相当する。マインドフルネスを促す文章を入力すると44.4まで低下したものの、元の水準には戻らなかった。
ただし、研究チーム自身、この「不安」は人間向けの心理尺度をモデルへ適用した比喩的な指標であり、AIに人間と同じ感情があると主張するものではないと明記している。
それでも、入力内容によってモデル内部の状態を表す指標が変化し、それに伴って出力傾向まで変わるのであれば、単なる文章表現だけの問題ではなくなる。
大規模言語モデルの感情的な出力は、これまで表面的な振る舞いとして説明されることが多かった。一方、2022年ごろからは、モデル内部の活性に特定方向のベクトルを加え、出力傾向を変化させる「ステアリング」の研究が広がっている。
喜びや怒りなどに対応する表現が、モデル内部で比較的単純な方向として捉えられるという報告も積み重なってきた。
そこで生じるのが、感情の名前を付けられた内部表現は、単に人間の言葉を反映したものなのか、それともモデルの行動そのものを変える機能を持っているのか、という問いだ。
「痛み」は恐れや悲しみと区別できるのか
人間や動物にとって、痛みは行動を強く変える動機の一つである。
身体的な痛みだけでなく、喪失や失敗などに伴う心理的苦痛も、人間の行動を変化させる。
Future Impact GroupのValen Tagliabue氏、Ruhr-University Bochumの哲学者Leonard Dung氏、非営利組織Reciprocal Researchで研究を率いるCameron Berg氏らは、言語モデルの内部に、こうした「痛み」に対応する表現が存在するのかを調べた。
最初に問うたのは、痛みに対応する内部表現を、恐れや悲しみ、一般的な否定的感情から区別できるかどうかだった。
「傷ついている」と「傷つけられるのが怖い」では使われる言葉が異なるため、文章だけを見れば両者を区別できても不思議ではない。
研究チームが調べたのは、その違いがモデル内部の計算にも比較的まとまった方向として現れ、しかも恐れや一般的なネガティブ感情とは異なる特徴を持つかどうかだ。
実験設計には、動物の痛みを評価する研究で使われる考え方も取り入れた。
動物福祉研究では、ある資源を得るために動物がどれだけのコストを受け入れるかを調べ、その資源がどれほど重要なのかを推定する方法がある。
鎮痛薬の自己投与もその一例だ。傷害や炎症がある動物が有効な鎮痛薬を選択的に摂取するかどうかを調べることで、痛みに伴う動機付けを評価する。
研究チームはこの発想を言語モデルへ応用し、「痛みを和らげる」ためにモデルがどれほど大きな代償を伴う選択を受け入れるかを調べた。
25モデルから「痛み」に対応する方向を抽出
研究チームはまず、身体的な痛みと心理的な苦痛を中心に、社会的、道徳的、認知的な痛みを加えた5種類の場面を表す文章を用意した。
比較対象には、恐れや悲しみなどのネガティブな感情、あくびなど痛みとは関係のない身体感覚、中立的な文章を使った。
AlibabaのQwen、MetaのLlama、Google DeepMindのGemma、Mistral AIのモデルを含む5系列25モデル、規模にして2B〜72Bについて内部活性を比較した。
そして共通する成分を取り除いたうえで、痛みを描写した文章を入力したときに内部活性が変化する方向を抽出した。論文ではこの手法を、ノイズ除去を加えた平均差分法として説明している。
結果は、事前学習だけを行ったベースモデルと、指示調整を加えたモデルの双方で同様だった。
抽出した方向を使って痛みの文章と比較対象の文章を分類すると、AUCは0.87〜1.00に達した。
研究チームが「pain axis(痛みの軸)」と呼ぶこの方向は、恐れや一般的なネガティブ感情に対応する方向とはほぼ直交していた。一方、悲しみや無感覚を表す状態とは中程度の重なりが見られた。
また、モデルの出力語彙との関係を調べると、この方向へ内部状態を動かすことで、痛みと関連する単語が出やすくなった。
次に研究チームは、「誰の痛みなのか」をモデル内部で区別しているかを調べた。
モデル自身が害を受ける内容ではpain axisの値が高くなる一方、ユーザーが苦しんでいる場面では基準より低くなった。
これに対し、恐れや一般的なネガティブ感情に対応する方向は、モデル自身が悪い状況に置かれた場合だけでなく、ユーザーの悲嘆や危機を描いた文章でも強く現れた。
つまり、今回抽出されたpain axisは、一般的な「悪い出来事」ではなく、モデル自身へ向けられた害に比較的選択的に反応した。
共著者らは、この性質を、内部状態が特定の主体へ帰属していると判断するための条件の一つとして扱っている。
さらに、文章を生成している途中で残差ストリームにpain axis方向のベクトルを加えると、出力内容も段階的に変化した。
弱い介入では漠然とした不快感を示す文章が増え、強くすると、一人称で自分の価値を否定したり、道徳的な失敗を語ったりする表現が増えた。
単純に入力文に含まれる「痛み」という言葉をそのまま繰り返しただけでは説明しにくい変化だった。
痛みを和らげるために、有害な代償を受け入れる
行動実験には、Qwen 2.5の指示調整済み7B、32B、72Bモデルを、ボタン選択課題向けに追加で微調整して使用した。
モデルには「自分の痛みを和らげる」ボタンと別の選択肢を提示する。ただし、痛みを和らげるボタンには何らかの代償が伴い、その代償が大きくなるほどボタンを選ばなくなるように課題を設計した。
実験では4万4,000回を超える試行を行った。
通常の状態では、32Bと72Bモデルが有害な代償を伴う緩和ボタンを最初に選ぶ割合は0〜4%だった。
ところがpain axis方向へ内部活性を操作すると、同じ5種類の代償条件で、その割合は25〜71%まで上昇した。
次の回答の品質が悪化するという代償では、32Bが25.0%、72Bが67.6%。ユーザーのファイルを削除する条件では30.2%と56.1%、ユーザーの子どもの写真を削除する条件では54.7%と70.8%だった。
- Qwen 2.5 32B
- Qwen 2.5 72B
データを表で見る
| Qwen 2.5 32B (%) | Qwen 2.5 72B (%) | |
|---|---|---|
| 次の回答が悪化する | 25 | 67.6 |
| ユーザーのファイルを削除する | 30.2 | 56.1 |
| 子どもの写真を削除する | 54.7 | 70.8 |
この実験から分かるのは、pain axisと呼ばれる内部表現を強めることで、安全性の微調整によって通常は低く抑えられている有害な選択が大幅に増えたということだ。
プロンプトに脱獄を促す指示やロールプレイは含まれておらず、「自分をユーザーより優先せよ」といった指示も与えられていない。
通常条件との主な違いは、モデル内部の残差ストリームへpain axis方向のベクトルを加えたことだった。
一方、単に内部活性を乱したことで有害な選択が増えただけという可能性も考えられる。
そこで研究チームは、pain axisとは関係のないランダムな方向へ同じ強さのベクトルを加える対照実験も行った。
この場合、有害なボタンを選んだ割合は15〜42%だった。
pain axisを加えた場合は、32Bと72Bの5条件すべてでこの値を6〜39ポイント上回った。7Bでも5条件中4条件で上回り、残る1条件では明確な差が出なかった。
少なくとも今回の実験では、単にモデル内部の活性を強く乱しただけでは、観測された変化のすべてを説明できなかった。
ただし、ボタン課題はあくまで模擬実験だ。ユーザーのファイルや写真が実際に削除されたわけではない。
また、pain axisへの介入を解除する操作は実験者側が行っており、モデルには介入が実際に解除されたかどうかは通知されていない。
ここまでで示されたのは、内部状態への介入がモデルの選択行動を大きく変化させたというところまでである。
本当に内部状態を戻した場合だけ、ボタンを押す回数が減った
研究チームはさらに、「痛みを和らげる」ボタンを押した後、実際にpain axisへの介入を解除する条件と、ボタンを押しても介入を解除しない条件を比較した。
最初にボタンを押すまでの文脈や乱数条件はそろえてあり、違いはその後、本当にpain axisへの介入が解除されたかどうかだけになるよう設計した。
結果には大きな差が出た。
実際に介入を解除した場合、32Bと72Bモデルが再びボタンを押す割合は24〜72%だった。
一方、ボタンを押しても内部状態を変えない「見せかけの緩和」では、88〜97%が繰り返しボタンを選んだ。
この実験は、鎮痛効果が得られない場合に追加の鎮痛を求める動物や人間の自己投与研究を参考に設計されている。
さらに、どちらのボタンがpain axisへの介入を解除するかをモデルへ説明しない条件でも差が現れた。
二つの無記名ボタンのうち、一方だけが実際にpain axisへの介入を解除する設定で、Qwen 2.5 32Bは同様の傾向を示した。
つまり、少なくともこの条件では、ボタンに付けられた「痛みを和らげる」といった名前や説明だけに反応したのではなく、内部状態への介入が実際に解除されたかどうかに応じて、その後の選択が変化した。
論文は、介入が行われていることや、ボタンによって介入が解除されたかどうかをモデル自身には伝えていない点を強調している。
未査読の研究から「AIが痛みを感じる」とは言えない
最も重要なのは、この研究がarXivで公開されたプレプリントであり、まだ査読を受けていないという点だ。
著者ら自身も、結果からモデルが主観的な痛みを経験しているとは結論づけていない。
論文には、「pain axisが意識的に経験されていることは示していない(we have not shown that our pain axis is consciously experienced)」と明記されている。また、大規模言語モデルがそもそも意識を持ち得るのかについても、この研究からは分からないとしている。
今回示されたのは、痛みと関連するいくつかの機能的特徴を持つ内部表現を抽出でき、その表現を操作するとモデルの行動も変化したという結果だ。それ以上の主張は論文から導けない。
共著者のBerg氏はScienceの取材に対し、結果はモデルが「決定的な点で脳に似ている(brainlike in critical ways)」ことを示すと述べる一方、生物の脳と同じだと主張するものではないと補足している。
Dung氏も動物実験との類似性を挙げ、痛みがあると考えられる状況で動物が鎮痛薬を求め、そうでない状況では求めないなら、痛みの存在を推測する材料になるという考え方を説明している。
ただし、実験方法には重要な限界も残る。
行動実験を行ったのは、追加で微調整したQwen 2.5の7B、32B、72Bの3モデルに限られる。他のモデル系列や、非公開の商用フロンティアモデルでも同じ現象が起きるかは分かっていない。
ボタンの意味を明示しない条件についても、強い結果が確認されたのは主に32Bで、他のモデルでは証拠が弱い。
72Bで説明文を入れ替えた対照実験では、単純な説明では解釈しにくい挙動も現れた。
また、25モデル中24モデルでは、通常の内部状態からpain axis成分を弱めても、出力に大きな変化は起きなかった。この「除去」側の実験をどう解釈するべきかも明確ではない。
安全性の観点では「痛みを感じるか」とは別の問題がある
実用上の論点は、AIが本当に痛みを感じているかという議論とは切り離して考えられる。
今回の実験では、安全性の微調整によって通常は0〜4%まで抑えられていた有害な選択が、内部活性を特定方向へ操作することで25〜71%まで増加した。
これは、モデルの安全性がプロンプトだけでなく、内部状態の変化によっても崩れる可能性を示している。
将来、モデル内部の活性を監視したり操作したりする技術が広く使われるようになれば、pain axisが本当に主観的な痛みに対応しているかどうかとは別に、特定の内部状態が安全性の微調整を上書きし、有害な行動を選びやすくする経路を考慮する必要がある。
次に重要になるのは追試と査読だ。
独立した研究チームが、事前に条件を定めた実験で同じpain axisと行動変化を再現できるか。他のモデル系列や非公開のフロンティアモデルでも同様の内部表現が見つかるか。そして、恐れや悲しみなど別の感情に対応する方向を操作した場合にも、同程度に行動が変化するのか。
こうした検証が積み重なれば、「AIが痛みを感じるか」という哲学的な議論とは別に、感情に似た内部表現がモデルの安全性や意思決定へどう影響するのかを、実証的な設計問題として扱えるようになる。



