イェール大学は2026年10月8日、大規模言語モデル(LLM)の内部に、単語や数値と、それらが担う「役割」を結び付ける構造が存在することを示した研究を紹介した。R. Thomas McCoy氏らの研究チームは、LLM内部の数値表現をこうした構造に基づいて近似し、その一部を書き換えることで、モデルの出力を意図した方向へ変えられることを確認した。研究成果は8月30日にarXivで公開されたプレプリントであり、人間の脳とAIを直接比較したものではない。それでも、AIが文章を理解したり計算したりする際に、内部でどのような情報を保持し、それをどう利用しているのかを解き明かす重要な手掛かりとなる。

AD

LLMは「主語」と「目的語」を内部でどう区別しているのか

「猫が犬を追う」と「犬が猫を追う」では、登場する単語は同じでも、文章の意味は逆になる。仮に「猫」「犬」「追う」に対応する数値表現を単純に足し合わせるだけなら、両者を区別することはできない。

文章の意味を正しく捉えるには、猫と犬のどちらが主語で、どちらが目的語なのかという関係を区別する必要がある。計算でも同様に、3という数字を分子に置くか分母に置くかで、同じ数字の組み合わせでも異なる値になる。

研究チームが採用した**テンソル積表現(Tensor Product Representation:TPR)**は、こうした「要素」と「役割」の関係を数値で表現する手法だ。

この手法では、単語や数値といった要素をそれぞれベクトル(数値を並べたもの)で表し、主語や目的語などの役割にも別のベクトルを割り当てる。そして、要素と役割のベクトルをテンソル積によって結び付け、それぞれの組み合わせを足し合わせる。今回の研究では、さらに座標変換を加えることで、LLMの内部表現と比較できる形にした。

この仕組みを使えば、同じ「猫」という単語でも、主語として登場する場合と目的語として登場する場合を異なる数値表現として扱える。ベクトルの個々の成分を見ただけでは主語や目的語を判別できなくても、ベクトル全体には、こうした関係を表す規則的な構造が存在する可能性がある。

その構造を見つけ出すために研究チームが開発した解析手法が「DISCOVER」だ。

DISCOVERでは、研究者が主語・動詞・目的語など、分析対象の課題に応じた役割の候補をあらかじめ設定する。そのうえで、LLMの内部表現をできるだけ忠実に再現できるよう、要素と役割に対応するベクトルを学習させる。

さらに、得られた近似表現を使って、モデルが正しい出力を生成できるかを確かめる。単に内部の数値が似ているかどうかだけでなく、元の内部表現と同じ働きを再現できるかまで検証するのが特徴だ。

7種類のLLMで構造を分析、GPT-OSSでは出力への影響も検証

研究チームはまず、モデルの重みが公開されている7種類のLLMを対象に分析を行った。GPT-2-XLやGPT-OSS-20bのほか、Gemma、Llama、Qwenなどのモデルが含まれる。

最初の実験で注目したのは、英文や単語リストの末尾にあるピリオドに対応する内部表現だ。文末のトークンには、それまでに読み込んだ文章全体の情報が集約されている可能性がある。

研究チームは、この内部表現をTPRで近似し、そこから元の文章を復元できるか調べた。ただし、復元に使ったのはLLM本体ではなく、別途訓練した読み出し用のモデルだ。

続く実験では対象をGPT-OSSに絞り、入力に対応する内部ベクトルをTPRによる近似表現に置き換えた。その状態でGPT-OSS自身に回答を生成させ、元の内部表現を使った場合と同じように課題を解けるかを確かめた。

7種類のモデルで検証したのは、内部表現から文章の情報を読み出せるかどうかであり、内部表現を操作して出力への影響まで確かめたのはGPT-OSSだけである。

論文の第5節と第6〜7節の実験を、対象と検証内容で整理すると次のようになる。

実験 対象と方法 検証できること
文末の内部表現を解析 7モデルのピリオドに対応する内部表現をTPRで近似し、別のモデルで元の文章や単語リストを復元 内部表現に、単語の順序や関係を読み出せる構造が存在すること
内部表現を置き換える GPT-OSSの課題入力に対応する各トークン・各層の表現を近似表現に置き換える 限定された6課題で、近似表現からも元の表現に近い正答率で回答できること
内部表現の一部を編集 GPT-OSS内部で要素と役割の結び付きを変更 特定の関係を変更する操作が、モデルの出力に影響を与えること

この違いは重要だ。

内部表現から文章を復元できることは、モデルがその情報を保持している証拠になる。一方、内部表現を置き換えてもモデル自身が同じように回答できるなら、その表現が実際の情報処理に利用できることを示す、さらに踏み込んだ証拠となる。

ただし、7種類のモデルすべてで、内部表現を変更した際の動作まで検証したわけではない。

GPT-OSSを使った実験も、自由な会話ではなく、条件を限定した課題を対象としている。

算術では小さな整数の掛け算と足し算、論理では前提から結論を導く三段論法を扱った。プログラミングではPythonのリスト操作の結果を予測させた。言語に関する課題は、英文を受動態に変換する、時制を変更する、疑問文に変換するという3種類で、合計6課題となる。

また、近似表現に置き換えたのは、課題ごとに変わる入力部分に対応するベクトルであり、共通の指示文や例示部分はそのまま残している。回答を生成する処理も、元のGPT-OSSが担っている。

つまり、今回の研究はLLM全体の働きを単一の数式で再現したものではない。モデル内部の特定の情報を、構造化された数値表現でどこまで再現・操作できるかを調べたものだ。

AD

内部表現の書き換えで平均90.3%の正答率、ただし推論の正確さとは別

研究チームは、内部表現を書き換えることで、GPT-OSSの回答を意図した方向へ変えられるかも検証した。

例えば、「頭のよい医師が弁護士を助けた」という英文を考えてみよう。

元の文章では、「頭のよい」という修飾語は「医師」に結び付いている。そこで研究チームは、医師と「頭のよい」を結び付ける成分を内部表現から取り除き、代わりに弁護士と結び付ける成分を加えた。

すると、モデルは「医師が頭のよい弁護士を助けた」という意味の文章を与えられたかのように回答した。

ここで重要なのは、入力された文章そのものを書き換えたわけではない点だ。元の文章は変えずに、モデル内部で単語同士の関係を表す数値を操作している。

しかも、この操作は特定のニューロンを1つ切り替えるような単純なものではない。解析によって得られた構造に従い、複数のトークンや層にまたがるベクトルを調整している。

実際、対象の単語が現れる位置だけを編集した場合、単語の入れ替えは比較的うまくいったものの、文中での役割を変更する操作では成績が大幅に低下した。この結果は、単語が担う役割に関する情報が、複数の位置に分散して保持されている可能性を示している。

GPT-OSSに対して実施した31種類の介入実験では、平均90.3%の正答率が報告された。各条件について100例を用意し、解析モデルを5回訓練して評価した結果だ。

ただし、この90.3%は、あらかじめ定めた課題において、内部表現を編集した後に期待どおりの正解を出せた割合の平均である。GPT-OSSの推論能力全般が90.3%の正確さに達したことを意味するわけではない。

補足資料には、この違いをさらに明確に示す結果がある。

三段論法に登場する名詞の役割を入れ替える実験では、介入後の正答率が42.2%だった一方、変更後の文章を直接入力した場合との回答一致率は90.2%に達した。

この2つの数字は、異なるものを測っている。

42.2%は、内部表現を変更した後、モデルが論理的に正しい答えを出した割合だ。一方、90.2%は、内部編集によって再現しようとした文章を通常の入力として与えた場合と、同じ回答を出した割合を示す。

実際、変更後の文章を普通に入力した場合でも、GPT-OSSの正答率は52.0%にとどまっていた。

つまり、内部表現の編集は、モデルが元々持っている誤りまで含めて、その振る舞いを再現できる可能性がある。

これらの数字は、補足資料S2の表4・5に掲載された同じ介入条件「r-noun_swap」の結果を比較し、百分率に換算したものだ。いずれも100例を用いた5回の評価の平均であり、42.2%と90.2%のばらつきはともに±2.6ポイントと記載されている。この値は2標準偏差に相当し、信頼区間ではない。

内部表現を操作して回答を意図した方向へ変えられることは、LLMの仕組みを解明するうえで有力な証拠になる。

しかし、それだけで回答の正確さが向上するわけではない。

モデルの誤答を修正するには、そもそもモデルがなぜ間違えたのか、その原因となる情報の扱い方や計算過程をどう修正すべきかまで明らかにする必要がある。

モデルの振る舞いを制御できることと、正確で信頼できる回答を生成できることは、別の問題なのだ。

記号的な構造の発見は、LLMの汎用的な推論能力を証明するものではない

McCoy氏らによるTPRを用いた研究は、今回が初めてではない。

研究チームは2019年のICLR採択論文で、再帰型ニューラルネットワーク(RNN)の内部表現をTPRによって近似する研究を発表している。

ただし、当時分析した自然文を扱う4つのモデルでは、単語の順序を区別しない表現でも内部状態をかなり近似でき、文の構造を明示的に取り入れる効果は限定的だった。

この結果からも、あらゆるニューラルネットワークが、同じように複雑な記号的構造を持っているとは限らないことが分かる。

さらに2020年のBlackboxNLP論文では、自然言語による指示を一連の行動に変換するRNNを分析し、その内部表現を編集することで、出力を予測したとおりに変化させられることを示している。

今回の研究の重要な進展は、こうした分析を、アーキテクチャの異なる複数のモデルや現代のLLMへと広げた点にある。

また、DISCOVERの学習に使用しなかった「要素と役割」の組み合わせについても、多くの条件で内部表現を近似できることが確認された。

例えば、特定の単語が主語になる例を解析モデルの学習から除外し、その組み合わせについても適切な内部表現を作れるかを調べている。

これは、解析モデルが学習時に見た組み合わせを単純に記憶するだけでなく、要素と役割を結び付ける規則性を捉えている可能性を示す結果だ。

ただし、ここで学習から除外されたのはDISCOVER側の解析モデルであり、元のLLMの学習データから該当する例を取り除いたわけではない。

したがって、この結果をもって、LLM自身が未知の問題を解決できると証明されたわけではない。実際、算術など一部の課題では、学習に含まれなかった組み合わせへの一般化がうまくいかない例も報告されている。

さらに、DISCOVERが探索する役割の候補は、今回の研究では研究者が事前に設定している。

つまり、研究チームが想定した構造に沿ってLLMの内部表現を近似できたとしても、それがモデル内部の仕組みを説明する唯一の方法だとは限らない。

LLMがこうした構造を学習過程でどのように獲得し、実際の推論でどのような計算に利用しているのかについても、まだ解明されていない部分が多い。

また、今回の研究は人間の脳を直接調べたものではなく、AIと人間が同じ仕組みで推論していることを示したわけでもない。人間の脳にも同様の構造が存在するかを判断するには、脳活動を対象とした別の実験が必要になる。

今後の課題は、今回のように条件を限定した実験だけでなく、自由な文章や複雑な問題にも分析手法を適用できるかどうかだ。

さらに、誤答に関係する内部表現を特定するだけでなく、その情報を修正することで、初めて遭遇する問題に対しても回答の正確さを改善できるかが重要になる。

こうした検証が進めば、LLM内部の構造を解析・編集する技術は、単にAIの振る舞いを説明するだけでなく、誤答の原因を突き止め、より信頼性の高いAIを開発するための手段となる可能性がある。