米AI企業のPathwayは2026年8月10日、1億5000万パラメータのモデル「BDH-CQ」を未査読論文としてarXivに公開した。途中の推論を文章にせずモデル内部で計算を重ねる設計で、色付きマス目の変換規則を当てるARC-AGI-1の公開評価セット400問でpass@2(2回までの解答で正解した割合)29.5%、費用は1問あたり計算上0.00070ドルだったと著者は報告している。9月22日にはScienceNewsが「AIは言葉なしで推論できるか」という問いとともにこの研究を取り上げた。著者はOpenAIのGPT-5.6 Lunaより約11倍安いと主張するが、その比較は評価に使った課題も費用の算定法も揃っておらず、ARC Prizeが値下げ後に測り直した値と並べると精度差は約10ポイントに開く。途中を言葉にしない小さなモデルが「安く推論できた」と言えるのは、どの条件の下なのか。

AD

例題を読むたびに書き換わる、大きさの変わらないメモリ

ARC-AGI-1は、入力と出力の色付きマス目を数組見せ、そこから変換規則を推定させて新しい入力に当てはめさせるベンチマークである。規則を示すこの入出力の組を、以下では例題と呼ぶ。

大規模言語モデル(LLM)は、2022年に提案された思考の連鎖(Chain-of-Thought)以降、答えの前に途中の手順を文章として書き出すことで難しい問題の正答率を上げてきた。書き出した文章はそのまま生成するトークンの数になる。考える手順が長いほど、待ち時間と計算費用も増えていく。

BDH-CQはこの途中の文章を作らない。論文によれば、モデルは例題を1組読み込むたびに固定サイズの再帰メモリを書き換える。例題が増えてもメモリは大きくならず、読んだ分だけ膨らみ続けるkey-valueキャッシュも持たない。問題をすべて読み込んだ後は、高次元の数値表現の上で計算を何度も繰り返し、途中の状態を言葉に戻さないまま答えのマス目だけを出力する。

途中を言葉にせず内部の数値表現のまま計算を重ねるこの方式は潜在推論と呼ばれる。PathwayのCEO、Zuzanna Stamirowskaは「途中の段階は一切言語に変換されない」とScienceNewsに説明した(原文:"Nothing in between ever converts into language.")。

推論の最中にパラメータは更新されない。未知の課題のやり方は、そのとき見せられた例題だけから読み取る。この文脈内学習(推論時に見せた例だけから学ぶこと)で解く点を、著者は設計の柱に据えている。評価課題の例題ペアや課題IDは学習に使っていないと著者は述べており、学習には独自に集めた例題のほか、ARC-AGI-1学習セット、RE-ARC、ConceptARC、ARC-Heavy、ARC-GEN100Kを組み合わせ、データ拡張を施した。

1問0.0007ドルの内訳

論文によれば、BDH-CQは400問のうち118問でpass@2の正解に届き、29.5%を記録した。1回目の解答だけで数えるpass@1では97問、24.25%になる。400問という規模から生じる揺らぎを示すWilson法の95%信頼区間は、pass@2で25.24〜34.15%だ。

費用は請求額ではない。著者は1問を解くのに要したNVIDIA H200の稼働時間を約0.85秒と実測し、H200を1時間3ドルで使えると置いて換算した。0.85秒分の利用料を3ドル毎時で割り当てた結果が、1問計算上0.00070ドル(0.1セント未満)である。この値は論文が主結果として報告する推論強度HIGH設定でのもので、論文の別の節ではSTANDARDやMIN設定など他の設定での1問あたり費用も報告されており、設定によって数字は異なる。

著者算定の1問0.00070ドルで計算すると、ARC-AGI-1の公開評価セット400問を一通り解く費用は約0.28ドル、H200の稼働時間は約340秒(約5.7分)になる。仮に2026年9月時点の1ドル150円で換算すると、400問一式で約42円、1問あたり約0.1円にあたる。

この数字には二つの前提がついている。一つは、学習にかかった費用を含まないことだ。もう一つは、著者自身が公開評価セットで実行した結果であり、ベンチマークを運営するARC Prizeの検証を経た値ではないことである。

AD

「約11倍」はどの数字から出たのか

値下げ前の精度と値下げ後の価格

論文が比較相手に選んだのは、OpenAIの低価格モデルGPT-5.6 Lunaを推論強度Lowで動かした結果だ。ARC Prizeが7月に公表した値は、ARC-AGI-1で34.2%、1問0.040ドルだった。著者はこの値と比べ、BDH-CQは約57倍安いと計算している。

OpenAIは7月30日、GPT-5.6 Lunaの価格を80%引き下げた。Axiosは、値下げ後の単価を入力100万トークン0.20ドル、出力1.20ドルと報じている。論文は、8月6日時点のARC Prizeのデータに値下げが反映されていなかったと書き、0.040ドル80%割り引いた0.008ドルで比べ直して約11倍という数字を出した。

ところが、並べた精度の34.2%は値下げ前の評価値のままである。ARC Prizeは値下げ後にGPT-5.6 Lunaを測り直しており、ARC-AGI-1の推論強度Lowは39.5%で1問0.008ドル、推論強度Maxは90.7%で1問0.065ドルだった。値下げ後のARC Prizeの再測定(推論強度Low、39.5%、1問0.008ドル)と組み合わせると、費用差は約11倍のままで、BDH-CQとの精度差は4.7ポイントから10.0ポイントに広がる。

計算は単純だ。費用比は0.008ドル÷0.00070ドルで約11.4倍になり、論文の約11倍と一致する。精度差は34.2%との比較なら4.7ポイントだが、39.5%と比べれば10.0ポイントになる。「約11倍安く、精度はわずかに劣る」という読み方は、値下げ前の精度と値下げ後の価格を組み合わせたときにだけ成り立つ。

評価課題と費用の算定法も揃っていない

組み合わせの問題を正しても、比較の土台はまだ揃わない。BDH-CQの29.5%は、誰でも入手できる公開評価セット400問を著者が自ら解かせた結果である。一方、ARC Prizeの検証済みリーダーボードは、一般には公開していない非公開評価セットを使う。

費用の数え方も違う。BDH-CQは実測したGPU時間に想定単価を掛けた値で、ARC Prizeは100万トークンあたりの公開価格などの小売価格から算定する。ScienceNewsも、両者の費用は計算方法が異なると記している。

システム ARC-AGI-1の精度 1問あたり費用 評価課題 費用の算定 時点
BDH-CQ 29.5%(pass@2) 0.00070ドル 公開評価セット(著者実行) 実測GPU時間×1時間3ドル 2026年8月論文
GPT-5.6 Luna(推論強度Low、当初) 34.2% 0.040ドル 非公開評価セット 小売価格 2026年7月
GPT-5.6 Luna(推論強度Low、値下げ後) 39.5% 0.008ドル 非公開評価セット 小売価格 2026年7月30日の値下げ後
GPT-6 Luna(推論強度Low) 37.7% 0.003ドル 非公開評価セット 小売価格 2026年9月22日公開
HRM(Hierarchical Reasoning Model) 32.0% 1.48ドル 非公開評価セット ARC Prize算定 9月23日時点
TRM(Tiny Recursion Model) 40.0% 1.76ドル 非公開評価セット ARC Prize算定 9月23日時点

表は順位づけのためのものではない。どの値がどの条件で測られたかを並べると、BDH-CQの行だけが評価課題と費用算定の両方で他と異なる。

9月23日時点でリーダーボードのテキスト版を確認した範囲では、ARC-AGI-1で29.5%以上を1問0.001ドル以下で出したエントリは見当たらず、GPT-6 Luna(推論強度Low)は37.7%を1問0.003ドルで出している。BDH-CQの0.00070ドルは著者が公開評価セットと実測GPU時間から算出した値で、条件は揃っていない。

著者は、BDH-CQがARC-AGI-1の費用と精度のパレートフロンティア(同じ費用でより高い精度、または同じ精度でより低い費用を出すシステムがない境界)を更新したと主張する。根拠は8月4日時点のリーダーボードとの比較だ。同じく内部で再帰的に計算するHRMとTRMは、評価課題の例題を最適化に使うため、ARC Prizeの算定で1問1.48〜1.76ドルかかる。推論時の例題だけで解くBDH-CQとは費用の構造が違う。

2022年の思考の連鎖から続く潜在推論の系譜

途中の推論を言葉にしない試みは、BDH-CQが最初ではない。主な研究をarXiv初版の投稿日で並べると次のようになる。

arXiv初版の投稿日 研究 内容
2022年1月28日 思考の連鎖(Weiら) 途中の推論を文章で書かせるプロンプト
2024年5月23日 Dengらの研究 文章で書いていた途中の推論をモデル内部の計算へ移す
2024年12月9日 Coconut(Meta) 連続的な数値表現の空間で推論する
2025年2月7日 再帰深度モデル(Geipingら) 計算の深さを再帰的に増やして潜在推論する
2025年6月26日 HRM 内部状態を再帰的に更新してARCなどを解く
2025年9月30日 BDH(Dragon Hatchling) PathwayのポストTransformer型アーキテクチャ
2025年10月6日 TRM 小規模ネットワークで再帰的に推論する
2026年8月10日 BDH-CQ BDHを土台にARC型課題を解く

思考の連鎖が2022年に途中の推論を文章で書かせた後、途中を言葉にしない研究は2024年5月のDengらの研究、同年12月のCoconut、2025年の再帰深度モデル、HRM、TRMと続いてきた。BDH-CQの著者は、推論時に見せた例題だけから未知の課題を学ぶ点を先行研究との違いに挙げる。

ScienceNewsにコメントを寄せた2人の研究者も、この系譜の当事者である。University of WaterlooのYuntian Dengは2024年5月の研究の筆頭著者で、ELLIS Institute TübingenとMax Planck Institute for Intelligent SystemsのJonas Geipingは再帰深度モデルの筆頭著者だ。Geipingの論文はBDH-CQ論文の関連研究にも引用されている。前身のBDHについては、XenoSpectrumも2025年10月18日に脳に着想を得た設計として紹介したが、その記事はARC-AGIでの成績を扱っていない。

AD

共著者の再現から第三者の再測定へ、次に要る3つの検証

Pathwayは29.5%という結果を、外部の評価者が再現したと説明している。論文によれば、Bielik AIのRemigiusz KinasとNew York UniversityのRichard Zhongが、モデルの重みにアクセスしないブラックボックス評価で、文書化した手順に沿って29.5%を再現した。ただし2人は論文の共著者に名を連ねている。Analytics India MagazineはŁukasz Kaiserを評価者のように挙げたが、Pathway自身の発表では、Kaiserは同社のアドバイザーで出資者という位置づけだ。

モデルの中身も多くが閉じたままである。論文は、内部表現の次元、メモリの更新則の詳細、実装、学習手順の全体を非公開と明記している。Pathwayは、独立した検証のためのAPIアクセスを要望に応じて提供するとしている。

能力の輪郭は、論文の制御実験がある程度示している。図形を境界まで伸ばす課題では、距離2〜8の48出力すべてで正解した。一方、長さ8の並べ替えは24問中0問しか解けず、テストと同じ難度の例題を1組加えると13問まで上がった。深さ5の入れ子構造も、例題の追加で24問中19問から24問すべてに改善した。変換を組み合わせる課題では、回転と移動が72問中72問、反転と移動が72問中47問、色の入れ替えと移動は72問中0問だった。

外部の研究者の評価も慎重だ。DengはScienceNewsに対し、これを「興味深い効率の結果」としつつ、アーキテクチャそのものが優れていることは示されていないと述べた。設計の効果と学習の効果を切り分ける追加の試験が要り、言葉にしない推論は中身を検査しにくいという。Geipingは手法を「neat(うまい)」と評し、再学習なしでテスト問題に取り組める点を挙げた一方、ARC型課題専用に作られているため汎用AIとの直接比較は難しいと指摘した。論文は言語課題でBDH-CQを評価しておらず、言語や数学への拡張は今後の方向として記すにとどめている。

これらを踏まえると、「安く推論できた」を確かめる検証は三つに絞られる。共著者以外の第三者がARC Prizeと同じ非公開評価セットと費用算定で測り直すこと、Dengが求めた設計と学習の切り分け、そして言語課題での評価である。Dengは「人間の言語は推論を伝えるには役立つが、途中のあらゆる計算にとって最も効率的な表現である必要はない」と語っている。三つの検証がそろえば、途中を文章にしない推論がパズルの外でも費用を抑える手段になるのかを、数字で判断できるようになる。