フランスのH Companyは9月28日、画面操作とコード実行を組み合わせ、外部ツールも呼び出せるAIモデル群「Holo4」を公開した。人間向けの画面をクリックするだけでなく、同じモデルが作業に応じて操作手段を選ぶ設計で、モデルの重みとAPIを提供する。ただし、長い作業を評価するOSWorld 2.0で、主力27B版の部分点を含むスコアは61.7%、完全成功率は41.5%だった。画面を扱える能力が、仕事を最後まで終える能力にどこまでつながるか。その違いは、安いモデルを選ぶ際の費用計算にも表れる。

AD

クリックとコードをつなぐHolo4

Holo4-27Bは270億パラメーターの密モデルで、AlibabaのQwen3.8-27Bを基盤とする。もう一方のHolo4-35B-A3BはQwen3.6-35B-A3Bを基盤とし、総パラメーター350億のうち、推論時に約30億を活性化するMoEモデルだ。HはNVIDIAのNemotron 3 Nano Omniを追加学習したHolotron4 Nanoも併せて公開した。

GUIとは、ボタンや入力欄を見て操作する画面のことである。APIはソフトウェアの機能をプログラムから呼び出す窓口で、MCPはAIが外部ツールを利用するための共通規格だ。Holo4は画面でのクリックや入力を行い、自らコードを書いて実行することも、MCPやAPI経由で機能を呼び出すこともできる。同社は、デスクトップやWebに加え、Androidでも同じモデルを使えると説明している。

例えば、業務システムから情報をAPIで取り出し、APIを備えない古いアプリへ画面から入力する仕事を考える。画面操作だけのAIなら、機械向けの窓口がある場面でもクリックを重ねることになる。逆に、ツール呼び出しだけに頼れば、画面からしか操作できないアプリで止まる。両方を扱えるモデルには、アプリごとに利用できる手段を変えながら作業を続けられる余地がある。これは設計から考えられる用途であり、Hがこの業務を実運用したという報告ではない。

HはFreeCADでエッフェル塔を作るデモも示した。コードで形状を組み立てる機能を持つソフトでは、操作画面の理解とプログラムを書く能力を組み合わせる意味がある。個別の作例が成功しても、任意の設計業務を無人で任せられることまでは示さない。

画面操作やローカル実行そのものが、今回初めて登場したわけではない。前世代のHolo3.1は、すでにWeb、デスクトップ、モバイルへの対応を掲げ、関数呼び出しと量子化した重みを提供していた。Holo4で注目したいのは、複数の操作手段を使う能力を、どう学習させ、長い仕事へつなぐかという設計である。

二つの専門学習と長期作業の記憶

Hは今回の学習方法で、画面を扱う能力とツールを使う能力を別々に鍛え、最後に統合した。まず教師あり学習を行い、その後、デスクトップとWebを担当する系統、端末のコマンドやMCP・APIを担当する系統に分けて強化学習を施す。小さな追加パラメーターでモデルを調整するLoRAを用い、両系統を等しい重みで統合し、その後の追加学習は行わないという。これは学習手順の説明であり、35B版のMoE構造を二つに分けるという意味ではない。

学習用の課題を作る「Agentic Task Factory」は、資料やソフトウェアをもとに、操作環境と達成すべき仕事を生成する仕組みだ。Hによると、これまでに約1万件の課題を作った。検証器には、何もしていない状態を不合格にし、正しく作業した状態を合格にするだけでなく、正解に近い誤りも退けることを求める。画面上でそれらしく振る舞うだけでは、仕事の完了を確認できないためだ。

モデルの能力を実際の操作へ変えるのは、周囲の実行基盤である。モデルカードが示す動作は、スクリーンショットとツールの結果をモデルへ渡し、返されたクリックやコードを実行して、その結果を再び返す循環だ。モデルの重みを読み込むだけで、PCが自動的に動き始めるわけではない。

Hはこの実行基盤も作り直した。数百手順の経過を追う記憶を設け、操作対象のデスクトップ上でコマンドを実行できるようにしたほか、画像処理の不具合などを修正した。評価時に許す操作回数や時間も拡大し、最大500手順、6時間へ変更している。これは平均所要時間ではなく上限だ。モデルを賢くすることと、途中の状態を忘れずに操作を続けさせることの両方が、長い作業の成績に関わる。

AD

1回の単価と、仕事が終わるまでの費用は違う

Hが掲げる27B版のOSWorldスコア85.2%を、長期作業の成功率として読むことはできない。別の評価であるOSWorld 2.0では、途中までの達成にも点を与える平均スコアと、課題を成功させた割合が分けて示されている。9月28日の公式評価表から、Holo4の2モデルを抜き出すと次のようになる。

OSWorld 2.0での指標 Holo4 27B Holo4 35B-A3B
部分点を含む平均スコア 61.7% 30.9%
完全成功率 41.5% 12.3%
1試行あたりのモデル費用 1.22ドル 0.61ドル

費用は同社が数えた入出力トークンをH Models APIの料金で換算したもの。両モデルとも、この評価では各課題を1回ずつ実行した結果である。61.7%という数字は「約6割の仕事を完了した」という意味ではない。課題を完全に成功させた割合を見るなら、41.5%を使う必要がある。

Holo4の公表値から失敗分を含む完全成功1件あたりのモデル費用を算出すると、27B版は約2.94ドル、35B-A3B版は約4.96ドルとなる。

計算は、27B版が「1.22÷0.415」、35B版が「0.61÷0.123」だ。全試行のモデル費用を、完全成功した件数で割るのと同じ計算になる。1回の料金は35B版が安いが、この評価の成功率を分母に置くと27B版のほうが安くなる。元の公表値が丸められているため、結果も概算である。

ただし、この値にPCや仮想環境の運用費、人が失敗を直す費用は含まれない。同じ仕事を何度も再試行した場合の期待費用でもなく、実際の業務で同じ成功率になるという予測でもない。それでも、モデルを選ぶ際に試行単価だけで済ませてよいか、という問いには具体的な答えを与える。

他社のモデルとの順位にも条件がある。Hの比較表は、各社が異なる実行基盤や推論設定で測った数字を並べており、評価対象の課題群も一致していない。OSWorld側の公開文書も、コードと課題、実行環境を同じ版にそろえるよう求めている。9月16日には修正版の2.1も公開された。版を確かめずに数値を並べても、モデルだけの性能差を取り出したことにはならない。

API操作を評価するAutomationBenchにも、別の留保がある。Hが公表した成績は公開600課題のもので、そのうち480課題は同社が学習データを収集した分割に含まれる。残る120課題については別に点数を示し、非公開の公式評価は今後行うとしている。「480課題すべてを学習に使った」とは断定できないが、公開課題の成績を未知の業務への強さと同一視することもできない。

公開重みの条件と、端末で動かすための余裕

27B版と35B版は、公開重みの利用条件が異なる。27B版のモデルカードは非商用のCC BY-NC 4.0を、35B-A3B版はApache 2.0を掲げる。元のQwenがApache 2.0でも、追加学習後の27B版が同じ条件になるわけではない。企業が自社で動かすモデルを選ぶなら、性能表と同時に確認する項目だ。HのAPI利用契約については、公開重みのライセンスとは別に確認する必要がある。

重みはBF16に加え、FP8やNVFP4、4ビットのGGUF形式で提供される。量子化は保存や計算に使う精度を抑えてモデルを軽くする方法で、GGUFはローカル推論で使われる形式だ。ただし、35B版で活性化するのが約30億パラメーターという説明を、保存する重みも30億分だけでよい、と読み替えることはできない。

4ビットで重みだけを単純計算すると、27B版は「270億×4÷8」で約13.5GB、35B版は「350億×4÷8」で約17.5GBになる。これはパラメーター数から求めた概算で、画像の処理や、過去の入力を保持するメモリーなどは別に必要だ。モデルが収まることと、長い作業を快適に回せることには差がある。特定の24GB GPUで実務が動く保証にはならない。

実行の中身を確かめる材料として、Hはベンチマークの操作履歴も公開した。記録にはモデルの思考と操作、ツールの結果が含まれ、画面の画像も付く。成功したか、部分点はいくつか、どれだけ時間と手順を使ったかも追える。ただし、個人情報などを隠し、一部の画像や課題は除外しているため、すべての生データをそのまま公開したものではない。公開は第三者が検証する材料であって、それ自体が独立した再現試験の結果ではない。

Hは補助モデルを使って推論を速めるDSparkの重みも数日以内に公開する予定だ。速度改善の余地はあるが、導入判断では、使える操作手段と利用条件をそろえたうえで、自社の作業がどこで止まり、正常に完了した件数に対して総費用がいくらかかるかを測る必要がある。その検証を経て初めて、APIを持つシステムと画面しか持たないアプリを、同じAIにまたがせる価値を判断できる。