
Gemini 4 Argon とは?Claude Fable 5.1 に17項目中15項目で勝ち、GPT-6 Astra も上回った Google の新モデル
Google は2026年9月30日、Gemini 4 世代の最初のモデル「Gemini 4 Argon」を発表しました。CEO の Sundar Pichai 氏は X の投稿で「次のモデルについて多くの議論が出ているので、できるだけ早く見てもらいたかった」と書き、Claude Fable 5.1、GPT-6 Astra、Claude Opus 5.5 と並べた比較表を公開しています。
この記事のポイント
- Google の公式比較表で、Argon は Claude Fable 5.1 と両方の値がある17項目のうち15項目で上回った。負けたのは FrontierSWE v2 と Terminal-bench 4.0 の2項目
- 表の19行のうち、Argon の単独首位は13行。GPT-6 Astra は3行、Claude Opus 5.5 は2行で首位をとり、1行は Argon と Astra の同率
- 導入期間中の API 価格は Fable 5.1 と Astra の5分の1。ただし今使えるのはサイバー防御の組織と一部の試験利用者だけ
Argon の仕様と提供範囲
Gemini 4 Argon は、長時間にわたる複雑な作業を一度に進めることを狙った Google のフロンティアモデル(各社の最上位モデル)です。Google DeepMind の Koray Kavukcuoglu 氏は公式ブログで、得意分野を実際のソフトウェア開発、法務や財務などの企業の知識労働、サイバー防御の3つに絞って説明しています。
発表の要点は次のとおりです。
- 出力上限の拡大: 1回の応答で出せるトークン数を、従来の6万4,000から100万に増やした。長い推論や大規模なコード移行を、途中で人に戻さずに進めやすくなる
- 価格: 導入期間中は入力100万トークンあたり2ドル、出力10ドル。キャッシュした入力は95%引き。導入期間の後は入力4ドル、出力20ドルになる
- 提供範囲: まずは Google の Fairwind Program に参加するサイバー防御の組織に限って提供する。米国政府の公開前評価にも参加し、その後に API の有料利用者と Google AI Ultra の契約者へ広げる
Google 社内ではすでに数千人が使っています。Google によれば、動画デコーダー libgav1 では、Argon のエージェントが SIMD(複数のデータを1命令で並列処理する CPU 命令)を使った3万2,000行のコードを安全な Rust に置き換え、既存の Rust 版より2.7倍速くしました。データセンター全体のメモリ使用を分析し、300TiB 以上を空ける最適化も見つけています。
Google にとっては久しぶりの最上位モデルです。2025年11月の Gemini 3 以降は新しいフラッグシップを出しておらず、Gemini 3.5 Pro は開発を中止して、軽量な Flash 系列の改良を続けていました。
Claude Fable 5.1 との比較
公式の比較表で Fable 5.1 と Argon の両方に値がある17項目のうち、Argon は15項目で上回りました。差が大きいのは、業務の自動化、科学、長い文脈、図表の読み取りです。
| 分野 | ベンチマーク | Gemini 4 Argon | Claude Fable 5.1 | 差 |
|---|---|---|---|---|
| 知識労働 | AutomationBench | 51.3% | 31.4% | +19.9 |
| 科学 | LABBench 2 | 88.8% | 68.6% | +20.2 |
| 長い文脈 | GraphWalks(25.6万〜100万トークン) | 84.2% | 65.0% | +19.2 |
| 図表の理解 | Chartography | 71.6% | 46.2% | +25.4 |
| 動画の理解 | LVBench | 91.7% | 79.7% | +12.0 |
| 開発 | DeepSWE v1.1 | 77.9% | 67.4% | +10.5 |
| セキュリティ | CWE-bench v1 | 68.0% | 58.0% | +10.0 |
| 開発 | FrontierSWE v2 | 55.0% | 56.3% | −1.3 |
| 開発 | Terminal-bench 4.0 | 57.4% | 57.9% | −0.5 |
Fable 5.1 が勝った2項目は、どちらもソフトウェア開発の中でも難度の高い試験です。差はそれぞれ1.3ポイントと0.5ポイントで、ほぼ互角です。
開発系の試験で差が出たのは DeepSWE v1.1(長時間のソフトウェア開発)で、10ポイント以上離れました。一方、Vibe Code Bench(指示からアプリを作る試験)は Argon が91.9%、Fable 5.1 が90.3%で、日常的なコーディングでは大きな差はありません。
GPT-6 Astra と Claude Opus 5.5 との比較
表の19行(GraphWalks は文脈の長さで2行に分かれる)のうち、Argon は13行で単独首位、1行で同率首位でした。Astra と Opus 5.5 も、それぞれ得意な項目で首位を守っています。
| 首位をとった行 | モデル | 主な項目 |
|---|---|---|
| 13行(単独) | Gemini 4 Argon | Vals Index、AutomationBench、DeepSWE v1.1、LABBench 2、Agent's Last Exam など |
| 3行(単独) | GPT-6 Astra | FrontierSWE v2(65.5%)、Terminal-Bench Science 0.1(68.1%)、OSWorld-2.0(72.6%) |
| 2行(単独) | Claude Opus 5.5 | Terminal-bench 4.0(66.4%)、PostTrainBench(49.3%) |
| 1行(同率) | Argon と Astra | CWE-bench v1(68.0%) |
Fable 5.1 が首位をとった行はありません。Anthropic の中では、9月22日に出た Opus 5.5 のほうが Terminal-bench 4.0 などのエージェント系の試験で強く、API 価格も Fable 5.1 より60%安くなっています。
Terminal-Bench 4.0 は、公表された値に違いがあります。Anthropic が Opus 5.5 の発表時に公表した Fable 5.1 の Terminal-Bench 4.0 は55.8%でしたが、Google の表では57.9%です。Google の評価方法によれば、この試験の他社モデルの値は公式のリーダーボード(公開の成績一覧)から、各モデルで最も高い思考設定の値を取っています。どの設定の値を採るかで1〜2ポイントずれることがあり、Argon と Fable 5.1 の0.5ポイント差は、このずれより小さい差です。
比較表は Google が作成したものです。評価方法の文書によれば、他社モデルの数字は特に断りがない限り各社の公表値で、一部は公開のリーダーボードから取られています。Argon の数字は Google が測ったもので、第三者による再現はまだありません。試験ごとに条件が揃っているとは限らないので、数ポイント以内の差は目安として読んでください。
リークと公式発表の違い
発表の約2週間前に出回った「Astra と Fable 超え」のリークは、方向は合っていましたが、数字は外れていました。TechBriefly によれば、9月17日、比較サイト Arena に「gemini-3.8-flash」という名前で正体不明のモデルが現れ、開発者たちはそれを社内コード名 Argon の Gemini 4 Pro だと推測しました。
| 項目 | リークの数字 | 公式の発表 |
|---|---|---|
| DeepSWE v1.1 | 88% | 77.9% |
| 出力の上限 | 25万6,000トークン | 100万トークン |
| 価格(入力 / 出力、100万トークンあたり) | 2.25ドル / 11.25ドル | 2ドル / 10ドル(導入期間中) |
| 名前 | Gemini 4 Pro | Gemini 4 Argon |
「Argon」というコード名と、Astra と Fable を上回るという方向は当たりました。一方、DeepSWE の数字は公式より10ポイント以上高く、出力の上限は公式の4分の1でした。
Arena に出ていたモデルが最終版と同じだったのかは分かりません。開発途中の試作版だった可能性もあります。リークの数字を使った乗り換えの判断やコストの見積もりは、公式発表をもとに見直す必要があります。
提供開始に向けた比較の準備
Argon はまだ一般の開発者に開放されていません。手元の業務で公式の数字どおりに動くかは、提供が広がってから確かめることになります。それまでに、今使っているモデルと比べるための入力や期待する出力を用意しておけます。
準備としてできることは、業務の種類によって違います。
- 法務、財務、業務自動化の比重が大きい会社: Argon が最も差をつけた分野です。今 Fable 5.1 や Astra で回している作業から代表的なものを10件ほど選び、提供開始の日に同じ条件で比べられるよう、入力と期待する出力を揃えておく
- コーディングエージェントを日常的に使う開発チーム: ターミナル操作と最先端のコーディングでは、Opus 5.5 と Astra がまだ上で、Fable 5.1 ともほぼ互角です。全面的な乗り換えより、長時間のコード移行や大規模なリファクタリングのような、出力上限100万トークンが効く作業から試すのが現実的です
- コストを重視する会社: 導入期間中の価格は Fable 5.1 と Astra の5分の1です。ただし導入期間の長さは発表されておらず、期間が終われば Opus 5.5 と同じ価格になります。安い期間だけを前提にした設計は避けたほうが安全です
9月だけでも、GPT-6 Astra(3日)、Claude Opus 5.5(22日)、GPT-6.1 Sol(29日)、Gemini 4 Argon(30日)と、主要なモデルの発表が続きました。どれか1社に深く依存するより、後からモデルを差し替えられる作りにしておくほうが、こうした入れ替わりに強くなります。この考え方は AIエージェントの実装方式4種類の選び方 でも扱いました。
ZenChAIne では、日々の開発で Claude と GPT の両方を使い分けています。Argon も提供が広がり次第、実際の開発作業で比べた結果をお伝えします。
よくある質問
Q. Gemini 4 Argon はいつから使えますか?
A. 2026年10月1日時点では、Google の Fairwind Program に参加するサイバー防御の組織と、一部の試験利用者だけが使えます。Google は「できるだけ早く」開発者、企業、一般の利用者に広げるとしており、API の有料利用者と Google AI Ultra の契約者が最初になります。
Q. Gemini 4 Argon は Claude Fable 5.1 より優れていますか?
A. Google の比較表では、両方の値がある17項目のうち15項目で Argon が上回りました。Fable 5.1 が勝ったのは FrontierSWE v2 と Terminal-bench 4.0 の2項目で、差は1.3ポイントと0.5ポイントです。
Q. Gemini 4 Argon の料金はいくらですか?
A. 導入期間中は入力100万トークンあたり2ドル、出力10ドルで、キャッシュした入力は95%引きです。導入期間の後は入力4ドル、出力20ドルになります。導入期間の長さは発表されていません。
Q. 発表前のリーク情報は正しかったのですか?
A. 「Astra と Fable を超える」という方向とコード名 Argon は当たりましたが、DeepSWE の数字(リークは88%、公式は77.9%)や出力上限は外れていました。
参考ソース
- Introducing Gemini 4 Argon - Sundar Pichai(X)
- Gemini 4 Argon: our next era of frontier intelligence - Google
- Gemini 4 Argon evaluation methodology - Google DeepMind
- Google unveils Gemini 4 Argon, retaking benchmark lead over OpenAI and Anthropic — but in limited release - VentureBeat
- Google announces Gemini 4 Argon as its new frontier model - 9to5Google
- Anthropic releases Claude Opus 5.5, beating Fable 5.1 on key agentic benchmarks at 60% cheaper API price - VentureBeat
- Leaked Gemini 4 Pro benchmarks show it beating GPT-6 Astra and Claude - TechBriefly
