Gemini 4 Argon は、2026 年 10 月 3 日時点で Google の Fairwind Program に参加する組織の一部 しか使えません。Google は次に有料 API の顧客と Google AI Ultra の加入者へ広げるとしていますが、日付は公表していません。Ultra に加入しても、今日から使えるわけではありません。

Google が Gemini 4 Argon を発表したのは 2026 年 9 月 30 日 (米国時間) です。9 月は GPT-6 Astra、Claude Fable 5.1、GPT-6 Sol・Luna、Claude Opus 5.5 と新しいモデルが続きました。組織の標準モデルを決めたばかりの開発責任者にとって、「GPT-6 Astra や Claude を上回る」という見出しは、選定をやり直すべきかを迷わせます。

この記事では、Argon について公式に確定していることと書かれていないことを分け、他社の現行モデルと単価・ベンチマークを並べます。結論は「今は標準モデルを変えず、提供開始の日に比べる準備をしておく」です。根拠は Google の英語版の公式ブログ、DeepMind のモデル紹介と評価手法の資料、Gemini API のドキュメントで、いずれも 2026 年 10 月 3 日に確認しました。FIXIT は Argon を使える立場になく、本記事は実機での評価ではありません。

Gemini 4 Argon で確定していること

公式ブログと DeepMind のページで確認できる事実を先に並べます。

項目内容
発表日2026 年 9 月 30 日 (米国時間)。日本語版のブログは 10 月 1 日
位置づけ実務のソフトウェア開発、法務・財務などの知識業務、サイバー防御に向けたモデル
いま使える範囲Fairwind Program の参加組織の一部
次の提供先有料 API の顧客と Google AI Ultra の加入者 (日付なし)
導入価格100 万トークンあたり入力 $2・出力 $10。キャッシュ入力は入力単価の 95% 引き
導入期間後の価格100 万トークンあたり入力 $4・出力 $20
出力上限100 万トークン (従来は 64K)

出力上限の 100 万トークンは、1 回の応答で出せる量の上限です。読み込める入力の長さとは別の数字で、入力のコンテキスト長は公式ブログの本文に書かれていません。ブログ冒頭の AI 生成の要約には「1 million token limit」とだけあり、入力の上限と読めてしまいますが、本文の該当箇所は出力上限の説明です。

Google は社内での使い方も報告しています。C/C++ のコードを Rust へ移す作業を、re2 や libgav1 のような数万行のライブラリから、80 万行を超える Fuchsia の Zircon カーネルまで進めています。動画デコーダーの libgav1 では、既存の Rust 版の SIMD コード 3.2 万行を置き換え、出力を変えずに Rust 版より 2.7 倍速くしたとしています。データセンターのメモリ最適化で 300 TiB 以上を空けた例もあります。いずれも Google 自身の報告で、大規模な書き換えは、本番に投入する前の自動・手動の監査、エミュレーションテスト、レビューを受けている段階です。自社のコードベースで同じ効果が出る根拠にはなりません。

公式に発表された「Gemini 4」のモデルは Argon だけです。Pro や Flash に当たるモデルについて、公式ブログにも DeepMind のページにも記載はありません。

いつ使えるか — 今は Fairwind Program の参加組織だけ

公式ブログが示しているのは段取りだけです。

  1. Fairwind Program を通じて、信頼できるサイバー防御の担当者へ展開する (発表時点)
  2. 米国政府のリリース前アクセスの枠組みに参加しながら、アクセスを段階的に拡大する
  3. 初期テスターの意見を聞いてガードレールを改良し、開発者・企業・一般の利用者へ公開する。公開は有料 API の顧客と Google AI Ultra の加入者から始める

3 について、ブログは「できる限り早く」と書くだけで日付はありません。

一般提供の前に強めるとしている安全対策は 4 つあります。サイバー攻撃や CBRN (化学・生物・放射性物質・核) への悪用の防止、間接プロンプトインジェクションへの耐性、思考の過程と行動を監視して必要なら実行を止める仕組み、そして学習や評価に使うサンドボックス環境の隔離です。どれも完了の目安が示されていないため、提供時期はこの先も読みにくい状態が続きます。

Gemini 4 Argon の使い始め方 — 今すぐ使う道と、提供開始までに用意すること

2026 年 10 月 3 日時点で Argon を使い始める道は、Fairwind Program に参加することだけです。それ以外の組織は提供開始を待つことになりますが、待つ間に契約と評価の準備は進められます。

立場いまできること
Fairwind Program の対象に当たる組織公式ページの申し込みフォームから参加を申請する
Gemini API で試したい開発チームプロジェクトを有料枠にし、評価タスクを用意しておく
Gemini アプリで試したい利用者契約中のプランを確かめ、提供開始の告知を待つ
脆弱性対策に使いたい対象外の組織公開済みのモデルで CodeMender を使う

Fairwind Program に申し込む

Fairwind Program は、防御側に先に高度なモデルを渡すための Google DeepMind のプログラムで、650 を超えるパートナーが参加しています。その一部が Argon を単体で、またはコードの脆弱性修正エージェント CodeMender と組み合わせて使えます。公式ページの記載を、申し込みの流れに沿って並べると次のとおりです。

  1. (申し込み前に) 自組織が優先対象に当たるかを確かめる。公式 FAQ が挙げる優先対象は、政府と国のサイバー当局、重要インフラの事業者 (医療・通信・エネルギー・金融など)、多くの利用者を抱える中核の技術基盤の 3 つ
  2. 公式ページの「Apply for access」から申し込みフォームを送る
  3. Google が申し込んだ組織の身元を調べ、セキュリティの経歴や倫理的な運用の実績を確認する
  4. 条件を満たした組織に、Google から返答がある (所要期間は「できる限り早く」とだけ書かれている)

参加組織は、利用者単位の認証、フィッシング耐性のある多要素認証 (MFA)、アクセス制御などの条件に同意します。Argon を使わせてよいのは社内のサイバーセキュリティ・インシデント対応・ペネトレーションテストのチームに限られ、従業員の利用を記録する必要もあります。用途は許可された脅威シミュレーション、リバースエンジニアリング、マルウェア解析などの防御・研究目的に限られ、アクセスの共有や再販はできません。

一般の企業の開発チームが、日々の開発に使う目的で参加できる枠ではありません。公式 FAQ は、防御的なベンチマークに取り組む学術機関の研究室からの申し込みも歓迎するとし、学生には Google Cloud の CodeMender を勧めています。なお、ゼロデータ保持 (Gemini Enterprise のマネージドモデルとして使う場合) は Fairwind の参加組織向けの FAQ にある記載で、一般提供後の条件は書かれていません。

有料 API・Google AI Ultra での提供を待つ場合に用意すること

次の提供先は「有料 API の顧客」と「Google AI Ultra の加入者」です。API で試すつもりなら、使うプロジェクトを Gemini API の有料枠にしておきます。Gemini API の課金ガイドによると、Google AI Studio のプロジェクトに請求先アカウントを紐づけると有料枠 (Tier 1) になります。設定の途中で最低 $5 の前払いを求められるのが基本で、後払いを選べるアカウントもあります。前払いの場合は、残高が無いとリクエストは処理されません。

ただし、Argon が有料枠のどの Tier から使えるのか、Tier ごとのレート制限がどうなるのかは書かれていません。有料枠にしておけば提供開始の日に必ず使える、とは言えない点に注意してください。モデル ID とエンドポイントも未公表なので、設定ファイルやコードに仮の名前を書き込むのは避け、公表されてから入れます。

Gemini アプリで試すつもりなら、組織や個人の契約が Google AI Ultra かどうかを確かめておきます。Ultra 以外のプランで、いつ使えるようになるかは書かれていません。Argon を目的に契約を変えるかは、提供開始の告知を見てから決めても遅くありません。

どちらの経路でも、比べる評価タスクを先に用意しておくと、提供開始の日から比較を始められます。中身は後半の「提供開始の日に比べる項目」で扱います。

公表されたら確かめる場所

2026 年 10 月 3 日時点で、次のページに Argon の記載はありません。

API で使えるようになったかは、変更履歴とモデル一覧で確かめるのが確実です。モデル一覧に載れば、モデル ID と合わせて入力の上限も確かめられるはずです。Gemini API の料金表の読み方は、Gemini 3.8 Live の料金を整理した記事も参考になります。

Fairwind の対象外でも、脆弱性対策は始められる

Argon は脆弱性を自律的に見つけ、確かめ、修正できるとされ、Fairwind の参加組織と Google 社内には、サイバー関連のガードレールを外した状態で提供されます。この能力に期待している情報システム部門やセキュリティ担当の方もいるでしょう。

対象外の組織について、公式 FAQ は「公開済みのモデルで CodeMender を使ってコードを守れる」と案内しています。Argon を待たずに始められるのは、AI が書いたコードを含めたレビューと脆弱性の検出を、開発の流れに組み込むことです。設計の考え方は AI 駆動開発のセキュリティ設計にまとめています。

料金 — 導入価格は GPT-6 Sol と同額、導入期間後の価格は Claude Opus 5.5 と同額

導入価格と導入期間後の価格

区分入力キャッシュ入力出力
導入価格$2$0.10$10
導入期間後の価格$4記載なし$20

単位は 100 万トークンあたりの USD です。導入価格のキャッシュ入力は、「入力単価の 95% 引き」という公式の記載から計算しました。導入期間後の価格は英語版ブログの脚注にだけ書かれており、日本語版のブログには載っていません。

導入期間がいつ終わるかは書かれていません。導入期間後のキャッシュ入力の単価も、95% 引きが続くかを含めて記載がありません。予算を組むときは、導入価格だけでなく導入期間後の価格でも試算しておくと、切り替わった月に組み直さずに済みます。

他社モデルとの単価比較

Google のベンチマーク表で比較相手になっている 3 モデルに、入出力の単価が Argon の導入価格と同じ GPT-6 Sol と GPT-6.1 Sol を加えて並べます。

モデル入力キャッシュ入力出力
Gemini 4 Argon (導入価格)$2$0.10$10
Gemini 4 Argon (導入期間後の価格)$4記載なし$20
GPT-6 Astra$10$1.00$50
GPT-6 Sol$2$0.20$10
GPT-6.1 Sol$2$0.10$10
Claude Opus 5.5$4$0.20$20
Claude Fable 5.1$10$0.25$50

他社の単価は OpenAI の料金ページ の Standard (入力 272K トークン以下) と、Anthropic の料金ページ の基本単価を、2026 年 10 月 3 日に確認したものです。OpenAI と Anthropic のキャッシュ入力は読み取りの単価で、どちらもキャッシュの書き込みは別に課金されます。GPT-6.1 Sol は OpenAI DevDay 2026 で発表されたモデルで、提供範囲は DevDay 2026 の発表まとめで扱っています。

入力と出力の単価だけを見ると、Argon の導入価格は GPT-6 Sol や GPT-6.1 Sol と同じで、GPT-6 Astra と Claude Fable 5.1 の 5 分の 1 です。キャッシュ入力は GPT-6.1 Sol と同じ $0.10 です。導入期間後の価格は Claude Opus 5.5 と同じになります。

ただし、単価が安くても 1 タスクの費用が安いとは限りません。出力単価が半分でも、同じ作業に 2 倍の出力トークンを使うモデルなら費用は同じです。Argon は出力上限を 100 万トークンまで広げ、長く考えて一度に解く使い方を前面に出しています。Argon が 1 タスクにどれだけ出力するかを示す公式の数値は、まだありません。単価表ではなく、同じタスクを流したときの課金額で比べてください。費用の測り方は LLM アプリのコスト最適化で扱っています。

ベンチマークの読み方 — 18 項目中 13 で首位、Terminal-bench 4.0 と OSWorld-2.0 では首位を譲る

作業の種類ごとの勝ち負け

Google が DeepMind のモデル紹介とブログに載せた表を並べます。「作業の種類」は Google の表の分類を訳したものです。GraphWalks は入力の長さで 2 区分ありますが、1 項目と数えています。

作業の種類ベンチマークArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5首位
知識業務Vals Index68.9%63.1%65.8%67.0%Argon
知識業務AutomationBench51.3%41.4%31.4%42.5%Argon
知識業務Vals Finance Agent v265.4%53.5%58.9%58.6%Argon
知識業務Harvey's Legal Agent Benchmark19.6%5.4%6.7%3.8%Argon
コーディングDeepSWE v1.177.9%74.1%67.4%74.2%Argon
コーディングFrontierSWE v255.0%65.5%56.3%62.3%GPT-6 Astra
コーディングVibe Code Bench91.9%89.6%90.3%90.3%Argon
コーディングTerminal-bench 4.057.4%58.2%57.9%66.4%Claude Opus 5.5
ML エンジニアリングPostTrainBench45.3%44.3%40.2%49.3%Claude Opus 5.5
科学・数学Terminal-Bench Science 0.157.6%68.1%52.6%63.3%GPT-6 Astra
科学・数学LABBench 288.8%85.4%68.6%73.1%Argon
科学・数学RiemannBench76.0%72.0%65.6%69.6%Argon
長いコンテキストGraphWalks (128k まで)99.7%98.7%91.4%90.6%Argon
長いコンテキストGraphWalks (256k〜1M)84.2%71.8%65.0%66.8%Argon
画面操作Agent's Last Exam39.5%34.2%—38.2%Argon
画面操作OSWorld-2.0 (offline subset)69.2%72.6%——GPT-6 Astra
画像・動画の理解Chartography71.6%71.0%46.2%66.3%Argon
画像・動画の理解LVBench91.7%87.5%79.7%83.7%Argon
サイバー防御CWE-bench v168.0%68.0%58.0%67.0%Argon・GPT-6 Astra (同率)

Argon が首位 (同率を含む) なのは 18 項目中 13 で、CWE-bench v1 の同率を除くと 12 です。2 位との差は項目によって大きく違います。Harvey's Legal Agent Benchmark では 12.9 ポイント (2 位の約 2.9 倍)、GraphWalks の 256k〜1M では 12.4 ポイント、AutomationBench では 8.8 ポイントの差があります。一方で Vals Index は 1.9 ポイント、GraphWalks の 128k まででは 1.0 ポイント、Chartography では 0.6 ポイントの差にとどまります。

首位でない 5 項目は、FrontierSWE v2・Terminal-Bench Science 0.1・OSWorld-2.0 (いずれも GPT-6 Astra が首位) と、Terminal-bench 4.0・PostTrainBench (いずれも Claude Opus 5.5 が首位) です。Claude Code や Codex をターミナル中心で使う開発チームにとって、見ておきたいのは Terminal-bench 4.0 です。Argon は 57.4% で 4 モデルの中で最も低い値でしたが、GPT-6 Astra (58.2%) と Claude Fable 5.1 (57.9%) との差は 1 ポイント未満です。首位の Claude Opus 5.5 (66.4%) とは 9.0 ポイント離れています。FrontierSWE v2 でも Argon は 55.0% で 4 モデル中最も低く、首位の GPT-6 Astra (65.5%) とは 10.5 ポイントの差があります。同じコーディングでも、DeepSWE v1.1 では首位なので、項目によって順位が入れ替わります。

数値の出どころは項目ごとに違い、測り方も揃っていない

Google の評価手法の資料 (PDF) には、表の数値の出どころが書かれています。Argon の数値は、Gemini API で最も高い thinking 設定を使い、1 回の試行で解けた割合 (pass@1) です。他社の数値は、資料の原則では各社の公表値で、最大の推論設定の値を使っています。ただし表の 18 項目すべてに個別の注記があり、出どころは Vals AI や Zapier などの公開リーダーボード、各社のシステムカードや公式ブログ、Google の自前の計測に分かれています。

項目ごとの注記には、比べ方の違いが具体的に書かれています。

  • DeepSWE v1.1 と Terminal-bench 4.0 は、Argon だけを Google が自前で測り、他社は公開リーダーボードやシステムカードの値を引用している
  • Terminal-Bench Science 0.1 も Argon だけ Google が測り、検証の制限時間を 6 倍に延ばしている
  • PostTrainBench・LABBench 2・GraphWalks・LVBench は、4 モデルとも Google が測っている
  • OSWorld-2.0 の Argon は 3 回測った中の最高値。Anthropic は online と offline を合算した値しか出しておらず、Claude の欄は空いている
  • LVBench は、Gemini が 1 秒 1 フレーム、GPT-6 Astra が 800 フレーム、Fable 5.1 が 300 フレーム、Opus 5.5 が 600 フレームと、API の制約で入力の条件が違う
  • Agent's Last Exam の Fable 5.1 は、公開リーダーボードに無いため載っていない

同じ表に並んでいても、同じ条件で測った数字ではない項目があります。差が数ポイントの項目は、測り方の違いで順位が入れ替わってもおかしくありません。

FIXITFIXIT

13 項目で首位なら、もう Argon に決めていいんじゃないの?

IrodoriIrodori

数字の出どころも測り方も、項目ごとに違います。条件が揃っていない数字で順位を決めると、比較が崩れます。

FIXITFIXIT

じゃあ、表のどこを見ればいいの?

IrodoriIrodori

自社の作業に近い行です。ターミナル中心のチームなら、Terminal-bench 4.0 の差を先に見てください。

第三者の評価

第三者の評価で確認できたのは、Vals AI の Vals Index です。2026 年 10 月 2 日更新の版で、Argon は 43 モデル中の首位 (68.90%) でした。2 位は Claude Sonnet 5.5 の 67.04%、3 位は Claude Opus 5.5 の 66.97% です。Google の表にある Vals Index の値も、この Vals AI の結果を引用したものです。

Vals Index は金融・コーディング・法務・税務の作業を、米国 GDP への寄与で重み付けした指標です。開発チームの日常の作業に近いとは限りません。他の第三者評価の数値は記事によって食い違っていたため、本記事では使っていません。

公式に書かれていないこと

2026 年 10 月 3 日時点で、公式ブログ・DeepMind のページ・Gemini API のドキュメントのどこにも書かれていない項目を並べます。社内の計画書やロードマップに Argon を書くときは、この表の項目を確定事項として扱わないでください。

項目公式に書かれている範囲提供開始後に確かめる場所
有料 API・Google AI Ultra での提供日提供の順番だけGemini API の変更履歴
Gemini API のモデル IDなしGemini API のモデル一覧
入力のコンテキスト長出力上限の 100 万トークンだけモデルページ・モデルカード
導入期間の終了日終了後の入出力の単価だけGemini API の料金ページ
導入期間後のキャッシュ入力の単価なしGemini API の料金ページ
Gemini アプリで使えるプラン「Google AI Ultra の加入者から」とだけGemini のプランページ
Vertex AI での提供なしVertex AI のモデル一覧
Gemini 4 の他のモデル (Pro・Flash など)なしGoogle の公式ブログ

「書かれていない」は「提供されない」という意味ではありません。たとえば Vertex AI で使えるかは、記載が無いだけで、使えないと決まったわけではありません。発表前から「Gemini 4 Pro」などの予想記事がありますが、公式の情報ではないため本記事では扱いません。DeepMind のモデルカードのページも、10 月 3 日時点ではまだ公開されていません。

今の標準モデルから乗り換えるかの判断 — 待つ間に評価タスクを用意する

今は標準モデルを変えない

使えないモデルを前提に、今の選定を止める理由はありません。Argon が使えるようになるまでは、GPT-6 Astra・GPT-6 Sol・Claude Opus 5.5 など、いま決めているモデルをそのまま使ってください。各モデルの提供範囲と移行の手順は、GPT-6 Sol・Luna の記事や Claude Opus 5.5 の記事にまとめています。

一方で、提供が始まった日に「なぜ試さないのか」と社内で聞かれることはありえます。そのときに慌てないよう、比べる材料だけは先に用意しておきます。待つ期間にやることは、評価タスクと記録の形を決めることです。

Gemini を開発ツールから使う場合の選び方は、Gemini Code Assist と Claude Code の比較を参照してください。個人向けの Gemini CLI と Gemini Code Assist の IDE 拡張は 2026 年 6 月 18 日で終わっているため、契約の形は Gemini CLI の移行の記事で確かめてください。

提供開始の日に比べる項目

評価タスクは、自社のリポジトリで実際にあった作業から選びます。コーディングのように、項目によって Argon が首位にも最下位にもなった作業の種類を、意識して含めてください。

タスクの種類例近いと考えられるベンチマーク (筆者の対応づけ)
日常の修正バグ修正、小さな機能追加、テストの追加DeepSWE v1.1 (Argon が首位)
大きめの移行ライブラリの更新、モジュール単位の書き換えFrontierSWE v2 (Argon は 4 モデル中で最も低い)
ターミナル操作を含む作業ビルドやテストの失敗の調査、環境構築の手順の再現Terminal-bench 4.0 (Argon は 4 モデル中で最も低い)

種類ごとに数本ずつ、完了の条件 (どのテストが通れば完了か) を先に書いておきます。完了の条件を後から決めると、結果を見てから基準を動かすことになります。

提供が始まったら、同じタスクを現行のモデルと Argon で、同じツールで流し、各モデルの推論設定を記録します。記録する項目は次のとおりです。

タスク ID / 種類 / モデルと推論設定 / 完了したか (テストが通ったか)
/ 人が直した回数 / 所要時間 / 入力・出力トークン数 / 課金額

切り替えるかどうかは、完了率が現行と同等以上で、1 タスクあたりの課金額が見合うかで決めます。費用は導入価格と導入期間後の価格の両方で計算してください。ターミナル操作を含む作業だけ完了率が下がるなら、その種類の作業は現行のモデルに残す使い分けも選べます。評価の回し方は LLM の評価ハーネスの記事でも扱っています。

FIXITFIXIT

使えるようになるまで、何もしなくていいってこと?

IrodoriIrodori

標準モデルは変えなくて構いません。比べるタスクと記録の形は、先に揃えておくと後が楽です。

FIXIT のおすすめ — 新しいモデルは、同じタスクで比べてから既定を変える

FIXIT は Argon を使える立場になく、ここまでの内容は発表資料を読み解いたものです。新しいモデルが出たときは、発表の数値ではなく、自社の代表的なタスクを同じ条件で流した結果で既定を変えるかを決める運用をおすすめします。比べるタスクと記録の形を先に決めておけば、提供が始まってから準備を始める必要はありません。9 月のように新しいモデルが続いても、比べる作業そのものは毎回同じにできます。

複数のベンダーのモデルを並行して使い、評価と切り替えの段取りを組織の手順にしたい場合は、AI 開発ツール定着支援でご相談いただけます。脆弱性対策を AI でどこまで進めるかの検討は、情報セキュリティコンサルタントでも扱っています。

まとめ

Gemini 4 Argon は、2026 年 10 月 3 日時点で Fairwind Program の一部の参加組織しか使えません。次は有料 API と Google AI Ultra ですが、日付は公表されていません。導入価格は GPT-6 Sol と同額、導入期間後の価格は Claude Opus 5.5 と同額で、導入期間の終了日は書かれていません。

ベンチマークは 18 項目中 13 で首位ですが、Terminal-bench 4.0 や OSWorld-2.0 を含む 5 項目では首位を譲っています。数値の出どころも項目ごとに違い、同じ条件で測った比較ではありません。今は標準モデルを変える必要はありません。

まずは、自社の作業から評価タスクを数本選び、完了の条件と記録の形を決めてください。提供開始の日に同じタスクで比べられれば、乗り換えの判断にかかる時間は短くなります。モデルの評価や切り替えの手順づくりを相談したい場合は、お問い合わせからご連絡ください。