PLUS
生成AIコラム
うさぎでもわかるGemini 4 Argon 出力100万トークンの新フロンティアモデル

はじめに
2026年9月30日、Google DeepMindが新しいフロンティアモデル「Gemini 4 Argon」を発表しました。
先に、この記事のポイントを3行でまとめます。
- 出力トークン上限が64Kから100万へ より長く複雑な用途に対応するための拡大です
- 公表された18項目のベンチマークのうち12項目で単独首位、1項目で同率首位 特に知識業務、超長文の読解、長時間動画の理解で大きな差をつけています
- 最初はサイバー防御者へ限定提供 Fairwind Programのパートナーから提供が始まり、その後は有料APIユーザーとGoogle AI Ultra契約者から順に広がる予定です

出典 Gemini 4 Argon our next era of frontier intelligence(Google公式ブログ)
この記事の情報は、2026年10月1日時点の公式発表をもとにまとめています。
生成AIの社内利用をお考えの企業様へ
ナレフルチャットは初心者でも使いやすい設計で、組織全体への生成AI浸透を支援するツールです。プロンプト自動生成機能や社内共有機能により、AIリテラシーに差があっても全員が活用できます。企業のAI導入を検討している方は、こちらをご覧ください。
Gemini 4 Argonとは?
長く複雑な仕事を最後まで考え抜くための、Gemini 4世代のフロンティアモデルうさよ🐰
長時間の仕事に向けたフロンティアモデル
Gemini 4 Argonは、長時間かつ何ステップにもわたる仕事(ロングホライズンタスク)で深い推論を続けられるように作られたモデルです。
公式ブログでは、重点領域として次の3つが挙げられています。
| 領域 | 具体例 |
|---|---|
| ソフトウェアエンジニアリング | 実際の開発タスク、大規模なコードベース移行、デバッグ |
| エンタープライズの知識業務 | 法務のリサーチと起案、金融リサーチ、業務フローの自動実行 |
| サイバーセキュリティ防御 | 脆弱性の発見、検証、パッチ作成 |
Google社内ではすでに数千人の社員がArgonを使っています。エンジニアは、日々のデバッグから大規模なコードベース移行、アルゴリズム設計まで、日常業務に活用していると紹介されています。
出力トークン上限が100万へ
いちばん目を引く変化は、出力トークン上限が従来の64Kから100万トークンへ広がったことです。約16倍の拡大です。
出力トークンとは、モデルが1回の応答で生成できる文章やコードの量のことです。
公式ブログによると、上限の拡大は、より長く複雑な用途に対応するためです。1回の処理で数十万トークンを生成できる余裕があると、より深く推論でき、難しい問題を一度で解けるようになると説明されています。
最初は、ベンチマークの数字がいちばんの見どころだと思っていました。実は公式ブログでは、冒頭で得意分野を紹介したすぐ後に、出力上限の拡大が説明されています。「長い仕事を任せる」ことを大切にしたモデルなのだと感じたうさ。
ベンチマークで見る実力
公式評価の全体像
Google DeepMindは、知識業務、コーディング、ML(機械学習)エンジニアリング、科学と数学、ロングコンテキスト、コンピューター操作、マルチモーダル理解、サイバーセキュリティの8分野で評価結果を公開しています。
比較対象は、OpenAIのGPT-6 Astra、AnthropicのClaude Fable 5.1とClaude Opus 5.5です。

出典 Gemini 4 Argon our next era of frontier intelligence(Google公式ブログ)
青く塗られたセルがArgonの首位、グレーのセルが他社モデルの首位を表しています。
首位の数え方
結果表を見ると、Argonの列で青く塗られたセルは14個あります。「12項目で単独首位」という数字と合わないように見えますが、次の2点を押さえると同じ数字になります。
- GraphWalksは2行で1項目です 表では「128Kまで」と「256K〜1M」の2行に分かれていますが、ベンチマークとしては1つです。そのため表は19行ありますが、項目数は18になります
- CWE-bench v1は同率首位です Argonのセルは青く塗られていますが、GPT-6 Astraも同じ68.0%で、そちらのセルもグレーで塗られています。他社と並んでいるので、単独首位とは分けて数えます
まとめると、GraphWalksを1項目として数えると全18項目となり、Argonの単独首位は12項目、同率首位は1項目になります。
数字から読み取れる強み
- 知識業務で大きくリード AutomationBench(Zapierによる業務自動化の評価)では2位に約9ポイント差をつけています。法務エージェントの評価であるHarvey’s Legal Agent Benchmarkでも、他モデルが一桁台のなか19.6%を記録しました
- 超長文の読解に強い 256K〜1Mトークンの長さで関係をたどるGraphWalksでは84.2%で、2位と12ポイント以上の差があります
- 長い動画の理解 長時間動画の理解を測るLVBenchで91.7%を記録しています

出典 Gemini 4 Argon our next era of frontier intelligence(Google公式ブログ)

出典 Gemini 4 Argon our next era of frontier intelligence(Google公式ブログ)
長時間のソフトウェア開発を測るDeepSWE v1.1でも、Argonは77.9%で首位です。

出典 Gemini 4 Argon our next era of frontier intelligence(Google公式ブログ)
一方で、FrontierSWE v2、Terminal-Bench 4.0、PostTrainBench、Terminal-Bench Science 0.1、OSWorld 2.0の5項目では他社モデルが上回っています。どのモデルも全項目で首位というわけではないので、用途に合わせてモデルを選ぶとよさそうです。
ベンチマークの順位よりも「自分の仕事に近いベンチマークで何点か」を見るほうが、モデル選びで外れにくいです。法務や金融の調査が多い方なら、Vals系の評価に注目するのがおすすめうさ。
Google社内での活用事例
Google自身が毎日の開発でArgonを使い込んでいる実例を紹介するうさ🐰
公式ブログでは、Google社内でArgonを使った具体的な成果が紹介されています。
大規模なC/C++からRustへの移行
Argonのエージェントは、Google社内のC/C++コードベースをRust(メモリ安全性の高いプログラミング言語)へ移行する作業を進めています。
規模はre2やlibgav1のような数万行のコアライブラリから、80万行を超えるFuchsiaのZirconカーネルまで広がっています。重要なシステムが多いため、本番に投入する前に、自動と手動の監査、エミュレーションテスト、レビューを行っているそうです。
動画デコーダーのlibgav1では、既存のRust移植版をもとに、プロファイル(実行時の性能計測)にもとづく試行を何度も重ね、32K行のSIMD(複数データを一度に処理する命令)コードを置き換えました。
その結果、出力される映像は同じまま、元のRust移植版より2.7倍高速で、メモリ安全な動画デコーダーができたと報告されています。
データセンターのメモリ最適化
Argonのエージェントのチームが、データセンター全体のプロファイリングデータを分析し、メモリ最適化を自律的に見つけて適用しました。
展開が終わると300TiB以上のメモリが空く見込みで、最終的な削減量は500TiB〜1PiBと見積もられています。
量子アルゴリズムの最適化
量子コンピューティングの研究者は、重要なアプリケーションのボトルネックになるサブルーチンの時空間リソース(量子ビット数とゲート数の積)の最適化にArgonを使っています。
ある例では、公開済みのベースラインを数分で40%上回ったそうです。
最初は「社内事例は宣伝寄りかな」と思っていました。実はどの事例にも行数やメモリ量などの具体的な数字が添えられていて、エンジニアとして参考にしやすい内容だったうさ。
法人向け生成AIサービス「ナレフルチャット」では、ChatGPT、Gemini、Claudeなど主要プロバイダのAIモデルを選んで利用可能!用途に応じて、料金の低いモデルを使うなど最適なAI活用を可能にします。
また、料金プランは企業単位の定額制を採用しており、何人で利用しても追加のコストは発生しないため、コスト管理の手間がかからないスムーズな全社導入を実現できます。
すべての機能が利用できるトライアル期間も用意しておりますので、生成AIの利活用を検討している企業様は、是非一度導入をご検討ください。
サイバー防御とFairwind Program
まず守る側にモデルを届けるという、新しいリリースの形うさよ🐰
脆弱性の発見からパッチまで
Argonはサイバー防御向けにも訓練されていて、重大なソフトウェア脆弱性を自律的に発見、検証し、パッチを作ることができるとされています。
実例として、セキュリティ企業Wizの取り組みが紹介されています。
Wizは、重要な公共インフラを無償で守るプログラム「Scan for Good」でArgonを活用しています。そして、世界中の病院で使われている医療ソフトウェアに、機微な個人情報が漏れるおそれのある重大な脆弱性を見つけました。公式ブログによると、この脆弱性はそれまでのフロンティアモデルでは見つかっていなかったものです。
公式のサイバー評価
公式ブログでは、Googleのサイバー向けモデル「Gemini 3.8 Flash Cyber」との比較も公開されています。

出典 Gemini 4 Argon our next era of frontier intelligence(Google公式ブログ)
| 評価 | 内容 | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|---|
| Real-world Vulnerability Discovery | 20言語のソースコードから実在の脆弱性を見つけるGoogleの社内評価 | 85.8% | 71.0% |
| Wiz Penetration Test Benchmark | ソースコードなしで稼働中のWebシステムを分析するWizの社内評価 | 70.9% | 58.2% |
公開リーダーボードのCWE-bench v1では、Argonは68%でGrok 4.7、GPT-6 Astraと並んで同率首位でした。

出典 Gemini 4 Argon our next era of frontier intelligence(Google公式ブログ)
Fairwind Programとは
Fairwind Programは、防御する側が脅威より一歩先を行けるように、フロンティアモデルへの早期アクセスを提供するGoogle DeepMindの取り組みです。
| 項目 | 内容 |
|---|---|
| 対象 | 政府や国家のサイバー当局、重要インフラ事業者(医療、通信、エネルギー、金融)、中核的な技術プラットフォーム企業 |
| パートナー数 | 650以上 |
| 提供されるもの | 一部のパートナーがGemini 4 Argonを利用でき、セキュリティ特化のエージェントCodeMenderの中でも使えます |
| 利用範囲 | 防御と学術研究の目的に限った、認可された脅威シミュレーション、リバースエンジニアリング、マルウェア分析 |
| 申し込み | 公式ページのフォームから申請します。申請した組織は、セキュリティの経歴や倫理的な運用実績の審査を受けます |
信頼された防御者には、Argonがサイバー用ガードレールを外した状態で提供されます。防御に必要なフル性能を引き出せるようにするためです。
なお、Fairwind Programは組織単位の審査制です。個人で試したい場合は、次の章で紹介する一般向けの展開を待つのがおすすめです。
安全性を支える4つの柱
性能の高いモデルを安全に公開するために、公式ブログでは4つの取り組みが紹介されています。
- 悪用の防止 サイバー攻撃やCBRN(化学、生物、放射性物質、核)攻撃につながる有害な依頼を拒否しつつ、正当な研究には応えられるように設計されています。悪用を見つけるためにモデル内部の活性を監視する技術を改善し、社内外のレッドチーム(攻撃者の視点で弱点を探す専門チーム)による検証も行っています
- プロンプトインジェクション対策 自動化したレッドチーミングと敵対的トレーニングを組み合わせ、間接プロンプトインジェクション耐性を測るGray Swan IPIベンチマークで首位になりました。公式ブログでは、Googleのモデルの中でこれまでで最も間接プロンプトインジェクションに強いと説明されています(結果は下のグラフで紹介します)
- ミスアライメントの監視 ユーザーの意図を超えた行動を防ぐため、思考過程(Chain of Thought)と行動を監視し、必要なら実行を止めます
- システムの堅牢化 Googleのエージェント制御ロードマップに沿って、リスクの高い訓練や評価を始める前にサンドボックス環境を隔離、封鎖しています
詳しい考え方は、Frontier Safety FrameworkやAIエージェントの安全性に関する記事で公開されています。
プロンプトインジェクションへの強さをグラフで確認
間接プロンプトインジェクションとは、モデルが読み込むWebページや文書などのコンテキストに悪意のある指示をまぎれ込ませ、モデルの動きを乗っ取る攻撃です。エージェントとして外部の情報を扱う機会が多いモデルほど、この攻撃への強さが大切になります。
次のグラフは、Gray Swan IPIベンチマークで、各モデルへの攻撃がどれくらい成功したかを比べたものです。

出典 Gemini 4 Argon our next era of frontier intelligence(Google公式ブログ)
グラフの見方は次のとおりです。
- 縦軸は攻撃成功率 値が低いほど攻撃に強いことを表します。ほかのベンチマークとは逆なので注意してください
- 棒の色の濃さは攻撃の試行回数 濃い部分から順に、1回、10回、15回まで攻撃を試みたときの成功率です
- 棒の上の数字は15回試行したときの成功率 いちばん厳しい条件での結果です
比べられた13モデルのうち、Gemini 4 Argonは0.7%で最も低い値でした。次に低いのはClaude Opus 5.5とClaude Fable 5.1の1.0%で、最も高いモデルでは50%を超えています。
「性能が高いからこそ、まず守る側に渡す」という順番が印象的だったうさ。
料金と提供スケジュール
料金
公式に発表された100万トークンあたりの料金は次のとおりです。
| 区分 | 入力 | 出力 | キャッシュ入力 |
|---|---|---|---|
| 導入価格 | $2 | $10 | 入力価格の95%オフ |
| 導入期間終了後 | $4 | $20 | 公式発表に記載なし |
導入期間が終わると、入力も出力も2倍の料金になります。導入期間の長さは、2026年10月1日時点では発表されていません。
出力100万トークン時代のコスト感
出力上限が大きくなった分、1回の呼び出しでかかる料金も大きくなりえます。
出力を上限いっぱいの100万トークンまで使うと、出力だけで導入価格なら1回$10、導入期間終了後なら1回$20かかります。
提供スケジュール
公式ブログによると、提供は次の順番で段階的に進みます。
- Fairwind Programを通じて、信頼されたサイバー防御者へ提供開始 初期のテスターからのフィードバックをもとに、ガードレールの改善を続けます
- 開発者、企業、一般ユーザーへ「できるだけ早く」展開 最初は有料APIユーザーとGoogle AI Ultra契約者が対象です
あわせて、Googleは公開前のモデルへのアクセスに関する米国政府の任意のプロセスにも参加しています。
一般向けの具体的な提供開始日は、2026年10月1日時点では明らかにされていません。今後の公式発表に期待したいところです。
まとめ
お疲れ様でした!最後に、もう一度ポイントを振り返ります。
- 出力トークン上限が64Kから100万へ より長く複雑な用途に対応するための拡大です
- 18項目中12項目で単独首位、1項目で同率首位 知識業務、超長文の読解、長時間動画の理解で特に強く、FrontierSWE v2やOSWorld 2.0など5項目では他社モデルが上回っています
- まず守る側へ Fairwind Programのサイバー防御者から提供が始まり、その後は有料APIユーザーとGoogle AI Ultra契約者から順に広がる予定です
ここまで読んでいただき、ありがとうございました。
あなたも生成AIの活用、始めてみませんか?
生成AIを使った業務効率化を、今すぐ始めるなら
「ユーザ数無制限」の法人向け生成AIサービスのナレフルチャット!
ChatGPT・Gemini・Claudeなどの主要AIモデルが使えて、
RAGやAIエージェント、スライド生成など全てナレフルチャットにお任せ!
生成AIの利用方法を学べる「公式動画」や、「プロンプトの自動生成機能」を
使えば知識ゼロの状態からでも、スムーズに生成AIの活用を始められます。

taku_sid
https://x.com/taku_sid
AIエージェントマネジメント事務所「r488it」を創立し、うさぎエージェントをはじめとする新世代のタレントマネジメント事業を展開。AI技術とクリエイティブ表現の新たな可能性を探求しながら、次世代のエンターテインメント産業の構築に取り組んでいます。
ブログでは一つのテーマから多角的な視点を展開し、読者に新しい発見と気づきを提供するアプローチで、テックブログやコンテンツ制作に取り組んでいます。「知りたい」という人間の本能的な衝動を大切にし、技術の進歩を身近で親しみやすいものとして伝えることをミッションとしています。



