64Kが1Mになった。Googleが9月30日に発表した新しいフロンティアモデル、Gemini 4 Argonで、出力トークンの上限が15倍以上に引き上げられている。仕様表の一行としては地味に見えるが、AIに長文を書かせている側にとっては、ワークフローの前提がひとつ崩れる話になる。
先に断っておくと、Argonは現時点で一般提供されていない。筆者も実機では触っていない。以下は公式発表を読んで整理した内容と、自分の運用に当てはめたときに何が引っかかったかの記録になる。
Gemini 4 Argonの発表内容
GoogleがArgonを公開したのは2026年9月30日。いきなり全員に配るのではなく、Fairwindプログラムを通じて、信頼済みのサイバー防御担当者という限られた層に先に渡している。米政府のリリース前モデルアクセスに関する自主的プロセスにも参加中で、ガードレールを固めながら段階的に広げていく、という書き方になっている。
一般向けの提供は、開発者・企業・消費者の順。その入口は有料APIの顧客とGoogle AI Ultraの加入者からと明記されている。
価格は入力2ドル・出力10ドル
導入価格は100万トークンあたり入力2ドル、出力10ドル。キャッシュ済み入力は入力価格の95%オフになる。この数字を見て最初に思ったのは、性能の話より先に「また同じ値段か」だった。前の週にOpenAIが出したGPT-6.1 Solが、入力2ドル・出力10ドルでまったく同じ水準にいる。
出力上限が64Kから1Mへ
仕様面でいちばん大きいのがここで、出力トークンの上限が従来の64Kから1Mに拡張された。Googleはこれを業界最高水準と表現していて、理由として、1回の軌跡で数十万トークンを生成できる余裕があると、推論の深さが変わると説明している。途中で切らずに最後まで考え切れる、という話だ。
ベンチマークの数字
- DeepSWE v1.1:77.9%(実務的な長期ソフトウェア開発タスク、最高水準)
- Vals Index:首位(金融・コーディング・法務・税務の経済的インパクトを測る指標)
- AutomationBench(Zapier):51.3%で1位
- LVBench:91.7%(長尺動画の理解、最高水準)
- CWE-bench v1:68%で同率1位(脆弱性の修正)
自動化を回している立場でいちばん引っかかったのはAutomationBenchだった。Zapierが出している指標で、業務の中核的な機能を端から端まで実行できるかを測るものとされている。コーディングの点数より、自分がやっていることに距離が近い。
Google社内ではすでに動いている
発表のなかで具体性があったのは社内事例のほうだった。量子計算のサブルーチン最適化では、公開されているベースラインを数分で40%上回ったという。データセンターのメモリ最適化では、Argonのエージェント群が全社規模のプロファイリング情報を解析して300TiB超のメモリを解放し、最終的に500TiBから1PiBの削減を見込むとしている。
もうひとつがC/C++からRustへの移行で、re2やlibgav1といったコアライブラリの数万行から、Fuchsia Zirconカーネルの80万行超まで。libgav1では既存のRust移植版にあった32,000行のSIMDコードを、コンパイラの出力を見ながら書き換えて、同じ映像出力のまま2.7倍速くしたとある。
3モデルを並べるとどう見えるか
| モデル | 入力(100万トークン) | 出力(100万トークン) | 備考 |
|---|---|---|---|
| Gemini 4 Argon | 2ドル | 10ドル | 出力上限1M/一般提供前 |
| GPT-6.1 Sol | 2ドル | 10ドル | キャッシュ済み入力0.1ドル |
| GPT-6 Astra | 10ドル | 50ドル | 最難度の推論向け |
| GPT-6 Luna | 0.1ドル | 0.5ドル | 定型の大量処理向け |
こうして並べると、2ドル/10ドルという枠にフロンティア級が2つ入ってきたことになる。値段で選ぶ理由が薄くなるという点では、先日自動化ツールの料金表を並べたときと同じ感触がある。あのときも差がついたのは金額ではなく、何を1回と数えるかだった。
副業・ライティングの運用で見るべき4点
1. 分割前提の生成フローを洗い出す
出力上限が64Kだった時代、長い記事は見出しごとに分けて投げるのが当たり前だった。筆者のブログ生成もその作りになっている。出力1Mが実用的に使えるなら、この分割は要らなくなる。ただし、分割をやめると途中で止まったときの復旧が面倒になる。だから今日やるべきなのは外すことではなく、どこに分割が入っているかを書き出しておくことだと思っている。
2. プロンプトの並び順をキャッシュ優先に直す
キャッシュ済み入力が95%オフというのは、Argonに限らず各社の料金表に共通して載るようになった項目だ。OpenAIが同じ週に出したGPT-6のモデルガイドでも、固定の指示や参考資料を先に置き、毎回変わるタスクの詳細を後ろに置けと書かれている。毎日同じプロンプトを回している人ほど効く。乗り換えの前に、手元のプロンプトの並び順を直すほうが先だ。
3. 実行役と執筆役を分けて考える
AutomationBenchで1位という結果と、文章の品質は別の話として置いたほうがいい。筆者の構成でいうと、記事の下書きはClaude、調査はGPT側、という分け方をしている。ここにArgonを入れるとしたら、まず候補になるのは文章ではなく、n8nから叩く実行側のほうだと思う。ただし試せる日が来てからの判断になる。
4. 長尺の資料・動画を読ませる用途を覚えておく
LVBenchで91.7%という数字は、長い動画の理解を測ったものだ。専門的なグラフ分析や、複数の書類をまたいだ判断にも強いとされている。セミナー動画の要約や、長いPDFの読み取りに時間を取られている人は、将来的にここが置き換わる可能性がある。今すぐの話ではない。
注意しておきたいこと
まず、一般提供前である点。今日から乗り換える話ではないし、提供が始まったときに価格や仕様が変わらない保証もない。発表では導入価格という書き方をしている。
次に、ベンチマークの数字はすべて公式発表のものだという点。自分のタスクで同じ差が出るとは限らない。筆者は毎回ここで判断を間違えそうになる。
それから、出力1Mは当然コストに直結する。上限が上がったからといって毎回フルに使えば、出力10ドルという単価がそのまま効いてくる。切れなくなったことと、長く出させることは別の判断だ。
最後に、ガードレールなしのサイバー防御版が配られているのは、信頼済みの防御者とGoogleの社内チームに限られる。ここは一般利用者の話ではない。
まとめ:今日やる1つ
自分の生成フローのなかで、出力が切れる前提で分割している箇所を1つだけ書き出してみてほしい。
上限が上がったときに真っ先に畳めるのはそこで、逆に言えば、そこを把握していないと、上限が15倍になっても手元の運用は何も変わらない。モデルの発表を追うことの実益は、たぶんこういう棚卸しのきっかけになる点にしかない。筆者もまだ1箇所しか書き出せていない。
出典:Gemini 4 Argon: our next era of frontier intelligence(Google Blog, 2026年9月30日)


コメント