Gemini 4 Argon、コード性能でGPT-6とClaudeを上回るも、まだ誰でも使えるわけではない – Korben

Googleが9月30日に発表した新しいAIモデル「Gemini 4 Argon」は、今のところ同社のプログラム「Fairwind」に選ばれたサイバー防衛の専門家しか試せません。発表直後からコードを任せたいと期待していた開発者は、しばらく待つしかなさそうです。いくつかのテストでGoogleがOpenAIとAnthropicを上回る結果を出しているだけに、ちょっと残念ですね。

長時間のソフトウェア開発タスクを評価するDeepSWE v1.1では、Argonが約78%に達しました。GPT-6 Astraと、Claudeを開発するAnthropicのモデル「Claude Opus 5.5」は約74%です。Googleは、調査や操作を途切れさせずに連続してこなす必要がある法務・財務の案件も視野に入れています。

ただし、Google自身の比較表を見ると、別のプログラミングテストであるFrontierSWE v2ではAstraが勝っており、コマンドライン作業を扱うTerminal-bench 4.0ではOpusが優位を保っています。メーカー自身が公表した結果で、しかもアクセスがここまで限られている以上、絶対的な勝者を決めるのは正直時期尚早でしょう。

Argonは最大100万トークン(モデルが扱うテキストの断片のことです)を出力でき、従来の6万4,000トークンから大幅に増えました。この上限はあくまで出力、つまりAIが生成する分に対するものです。大規模なソフトウェア開発や長文ドキュメントの作成でも、作業を中断せずに進めやすくなります。

セキュリティ面では、Googleは信頼できるパートナーに向けて、サイバー関連のガードレールを外した版を提供する予定です。脆弱性を探して修正を準備する際に、通常の拒否反応に引っかからずに済むようにするためです。ガードレールを外すのはこの管理された用途に限った話で、あらゆるハッキングの依頼に応じる公開版が出るわけではありません。

サイバーセキュリティ企業のWizは、Argonを使って、世界中の病院で使われているソフトウェアに重大な脆弱性を見つけたとされています。機密性の高い個人データが露出していたそうです。Googleはさらに、モデルが読み込むコンテンツに仕込まれた悪意ある指示がモデルの動作を乗っ取る恐れがあるため、その対策も強化するとしています。

開発者向けの発表済みローンチ価格は、入力100万トークンあたり2ドル、出力100万トークンあたり10ドルです。その後は4ドルと20ドルに倍増します。この導入価格がいつまで続くのかは明らかにされていません。

次にアクセスできるようになるのは、API(モデルをソフトウェアに組み込むためのインターフェース)の有料顧客と、Google AI Ultraの加入者です。

Googleは、この公開時期について日付を発表していません。

情報源:
Frandroid