(写真:ITmedia AI+)(写真:ITmedia AI+)
米Googleは9月30日(現地時間、以下同)、同社の新たな最先端モデル「Gemini 4 Argon」(以下、Argon)を発表した。Google DeepMindの評価資料では、米OpenAIの「GPT-6 Astra」(以下、Astra)、米Anthropicの「Claude Fable 5.1」(以下、Fable 5.1)と「Claude Opus 5.5」(以下、Opus 5.5)を相手に19項目中14項目で首位に立ち(内1つはAstraと同点)、ソフトウェア開発や知識労働、サイバー防御でフロンティア級の性能をうたう。
【画像】他社モデルとの性能比較
ただし当面はサイバー防御組織などへの限定提供で、一般提供の時期は「できるだけ早く」としか示されていない。競合との違いと一般提供の見通しを、公式資料と第三者評価、関係者の発言から整理する。
「Pro」ではなく「Argon」 7カ月ぶりのフラッグシップ級
Argonは「Gemini 4」世代の最初のモデルだ。Googleは「Gemini 3.5 Flash」の発表時に上位版「Pro」を6月に公開するとしていたが実現せず、9月発表の「Gemini 3.8 Flash」まで軽量なFlash系のモデルが続いていた。AIモデルの性能評価を手掛ける米Artificial Analysisは、ArgonをGoogle DeepMindにとって「7カ月以上ぶりのFlash級を超える独自モデル」と位置付ける。
Google DeepMindの開発責任者コーレイ・カヴクチュオール氏は9月、米The Information主催のイベントでGemini 4が年末までに登場すると示唆したと報じられていた。Googleのスンダー・ピチャイCEOはXで「できるだけ早く最初の姿を見せたかった」と投稿しており、今回の発表は正式な提供開始というより、検証段階のモデルの“お披露目”という性質が強い。
気になる性能は? Astra、Fable、Opusとの比較
Google自身によるArgonの評価では、競合3モデルと8分野19項目で比較している。Argonは最も高い思考量設定での自社計測、競合は原則として各社の公表値だという。
知識労働とロングコンテキストに強み
最も差を付けたタスクは知識労働だ。金融や法務などの業務で経済的影響を測る「Vals Index」で68.9%(Opus 5.5は67.0%、Fable 5.1は65.8%、Astraは63.1%)、米Zapierの業務自動化ベンチマーク「AutomationBench」で51.3%(Opus 5.5は42.5%、Astraは41.4%、Fable 5.1は31.4%)と、いずれも首位。法務エージェントの「Harvey’s Legal Agent Benchmark」も19.6%と、競合(3.8〜6.7%)を大きく上回った。
長いコンテキストの処理もArgonの強みだ。25万6000〜100万トークンのグラフ探索問題「GraphWalks」では84.2%と、Astra(71.8%)、Opus 5.5(66.8%)、Fable 5.1(65.0%)に大差を付けた。長時間の動画理解を測る「LVBench」でも91.7%で首位だった。出力トークンの上限も従来の6万4000から100万に引き上げたことで、Googleは「単一の出力で数十万トークンを生成できるようになったことで、推論に新たな深みが加わり、困難な問題を一度に解決可能になった」とうたっている。
サイバーセキュリティでは、脆弱(ぜいじゃく)性の修正能力を測る「CWE-bench v1」で68%を記録し、Astraと首位タイ(Opus 5.5は67%、Fable 5.1は58%)だった。
コーディングは一部他社に届かず
コーディングでは、実世界の開発タスクを測る「DeepSWE v1.1」で77.9%と最高記録を更新したとうたう(Opus 5.5は74.2%、Astraは74.1%、Fable 5.1は67.4%)。一方、「FrontierSWE v2」はAstraの65.5%に対して55.0%、ターミナル操作を伴う「Terminal-Bench 4.0」はOpus 5.5の66.4%に対して57.4%と4モデル中最下位で、一部のコーディング性能ではAnthropicとOpenAIが依然として先行する。