「Gemini 4 Argon」とは 性能評価にみるAstra/Fable/Opusとの違い 一般提供は年内?(ITmedia NEWS) – Yahoo!ニュース

(写真:ITmedia AI+)(写真:ITmedia AI+)

【画像】他社モデルとの性能比較

 ただし当面はサイバー防御組織などへの限定提供で、一般提供の時期は「できるだけ早く」としか示されていない。競合との違いと一般提供の見通しを、公式資料と第三者評価、関係者の発言から整理する。

「Pro」ではなく「Argon」 7カ月ぶりのフラッグシップ級

 Google DeepMindの開発責任者コーレイ・カヴクチュオール氏は9月、米The Information主催のイベントでGemini 4が年末までに登場すると示唆したと報じられていた。Googleのスンダー・ピチャイCEOはXで「できるだけ早く最初の姿を見せたかった」と投稿しており、今回の発表は正式な提供開始というより、検証段階のモデルの“お披露目”という性質が強い。

気になる性能は? Astra、Fable、Opusとの比較

知識労働とロングコンテキストに強み

 最も差を付けたタスクは知識労働だ。金融や法務などの業務で経済的影響を測る「Vals Index」で68.9%(Opus 5.5は67.0%、Fable 5.1は65.8%、Astraは63.1%)、米Zapierの業務自動化ベンチマーク「AutomationBench」で51.3%(Opus 5.5は42.5%、Astraは41.4%、Fable 5.1は31.4%)と、いずれも首位。法務エージェントの「Harvey’s Legal Agent Benchmark」も19.6%と、競合(3.8〜6.7%)を大きく上回った。

 長いコンテキストの処理もArgonの強みだ。25万6000〜100万トークンのグラフ探索問題「GraphWalks」では84.2%と、Astra(71.8%)、Opus 5.5(66.8%)、Fable 5.1(65.0%)に大差を付けた。長時間の動画理解を測る「LVBench」でも91.7%で首位だった。出力トークンの上限も従来の6万4000から100万に引き上げたことで、Googleは「単一の出力で数十万トークンを生成できるようになったことで、推論に新たな深みが加わり、困難な問題を一度に解決可能になった」とうたっている。

 サイバーセキュリティでは、脆弱(ぜいじゃく)性の修正能力を測る「CWE-bench v1」で68%を記録し、Astraと首位タイ(Opus 5.5は67%、Fable 5.1は58%)だった。

コーディングは一部他社に届かず

 コーディングでは、実世界の開発タスクを測る「DeepSWE v1.1」で77.9%と最高記録を更新したとうたう(Opus 5.5は74.2%、Astraは74.1%、Fable 5.1は67.4%)。一方、「FrontierSWE v2」はAstraの65.5%に対して55.0%、ターミナル操作を伴う「Terminal-Bench 4.0」はOpus 5.5の66.4%に対して57.4%と4モデル中最下位で、一部のコーディング性能ではAnthropicとOpenAIが依然として先行する。