GPT-5.5・Claude Opus 4.7、推論能力は人間並みか…ARC-AGI-3テストでは正答率1%未満の「惨敗」 — BigGo ファイナンス

人工知能(AI)業界のライバルであるOpenAIとAnthropicが、それぞれ新型モデルを投入し熾烈な主導権争いを繰り広げている。しかし、両社の最先端モデルには共通の課題が浮き彫りとなっている。大学院レベルの推論やサイバーセキュリティ対策では目覚ましい進化を遂げたものの、人間の知能を測る新たな基準においては、依然として大きな隔たりがあることが指摘された。

2日(現地時間)、AI業界や学界によると、先頃発表されたOpenAIのGPT-5.5とAnthropicのClaude Opus 4.7は、英国AI安全研究所(AISI)が実施したサイバーセキュリティテストで前世代を大きく上回る成績を収めた。一方で、Kerasの創始者であるFrançois Chollet氏が設計した汎用人工知能(AGI)の推論ベンチマーク「ARC-AGI-3」では、両モデルとも正答率1%未満という結果となり、人間どころか6歳の児童が持つ問題解決能力にも及ばないことが判明した。

◆サイバー戦場では「超人的」…20時間のハッキング課題をAIが実行

英国政府傘下のAI安全研究所(AISI)が先月30日に公表した「GPT-5.5サイバー能力評価」報告書によると、GPT-5.5は高難度のCTF(Capture The Flag)テストにおいて、平均71.4%の成功率を記録した。これはAnthropicの最新モデル「Mythos Preview」の68.6%や「Claude Opus 4.7」の48.6%を大きく引き離す数値だ。GPT-5.5は特にWebブラウジング(84.4%)、ターミナル自動化(82.7%)、サイバーセキュリティ(81.8%)といったエージェント機能において強みを見せた。

さらに注目すべきは「サイバーレンジ」テストの結果である。AISIは、熟練の人間セキュリティ専門家が約20時間を要すると見積もる32段階の企業ネットワーク攻撃シミュレーション「The Last Ones(TLO)」をAIに課した。その結果、Mythos Previewは10回の試行中3回、GPT-5.5は2回の完遂に成功した。これはAIが単なるツールを超え、情報収集から権限奪取、内部ネットワークへの侵入、最終的なデータ流出に至るまでの経路を自ら設計・実行する「作戦遂行者」へと進化したことを意味する。

AISIは報告書の中で「今回の結果は、サイバー攻撃能力の急激な向上は特定のモデルに限った例外ではなく、長期的な自律性、推論、コーディング能力の向上の副産物である可能性がある」と分析した。ただし、発電所などの産業制御システム(ICS)を攻撃する7段階シミュレーション「Cooling Tower」では、両モデルとも課題を解決できず、依然として限界があることも明らかになった。

◆オフィス市場の二強体制…「実行力のGPT」vs「思考力のClaude」

企業業務環境における両モデルの競争はさらに鮮明化している。報道によると、GPT-5.5はターミナル自動化やWebブラウジングなどのエージェント実行能力でClaude Opus 4.7を大きくリードした。ある開発者は「かつては画像を理解させるために個別のプロンプトが必要だったが、GPT-5.5には写真を添付するだけで全て読み取ってくれる」と、OCR機能の飛躍的な向上を評価している。

一方でClaude Opus 4.7は、大学院レベルの推論(94.2%)や高難度推論(46.9%)でGPT-5.5を上回っており、依然として最も優れた「知能」を搭載していることを証明した。複雑な企画や設計業務においてはClaude Opus 4.7が優位に立つというわけだ。OpenAIはこれに対抗し、Claudeのように20万トークン超過時にコストを上乗せする方式ではなく、定額制を維持する価格戦略を打ち出している。

こうした競争の中、開発者の間ではAIに絶えず質問を投げかけて暗黙知を引き出し、業務を高度化させる「Harness Engineering」という新たな概念が注目されている。ZEPのエンジニアであるLee Jae-kyu氏は「AIの知能が飛躍的に高まった今、人間が指示を出すレベルを超え、AIとやり取りする対話そのものが高度なエンジニアリングとなっている」と説明した。

◆ARC-AGI-3で1%未満…「人間は100点、AIは0点台」

しかし、AIの躍進が全ての領域で通用するわけではない。ARC Prize財団が2日に公開した分析報告書によると、GPT-5.5とClaude Opus 4.7は、135種類の新しい推論環境で構成されるARC-AGI-3テストにおいて、それぞれ0.43%と0.18%の正答率にとどまった。一方、事前トレーニングなしでテストに臨んだ人間は、全ての環境を100%解決した。

研究チームは、AIの失敗原因を以下の3点に挙げた。第一に「ルールの一般化の失敗」。モデルは特定の行動の結果を局所的には理解できても、全体に応用する普遍的なルールへと統合できない。第二に「汚染された知識」。未知の課題を学習データに基づき、既存のゲームであるかのように誤解し、誤った方向に進んでしまう。第三に「偽の成功」。偶然ステップを通過しても原理を理解しているわけではないため、次段階で完全に破綻する現象が繰り返された。

研究チームは「Claude Opus 4.7は観察内容を自信満々に、しかし誤った理論に圧縮する傾向があり、GPT-5.5は可能性を過剰に広げて実行に移せない様子が見られた」と分析した。

◆AI時代の権力移動…CTOたちが管理職を捨てエンジニアへ

一方、AIモデルの急速な性能向上は、シリコンバレーの人材地図まで塗り替えている。最近、数名の元最高技術責任者(CTO)たちが、高額な報酬や役職を捨ててAnthropicに一般技術職として入社するケースが目撃されている。彼らは「AGIが2027年から2028年に到来するなら、最前線の研究室でそれを見守りたい」「管理する人数ではなく、モデルの核心に近いことが真の権力だ」と口を揃えたという。

実際にAnthropicの成長は、こうした期待を裏付けている。Semi Analysisの報告書によると、Anthropicの年間経常収益(ARR)は2025年末の90億ドル(約1.4兆円)から、2026年5月時点では440億ドル(約6.9兆円)へと急増した。特に開発者向けAIエージェント「Claude Code」のARRは25億ドル(約3,900億円)を突破している。Anthropicは現在、500億ドル(約7.9兆円)規模の新規資金調達を推進中であり、企業価値は9,000億ドル(約141.4兆円)に達する見込みだ。これはライバルであるOpenAIの現在の企業価値8,520億ドル(約133.8兆円)を上回る水準となる。

ただし、急成長に伴う副作用も生じている。最近、Anthropicが月額20ドル(約3,100円)のプロプランからClaude Codeを除外するテストを行ったり、Claude Opus使用時に追加課金を案内する文言を表示したりと、料金体系改編の動きが利用者の反感を買っている。Anthropicはこれを「単純な表記ミス」と釈明したが、業界ではClaude Codeの膨大なインフラコスト(ヘビーユーザー基準で月数百ドル)を賄うための課金体系の見直しが迫っているとの見方が強い。

AI業界の関係者は「モデルの高度化に伴い、推論コストは日々増加している」とし、「利用量に応じた従量課金や、高性能機能を高価格帯プランに限定する手法が今後導入される可能性が高い」と予測した。