OpenAI Dotsは人間よりパソコン操作が上手 その結果、何が変わる? – AI新聞

OpenAIのエンジニアが人気ポッドキャスト「Latent Space」に登場し、新しいパーソナルAI「Dots」のcomputer use機能について説明した。そこで示されたのは、AIが人間よりパソコンを上手に使い始めているという現状だ。

過去半年で大きく進化したcomputer use

computer useとは、AIエージェントが人間に代わってパソコンを操作する技術だ。Webサイトを開き、ボタンを押し、フォームに入力し、必要な情報を探す。これまで人間がマウスやキーボードを使って行ってきた作業を、AIが代行する。

computer useには、ユーザー自身のパソコンをAIに操作させる方式もある。一方、Dotsでは各エージェントにクラウド上のLinux仮想コンピューターが与えられる。AIはその中でブラウザだけでなく、デスクトップアプリも操作できる。

これまでcomputer useには、途中で操作に失敗したり、処理に時間がかかったりする問題があった。ところがOpenAIでcomputer use agentsのプロダクト・エンジニアリングを率いるAri Weinstein氏によると、この数カ月で性能が大きく向上したという。

同氏は現在のDotsのcomputer useについて、「おそらく多くの場合、平均的な人間より速くタスクを完了できる」と語っている。同氏は、食材の量まで細かく指定できる宅配食サービスを例に挙げた。何食分もの注文内容を細かく設定する作業は、自分で行うと約2時間かかったが、computer useでは15分で終わったという。次の目標は、熟練したコンピューターユーザーと同等か、それ以上の速度でソフトウェアを操作することだという。

だが、AIが人間より優位なのは速さだけではない。

人間なら「クリックする、待つ、画面を見る、次をクリックする」と順番に進めるところを、Dotsは必要に応じてJavaScriptを書き、一連の操作をまとめて実行する。さらにOpenAIの新しいAPIでは、あるツールの処理が終わるのを待たずに、別の処理を進める仕組みも導入されている。

さらにDotsには、人間にはないもう一つの強みがある。

Appshotという仕組みでは、Dotsが受け取るのは画面の画像だけではない。アプリやWebページの内部構造も一緒に渡される。

たとえば人間がWebページを見ても、画面上に表示された文字の裏側に設定されているリンク先URLまでは見えない。しかしDotsには、その情報まで渡すことができる。カレンダーで画面上では途中までしか表示されていない予定名なども取得できる。

AIのパソコンを机の上に置く必要はない

そう考えると、一つの疑問が浮かぶ。

AIの方が人間より上手にコンピューターを使えるのであれば、そのコンピューターを手元に置く必要があるのだろうか。

Dotsでは、AIエージェント自身がクラウド上にLinux仮想コンピューターを持っている。人間のパソコンを遠隔操作するのではなく、AI自身の作業場所がクラウド上に用意されているわけだ。

この形が広がれば、人間の手元にあるパソコンの役割も変わってくる。

人間は手元の端末から、「この資料を調べて」「経費処理をして」「このアプリを修正して」とAIに指示する。実際の作業はクラウド上の仮想コンピューターでエージェントが行い、人間は結果を確認する。

これは、かつて企業で使われてきた「thin client」に似ている。

thin clientは、計算処理やデータをサーバー側に置き、手元の端末では主に画面表示や入力だけを行う仕組みだ。

ただ、AIエージェント時代のthin clientには大きな違いがある。これまでのthin clientでは、クラウド上のコンピューターを操作するのはあくまで人間だった。これからは、その操作自体をAIエージェントが行うことになるのだ。

既にその方向を示す製品もある。米Microsoftの「Windows 365 Link」は、Windows 365のクラウドPCへの接続を前提にした小型端末で、米国での希望小売価格は349ドル。処理やデータの多くをクラウド側に置く設計になっている。

もちろん、動画編集やゲーム、ローカルAIなど、高い処理能力を手元に必要とする用途は残る。一方、メール、資料作成、情報収集、経費処理といった一般的なオフィスワークをAIエージェントに任せるようになれば、パソコン市場の一部では、高性能化より低価格化が進む可能性がある。

クラウド上の仮想コンピューターには、もう一つ利点がある。セキュリティだ。

一般ユーザーのパソコンには、仕事のファイル、個人データ、ブラウザーのログイン情報、さまざまなアプリが混在している。OSやソフトウェアの更新、アクセス権限の管理も、ユーザー自身に委ねられている部分が大きい。

強力なAIエージェントにそうしたパソコン全体を操作させるより、エージェント専用の仮想環境を用意し、アクセスできるデータやアプリを必要な範囲に限定する方が管理しやすい。

OpenAIの新デバイスも、この流れに沿うのか

ここで気になるのが、OpenAI自身が開発を進めている新しいハードウェアだ。

OpenAIは2025年、AppleでiPhoneなどのデザインを率いたJony Ive氏らが設立したioを統合し、新しいAIデバイスの開発を進めることを発表した。具体的な形状や機能は、まだ正式には明らかになっていない。一部報道によると、OpenAIはこの端末を、日常生活を助け、時間とともに利用者に合わせて変わっていくAIコンピューターと位置づけている。Dotsの売り文句とほぼ同じだ。高度な計算や実際のパソコン操作をクラウド上のAIに任せ、人間の手元にはAIとのやり取りに特化した端末を置く、という設計は十分に考えられる。OpenAIは明かしていないものの、新デバイスにDotsが載るという読みもあながち間違いではなさそうだ。

コンピューターを操作する主体が人間からAIへ移っていく。それに伴い、人間が手元に持つデバイスの形が変わっていくのは、自然なことと言えそうだ。

主要ソース

Latent Space
https://www.youtube.com/watch?v=z9OkBD2-MDU

OpenAI「A letter from Sam & Jony」
https://openai.com/sam-and-jony/

OpenAI「The full stack behind abundant intelligence」
https://openai.com/index/the-full-stack-behind-abundant-intelligence/