「このように大量の個人データにアクセスできる製品をつくるのであれば、そのデータを責任をもって扱うことが極めて重要だと認識しています。そのため、非常に慎重にシステムを設計しました」と、Meta Superintelligence Labsでコンシューマー製品担当エンジニアリング部門のバイスプレジデントを務めるデイビッド・シングルトンは語る。
「『Sentinel』と呼ぶ仕組みも構築しました。VMの外へ出ようとするすべての情報を監視し、その処理についてユーザーまたはシステムがすでに許可している既存のポリシーがあれば、それと照合します。そうでなければ、人間を介在させる確認画面を表示し、実行しようとしている操作を承認するかどうかユーザーに尋ねます」
シングルトンによると、こうしたユーザーへの確認はモデルを介さず、ユーザーに直接送られる。プロンプトインジェクション攻撃などから保護するためだ。
Secure VMはユーザーのセキュリティとプライバシーを守るために設計されているが、完全に閉ざされた環境というわけではない。シングルトンによると、メタはポリシー上はユーザーのMuseデータへのアクセスを禁じられているが、技術的にはアクセスが可能だ。ユーザーは、自分のデータをAIの学習に使用しないようオプトアウトすることもできる。
さらに強化された仕組みを提供へ
Secure VMの仕組みは、AIエージェントのプライバシーに関する新たな業界標準になりうるという点だけでも注目に値する。
メタは将来的に「Muse Confidential VM」も提供する予定だ。各VMを信頼できる実行環境内で動作させ、ユーザー自身が端末上でアクセスキーを管理する仕組みとなる。これによりメタを含め、ユーザー本人以外はそのユーザーのAIエージェントのVMにアクセスできなくなる。
Muse Confidential VMは、エンドツーエンド暗号化メッセージアプリ「Signal」の開発者であり、近年はプライバシー重視のAIプラットフォーム「Confer」も開発したモクシー・マーリンスパイクとメタが進めている取り組みの一環だ。
『WIRED』は、Muse Confidential VMについて説明した技術ホワイトペーパーの草稿を事前に確認した。メタは、ユーザー自身がアクセスキーを管理する仕組みに加え、一部のセキュリティ企業にMuse Confidential VMのソースコードへのアクセスを認め、プライバシー保護の仕組みを定期的に監査・検証できるようにする。さらにメタは、Muse Confidential VMのバイナリ(機械が読み取れる命令ファイル)と透明性ログも公開する。これによりユーザーは、Museへの接続が正当なものであり、改ざんされていないことを確認できるという。
バグ報奨金プログラムによる検証も
シングルトンはMuse Secure VMについて、メタの人間およびAIエージェントによるレッドチームのほか、同社の非公開のバグ報奨金プログラムを通じて、すでに広範な検証を実施していると強調する。
メタはさらに、Museを公開バグ報奨金プログラムの対象にも加える。有効な脆弱性を発見した場合の報奨金は最大30万ドル(約4,700万円)で、単一ユーザーに影響を及ぼすプロンプトインジェクション攻撃を成功させた場合には、最大13万ドル(約2,000万円)が支払われる。