操作しないインターフェース
最近、インターフェースを自分で操作する時間が少しずつ減ってきた。業務用の管理画面で作業するときや、たまの出張で交通手段や宿泊先を予約するときに、とくにそう感じる。
久しぶりに開いた管理画面やウェブサイトで、「この設定はどこにあるんだろう」とメニューを探す。目的の操作にたどり着くまでに、そのサービス独自のUIの構造を理解しなければならない。以前はそういうものだと思っていたけれど、最近はこの「まず使い方を理解する」時間を少し面倒に感じるようになった。
そういうとき、自分で複雑なUIを攻略する前に、Computer Useに頼むことがある。Computer Useは、目的を伝えると、AIが人の代わりにウェブサイトやアプリの画面を見ながら、クリックや入力などの操作を進めてくれる機能だ。
どこを押せばいいのか、どの順番で進めばいいのか。複雑なUIを攻略すること自体を、AIに任せるようになってきた。
「心地とインターフェース」の記事をSubstackで配信するときも、実は作業のかなりの部分をComputer Useに任せている。以前なら、Substackを開いて、タイトルや本文を入れて、画像を作成して挿入し、配信設定をして、とひとつずつ操作していた。
今は「この記事の日英版をSubstackでも配信して」と頼むと、エージェントがComputer Useで管理画面を開き、必要なところに情報を入れて進めていく。私は途中で確認が必要になったときだけ画面を見る。もはや自分よりもエージェントのほうが、Substackの管理画面について詳しいかもしれない。
これまでは、新しいアプリやウェブサービスを使うとき、まずその画面の使い方を覚える必要があった。使いやすいインターフェースとは、その操作をできるだけ迷わず行えるものだったと思う。
自分がUIをつくるときも、目的の場所まで迷わずたどり着けるか、操作した結果がちゃんと伝わるか、といったことを考えてきた。もちろん、それが必要なくなるわけではない。Computer Useが操作しているのも、結局は人のためにつくられた既存のウェブサイトやアプリだ。
ただ、その画面を直接操作するのが、人ではなくAIになる場面が出てきた。Substackの管理画面は何も変わっていないのに、私にとっての使い方はかなり変わった。どこに配信ボタンがあるのか、画像をどこから設定するのかを覚えていなくても、記事を配信できる。
私とインターフェースとのあいだにエージェントが入った。
こうした変化については、最近の研究でも少しずつ扱われ始めている。2026年にAppleが発表したComputer Use Agentの研究では、AIに画面操作を任せるときのUXを、「どう指示するか」「AIが何をしているのかをどう伝えるか」「どこまでユーザーが操作に介入できるか」といった観点から整理している。
これまでのボタンやフォームの設計に加えて、エージェントに何をどう頼めば伝わるのか、いま何をしているのかをどこまで見せるのか、いつ止めたり自分で操作を引き取ったりできるのかも、デザインする対象になっていく。
研究では、そのあり方にひとつの正解があるわけではなく、必要な説明やコントロールの度合いは、タスクやユーザーによって変わることも示されている。
一方、Microsoft Researchの「AI at your Fingertips」では、そもそも画面を見なくてもAIに仕事を任せられるのかを試している。研究チームは、触れて話しかけるとAIに仕事を頼めて、終わると振動で知らせるリング型のデバイスをつくった。
簡単なタスクでは、参加者は画面を見ずに任せられることを便利に感じた一方で、複雑なタスクになると、画面や音声によるフィードバックがないことに不安を感じたという。
操作しなくていいことと、何も見えなくていいことは、同じではないらしい。これは実際にComputer Useを使っていてもよく分かる。
配信前の確認は自分でするが、Substackへの下書き作成ならかなり任せてしまっていい。一方で航空券の予約なら、候補を探したり必要な情報を入力したりするところまでは任せたいけれど、金額や日時を確認せずに購入まで進まれるのは少し怖い。
逆に、何をするにも「進めてもいいですか?」と聞かれると、自分で操作したほうが早いと思ってしまう。
任せたいけれど、ときどき見たい。
ずっと画面を見ていなくても、気になったときには何をしているか分かる。大事なところでは、自分で確認して決められる。そういう任せ方ができると、ほかのことをしているあいだも気が楽だ。
さらに最近は、AIが人間向けのUIをうまく操作するだけではなく、ウェブサイトの側もAIに使われることを前提につくろうとする動きがある。WebMCPと呼ばれる、仕様の検討が進んでいる仕組みもそのひとつだ。
画面を見て操作するComputer Useは、私たちとかなり似た方法でウェブサイトを使っている。検索欄やボタンを見つけて、ひとつずつ操作していく。WebMCPでは、サイト側がAIに「このサイトでは、こういうことができます」と機能を直接伝えられる。
たとえば旅行予約サイトなら、人にはこれまで通り検索フォームや予約ボタンが見えている。一方でAIには、「フライトを検索する」「予約を始める」といった機能を直接渡すことができる。AIは画面の中からボタンを探さなくても、その機能を使えるようになる。
WebMCPのような仕組みが広がれば、人とAIが同じ画面を同じように操作することを前提にしなくてもよくなる。人にとって分かりやすい画面と、AIが使いやすい入口を、それぞれに合わせて設計できるようになる。
自分がUIをつくるときは、これまで人がどう操作するかを細かく考えてきた。でも、人とUIのあいだにエージェントが入り、サイトの側にもAI向けの入口ができるようになると、考えることは少し増えそうだ。どこまでAIに任せるのか。途中で何を見せて、どこで人に判断を求めるのか。
最近、自分が「使いやすい」と感じるものも少し変わってきた気がする。迷わず操作できることはもちろん大事だけれど、そもそも自分で操作しなくて済むことにも、かなり助けられている。
画面を操作しなくていい時間をどうつくるかも、心地よいインターフェースを考えるときのひとつの問いになっていきそうだ。
