ビジネスソフトウェアは一人のユーザーを念頭に置いており、それは常に同じです:画面を読み取る目とそれを入力する手を持つ人です。すべてのフォーム、タブ、ウィザード、ダッシュボードは、その人の作業記憶と注意に対する妥協です。下にあるデータモデルは通常堅実です。インターフェースは、一種類の読者のためのそれの表現です。
第二の種類の読者が現れました。AIエージェントは画面を見ず、名前、説明、スキーマを持つツールのリストを読み、それを呼び出します。そのユーザーによって操作されることを望むソフトウェアは、そのアクションをツールとして公開し、すべての呼び出しに対して権限を強制し、設計によって要求し、記録を副産物として保持しなければなりません。これがエージェントネイティブソフトウェアの意味であり、古い画面にチャットウィンドウを追加するよりも大きな変化です。
すべての画面は誰が見ているかの推測である
ERPがそのユーザーの側から何であるかを考えてみてください。ブランドの背後には、顧客、アイテム、注文、請求書、在庫移動、そしてそれらを一貫性のあるものに保つ制約のセットがあります。その前には、ほとんどの費用がかけられた部分があります:数千の画面があり、それらのテーブルを一度に数フィールドずつ、ユーザーが追跡できる順序で、ユーザーが読めるラベルと見つけられるボタンで提示します。
それぞれの画面は、向こう側にいる人についての推測をエンコードしています。その推測は、限られた作業記憶を持つ人ですので、フォームはタブに分割されています。左から右に読む人なので、重要なフィールドは左上に配置されます。おおよそ7つのことを心に留めることができる人なので、ダッシュボードには6つのタイルがあります。タイプミスをする人なので、送信時にバリデーションがあります。疲れる人なので、一般的な経路にはクリックが少なくなっています。これらすべては、デザイナーが想定したユーザーにとって良いデザインであり、40年間そのユーザーが唯一の存在でした。
その結果、インターフェースは一種類の読者のためのデータモデルの損失のある表現です。モデルは、請求書には行、顧客、期日、ステータスがあることを知っています;画面は、行を一つのタブに、顧客を別のタブに、ステータスを色で表示します。5つのレコードに触れる作業は5つの画面を意味し、その人はそれらの間の糸を頭の中で持ち運びます。その糸は、ビジネスがその管理スタッフに支払うほとんどのものです。
新しいユーザーは手ではなくツールを持っています。
ビジネスシステムを操作するAIエージェントは、そのいずれも受け取りません。モデルコンテキストプロトコルを介して接続するときに受け取るのは、ツールのリストを表示するリクエストの結果です:各ツールについて、名前、モデルが読むために書かれた説明、入力用のスキーマ、オプションでそのツールが読み取り専用か、何かを破壊できるか、二度呼び出すことが安全かどうかを示す注釈です。エージェントはツールを選択し、型付き引数で呼び出し、結果を読み、再度選択します。プロトコルの要約は、AIアプリケーションを外部システムに接続するための標準化された方法であり、一般的なポートがデバイスを接続する方法であり、主要なクライアントは現在これを使用しています:Claude、ChatGPT、Cursor、VS Codeなど。
このユーザーが必要としないものを見てください。請求書をタブに分割する必要はありません。なぜなら、全体の記録を一度に保持できるからです。重要なフィールドが左上にある必要はありません。なぜなら、左がないからです。6つのタイルが必要ではありません。なぜなら、欲しい数を要求できるからです。疲れませんし、クリックもありません。画面を人にとって良くするためのすべての妥協は、このユーザーにとっては無関係か障害です。
そして、画面が提供しなかった代わりに何が必要かを見てみましょう。それは、各アクションの説明が正確である必要があります。なぜなら、その説明が理解の全てだからです。それは、スキーマが完全である必要があります。なぜなら、例を見ることができないからです。それは、どのアクションが再試行しても安全かを知る必要があります。それは、結果が何が起こったか、次に何をする可能性があるかを示す必要があります。このユーザーにとって、ドキュメントはインターフェースであり、命名はデザインです。2行の説明を持つ1つの広いツールは、上にある画面がどうであれ、平易な名前と誠実な説明を持つ3つのツールとしての同じ機能よりも劣る製品です。
画面を通る迂回は長続きしません。
新しいユーザーへの最初の応答は、常に古いユーザーと同じように装うことです。ロボティックプロセスオートメーションは10年間これを行ってきました:ボットはサービスアカウントでログインし、手があるかのように画面を操作し、ボタンをそのセレクタや座標で見つけます。現在のバージョンは、言語モデルにスクリーンショットとカーソルを提供します。Anthropicのコンピュータ使用はまさにそれを行い、そのドキュメントはどこに属するかを注意深く示しています:より厳密なインターフェースが利用できない場合に存在し、作業がページ内に留まるときにブラウザツールに誘導し、実際の意味のある結果、金融取引を含む、何かを確認するために人を求めます。
コスチュームは着るのが高価です。画面は機械に対して約束をしないため、ユーザーのために行われたすべての変更は、1つのものとして振る舞う自動化を壊します。エージェントとアクションの間のすべての層、スクリーンショット、どのピクセルがボタンであるかの推測、正しいフィールドに入力されたかもしれないテキストは、間違う可能性のある場所であり、モデル自体もすでに間違う可能性のある場所です。画面操作は、システムの下により良いものがない間に構築する橋です。そして、ボットのベンダー自身がそう言っています:彼らは今、ロボットをエージェントがまだ必要とするシステムのために呼び出す実行層として説明しています。
ソフトウェアがなければならないもの
これまでの議論が正しければ、エージェントネイティブソフトウェアの形状はそれに従い、単なるAPIではありません。5つの特性が同時に真である必要があります。
- すべての行動はツールです。 ベンダーが安全だと考えた12個ではなく、画面を通じて人が到達できる全ての範囲:作成、読み取り、移動、承認、送信、調整。これ以下では、エージェントは残りの作業を画面に頼らざるを得ません。
- すべてのコールには本人確認が伴います。 エージェントは特定の人物として機能し、通常のサインインを通じて、その人物の役割に基づいて提供されるツールがフィルタリングされ、実行時にも再確認されます。システム全体を操作できるエージェントは、機能ではなく設計の失敗です。
- それは設計上、尋ねます。 一部のアクションは実行され、一部は人のために保留され、一部は明示的に拒否されます。プロトコル自体は、ツールコールを拒否できる人間が常にループ内にいるべきだと述べており、主要なクライアントはデフォルトで書き込みの前に確認を求めます。ソフトウェアは、モデルが礼儀正しいことを期待するのではなく、カテゴリを明示的に示す必要があります。
- 支出には上限があります。 システムの独自の推論がコストを伴う場合や、ツールが資金をコミットする場合、システムが強制する接続ごとの上限があり、モデルはそれを超えることはできません。
- ログが製品です。 すべての呼び出し、その入力と結果は、それを作成した本人の下で、個人の行動と同じようにレビュー可能です。エージェントにとって、監査の履歴は信頼が構築される方法であり、週ごとに積み重ねられます。
第六の特性は、要件というよりも結果です。ツールを通じて作業が行われると、記録は副産物として保持されます。請求書を発行し、追跡し、調整するエージェントは、入力なしで人がタイプしたであろう請求書、追跡者、調整を正確に残します。画面は、見る、レビューする、決定するために残ります。作業が行われる唯一の場所ではなくなります。
真剣に受け止めるべき反論
最も強い反論は、エージェントが作業を行うことができることを認め、時には自信を持って誤って行うことを指摘します。これは真実であり、正直な文書もそう述べています。ChatGPTは、読み取り専用の注釈がないツールをすべて書き込みとして扱い、デフォルトで確認を要求します。Claudeは、カスタムコネクタからツールを呼び出す前に承認を求め、悪意のあるサーバーが隠れた指示を持っている可能性があることを警告します。クライアントは慎重であるべきであり、ビジネスもそうあるべきです。
しかし、注意が必要な場所に気付いてください。それは、間違っている可能性のある当事者であるモデルの中には存在できません。それは、良いソフトウェアが人間のユーザーのためにすでに配置した場所であるソフトウェアの中に存在しなければなりません。検証、権限、承認の閾値、元に戻す、監査:これらのすべては、前のユーザーも自信を持って書き込みの際に間違いを犯したために存在します。エージェントネイティブソフトウェアは、画面デザイナーが覚えていた少数のアクションではなく、すべてのアクションでその古い規律を真剣に受け止め、昼食前に100のツールを呼び出すユーザーに適用します。
第二の反論は決定論です。同じ入力に対して同じ出力を毎回証明可能に生成する必要がある作業があります。その作業は固定されたワークフローのままであり、エージェントはそれを即興で行うのではなく、ツールとしてワークフローを呼び出すべきです。ここでは判断がルールに取って代わることはありません。システムは両方を必要とし、それを区別できるユーザーに対して公開される必要があります。
誰がそれを作り、誰のために
最後の結果は、起業家が気付くべきものです。ソフトウェアのユーザーがエージェントになれるなら、ビルダーもそうなれます。開発者は、すでに持っているエージェントに望むアプリを説明し、エージェントは一連のビルドツールに対してそれを構築し、開発者はローカルで検証して公開します。そして、初日からアプリが出荷するすべてのツールは、プラットフォーム上の他のすべてのエージェントが利用可能です。それをインストールするビジネスは、その画面を学ぶことはなく、スタッフはすでに使用しているエージェントを持ち込み、結果を説明します。これは、Soisが構築されている枠組みであり、結論ではなく議論の一つの実装としてここに提供されています。
結論はよりシンプルです。40年間、ソフトウェアデザイナーが尋ねた質問は、向こう側の人が何を見たいかということでした。次のユーザーはそれを見ません。それは契約を読み、呼び出すことが許可されているものを呼び出し、画面が構築された同じ人々のためにそれを行います。そのユーザーを第一級市民として扱うソフトウェアは、流暢に操作されます。画面を唯一の入り口として保持するソフトウェアは、コスチュームを着たエージェントによって、鍵穴を通して操作され続け、所有者がコスチュームに飽きて移動するまで続きます。
- モデルコンテキストプロトコル:導入 プロトコルとは何か、ポートのアナロジー、およびそれをサポートするクライアント
- モデルコンテキストプロトコル仕様:セキュリティと信頼 ユーザーの同意と管理、ツールの安全性、ヒューマンインザループ原則
- Anthropic: コンピュータ使用ツール Claudeのための画面制御、適切な場所にあり、重要なアクションを確認するためのガイダンス
- Sois:Soisとは何か 前のセクションで説明されたプラットフォーム、1つの実装として
この文書は、記載されている製品が変更される際にレビューされます。次回の予定レビュー: 2026年12月4日.
