AI ERPを評価するには、各ベンダーに、画面に誰もいない状態で、エンドツーエンドで実際の成果を完了させるよう依頼します。成果を自分で選び、少なくとも3つのモジュールを跨がせ、チームがすでに使用しているエージェントを持参し、リクエストを一度だけ述べます。その後、記録を開き、制限されたユーザーとしてサインインし、繰り返し、ログを読みます。見たものに対して固定カードでスコアを付けます。成果の一部をクリックする必要がある製品はアシスタントであり、成果を完了し、あなたの権限内でログに作業を示す製品はエージェントシステムです。
これが機能する理由は、スライドが主張できるすべてのことを、テストがあなたの環境で、あなたのデータを使って1時間で検証または反証できるからです。また、すべてのベンダーに対して同じテストであるという有用な特性があり、これがスコアを比較可能にします。
デモを超える唯一のテスト
デモはパフォーマンスです。プレゼンターはデータを選び、リクエストをリハーサルし、避けるべき機能を知っています。それはどれも不誠実ではなく、あなたのデータとリクエストの際に製品が何をするかを教えてくれるものではありません。AI ERPを評価する方法を知りたい場合、短い答えはプレゼンターからリクエストを取り去ることです。
あなたのビジネスで重要な成果を1つ選び、能力のあるジュニアが午後にできること: 顧客に請求書を発行し、追跡する、発注書に対して在庫を予約し、サプライヤーの請求書と照合する、または受け入れられた見積もりを仕事、スケジュール、預金リクエストに変える。チームがすでに使用しているエージェントを持参し、ベンダーの製品の外部からModel Context Protocolを介して接続します。リクエストを1つのメッセージで述べ、キーボードから手を離します。次に何が起こるかが評価です。
三つのことが起こり得ます。結果が完了し、記録が正しい場合。システムが一部を処理し、残りを通常はモジュールの境界や保存時に人に渡す場合。あるいは、ベンダー自身のエージェントが完了させるが、外部からは接続できない場合。それぞれが異なる製品であり、下のカードで異なるスコアが付けられます。
成果の選択
結果がほとんどの作業を行うため、どのベンダーとも話す前にそれを選択し、すべてに同じものを使用してください。それは四つの条件を満たす必要があります。
- モジュールを横断します。 少なくとも三つ:一つの画面内に留まるリクエストはコパイロットをテストし、エージェントをテストしません。請求書、連絡先、メール、スケジュールされたタスクの組み合わせは良い形です。在庫受領、発注書、仕入先請求書の照合は別の形です。
- 書き込みが含まれています。 読み取りと要約は簡単な半分です。評価は、システムがエージェントに記録を変更させるかどうか、そしてそれを行う前に誰が要求しているかを確認するかどうかに関するものです。
- 明らかな例外があります。 例1:ほぼ同一の記録を持つ顧客、または注文と一致しない納品数量。エージェントが尋ねるのか、推測するのか、静かに修正するのかを確認したいです。
- 将来のフォローアップがあります。 リマインダー、追跡、スケジュールされたチェック。それは、エージェントが後で何かを残せるかどうか、そしてシステムがその日が来たときにそれを実行するかどうかをテストします。
その日より前に、オペレーションリードが入力するのと同じように、平易な言葉でリクエストを書き留め、ベンダーに編集させないでください。リクエストの言い換えを求めるベンダーは、境界がどこにあるかを示しています。
日を運営する
以下の手順は、ベンダーごとに約1時間かかり、技術者は必要ありません。あなたが管理するトライアルワークスペースで、あなたがロードしたデータを使用し、あなた自身のエージェントを接続して行うように主張してください。その三つのうちのいずれかが拒否された場合、その拒否は結果となり、カードに記載されます。
- 自分のエージェントを接続するベンダーのMCPサーバーをClaude、ChatGPTの開発者モード、またはチームが使用するクライアントに追加し、サインインします。OAuthサインインか、ペーストする必要があるトークンか、ベンダーがそれを行えるかどうかを確認してください。
- ツールのリストエージェントに何が許可されているかを尋ねます。結果におけるモジュールの長さとカバレッジのリストを読みます。その後、制限されたユーザーとしてサインインし、再度尋ねます。リストは縮小するはずです。
- 結果を一度述べてください。準備したリクエストをフルパーミッションユーザーとして入力し、停止します。エージェントからの本物の質問のみ(例えば、2人の一致する顧客のうちどちらを指しているのか)に答えます。ハンドバックの数を数えます。
- 記録を確認するリクエストが触れるべきすべての記録を開きます。請求書、メール、在庫の動き、タスクを確認します。その後、制限されたユーザーとして同じリクエストを実行し、どこで拒否されるかを確認します。
- ログとメーターを読むログエントリを見つけます:誰が尋ねたか、どのエージェント、どのツール、入力、結果、拒否。実行コストと、上限がそれを止められたかどうかを確認します。
- その日のスコア部屋を出る前にカードに記入します。記憶は良いプレゼンターに優しいです。
スコアカード
各行に0、1、または2のスコアを付けてください。0は見なかったことを意味し、1は注意点付きで見たことを意味し、2はあなたの環境で明確に見たことを意味し、証拠が目の前にあることを示します。行は10行あり、最大は20です。少なくとも2つの製品でテストを実施する前に行に重みを付けないでください。事前に重みを付けることはマーケティングが戻ってくる方法です。
| Row | 2の見た目 | 1または0の一般的な理由 |
|---|---|---|
| 結果が完了しました | すべての記録が正確で、画面に人はいません | モジュール境界でのハンドバックまたは保存 |
| あなたのエージェントが接続されました | あなた専用のMCPクライアント、OAuthサインイン、トークンを貼り付ける必要なし | ベンダーのアシスタントのみ、または貼り付けたAPIキー |
| ツールリストは実在します | 長文で入力され、モジュールをカバーし、機械可読性があります。 | 12の機能、またはスライド上のリストのみ。 |
| コールごとの権限。 | 制限されたユーザーはコールで拒否され、他は完了します。 | 画面の読み込み時のみ拒否、または承認が通過します。 |
| 例外が処理されました。 | 植え付けられた曖昧さは、推測ではなく質問を生み出しました。 | 静かな修正、または誤った記録が選択されました。 |
| 将来のアクションが予定されています。 | フォローアップは存在し、指定された日に実行されます。 | 要約にメモがあり、システムには何もありません。 |
| ログは完了しています。 | 誰が尋ねたか、エージェント、ツール、入力、結果、拒否 | レコードは変更されましたが、コールシーケンスはありません。一般的な統合ユーザーです。 |
| 支出には上限があります | エージェントが超えることのできない統合ごとの上限;アクションごとのコスト | 月間合計のみ、または上限なし |
| 自社エージェントのコスト | エージェントが推論を行う際は料金は発生しません | 誰が推論を行ってもAIには料金が発生します |
| 他の人によって拡張可能 | サードパーティアプリがインストールされ、ツールリストに表示されます | ロードマップまたはカスタム作業のみ |
10行、各2ポイント。可能であれば、同じ結果で同じ日にすべてのベンダーを評価し、各行に数字が入った後にのみ合計を比較してください。
結果を読む
合計は最初の4行のパターンより重要ではありません。なぜなら、その4行があなたが見ている製品の種類を決定するからです。結果がゼロで、あなたのエージェントが接続できない製品は、画面内のアシスタントであり、残りのスコアは必要のないコントロールを示しています。もしあなたのチームがより速い画面を望んでいるのであれば、それは適切な購入かもしれませんが、そのように購入すべきです。
結果を達成するが、あなたのエージェントが接続できない製品は、閉じたドアを持つエージェント的な製品です。それは、ベンダーの条件で、ベンダーのエージェントとともに、ベンダーの価格で機能します。自問すべきは、あなたのチームのエージェントが使いたいエージェントになる2年後に何が起こるのか、そしてベンダーがドアを開けることについて何か言ったかどうかです。
すべての4項目で2点を獲得する製品はエージェントネイティブであり、残りの6行が実際の比較が行われる場所です:あなたが植えた例外をどれだけうまく処理するか、ログがどれだけ完全か、支出を制限できるか、あなたのエージェントが推論する際に何を請求するか、外部者がそれを拡張できるかどうかです。2つのエージェントネイティブ製品は、これらの6項目で大きく異なる可能性があり、これらの行が製品と共に生活することがどのようなものになるかを予測します。
もう一つの読み方です。もしベンダーがテストを拒否するか、録画版を提供するか、彼らのリクエストをあなたのリクエストに置き換えるように求める場合、観察できなかった行はゼロとしてスコアを付け、その理由をノートに記載してください。拒否は情報です。これができる製品は、あなたに見せたいと思うでしょう。
私たちがあなたに見せるもの
Soisはこの評価を行うことができる製品の一つであり、私たちがそれを構築しているので、あなたが見ることになるものを説明できます。ワークスペースはMCPサーバーです。そのアドレスをClaude、ChatGPT、または他のクライアントに追加し、OAuthで一度サインインします。トークンを貼り付ける必要はありません。ツールリストは、エージェントが見る前にあなたの役割によってフィルタリングされ、各ツールが実行される際に再度確認されます。アクセスは閉じた状態で失敗します。支出は統合ごとに制限でき、すべてのアクションがログに記録され、あなた自身のエージェントが推論を行うとき、プラットフォームはあなたの代わりにAIを実行せず、何も請求しません。マーケットプレイスからのアプリは、インストールされるとツールリストに表示されます。上記のフローからの請求結果は、実行されると以下の通りです。
- プロジェクトの請求可能な作業と顧客記録を読み取る
- 請求可能な行から作成された請求書
- 顧客の連絡先にメールで送信されました
- 支払期日に追跡を予定
会計、連絡先、受信トレイ、タスクにまたがる4つのツールがあり、ログには各呼び出しが表示されます。請求書を発行できないユーザーとして実行すると、最初の書き込みが拒否され、その理由が示されます。
その後、他のすべての人と同じカードでスコアを付けてください。固定テストの目的は、製品を誰が構築したかに関係なく、あなたが擁護できる評価は、このベンダーを含むすべてのベンダーを同じように扱ったものであるということです。
人々が尋ねる質問
この評価はベンダーごとにどのくらいの時間がかかりますか?
結果が書かれ、あなたのデータを含む試用ワークスペースが存在する場合、約1時間です。現実的なデータを読み込み、例外を植え付けることが準備です。テスト自体は1つのリクエスト、2回のサインイン、そしてログの読み取りです。
もしベンダーが私のエージェントの接続を許可できない場合はどうなりますか?
その行をゼロにスコアリングし、エージェントとテストを実行して結果、権限、ログ、コストの行を確認します。その後、閉じたドアがチームにとって受け入れ可能かどうかを判断し、ベンダーにいつ開くかを尋ねてください。
スコアカードの行に重みを付けるべきですか?
少なくとも2つの製品でテストを実行する前には、重みを付けないでください。まず10行すべてにスコアを付け、その後、どの行があなたの業務に最も重要かを決定します。事前に重みを付けることは、強力なプレゼンテーションがテストの目的から外れる決定に戻る方法です。
- モデルコンテキストプロトコル仕様:ツール ツールリスト、承認依存のリスト、および人間がツール呼び出しを拒否できるようにループ内に留まることを推奨します。
- Anthropic: リモートMCPを使用したカスタムコネクタの開始方法 リモートサーバーの追加、OAuthサインイン、およびClaudeでのツールごとの承認
- OpenAI: ChatGPT開発者モード ChatGPTでの完全なMCPクライアントサポート;書き込みアクションはデフォルトで確認を必要とします。
- Soisドキュメント:ワークスペースMCPサーバー テストが1つの実装で観察する内容:OAuth、役割フィルタリングツール、フェイルクローズ実行、予算上限
この文書は、記載されている製品が変更される際にレビューされます。次回の予定レビュー: 2026年12月4日.
