Bewerten Sie ein KI-ERP, indem Sie jeden Anbieter bitten, ein echtes Ergebnis von Anfang bis Ende zu erzielen, ohne dass jemand am Bildschirm ist. Wählen Sie das Ergebnis selbst aus, lassen Sie es mindestens drei Module umfassen, bringen Sie den Agenten mit, den Ihr Team bereits verwendet, und formulieren Sie die Anfrage einmal. Öffnen Sie dann die Aufzeichnungen, melden Sie sich als eingeschränkter Benutzer an und wiederholen Sie den Vorgang, und lesen Sie das Protokoll. Bewerten Sie, was Sie auf einer festen Karte gesehen haben. Ein Produkt, das eine Person benötigt, um einen Teil des Ergebnisses durchzuklicken, ist ein Assistent; ein Produkt, das es abschließt und seine Arbeit im Protokoll innerhalb Ihrer Berechtigungen zeigt, ist ein agentisches System.
Der Grund, warum das funktioniert, ist, dass alles, was eine Folie behaupten kann, der Test innerhalb einer Stunde in Ihrer Umgebung und mit Ihren Daten überprüfen oder widerlegen kann. Es hat auch den nützlichen Vorteil, dass es der gleiche Test für jeden Anbieter ist, was die Bewertungen vergleichbar macht.
Der eine Test, der eine Demo übersteht
Eine Demo ist eine Aufführung. Der Präsentator wählte die Daten, übte die Anfrage und weiß, von welchen Funktionen er Abstand nehmen sollte. Nichts davon ist unehrlich, und nichts davon sagt Ihnen, was das Produkt mit Ihren Daten und Ihrer Anfrage tut. Wenn Sie wissen möchten, wie man ein KI-ERP bewertet, ist die kurze Antwort, die Anfrage vom Präsentator wegzunehmen.
Wählen Sie ein Ergebnis, das in Ihrem Unternehmen wichtig ist und das ein kompetenter Junior an einem Nachmittag erledigen könnte: einen Kunden in Rechnung stellen und nachverfolgen, Lagerbestände gegen einen Einkaufsauftrag buchen und die Rechnung des Lieferanten abgleichen oder ein akzeptiertes Angebot in einen Auftrag, einen Zeitplan und eine Anforderung für eine Anzahlung umwandeln. Bringen Sie den Agenten mit, den Ihr Team bereits verwendet, verbunden von außerhalb des Produkts des Anbieters über das Model Context Protocol, den offenen Standard, den die Mainstream-Kunden verwenden. Formulieren Sie die Anfrage in einer Nachricht und nehmen Sie die Hände von der Tastatur. Was auch immer als Nächstes passiert, ist die Bewertung.
Drei Dinge können passieren. Das Ergebnis wird abgeschlossen und die Aufzeichnungen sind korrekt. Das System erledigt einen Teil und übergibt den Rest an eine Person, normalerweise an einer Modulgrenze oder beim Speichern. Oder der eigene Agent des Anbieters schließt es ab, aber nichts von außen kann sich verbinden. Jedes dieser Szenarien ist ein anderes Produkt, und jedes wird unterschiedlich auf der Karte unten bewertet.
Das Ergebnis auswählen
Das Ergebnis erledigt den Großteil der Arbeit, wählen Sie es also aus, bevor Sie mit einem Anbieter sprechen, und verwenden Sie dasselbe für alle. Es sollte vier Bedingungen erfüllen.
- Es überschreitet Module. Mindestens drei: Eine Anfrage, die innerhalb eines Bildschirms bleibt, testet den Co-Piloten, nicht den Agenten. Rechnungsstellung plus Kontakte plus E-Mail plus eine geplante Aufgabe ist eine gute Kombination. Wareneingang plus Bestellung plus Abgleich der Lieferantenrechnung ist eine weitere.
- Es enthält einen Schreibvorgang. Lesen und Zusammenfassen ist die einfache Hälfte. Die Bewertung betrifft, ob das System einem Agenten erlaubt, Aufzeichnungen zu ändern, und ob es überprüft, wer fragt, bevor es dies tut.
- Es hat eine offensichtliche Ausnahme. Beispiel eins: Ein Kunde mit zwei nahezu identischen Aufzeichnungen oder eine Liefermenge, die nicht mit der Bestellung übereinstimmt. Sie möchten sehen, ob der Agent fragt, rät oder stillschweigend korrigiert.
- Es hat eine Nachverfolgung in der Zukunft. Eine Erinnerung, eine Nachverfolgung, eine geplante Überprüfung. Das testet, ob der Agent etwas für später hinterlassen kann und ob das System es ausführt, wenn das Datum erreicht ist.
Schreiben Sie die Anfrage in einfacher Sprache vor dem Tag auf, genau so, wie es ein Operations-Leiter eingeben würde, und lassen Sie den Anbieter sie nicht bearbeiten. Ein Anbieter, der um eine Umformulierung der Anfrage bittet, zeigt Ihnen, wo die Grenzen liegen.
Den Tag durchführen
Die folgende Abfolge dauert etwa eine Stunde pro Anbieter und benötigt niemanden Technisches. Bestehen Sie darauf, dies in einem Testarbeitsbereich zu tun, den Sie kontrollieren, mit Daten, die Sie geladen haben, und mit Ihrem eigenen Agenten verbunden. Wenn einer dieser drei Punkte abgelehnt wird, ist diese Ablehnung ein Ergebnis und wird auf die Karte geschrieben.
- Verbinden Sie Ihren eigenen AgentenFügen Sie den MCP-Server des Anbieters zu Claude, ChatGPT im Entwicklermodus oder zu welchem Client Ihr Team auch verwendet, hinzu und melden Sie sich an. Beachten Sie, ob es sich um eine OAuth-Anmeldung oder ein Token handelt, das Sie einfügen müssen, und ob der Anbieter dies überhaupt tun konnte.
- Liste der WerkzeugeFragen Sie den Agenten, was er tun darf. Lesen Sie die Liste hinsichtlich der Länge und Abdeckung der Module in Ihrem Ergebnis. Melden Sie sich dann als eingeschränkter Benutzer an und fragen Sie erneut; die Liste sollte kürzer werden.
- Geben Sie das Ergebnis einmal an.Geben Sie die vorbereitete Anfrage als Benutzer mit vollen Berechtigungen ein und stoppen Sie. Beantworten Sie nur echte Fragen des Agenten, wie z.B. welchen von zwei übereinstimmenden Kunden Sie gemeint haben. Zählen Sie die Rückgaben.
- Überprüfen Sie die AufzeichnungenÖffnen Sie jede Aufzeichnung, die die Anfrage berührt haben sollte. Bestätigen Sie die Rechnung, die E-Mail, die Bestandsbewegung, die Aufgabe. Führen Sie dann dieselbe Anfrage als eingeschränkter Benutzer aus und beobachten Sie, wo sie abgelehnt wird.
- Lesen Sie das Protokoll und den ZählerFinden Sie den Protokolleintrag: wer gefragt hat, welcher Agent, welche Werkzeuge, Eingaben, Ergebnisse, Ablehnungen. Finden Sie heraus, was die Ausführung gekostet hat und ob eine Obergrenze dies hätte stoppen können.
- Punktzahl des TagesFüllen Sie die Karte aus, bevor Sie den Raum verlassen. Das Gedächtnis ist freundlich zu guten Präsentatoren.
Das Scorecard
Bewerten Sie jede Zeile mit 0, 1 oder 2. Null bedeutet, dass Sie es nicht gesehen haben; eins bedeutet, dass Sie es mit einem Vorbehalt gesehen haben; zwei bedeutet, dass Sie es klar in Ihrer Umgebung gesehen haben, mit den Beweisen vor Ihnen. Zehn Zeilen, also ist das Maximum zwanzig. Gewichten Sie die Zeilen nicht, bevor Sie den Test an mindestens zwei Produkten durchgeführt haben; das Vorabgewicht ist, wie das Marketing zurückkommt.
| Row | What a 2 looks like | Häufiger Grund für eine 1 oder 0 |
|---|---|---|
| Ergebnis abgeschlossen | Alle Aufzeichnungen korrekt, keine Person am Bildschirm | Rückgabe an einer Modulgrenze oder ein Speichern |
| Ihr Agent ist verbunden | Ihr eigener MCP-Client, OAuth-Anmeldung, kein Token zum Einfügen | Nur für den Assistenten des Anbieters oder einen eingefügten API-Schlüssel |
| Die Werkzeugliste ist echt | Lang, getippt, deckt Ihre Module ab, maschinenlesbar | Ein Dutzend Funktionen oder nur eine Liste auf einer Folie |
| Berechtigungen pro Aufruf | Eingeschränkter Benutzer wurde beim Aufruf abgelehnt; der Rest wird abgeschlossen | Ablehnung nur beim Laden des Bildschirms oder eine Genehmigung, die durchgeht |
| Ausnahme behandelt | Die eingepflanzte Mehrdeutigkeit erzeugte eine Frage, keine Vermutung | Stille Korrektur oder ein falscher Datensatz ausgewählt |
| Zukünftige Aktion geplant | Die Nachverfolgung existiert und wird am Datum durchgeführt | Eine Notiz in einer Zusammenfassung, nichts im System |
| Protokoll ist vollständig | Wer gefragt hat, Agent, Werkzeuge, Eingaben, Ergebnisse, Ablehnungen | Datensätze geändert, aber keine Anrufsequenz; ein generischer Integrationsbenutzer |
| Ausgaben sind begrenzt | Eine Integrationsobergrenze, die der Agent nicht überschreiten kann; Kosten pro Aktion | Nur monatliche Gesamtsumme oder keine Obergrenze |
| Kosten des eigenen Agents | Nichts wird berechnet, wenn Ihr Agent das Denken übernimmt | KI wird unabhängig davon berechnet, wer das Denken übernimmt |
| Von anderen erweiterbar | Eine Drittanbieter-App wird installiert und erscheint in der Werkzeugliste | Nur Roadmap oder individuelle Arbeiten |
Zehn Zeilen, zwei Punkte jeweils. Bewerten Sie jeden Anbieter nach demselben Ergebnis, am selben Tag, wenn möglich, und vergleichen Sie die Gesamtsummen erst, nachdem jede Zeile eine Zahl hat.
Das Ergebnis lesen
Gesamtergebnisse sind weniger wichtig als das Muster in den ersten vier Zeilen, denn diese vier entscheiden, um welche Art von Produkt es sich handelt. Ein Produkt, das in der Ergebnisbewertung null Punkte und null Punkte für die Verbindung zu Ihrem Agenten erzielt, ist ein Assistent innerhalb eines Bildschirms, und der Rest seiner Bewertung beschreibt Steuerungen, die es nicht benötigt. Es könnte dennoch der richtige Kauf sein, wenn Ihr Team einen schnelleren Bildschirm möchte, aber Sie sollten es als solchen kaufen.
Ein Produkt, das das Ergebnis erfüllt, aber null Punkte für die Verbindung zu Ihrem Agenten erzielt, ist agentisch mit einer geschlossenen Tür. Es funktioniert zu den Bedingungen des Anbieters, mit dem Agenten des Anbieters, zum Preis des Anbieters für die Begründung. Die Frage, die Sie sich stellen sollten, ist, was in zwei Jahren passiert, wenn der Agent Ihres Teams derjenige ist, den sie verwenden möchten, und ob der Anbieter etwas über das Öffnen der Tür gesagt hat.
Ein Produkt, das in allen vier Kategorien zwei Punkte erzielt, ist agent-native, und die verbleibenden sechs Zeilen sind der Ort, an dem der eigentliche Vergleich stattfindet: wie gut es die Ausnahme behandelt, die Sie eingebracht haben, wie vollständig das Protokoll ist, ob Ausgaben begrenzt werden können, was es kostet, wenn Ihr Agent die Begründung übernimmt, und ob Außenstehende es erweitern können. Zwei agent-native Produkte können sich in diesen sechs Punkten stark unterscheiden, und sie sind die Zeilen, die vorhersagen, wie das Leben mit dem Produkt sein wird.
Eine weitere Lesart. Wenn ein Anbieter den Test ablehnt, eine aufgezeichnete Version anbietet oder darum bittet, seine Anfrage gegen Ihre auszutauschen, bewerten Sie die Zeilen, die Sie nicht beobachten konnten, mit null und erklären Sie in den Anmerkungen, warum. Eine Ablehnung ist Information. Ein Produkt, das dies kann, wird es Ihnen zeigen wollen.
Was wir Ihnen zeigen würden
Sois ist ein Produkt, gegen das Sie diese Bewertung durchführen könnten, und da wir es entwickeln, können wir sagen, was Sie sehen würden. Ein Arbeitsbereich ist ein MCP-Server; Sie fügen seine Adresse zu Claude, ChatGPT oder einem anderen Client hinzu und melden sich einmal über OAuth an, ohne Token einfügen zu müssen. Die Werkzeugliste wird vor der Sichtbarkeit für den Agenten nach Ihrer Rolle gefiltert und bei jedem Toollauf erneut überprüft; der Zugriff wird geschlossen verweigert. Ausgaben können pro Integration begrenzt werden, jede Aktion wird protokolliert, und wenn Ihr eigener Agent die Begründung übernimmt, führt die Plattform keine KI in Ihrem Namen aus und erhebt dafür keine Gebühren. Apps aus dem Marktplatz erscheinen in der Werkzeugliste, sobald sie installiert sind. Hier ist das Rechnungsergebnis aus dem obigen Ablauf, während es läuft.
- Lesen der abrechenbaren Arbeiten des Projekts und des Kundenkontos.
- Rechnung aus den abrechenbaren Zeilen erstellt.
- An den Kundenkontakt per E-Mail gesendet.
- Verfolgung für das Fälligkeitsdatum geplant
Vier Werkzeuge in den Bereichen Buchhaltung, Kontakte, Posteingang und Aufgaben, mit dem Protokoll, das jeden Anruf zeigt. Führen Sie es als Benutzer aus, der keine Rechnungen erstellen kann, und der erste Schreibvorgang wird mit dem Grund abgelehnt.
Bewerten Sie es dann auf derselben Karte wie alle anderen. Der Sinn eines festen Tests ist, dass es egal ist, wer das Produkt gebaut hat, und eine Bewertung, die Sie verteidigen können, ist eine, die jeden Anbieter, einschließlich dieses, gleich behandelt hat.
Fragen, die Menschen stellen
Wie lange dauert diese Bewertung pro Anbieter?
Etwa eine Stunde, nachdem das Ergebnis geschrieben wurde und ein Testarbeitsbereich mit Ihren Daten existiert. Das Laden realistischer Daten und das Einbringen der Ausnahme ist die Vorbereitung; der Test selbst besteht aus einer Anfrage, zwei Anmeldungen und einem Lesen des Protokolls.
Was ist, wenn der Anbieter meinen eigenen Agenten nicht verbinden kann?
Setze diese Zeile auf null und führe den Test mit ihrem Agenten durch, damit du weiterhin die Ergebnisse, Berechtigungen, Protokolle und Kostenzeilen siehst. Entscheide dann, ob eine geschlossene Tür für dein Team akzeptabel ist, und frage den Anbieter, ob und wann sie sich öffnet.
Sollte ich die Scorecard-Zeilen gewichten?
Nicht bevor du den Test an mindestens zwei Produkten durchgeführt hast. Bewerte zuerst alle zehn Zeilen und entscheide dann, welche Zeilen für deinen Betrieb am wichtigsten sind. Eine vorherige Gewichtung ist der Weg, wie eine starke Präsentation wieder in eine Entscheidung gelangt, aus der der Test sie heraushalten sollte.
- Model Context Protocol-Spezifikation: Werkzeuge Tool-Listen, autorisierungsabhängige Auflistung und die Empfehlung, dass ein Mensch im Prozess bleibt und die Möglichkeit hat, Tool-Aufrufe abzulehnen.
- Anthropic: Erste Schritte mit benutzerdefinierten Verbindungen über remote MCP Hinzufügen eines Remote-Servers, OAuth-Anmeldung und genehmigung pro Tool in Claude.
- OpenAI: ChatGPT-Entwicklermodus Vollständige MCP-Client-Unterstützung in ChatGPT; Schreibaktionen erfordern standardmäßig eine Bestätigung.
- Sois-Dokumentation: der Arbeitsbereich MCP-Server Was der Test bei einer Implementierung beobachtet: OAuth, rollenbasierte gefilterte Tools, fail-closed Ausführung, Budgetobergrenzen.
Dieser Artikel wird überprüft, wenn sich die beschriebenen Produkte ändern. Nächste geplante Überprüfung: 4. Dezember 2026.
