Für Unternehmen Für Großunternehmen Lösungen Apps Preise Entwickler Blog Dokumentation Einen Arbeitsbereich starten
Blog / Agentic ERP

Wie man ein KI-ERP bewertet, ohne auf das Marketing hereinzufallen.

Ein Test übersteht jede Demo: Fordern Sie den Anbieter auf, ein echtes Ergebnis über Module hinweg zu erzielen, ohne dass jemand am Bildschirm ist, und verwenden Sie einen Agenten, den Sie mitbringen. So wählen Sie das Ergebnis aus, führen den Tag durch, bewerten es und lesen, was die Bewertung bedeutet.

6 Minuten LesezeitAktualisiert 4. September 2026Sois Engineering, das Team, das die Plattform entwickelt

Ein Konferenztisch vor einem Meeting: dunkles Holz, vier ausgedruckte Vorschläge mit der Vorderseite nach unten in einer Reihe, ein Krug Wasser, ein einzelner Bleistift, hohe Fenster mit grauem Morgenlicht
Kurze Antwort

Bewerten Sie ein KI-ERP, indem Sie jeden Anbieter bitten, ein echtes Ergebnis von Anfang bis Ende zu erzielen, ohne dass jemand am Bildschirm ist. Wählen Sie das Ergebnis selbst aus, lassen Sie es mindestens drei Module umfassen, bringen Sie den Agenten mit, den Ihr Team bereits verwendet, und formulieren Sie die Anfrage einmal. Öffnen Sie dann die Aufzeichnungen, melden Sie sich als eingeschränkter Benutzer an und wiederholen Sie den Vorgang, und lesen Sie das Protokoll. Bewerten Sie, was Sie auf einer festen Karte gesehen haben. Ein Produkt, das eine Person benötigt, um einen Teil des Ergebnisses durchzuklicken, ist ein Assistent; ein Produkt, das es abschließt und seine Arbeit im Protokoll innerhalb Ihrer Berechtigungen zeigt, ist ein agentisches System.

Der Grund, warum das funktioniert, ist, dass alles, was eine Folie behaupten kann, der Test innerhalb einer Stunde in Ihrer Umgebung und mit Ihren Daten überprüfen oder widerlegen kann. Es hat auch den nützlichen Vorteil, dass es der gleiche Test für jeden Anbieter ist, was die Bewertungen vergleichbar macht.

Der eine Test, der eine Demo übersteht

Eine Demo ist eine Aufführung. Der Präsentator wählte die Daten, übte die Anfrage und weiß, von welchen Funktionen er Abstand nehmen sollte. Nichts davon ist unehrlich, und nichts davon sagt Ihnen, was das Produkt mit Ihren Daten und Ihrer Anfrage tut. Wenn Sie wissen möchten, wie man ein KI-ERP bewertet, ist die kurze Antwort, die Anfrage vom Präsentator wegzunehmen.

Wählen Sie ein Ergebnis, das in Ihrem Unternehmen wichtig ist und das ein kompetenter Junior an einem Nachmittag erledigen könnte: einen Kunden in Rechnung stellen und nachverfolgen, Lagerbestände gegen einen Einkaufsauftrag buchen und die Rechnung des Lieferanten abgleichen oder ein akzeptiertes Angebot in einen Auftrag, einen Zeitplan und eine Anforderung für eine Anzahlung umwandeln. Bringen Sie den Agenten mit, den Ihr Team bereits verwendet, verbunden von außerhalb des Produkts des Anbieters über das Model Context Protocol, den offenen Standard, den die Mainstream-Kunden verwenden. Formulieren Sie die Anfrage in einer Nachricht und nehmen Sie die Hände von der Tastatur. Was auch immer als Nächstes passiert, ist die Bewertung.

Drei Dinge können passieren. Das Ergebnis wird abgeschlossen und die Aufzeichnungen sind korrekt. Das System erledigt einen Teil und übergibt den Rest an eine Person, normalerweise an einer Modulgrenze oder beim Speichern. Oder der eigene Agent des Anbieters schließt es ab, aber nichts von außen kann sich verbinden. Jedes dieser Szenarien ist ein anderes Produkt, und jedes wird unterschiedlich auf der Karte unten bewertet.

Das Ergebnis auswählen

Das Ergebnis erledigt den Großteil der Arbeit, wählen Sie es also aus, bevor Sie mit einem Anbieter sprechen, und verwenden Sie dasselbe für alle. Es sollte vier Bedingungen erfüllen.

  • Es überschreitet Module. Mindestens drei: Eine Anfrage, die innerhalb eines Bildschirms bleibt, testet den Co-Piloten, nicht den Agenten. Rechnungsstellung plus Kontakte plus E-Mail plus eine geplante Aufgabe ist eine gute Kombination. Wareneingang plus Bestellung plus Abgleich der Lieferantenrechnung ist eine weitere.
  • Es enthält einen Schreibvorgang. Lesen und Zusammenfassen ist die einfache Hälfte. Die Bewertung betrifft, ob das System einem Agenten erlaubt, Aufzeichnungen zu ändern, und ob es überprüft, wer fragt, bevor es dies tut.
  • Es hat eine offensichtliche Ausnahme. Beispiel eins: Ein Kunde mit zwei nahezu identischen Aufzeichnungen oder eine Liefermenge, die nicht mit der Bestellung übereinstimmt. Sie möchten sehen, ob der Agent fragt, rät oder stillschweigend korrigiert.
  • Es hat eine Nachverfolgung in der Zukunft. Eine Erinnerung, eine Nachverfolgung, eine geplante Überprüfung. Das testet, ob der Agent etwas für später hinterlassen kann und ob das System es ausführt, wenn das Datum erreicht ist.

Schreiben Sie die Anfrage in einfacher Sprache vor dem Tag auf, genau so, wie es ein Operations-Leiter eingeben würde, und lassen Sie den Anbieter sie nicht bearbeiten. Ein Anbieter, der um eine Umformulierung der Anfrage bittet, zeigt Ihnen, wo die Grenzen liegen.

Den Tag durchführen

Die folgende Abfolge dauert etwa eine Stunde pro Anbieter und benötigt niemanden Technisches. Bestehen Sie darauf, dies in einem Testarbeitsbereich zu tun, den Sie kontrollieren, mit Daten, die Sie geladen haben, und mit Ihrem eigenen Agenten verbunden. Wenn einer dieser drei Punkte abgelehnt wird, ist diese Ablehnung ein Ergebnis und wird auf die Karte geschrieben.

  1. Verbinden Sie Ihren eigenen AgentenFügen Sie den MCP-Server des Anbieters zu Claude, ChatGPT im Entwicklermodus oder zu welchem Client Ihr Team auch verwendet, hinzu und melden Sie sich an. Beachten Sie, ob es sich um eine OAuth-Anmeldung oder ein Token handelt, das Sie einfügen müssen, und ob der Anbieter dies überhaupt tun konnte.
  2. Liste der WerkzeugeFragen Sie den Agenten, was er tun darf. Lesen Sie die Liste hinsichtlich der Länge und Abdeckung der Module in Ihrem Ergebnis. Melden Sie sich dann als eingeschränkter Benutzer an und fragen Sie erneut; die Liste sollte kürzer werden.
  3. Geben Sie das Ergebnis einmal an.Geben Sie die vorbereitete Anfrage als Benutzer mit vollen Berechtigungen ein und stoppen Sie. Beantworten Sie nur echte Fragen des Agenten, wie z.B. welchen von zwei übereinstimmenden Kunden Sie gemeint haben. Zählen Sie die Rückgaben.
  4. Überprüfen Sie die AufzeichnungenÖffnen Sie jede Aufzeichnung, die die Anfrage berührt haben sollte. Bestätigen Sie die Rechnung, die E-Mail, die Bestandsbewegung, die Aufgabe. Führen Sie dann dieselbe Anfrage als eingeschränkter Benutzer aus und beobachten Sie, wo sie abgelehnt wird.
  5. Lesen Sie das Protokoll und den ZählerFinden Sie den Protokolleintrag: wer gefragt hat, welcher Agent, welche Werkzeuge, Eingaben, Ergebnisse, Ablehnungen. Finden Sie heraus, was die Ausführung gekostet hat und ob eine Obergrenze dies hätte stoppen können.
  6. Punktzahl des TagesFüllen Sie die Karte aus, bevor Sie den Raum verlassen. Das Gedächtnis ist freundlich zu guten Präsentatoren.

Das Scorecard

Bewerten Sie jede Zeile mit 0, 1 oder 2. Null bedeutet, dass Sie es nicht gesehen haben; eins bedeutet, dass Sie es mit einem Vorbehalt gesehen haben; zwei bedeutet, dass Sie es klar in Ihrer Umgebung gesehen haben, mit den Beweisen vor Ihnen. Zehn Zeilen, also ist das Maximum zwanzig. Gewichten Sie die Zeilen nicht, bevor Sie den Test an mindestens zwei Produkten durchgeführt haben; das Vorabgewicht ist, wie das Marketing zurückkommt.

RowWhat a 2 looks likeHäufiger Grund für eine 1 oder 0
Ergebnis abgeschlossenAlle Aufzeichnungen korrekt, keine Person am BildschirmRückgabe an einer Modulgrenze oder ein Speichern
Ihr Agent ist verbundenIhr eigener MCP-Client, OAuth-Anmeldung, kein Token zum EinfügenNur für den Assistenten des Anbieters oder einen eingefügten API-Schlüssel
Die Werkzeugliste ist echtLang, getippt, deckt Ihre Module ab, maschinenlesbarEin Dutzend Funktionen oder nur eine Liste auf einer Folie
Berechtigungen pro AufrufEingeschränkter Benutzer wurde beim Aufruf abgelehnt; der Rest wird abgeschlossenAblehnung nur beim Laden des Bildschirms oder eine Genehmigung, die durchgeht
Ausnahme behandeltDie eingepflanzte Mehrdeutigkeit erzeugte eine Frage, keine VermutungStille Korrektur oder ein falscher Datensatz ausgewählt
Zukünftige Aktion geplantDie Nachverfolgung existiert und wird am Datum durchgeführtEine Notiz in einer Zusammenfassung, nichts im System
Protokoll ist vollständigWer gefragt hat, Agent, Werkzeuge, Eingaben, Ergebnisse, AblehnungenDatensätze geändert, aber keine Anrufsequenz; ein generischer Integrationsbenutzer
Ausgaben sind begrenztEine Integrationsobergrenze, die der Agent nicht überschreiten kann; Kosten pro AktionNur monatliche Gesamtsumme oder keine Obergrenze
Kosten des eigenen AgentsNichts wird berechnet, wenn Ihr Agent das Denken übernimmtKI wird unabhängig davon berechnet, wer das Denken übernimmt
Von anderen erweiterbarEine Drittanbieter-App wird installiert und erscheint in der WerkzeuglisteNur Roadmap oder individuelle Arbeiten

Zehn Zeilen, zwei Punkte jeweils. Bewerten Sie jeden Anbieter nach demselben Ergebnis, am selben Tag, wenn möglich, und vergleichen Sie die Gesamtsummen erst, nachdem jede Zeile eine Zahl hat.

Das Ergebnis lesen

Gesamtergebnisse sind weniger wichtig als das Muster in den ersten vier Zeilen, denn diese vier entscheiden, um welche Art von Produkt es sich handelt. Ein Produkt, das in der Ergebnisbewertung null Punkte und null Punkte für die Verbindung zu Ihrem Agenten erzielt, ist ein Assistent innerhalb eines Bildschirms, und der Rest seiner Bewertung beschreibt Steuerungen, die es nicht benötigt. Es könnte dennoch der richtige Kauf sein, wenn Ihr Team einen schnelleren Bildschirm möchte, aber Sie sollten es als solchen kaufen.

Ein Produkt, das das Ergebnis erfüllt, aber null Punkte für die Verbindung zu Ihrem Agenten erzielt, ist agentisch mit einer geschlossenen Tür. Es funktioniert zu den Bedingungen des Anbieters, mit dem Agenten des Anbieters, zum Preis des Anbieters für die Begründung. Die Frage, die Sie sich stellen sollten, ist, was in zwei Jahren passiert, wenn der Agent Ihres Teams derjenige ist, den sie verwenden möchten, und ob der Anbieter etwas über das Öffnen der Tür gesagt hat.

Ein Produkt, das in allen vier Kategorien zwei Punkte erzielt, ist agent-native, und die verbleibenden sechs Zeilen sind der Ort, an dem der eigentliche Vergleich stattfindet: wie gut es die Ausnahme behandelt, die Sie eingebracht haben, wie vollständig das Protokoll ist, ob Ausgaben begrenzt werden können, was es kostet, wenn Ihr Agent die Begründung übernimmt, und ob Außenstehende es erweitern können. Zwei agent-native Produkte können sich in diesen sechs Punkten stark unterscheiden, und sie sind die Zeilen, die vorhersagen, wie das Leben mit dem Produkt sein wird.

Eine weitere Lesart. Wenn ein Anbieter den Test ablehnt, eine aufgezeichnete Version anbietet oder darum bittet, seine Anfrage gegen Ihre auszutauschen, bewerten Sie die Zeilen, die Sie nicht beobachten konnten, mit null und erklären Sie in den Anmerkungen, warum. Eine Ablehnung ist Information. Ein Produkt, das dies kann, wird es Ihnen zeigen wollen.

Was wir Ihnen zeigen würden

Sois ist ein Produkt, gegen das Sie diese Bewertung durchführen könnten, und da wir es entwickeln, können wir sagen, was Sie sehen würden. Ein Arbeitsbereich ist ein MCP-Server; Sie fügen seine Adresse zu Claude, ChatGPT oder einem anderen Client hinzu und melden sich einmal über OAuth an, ohne Token einfügen zu müssen. Die Werkzeugliste wird vor der Sichtbarkeit für den Agenten nach Ihrer Rolle gefiltert und bei jedem Toollauf erneut überprüft; der Zugriff wird geschlossen verweigert. Ausgaben können pro Integration begrenzt werden, jede Aktion wird protokolliert, und wenn Ihr eigener Agent die Begründung übernimmt, führt die Plattform keine KI in Ihrem Namen aus und erhebt dafür keine Gebühren. Apps aus dem Marktplatz erscheinen in der Werkzeugliste, sobald sie installiert sind. Hier ist das Rechnungsergebnis aus dem obigen Ablauf, während es läuft.

Claudeverbunden mitapp.sois.aiüber MCP
SieRechnung an Acme für die Arbeiten im September, E-Mail an Sarah Cole, und verfolgen Sie es, wenn es bis zum 18. nicht bezahlt ist.
Agent
  • Lesen der abrechenbaren Arbeiten des Projekts und des Kundenkontos.
  • Rechnung aus den abrechenbaren Zeilen erstellt.
  • An den Kundenkontakt per E-Mail gesendet.
  • Verfolgung für das Fälligkeitsdatum geplant
Erledigt.
Sois-Daten
INV-1064Rechnung erstellt, Acme Ltd
Sarah ColeE-Mail aus dem Arbeitsbereich-Posteingang gesendet
AufgabeNachfassen, wenn am fällig 18. September

Vier Werkzeuge in den Bereichen Buchhaltung, Kontakte, Posteingang und Aufgaben, mit dem Protokoll, das jeden Anruf zeigt. Führen Sie es als Benutzer aus, der keine Rechnungen erstellen kann, und der erste Schreibvorgang wird mit dem Grund abgelehnt.

Bewerten Sie es dann auf derselben Karte wie alle anderen. Der Sinn eines festen Tests ist, dass es egal ist, wer das Produkt gebaut hat, und eine Bewertung, die Sie verteidigen können, ist eine, die jeden Anbieter, einschließlich dieses, gleich behandelt hat.

Fragen, die Menschen stellen

Wie lange dauert diese Bewertung pro Anbieter?

Etwa eine Stunde, nachdem das Ergebnis geschrieben wurde und ein Testarbeitsbereich mit Ihren Daten existiert. Das Laden realistischer Daten und das Einbringen der Ausnahme ist die Vorbereitung; der Test selbst besteht aus einer Anfrage, zwei Anmeldungen und einem Lesen des Protokolls.

Was ist, wenn der Anbieter meinen eigenen Agenten nicht verbinden kann?

Setze diese Zeile auf null und führe den Test mit ihrem Agenten durch, damit du weiterhin die Ergebnisse, Berechtigungen, Protokolle und Kostenzeilen siehst. Entscheide dann, ob eine geschlossene Tür für dein Team akzeptabel ist, und frage den Anbieter, ob und wann sie sich öffnet.

Sollte ich die Scorecard-Zeilen gewichten?

Nicht bevor du den Test an mindestens zwei Produkten durchgeführt hast. Bewerte zuerst alle zehn Zeilen und entscheide dann, welche Zeilen für deinen Betrieb am wichtigsten sind. Eine vorherige Gewichtung ist der Weg, wie eine starke Präsentation wieder in eine Entscheidung gelangt, aus der der Test sie heraushalten sollte.

Quellen
  1. Model Context Protocol-Spezifikation: Werkzeuge Tool-Listen, autorisierungsabhängige Auflistung und die Empfehlung, dass ein Mensch im Prozess bleibt und die Möglichkeit hat, Tool-Aufrufe abzulehnen.
  2. Anthropic: Erste Schritte mit benutzerdefinierten Verbindungen über remote MCP Hinzufügen eines Remote-Servers, OAuth-Anmeldung und genehmigung pro Tool in Claude.
  3. OpenAI: ChatGPT-Entwicklermodus Vollständige MCP-Client-Unterstützung in ChatGPT; Schreibaktionen erfordern standardmäßig eine Bestätigung.
  4. Sois-Dokumentation: der Arbeitsbereich MCP-Server Was der Test bei einer Implementierung beobachtet: OAuth, rollenbasierte gefilterte Tools, fail-closed Ausführung, Budgetobergrenzen.

Dieser Artikel wird überprüft, wenn sich die beschriebenen Produkte ändern. Nächste geplante Überprüfung: 4. Dezember 2026.

Starten

Erforschen Sie die Sois-Plattform.

Wie die Plattform funktioniert, was die Berechtigungsebene tut und was sie kostet, in einfachen Worten.

  • Kostenloser Start
  • Bringen Sie Ihren eigenen Agenten mit
  • Kein Anbieter-Lock-in