Niemand kann Ihnen das beste agentische ERP empfehlen, ohne Ihr Unternehmen zu kennen, und jede Seite, die sie einstuft, verkauft Platzierungen oder rät. Was ehrlich getan werden kann, ist, Ihnen die Tests zu geben, die ein agentisches System von einem unterscheiden, das lediglich ein Chat-Fenster hinzugefügt hat, sowie die Beweise, die Sie von jedem Anbieter anfordern können. Es gibt fünf: ein offenes Protokoll, das es Ihrem eigenen Agenten ermöglicht, von außen zu verbinden; Berechtigungen, die pro Benutzer bei jedem Aufruf durchgesetzt werden; ein Ausgabenbudget, das der Agent nicht überschreiten kann; ein Audit-Protokoll, das die Arbeit des Agenten so vollständig aufzeichnet wie die eines Menschen; und einen Marktplatz, der zeigt, dass andere Entwickler das System mit denselben Werkzeugen erweitern können.
Führen Sie alle fünf Tests mit jedem Produkt auf Ihrer Shortlist in Ihrer eigenen Umgebung durch und bewerten Sie sie schriftlich. Das Produkt, das alle fünf besteht und die Module abdeckt, die Sie tatsächlich benötigen, ist das beste für Sie. Das ist eine Schlussfolgerung, die Sie vor einem Vorstand verteidigen können, was eine Rangliste nicht ist.
Warum es hier keine Rangliste gibt
Stellen Sie sich die engere Auswahl vor. Vier Anbieter, vier Vorschläge und das Wort agentisch auf jedem Cover. Einer ist eine etablierte Suite mit einem letzten Jahr hinzugefügten Assistenten. Einer ist ein neueres Produkt, das um seinen eigenen Agenten herum aufgebaut ist. Einer ist eine Plattform, die es jedem Agenten ermöglicht, über ein offenes Protokoll zu verbinden. Einer ist ein Workflow-Tool mit einem Sprachmodell in der Mitte. Alle vier Demos sind gut. Zwei von ihnen erwarten immer noch eine Person am Bildschirm für alles, was eine Modulgrenze überschreitet, und Sie werden nicht herausfinden, welche zwei aus den Vorschlägen.
Eine rangierte Liste kann dabei nicht helfen, aus einem Grund, der nichts mit der Qualität der Produkte zu tun hat. Agentisch ist eine Eigenschaft der Architektur, und ob eine bestimmte Architektur für Sie geeignet ist, hängt davon ab, welche Module Sie verwenden, welchen Agenten Ihr Team bereits nutzt, welche Genehmigungsschwellen Sie haben und wie viel Sie im Protokoll sehen müssen. Das sind Ihre Fakten, nicht die eines Rezensenten. Was zwischen Unternehmen ausgetauscht wird, ist die Menge an Tests, daher gibt Ihnen diese Seite die Tests und fordert Sie auf, die Rangfolge zu erstellen.
Test 1: offenes Protokoll, Ihr Agent von außen
Der erste Test ist, ob ein Agent, den der Anbieter nicht erstellt hat, das System bedienen kann. Der offene Standard dafür ist das Model Context Protocol, das die gängigen Agenten-Clients verwenden: Claude fügt einen Remote-MCP-Server als benutzerdefinierten Connector mit einer OAuth-Anmeldung hinzu; ChatGPT macht dasselbe im Entwicklermodus mit vollständiger Lese- und Schreibunterstützung; Coding-Agenten und interne Agenten, die auf den SDKs des Anbieters basieren, verbinden sich auf die gleiche Weise. Ein Produkt, das MCP spricht, kann von jedem von ihnen bedient werden. Ein Produkt, das nur mit seinem eigenen Assistenten funktioniert, kann von niemand anderem bedient werden, und diese Entscheidung wurde für Sie getroffen.
Der Nachweis, den Sie anfordern sollten, ist die Antwort des Servers auf eine tools/list-Anfrage, die gemäß dem Protokoll die maschinenlesbare Liste von allem ist, was der Agent tun kann. Sie sollte in etwa so aussehen, wiederholt für jede Aktion im System.
{
"tools": [
{
"name": "contacts.search",
"description": "Find contacts by name, email or company.",
"inputSchema": { "type": "object", "properties": { "query": { "type": "string" } }, "required": ["query"] }
},
{
"name": "invoices.create",
"description": "Create a draft invoice from billable lines. Fails if the caller cannot raise invoices.",
"inputSchema": { "type": "object", "properties": { "customer_id": { "type": "string" }, "lines": { "type": "array" } }, "required": ["customer_id", "lines"] }
},
{
"name": "purchase_orders.approve",
"description": "Approve a purchase order within the caller's approval limit.",
"inputSchema": { "type": "object", "properties": { "purchase_order_id": { "type": "string" } }, "required": ["purchase_order_id"] }
}
]
}Eine illustrative Antwort auf Werkzeuge/Listen in der Form, die die MCP-Spezifikation definiert. Namen und Abdeckung variieren je nach Produkt; entscheidend ist, dass die Liste existiert, typisiert ist und lang genug ist, um die von Ihnen verwendeten Module abzudecken.
Drei Dinge, die in der Liste überprüft werden müssen. Sie ist lang, da ein ERP Hunderte von Aktionen hat und eine Liste von zwanzig bedeutet, dass der Assistent zwanzig Funktionen erreicht. Sie ist typisiert, mit einem JSON-Schema für jede Eingabe, da dies dem Server ermöglicht, Aufrufe zu validieren, anstatt Prosa zu interpretieren. Und sie ändert sich, wenn sich ein eingeschränkterer Benutzer anmeldet, was die Brücke zum zweiten Test ist.
Test 2: benutzerspezifische Berechtigungen bei jedem Aufruf
An agent that can do more than the person it represents is a liability, not a feature. The second test is whether permissions are enforced per user and per call, not per product or per session. The protocol allows a server to vary the tool list by the authorisation presented and requires servers to implement proper access controls, but it cannot enforce either on the vendor's behalf. The good implementations filter the list before the agent sees it and then check again when each tool runs, because a filtered list is a courtesy and an execution-time check is a control.
Der Beweis ist eine live Ablehnung. Melden Sie sich als Benutzer an, der keine Bestellungen genehmigen kann, bitten Sie seinen Agenten, eine zu genehmigen, und beobachten Sie, was passiert. Die richtige Antwort ist eine klare Ablehnung zum Zeitpunkt des Anrufs, protokolliert, während der Rest der Anfrage weiterhin abgeschlossen wird. Die falschen Antworten sind eine Genehmigung, die durchgeht, ein Fehler, der verrät, was das Tool getan hätte, oder eine Sitzung, die offen bleibt, weil die Überprüfung nur auf dem Bildschirm war.
Test 3: Budget- und Kosten-Transparenz
Ein Agent, der auf den Modellen des Anbieters schlussfolgert, verbraucht jedes Mal etwas, wenn er läuft, und der dritte Test ist, ob Sie diese Ausgaben begrenzen und sehen können, wohin sie gegangen sind. Der spezifische Mechanismus ist weniger wichtig als die beiden Eigenschaften: ein pro Integration oder pro Schlüssel festgelegtes Limit, das der Agent nicht überschreiten kann, und ein pro Aktion aufgezeichnetes Protokoll, was jeder Lauf gekostet hat. Ein Produkt, das Ihnen nur nachträglich die monatliche Gesamtsumme mitteilen kann, hat den Zähler nicht gebaut, und das werden Sie herausfinden, wenn eine unkontrollierte Schleife oder ein neuer, eifriger Benutzer die Rechnung erhält.
Es gibt eine zweite Kostenfrage, die Bewertungsseiten völlig überspringen. Wenn das Produkt es Ihnen erlaubt, Ihren eigenen Agenten mitzubringen, dann kann der Anbieter, wenn dieser Agent die Schlussfolgerungen zieht, überhaupt keine KI in Ihrem Namen durchführen und dafür nichts berechnen. Für ein Team, das bereits für Claude oder ChatGPT bezahlt, verwandelt sich die Agentenkosten in eine Zeile, die Sie kontrollieren, anstatt in eine Zeile, die der Anbieter festlegt. Fragen Sie jeden Anbieter, was er berechnet, wenn Ihr eigener Agent das Denken übernimmt, und notieren Sie die Antwort.
Test 4: Prüfung, die wie ein persönliches Protokoll gelesen wird
Wenn ein Agent die Arbeit erledigt, wird das Protokoll zur primären Möglichkeit, wie ein Manager es überprüft, daher ist der vierte Test, ob die Prüfspur die Aktionen des Agenten so vollständig aufzeichnet wie die einer Person. Das Minimum ist, wer gefragt hat, welcher Agent in ihrem Namen gehandelt hat, welche Werkzeuge ausgeführt wurden, mit welchen Eingaben, mit welchem Ergebnis und wann. Die eigene Anleitung des Protokolls besagt, dass Kunden die Nutzung von Werkzeugen für die Prüfung protokollieren sollten; der Server sollte dasselbe von seiner Seite tun, da nur der Server weiß, was sich tatsächlich geändert hat.
Der Beweis ist das Protokoll selbst, nach der Demoanfrage. Öffnen Sie es und überprüfen Sie vier Dinge: Zuordnung zu einer Person, nicht zu einem generischen Integrationsbenutzer; die Reihenfolge der Werkzeugaufrufe, nicht nur die Protokolle, die geändert wurden; Eingaben und Ergebnisse, damit eine falsche Aktion auf eine falsche Eingabe zurückverfolgt werden kann; und Ablehnungen, denn ein Berechtigungsmodell, das seine Ablehnungen nicht protokolliert, kann nicht optimiert werden.
Test 5: ein Marktplatz und was er Ihnen sagt
Der fünfte Test ist indirekt, aber aufschlussreich. Wenn eine Plattform einen Marktplatz für Apps hat, die von anderen Personen als dem Anbieter erstellt wurden, und diese Apps von Agenten über dieselbe Werkzeugoberfläche wie die Kernmodule betrieben werden, dann ist die Werkzeugoberfläche real, dokumentiert und stabil genug, damit Außenstehende darauf aufbauen können. Ein Marktplatz ist die eigene Architektur des Anbieters, die jeden Tag von Fremden getestet wird. Er beantwortet auch die praktische Frage, was passiert, wenn Sie eine Funktion benötigen, die das Kernprodukt nicht hat: ob Sie auf die Roadmap warten, für maßgeschneiderte Arbeiten bezahlen oder etwas installieren, das bereits existiert.
Der Beweis ist eine veröffentlichte App von einem Drittanbieter, die in Ihrem Testarbeitsbereich installiert ist und in der Werkzeugliste des Agenten bei der nächsten Anfrage erscheint. Wenn der Marktplatz existiert, aber alle Apps vom Anbieter selbst sind, oder wenn die Installation einer App nicht ändert, was der Agent tun kann, ist der Test nur zur Hälfte bestanden.
Das Scorecard
Nehmen Sie dies in jede Demo mit und füllen Sie es am Tag aus. Bewerten Sie jeden Test als bestanden, teilweise bestanden oder nicht bestanden und bestehen Sie darauf, die Beweise zu sehen, anstatt nur darüber zu hören. Ein Produkt, das den ersten Test nicht besteht, ist ein Produkt mit einem Assistenten, egal was das Cover sagt, und die anderen vier Tests werden akademisch.
| Test | Was besteht | Beweise, nach denen zu fragen ist |
|---|---|---|
| 1. Offenes Protokoll | Ihr eigener Agent verbindet sich von außen über MCP mit OAuth | Eine Antwort auf die Werkzeuge/Liste; eine Live-Verbindung von Claude oder ChatGPT |
| 2. Benutzerberechtigungen | Werkzeuge nach Rolle gefiltert und bei jedem Aufruf erneut überprüft; bei Fehlern wird geschlossen | Der Agent eines eingeschränkten Benutzers wurde beim Aufruf abgelehnt, während der Rest abgeschlossen wurde |
| 3. Budget | Ein Limit pro Integration, das der Agent nicht überschreiten kann; Kosten pro Aktion sichtbar | Die Limit-Einstellung; ein Nutzungsprotokoll pro Aktion; der Preis, wenn Ihr eigener Agent argumentiert |
| 4. Prüfung | Wer gefragt hat, welcher Agent, welche Werkzeuge, Eingaben, Ergebnisse, Ablehnungen | Der Protokolleintrag für die Demoanfrage, die vor Ihnen geöffnet wurde |
| 5. Marktplatz | Drittanbieter-Apps, die über dieselbe Schnittstelle vom Agenten aufgerufen werden können. | Eine installierte App, die in der Werkzeugliste des Agenten erscheint. |
Bewertung schriftlich am Tag. Das beste agentische ERP auf Ihrer Shortlist ist das, das alle fünf Tests besteht und die Module abdeckt, die Sie nutzen.
Sois ist eine Implementierung, gegen die Sie diese Tests durchführen können, und da wir es entwickeln, können wir sagen, wie es reagiert. Ein Arbeitsbereich ist ein MCP-Server; jeder kompatible Client verbindet sich, indem er die Arbeitsbereichsadresse hinzufügt und sich einmal über OAuth anmeldet, ohne Token einfügen zu müssen. Werkzeuge werden vor der Bereitstellung nach der Rolle des Benutzers gefiltert und erneut überprüft, wenn sie ausgeführt werden, und der Zugriff wird geschlossen verweigert. Die Ausgaben können pro Integration begrenzt werden, jede Aktion wird protokolliert, und wenn Ihr eigener Agent das Denken übernimmt, führt die Plattform keine KI in Ihrem Namen aus und erhebt dafür keine Gebühren. Entwickler erstellen Apps mit ihrem eigenen Agenten, validieren sie lokal kostenlos und veröffentlichen sie in einem Marktplatz, wo jeder verbundene Agent sie aufrufen kann. Führen Sie die gleichen fünf Tests gegen sie durch wie gegen alle anderen; dafür sind sie da.
Fragen, die Menschen stellen
Gibt es ein bestes agentisches ERP für kleine Unternehmen?
Nicht als Rangliste. Das richtige hängt davon ab, welche Module Sie nutzen, welchen Agenten Ihr Team verwendet und wie viel Kontrolle Sie benötigen. Führen Sie die fünf Tests gegen die Produkte durch, die Ihre Module abdecken, in einem Testarbeitsbereich, und die Antwort ist das, das alle besteht.
Muss ein ERP MCP unterstützen, um agentisch zu sein?
Es muss seine Aktionen als Werkzeuge bereitstellen, die ein externer Agent aufrufen kann, und MCP ist der offene Standard, den die gängigen Clients dafür verwenden. Ein Produkt, das nur mit seinem eigenen Assistenten funktioniert, kann nützlich sein, hat jedoch entschieden, welchen Agenten Sie verwenden und wie weit er reicht.
Was ist der wichtigste Test?
Der erste. Wenn Ihr eigener Agent sich von außen über ein offenes Protokoll nicht verbinden kann, ist das Produkt ein Assistent innerhalb eines Bildschirms, und die verbleibenden Tests beschreiben Kontrollen, die es nicht benötigt. Wenn es besteht, ist der Berechtigungstest derjenige, der entscheidet, ob Sie ihm beim Schreiben vertrauen können.
- Model Context Protocol-Spezifikation: Werkzeuge tools/list und tools/call, berechtigungsabhängige Werkzeuglisten und die Sicherheitsanforderungen an Server und Clients einschließlich Audit-Protokollierung
- Anthropic: Erste Schritte mit benutzerdefinierten Verbindungen über remote MCP wie Claude sich mit einem entfernten MCP-Server über OAuth und genehmigung pro Werkzeug verbindet.
- OpenAI: ChatGPT-Entwicklermodus vollständige MCP-Kundenunterstützung in ChatGPT, einschließlich Schreibaktionen mit Bestätigung
- Sois-Dokumentation: der Arbeitsbereich MCP-Server wie eine Implementierung die fünf Tests beantwortet: OAuth, rollenbasierte Werkzeuge, fail-closed Ausführung, Budgetobergrenzen
Dieser Artikel wird überprüft, wenn sich die beschriebenen Produkte ändern. Nächste geplante Überprüfung: 4. Dezember 2026.
