Evalueer een AI ERP door elke leverancier te vragen om één echt resultaat te voltooien, van begin tot eind, zonder iemand achter het scherm. Kies het resultaat zelf, zorg ervoor dat het over ten minste drie modules gaat, breng de agent mee die je team al gebruikt, en geef de aanvraag één keer aan. Open vervolgens de records, log in als een beperkte gebruiker en herhaal, en lees het logboek. Beoordeel wat je hebt gezien op een vaste kaart. Een product dat een persoon nodig heeft om door een deel van het resultaat te klikken, is een assistent; een product dat het voltooit en zijn werk in het logboek toont, binnen jouw rechten, is een agentisch systeem.
De reden dat dit werkt, is dat alles wat een dia kan beweren, de test kan verifiëren of falsifiëren in een uur, in jouw omgeving, op jouw data. Het heeft ook het nuttige kenmerk dat het dezelfde test is voor elke leverancier, wat de scores vergelijkbaar maakt.
De enige test die een demo overleeft
Een demo is een voorstelling. De presentator koos de data, oefende de aanvraag en weet welke functies te vermijden. Geen van dit is oneerlijk, en niets daarvan vertelt je wat het product doet wanneer het jouw data en jouw aanvraag is. Als je wilt weten hoe je een AI ERP moet evalueren, is het korte antwoord om de aanvraag weg te nemen van de presentator.
Kies één resultaat dat belangrijk is voor jouw bedrijf en dat een competente junior in een middag kan doen: factureer een klant en volg deze op, boek voorraad tegen een inkooporder en match de factuur van de leverancier, of zet een geaccepteerde offerte om in een klus, een planning en een verzoek om aanbetaling. Breng de agent mee die jouw team al gebruikt, verbonden van buiten het product van de leverancier via het Model Context Protocol, de open standaard die de gangbare klanten gebruiken. Geef de aanvraag in één bericht aan en laat je handen van het toetsenbord. Wat er daarna ook gebeurt, is de evaluatie.
Er kunnen drie dingen gebeuren. Het resultaat wordt voltooid en de records zijn juist. Het systeem doet een deel ervan en geeft de rest aan een persoon, meestal bij een modulegrens of bij een Opslaan. Of de eigen agent van de leverancier voltooit het, maar niets van buitenaf kan verbinden. Elk van deze is een ander product, en elk scoort anders op de kaart hieronder.
Het resultaat kiezen
De uitkomst doet het meeste werk, dus kies deze voordat je met een leverancier spreekt en gebruik dezelfde voor allemaal. Het moet aan vier voorwaarden voldoen.
- Het overschrijdt modules. Minimaal drie: een verzoek dat binnen één scherm blijft test de copilot, niet de agent. Facturering plus contacten plus e-mail plus een geplande taak is een goede vorm. Ontvangst van voorraad plus inkooporder plus matching van leveranciersfacturen is een andere.
- Het bevat een schrijfopdracht. Lezen en samenvatten is de gemakkelijke helft. De evaluatie gaat over of het systeem een agent toestaat om records te wijzigen, en of het controleert wie er vraagt voordat het dat doet.
- Het heeft een duidelijke uitzondering. Plant één: een klant met twee bijna identieke records, of een leveringshoeveelheid die niet overeenkomt met de bestelling. Je wilt zien of de agent vraagt, raadt of stilletjes corrigeert.
- Het heeft een follow-up in de toekomst. Een herinnering, een achtervolging, een geplande controle. Dat test of de agent iets voor later kan laten en of het systeem het uitvoert wanneer de datum arriveert.
Schrijf het verzoek in eenvoudige taal op vóór de dag, precies zoals een operations lead het zou typen, en laat de leverancier het niet bewerken. Een leverancier die vraagt om het verzoek te herformuleren, vertelt je waar de grenzen liggen.
De dag runnen
De onderstaande volgorde duurt ongeveer een uur per leverancier en heeft niemand technisch nodig. Sta erop om dit te doen in een proefwerkruimte die jij beheert, op gegevens die jij hebt geladen, met jouw eigen agent verbonden. Als een van die drie wordt geweigerd, is die weigering een resultaat en komt op de kaart.
- Verbind je eigen agentVoeg de MCP-server van de leverancier toe aan Claude, ChatGPT in ontwikkelaarsmodus, of welke client jouw team ook gebruikt, en log in. Let op of het een OAuth-inlog is of een token dat je moet plakken, en of de leverancier het überhaupt kon doen.
- Lijst de toolsVraag de agent wat het mag doen. Lees de lijst voor de lengte en dekking van de modules in jouw resultaat. Log vervolgens in als een beperkte gebruiker en vraag opnieuw; de lijst zou moeten krimpen.
- Geef het resultaat één keer aanTyp het voorbereide verzoek als de gebruiker met volledige rechten en stop. Beantwoord alleen echte vragen van de agent, zoals welke van de twee overeenkomende klanten je bedoelde. Tel de hand-backs.
- Controleer de recordsOpen elk record dat het verzoek had moeten raken. Bevestig de factuur, de e-mail, de voorraadbeweging, de taak. Voer vervolgens hetzelfde verzoek uit als de beperkte gebruiker en kijk waar het wordt geweigerd.
- Lees het logboek en de meterVind de logboekvermelding: wie vroeg, welke agent, welke tools, invoer, resultaten, weigeringen. Vind wat de kosten van de uitvoering waren en of een limiet het had kunnen stoppen.
- Score op de dagVul de kaart in voordat je de kamer verlaat. Geheugen is vriendelijk voor goede presentatoren.
De scorekaart
Beoordeel elke rij met 0, 1 of 2. Nul betekent dat je het niet hebt gezien; één betekent dat je het met een voorbehoud hebt gezien; twee betekent dat je het duidelijk hebt gezien, in jouw omgeving, met het bewijs voor je. Tien rijen, dus het maximum is twintig. Weeg de rijen niet voordat je de test op ten minste twee producten hebt uitgevoerd; vooraf wegen is hoe de marketing weer binnenkomt.
| Rij | Hoe een 2 eruitziet | Veelvoorkomende reden voor een 1 of 0 |
|---|---|---|
| Resultaat voltooid | Alle records correct, geen persoon achter een scherm | Teruggeven bij een modulegrens of een Opslaan |
| Jouw agent verbonden | Jouw eigen MCP-client, OAuth-aanmelding, geen token om in te voeren | Alleen de assistent van de leverancier, of een geplakte API-sleutel |
| Lijst met tools is echt | Lang, getypt, dekt jouw modules, machine-leesbaar | Een dozijn functies, of alleen een lijst op een dia |
| Toestemmingen per oproep | Beperkte gebruiker geweigerd bij de oproep; de rest voltooit | Weigering alleen bij het laden van het scherm, of een goedkeuring die doorgaat |
| Uitzondering afgehandeld | De geplante ambiguïteit leidde tot een vraag, geen gok | Stille correctie, of een verkeerd record gekozen |
| Toekomstige actie gepland | De follow-up bestaat en zal op de datum plaatsvinden | Een opmerking in een samenvatting, niets in het systeem |
| Log is compleet | Wie vroeg, agent, tools, invoer, resultaten, weigeringen | Records gewijzigd, maar geen belvolgorde; een generieke integratiegebruiker |
| Uitgaven zijn beperkt | Een limiet per integratie die de agent niet kan overschrijden; kosten per actie | Maandtotaal alleen, of geen limiet |
| Eigen-agent kosten | Niets in rekening gebracht wanneer uw agent de redenering doet | AI wordt in rekening gebracht ongeacht wie redeneert |
| Uitbreidbaar door anderen | Een derde partij app installeert en verschijnt in de lijst met tools | Roadmap of alleen maatwerk |
Tien rijen, twee punten elk. Beoordeel elke leverancier op hetzelfde resultaat, op dezelfde dag als dat mogelijk is, en vergelijk totalen pas nadat elke rij een nummer heeft.
Het resultaat lezen
Totalen zijn minder belangrijk dan het patroon in de eerste vier rijen, omdat die vier bepalen wat voor soort product u bekijkt. Een product dat nul scoort op het resultaat en nul op uw agent die verbinding maakt, is een assistent binnen een scherm, en de rest van zijn score beschrijft controles die het niet nodig heeft. Het kan nog steeds de juiste aankoop zijn als wat uw team wil een sneller scherm is, maar u moet het als zodanig kopen.
Een product dat de uitkomst compleet maakt maar nul scoort op de verbinding met uw agent, is agentisch met een gesloten deur. Het werkt, op de voorwaarden van de leverancier, met de agent van de leverancier, tegen de prijs van de leverancier voor redenering. De vraag die u uzelf moet stellen is wat er over twee jaar gebeurt als de agent van uw team degene is die ze willen gebruiken, en of de leverancier iets heeft gezegd over het openen van de deur.
Een product dat op alle vier een score van twee behaalt, is agent-native, en de overige zes rijen zijn waar de echte vergelijking plaatsvindt: hoe goed het de uitzondering die u heeft geplaatst afhandelt, hoe compleet het logboek is, of de uitgaven kunnen worden beperkt, wat het kost wanneer uw agent redeneert, en of buitenstaanders het kunnen uitbreiden. Twee agent-native producten kunnen sterk verschillen op die zes, en dat zijn de rijen die voorspellen hoe het zal zijn om met het product te leven.
Nog een keer lezen. Als een leverancier de test afwijst, of een opgenomen versie aanbiedt, of vraagt om hun verzoek te vervangen door het uwe, scoor dan de rijen die u niet kon observeren als nul en geef in de notities aan waarom. Afwijzen is informatie. Een product dat dit kan doen, wil u dat laten zien.
Wat we je zouden laten zien
Sois is een product waarop u deze evaluatie kunt uitvoeren, en aangezien wij het bouwen, kunnen we zeggen wat u zou zien. Een werkruimte is een MCP-server; u voegt het adres toe aan Claude, ChatGPT of een andere client en logt eenmaal in via OAuth, zonder token om in te voeren. De lijst met tools wordt gefilterd op basis van uw rol voordat de agent deze ziet en opnieuw gecontroleerd wanneer elke tool draait; toegang faalt gesloten. Uitgaven kunnen per integratie worden beperkt, elke actie wordt gelogd, en wanneer uw eigen agent de redenering doet, voert het platform geen AI namens u uit en brengt er niets voor in rekening. Apps uit de marketplace verschijnen in de lijst met tools zodra ze zijn geïnstalleerd. Hier is de factureringsuitkomst van de bovenstaande flow, zoals deze draait.
- Het lezen van het factureerbare werk van het project en het klantrecord
- Factuur aangemaakt op basis van de factureerbare regels
- Verzonden naar de klantcontactpersoon per e-mail
- Volgen gepland voor de vervaldatum
Vier tools voor boekhouding, contacten, inbox en taken, met het logboek dat elke oproep toont. Voer het uit als een gebruiker die geen facturen kan opstellen en de eerste schrijfopdracht wordt geweigerd, met de reden.
Beoordeel het dan op dezelfde kaart als iedereen. Het doel van een vaste test is dat het niet uitmaakt wie het product heeft gebouwd, en een evaluatie die u kunt verdedigen, is er een die elke leverancier, inclusief deze, op dezelfde manier heeft behandeld.
Vragen die mensen stellen
Hoe lang duurt deze evaluatie per leverancier?
Ongeveer een uur zodra de uitkomst is geschreven en er een proefwerkruimte met uw gegevens bestaat. Realistische gegevens laden en de uitzondering plaatsen is de voorbereiding; de test zelf is één verzoek, twee inlogpogingen en een lezing van het logboek.
Wat als de leverancier mijn eigen agent niet kan laten verbinden?
Scoor die rij nul en voer de test uit met hun agent zodat u nog steeds de uitkomst, machtigingen, log en kostenrijen ziet. Beslis dan of een gesloten deur acceptabel is voor uw team, en vraag de leverancier of en wanneer deze opent.
Moet ik de scorecard-rijen wegen?
Niet voordat je de test op ten minste twee producten hebt uitgevoerd. Beoordeel eerst alle tien rijen en beslis dan welke rijen het belangrijkst zijn voor jouw operatie. Vooraf wegen is hoe een sterke presentatie weer in een beslissing komt die de test juist buiten moest houden.
- Model Context Protocol specificatie: tools hulplijsten, autorisatie-afhankelijke lijsten, en de aanbeveling dat een mens betrokken blijft met de mogelijkheid om tool-aanroepen te weigeren
- Anthropic: aan de slag met aangepaste connectors met behulp van externe MCP een externe server toevoegen, OAuth-inloggen en goedkeuring per tool in Claude
- OpenAI: ChatGPT ontwikkelaarsmodus volledige MCP-clientondersteuning in ChatGPT; schrijfacties vereisen standaard bevestiging
- Sois documentatie: de werkruimte MCP-server wat de test observeert op één implementatie: OAuth, rol-gefilterde tools, fail-closed uitvoering, budgetlimieten
Dit artikel wordt herzien wanneer de producten die het beschrijft veranderen. Volgende geplande herziening: 4 december 2026.
