Voor bedrijven Voor ondernemingen Oplossingen Apps Prijzen Ontwikkelaars Blog Documentatie Start een werkruimte
Blog / Agentic ERP

Hoe je een AI ERP kunt evalueren zonder voor de marketing te vallen.

Één test overleeft elke demo: vraag de leverancier om een echt resultaat te behalen, over modules heen, zonder iemand achter het scherm, met een agent die je meebrengt. Hier is hoe je het resultaat kiest, de dag runt, het beoordeelt en leest wat de score betekent.

6 min lezenBijgewerkt 4 september 2026Sois engineering, het team dat het platform bouwt

Een vergadertafel voor een bijeenkomst: donker hout, vier afgedrukte voorstellen met de kop naar beneden in een rij, een kan water, een enkele potlood, hoge ramen met grijs ochtendlicht.
Korte antwoord

Evalueer een AI ERP door elke leverancier te vragen om één echt resultaat te voltooien, van begin tot eind, zonder iemand achter het scherm. Kies het resultaat zelf, zorg ervoor dat het over ten minste drie modules gaat, breng de agent mee die je team al gebruikt, en geef de aanvraag één keer aan. Open vervolgens de records, log in als een beperkte gebruiker en herhaal, en lees het logboek. Beoordeel wat je hebt gezien op een vaste kaart. Een product dat een persoon nodig heeft om door een deel van het resultaat te klikken, is een assistent; een product dat het voltooit en zijn werk in het logboek toont, binnen jouw rechten, is een agentisch systeem.

De reden dat dit werkt, is dat alles wat een dia kan beweren, de test kan verifiëren of falsifiëren in een uur, in jouw omgeving, op jouw data. Het heeft ook het nuttige kenmerk dat het dezelfde test is voor elke leverancier, wat de scores vergelijkbaar maakt.

De enige test die een demo overleeft

Een demo is een voorstelling. De presentator koos de data, oefende de aanvraag en weet welke functies te vermijden. Geen van dit is oneerlijk, en niets daarvan vertelt je wat het product doet wanneer het jouw data en jouw aanvraag is. Als je wilt weten hoe je een AI ERP moet evalueren, is het korte antwoord om de aanvraag weg te nemen van de presentator.

Kies één resultaat dat belangrijk is voor jouw bedrijf en dat een competente junior in een middag kan doen: factureer een klant en volg deze op, boek voorraad tegen een inkooporder en match de factuur van de leverancier, of zet een geaccepteerde offerte om in een klus, een planning en een verzoek om aanbetaling. Breng de agent mee die jouw team al gebruikt, verbonden van buiten het product van de leverancier via het Model Context Protocol, de open standaard die de gangbare klanten gebruiken. Geef de aanvraag in één bericht aan en laat je handen van het toetsenbord. Wat er daarna ook gebeurt, is de evaluatie.

Er kunnen drie dingen gebeuren. Het resultaat wordt voltooid en de records zijn juist. Het systeem doet een deel ervan en geeft de rest aan een persoon, meestal bij een modulegrens of bij een Opslaan. Of de eigen agent van de leverancier voltooit het, maar niets van buitenaf kan verbinden. Elk van deze is een ander product, en elk scoort anders op de kaart hieronder.

Het resultaat kiezen

De uitkomst doet het meeste werk, dus kies deze voordat je met een leverancier spreekt en gebruik dezelfde voor allemaal. Het moet aan vier voorwaarden voldoen.

  • Het overschrijdt modules. Minimaal drie: een verzoek dat binnen één scherm blijft test de copilot, niet de agent. Facturering plus contacten plus e-mail plus een geplande taak is een goede vorm. Ontvangst van voorraad plus inkooporder plus matching van leveranciersfacturen is een andere.
  • Het bevat een schrijfopdracht. Lezen en samenvatten is de gemakkelijke helft. De evaluatie gaat over of het systeem een agent toestaat om records te wijzigen, en of het controleert wie er vraagt voordat het dat doet.
  • Het heeft een duidelijke uitzondering. Plant één: een klant met twee bijna identieke records, of een leveringshoeveelheid die niet overeenkomt met de bestelling. Je wilt zien of de agent vraagt, raadt of stilletjes corrigeert.
  • Het heeft een follow-up in de toekomst. Een herinnering, een achtervolging, een geplande controle. Dat test of de agent iets voor later kan laten en of het systeem het uitvoert wanneer de datum arriveert.

Schrijf het verzoek in eenvoudige taal op vóór de dag, precies zoals een operations lead het zou typen, en laat de leverancier het niet bewerken. Een leverancier die vraagt om het verzoek te herformuleren, vertelt je waar de grenzen liggen.

De dag runnen

De onderstaande volgorde duurt ongeveer een uur per leverancier en heeft niemand technisch nodig. Sta erop om dit te doen in een proefwerkruimte die jij beheert, op gegevens die jij hebt geladen, met jouw eigen agent verbonden. Als een van die drie wordt geweigerd, is die weigering een resultaat en komt op de kaart.

  1. Verbind je eigen agentVoeg de MCP-server van de leverancier toe aan Claude, ChatGPT in ontwikkelaarsmodus, of welke client jouw team ook gebruikt, en log in. Let op of het een OAuth-inlog is of een token dat je moet plakken, en of de leverancier het überhaupt kon doen.
  2. Lijst de toolsVraag de agent wat het mag doen. Lees de lijst voor de lengte en dekking van de modules in jouw resultaat. Log vervolgens in als een beperkte gebruiker en vraag opnieuw; de lijst zou moeten krimpen.
  3. Geef het resultaat één keer aanTyp het voorbereide verzoek als de gebruiker met volledige rechten en stop. Beantwoord alleen echte vragen van de agent, zoals welke van de twee overeenkomende klanten je bedoelde. Tel de hand-backs.
  4. Controleer de recordsOpen elk record dat het verzoek had moeten raken. Bevestig de factuur, de e-mail, de voorraadbeweging, de taak. Voer vervolgens hetzelfde verzoek uit als de beperkte gebruiker en kijk waar het wordt geweigerd.
  5. Lees het logboek en de meterVind de logboekvermelding: wie vroeg, welke agent, welke tools, invoer, resultaten, weigeringen. Vind wat de kosten van de uitvoering waren en of een limiet het had kunnen stoppen.
  6. Score op de dagVul de kaart in voordat je de kamer verlaat. Geheugen is vriendelijk voor goede presentatoren.

De scorekaart

Beoordeel elke rij met 0, 1 of 2. Nul betekent dat je het niet hebt gezien; één betekent dat je het met een voorbehoud hebt gezien; twee betekent dat je het duidelijk hebt gezien, in jouw omgeving, met het bewijs voor je. Tien rijen, dus het maximum is twintig. Weeg de rijen niet voordat je de test op ten minste twee producten hebt uitgevoerd; vooraf wegen is hoe de marketing weer binnenkomt.

RijHoe een 2 eruitzietVeelvoorkomende reden voor een 1 of 0
Resultaat voltooidAlle records correct, geen persoon achter een schermTeruggeven bij een modulegrens of een Opslaan
Jouw agent verbondenJouw eigen MCP-client, OAuth-aanmelding, geen token om in te voerenAlleen de assistent van de leverancier, of een geplakte API-sleutel
Lijst met tools is echtLang, getypt, dekt jouw modules, machine-leesbaarEen dozijn functies, of alleen een lijst op een dia
Toestemmingen per oproepBeperkte gebruiker geweigerd bij de oproep; de rest voltooitWeigering alleen bij het laden van het scherm, of een goedkeuring die doorgaat
Uitzondering afgehandeldDe geplante ambiguïteit leidde tot een vraag, geen gokStille correctie, of een verkeerd record gekozen
Toekomstige actie geplandDe follow-up bestaat en zal op de datum plaatsvindenEen opmerking in een samenvatting, niets in het systeem
Log is compleetWie vroeg, agent, tools, invoer, resultaten, weigeringenRecords gewijzigd, maar geen belvolgorde; een generieke integratiegebruiker
Uitgaven zijn beperktEen limiet per integratie die de agent niet kan overschrijden; kosten per actieMaandtotaal alleen, of geen limiet
Eigen-agent kostenNiets in rekening gebracht wanneer uw agent de redenering doetAI wordt in rekening gebracht ongeacht wie redeneert
Uitbreidbaar door anderenEen derde partij app installeert en verschijnt in de lijst met toolsRoadmap of alleen maatwerk

Tien rijen, twee punten elk. Beoordeel elke leverancier op hetzelfde resultaat, op dezelfde dag als dat mogelijk is, en vergelijk totalen pas nadat elke rij een nummer heeft.

Het resultaat lezen

Totalen zijn minder belangrijk dan het patroon in de eerste vier rijen, omdat die vier bepalen wat voor soort product u bekijkt. Een product dat nul scoort op het resultaat en nul op uw agent die verbinding maakt, is een assistent binnen een scherm, en de rest van zijn score beschrijft controles die het niet nodig heeft. Het kan nog steeds de juiste aankoop zijn als wat uw team wil een sneller scherm is, maar u moet het als zodanig kopen.

Een product dat de uitkomst compleet maakt maar nul scoort op de verbinding met uw agent, is agentisch met een gesloten deur. Het werkt, op de voorwaarden van de leverancier, met de agent van de leverancier, tegen de prijs van de leverancier voor redenering. De vraag die u uzelf moet stellen is wat er over twee jaar gebeurt als de agent van uw team degene is die ze willen gebruiken, en of de leverancier iets heeft gezegd over het openen van de deur.

Een product dat op alle vier een score van twee behaalt, is agent-native, en de overige zes rijen zijn waar de echte vergelijking plaatsvindt: hoe goed het de uitzondering die u heeft geplaatst afhandelt, hoe compleet het logboek is, of de uitgaven kunnen worden beperkt, wat het kost wanneer uw agent redeneert, en of buitenstaanders het kunnen uitbreiden. Twee agent-native producten kunnen sterk verschillen op die zes, en dat zijn de rijen die voorspellen hoe het zal zijn om met het product te leven.

Nog een keer lezen. Als een leverancier de test afwijst, of een opgenomen versie aanbiedt, of vraagt om hun verzoek te vervangen door het uwe, scoor dan de rijen die u niet kon observeren als nul en geef in de notities aan waarom. Afwijzen is informatie. Een product dat dit kan doen, wil u dat laten zien.

Wat we je zouden laten zien

Sois is een product waarop u deze evaluatie kunt uitvoeren, en aangezien wij het bouwen, kunnen we zeggen wat u zou zien. Een werkruimte is een MCP-server; u voegt het adres toe aan Claude, ChatGPT of een andere client en logt eenmaal in via OAuth, zonder token om in te voeren. De lijst met tools wordt gefilterd op basis van uw rol voordat de agent deze ziet en opnieuw gecontroleerd wanneer elke tool draait; toegang faalt gesloten. Uitgaven kunnen per integratie worden beperkt, elke actie wordt gelogd, en wanneer uw eigen agent de redenering doet, voert het platform geen AI namens u uit en brengt er niets voor in rekening. Apps uit de marketplace verschijnen in de lijst met tools zodra ze zijn geïnstalleerd. Hier is de factureringsuitkomst van de bovenstaande flow, zoals deze draait.

Claudeverbonden metapp.sois.aiover MCP
UFactureer Acme voor het werk in september, e-mail Sarah Cole, en volg het op als het niet is betaald voor de 18e.
Agent
  • Het lezen van het factureerbare werk van het project en het klantrecord
  • Factuur aangemaakt op basis van de factureerbare regels
  • Verzonden naar de klantcontactpersoon per e-mail
  • Volgen gepland voor de vervaldatum
Klaar.
Sois-registraties
INV-1064Factuur aangemaakt, Acme Ltd
Sarah ColeE-mail verzonden vanuit de inbox van de werkruimte
TaakVolg op als het niet betaald is op 18 september

Vier tools voor boekhouding, contacten, inbox en taken, met het logboek dat elke oproep toont. Voer het uit als een gebruiker die geen facturen kan opstellen en de eerste schrijfopdracht wordt geweigerd, met de reden.

Beoordeel het dan op dezelfde kaart als iedereen. Het doel van een vaste test is dat het niet uitmaakt wie het product heeft gebouwd, en een evaluatie die u kunt verdedigen, is er een die elke leverancier, inclusief deze, op dezelfde manier heeft behandeld.

Vragen die mensen stellen

Hoe lang duurt deze evaluatie per leverancier?

Ongeveer een uur zodra de uitkomst is geschreven en er een proefwerkruimte met uw gegevens bestaat. Realistische gegevens laden en de uitzondering plaatsen is de voorbereiding; de test zelf is één verzoek, twee inlogpogingen en een lezing van het logboek.

Wat als de leverancier mijn eigen agent niet kan laten verbinden?

Scoor die rij nul en voer de test uit met hun agent zodat u nog steeds de uitkomst, machtigingen, log en kostenrijen ziet. Beslis dan of een gesloten deur acceptabel is voor uw team, en vraag de leverancier of en wanneer deze opent.

Moet ik de scorecard-rijen wegen?

Niet voordat je de test op ten minste twee producten hebt uitgevoerd. Beoordeel eerst alle tien rijen en beslis dan welke rijen het belangrijkst zijn voor jouw operatie. Vooraf wegen is hoe een sterke presentatie weer in een beslissing komt die de test juist buiten moest houden.

Bronnen
  1. Model Context Protocol specificatie: tools hulplijsten, autorisatie-afhankelijke lijsten, en de aanbeveling dat een mens betrokken blijft met de mogelijkheid om tool-aanroepen te weigeren
  2. Anthropic: aan de slag met aangepaste connectors met behulp van externe MCP een externe server toevoegen, OAuth-inloggen en goedkeuring per tool in Claude
  3. OpenAI: ChatGPT ontwikkelaarsmodus volledige MCP-clientondersteuning in ChatGPT; schrijfacties vereisen standaard bevestiging
  4. Sois documentatie: de werkruimte MCP-server wat de test observeert op één implementatie: OAuth, rol-gefilterde tools, fail-closed uitvoering, budgetlimieten

Dit artikel wordt herzien wanneer de producten die het beschrijft veranderen. Volgende geplande herziening: 4 december 2026.

Start

Verken het Sois-platform.

Hoe het platform werkt, wat de machtigingslaag doet en wat het kost, in eenvoudige termen.

  • Gratis om te beginnen
  • Breng uw eigen agent mee
  • Geen vendor lock-in