Valuta un AI ERP chiedendo a ciascun fornitore di completare un risultato reale, dall'inizio alla fine, senza nessuno davanti allo schermo. Scegli tu stesso il risultato, assicurati che attraversi almeno tre moduli, porta l'agente che il tuo team utilizza già e comunica la richiesta una sola volta. Poi apri i registri, accedi come utente ristretto e ripeti, e leggi il log. Valuta ciò che hai visto su una scheda fissa. Un prodotto che ha bisogno di una persona per cliccare su parte del risultato è un assistente; un prodotto che lo completa e mostra il suo lavoro nel log, all'interno dei tuoi permessi, è un sistema agentico.
Il motivo per cui questo funziona è che tutto ciò che una slide può affermare, il test può verificare o falsificare in un'ora, nel tuo ambiente, sui tuoi dati. Ha anche la proprietà utile di essere lo stesso test per ogni fornitore, il che rende i punteggi comparabili.
L'unico test che sopravvive a una demo
Una demo è una performance. Il presentatore ha scelto i dati, ha provato la richiesta e sa quali funzionalità evitare. Nulla di tutto ciò è disonesto, e nulla di ciò ti dice cosa fa il prodotto quando si tratta dei tuoi dati e della tua richiesta. Se vuoi sapere come valutare un AI ERP, la risposta breve è togliere la richiesta al presentatore.
Scegli un risultato che conta per la tua azienda e che un junior competente potrebbe fare in un pomeriggio: fatturare un cliente e sollecitarlo, prenotare stock contro un ordine di acquisto e abbinare la fattura del fornitore, o trasformare un preventivo accettato in un lavoro, un programma e una richiesta di deposito. Porta l'agente che il tuo team utilizza già, connesso dall'esterno del prodotto del fornitore tramite il Model Context Protocol, lo standard aperto parlato dai clienti mainstream. Comunica la richiesta in un messaggio e stacca le mani dalla tastiera. Qualunque cosa accada dopo è la valutazione.
Possono succedere tre cose. L'esito si completa e i registri sono corretti. Il sistema fa parte del lavoro e passa il resto a una persona, di solito al confine di un modulo o durante un Salvataggio. Oppure l'agente del fornitore completa il lavoro, ma nulla dall'esterno può connettersi. Ognuno di questi è un prodotto diverso e ciascuno ha un punteggio diverso nella scheda qui sotto.
Scegliere il risultato
L'esito fa la maggior parte del lavoro, quindi sceglilo prima di parlare con qualsiasi fornitore e usalo per tutti loro. Dovrebbe soddisfare quattro condizioni.
- Attraversa i moduli. Almeno tre: una richiesta che rimane all'interno di un'unica schermata testa il copilota, non l'agente. Fatturazione più contatti più email più un'attività programmata è una buona configurazione. Ricezione di magazzino più ordine d'acquisto più corrispondenza della fattura del fornitore è un'altra.
- Contiene una scrittura. Leggere e riassumere è la parte facile. La valutazione riguarda se il sistema permetterà a un agente di modificare i registri e se verifica chi sta chiedendo prima di farlo.
- Ha un'eccezione ovvia. Punto uno: un cliente con due registri quasi identici, o una quantità di consegna che non corrisponde all'ordine. Vuoi vedere se l'agente chiede, indovina o corregge silenziosamente.
- Ha un seguito nel futuro. Un promemoria, un sollecito, un controllo programmato. Questo testa se l'agente può lasciare qualcosa per dopo e se il sistema lo eseguirà quando arriva la data.
Scrivi la richiesta in linguaggio semplice prima del giorno, esattamente come la scriverebbe un responsabile delle operazioni, e non lasciare che il fornitore la modifichi. Un fornitore che chiede di riformulare la richiesta ti sta indicando dove sono i confini.
Gestire la giornata
La sequenza qui sotto richiede circa un'ora per fornitore e non ha bisogno di nessuno tecnico. Insisti per farlo in uno spazio di lavoro di prova che controlli, su dati che hai caricato, con il tuo agente connesso. Se uno di questi tre viene rifiutato, quel rifiuto è un risultato e va sulla scheda.
- Collega il tuo agenteAggiungi il server MCP del fornitore a Claude, ChatGPT in modalità sviluppatore, o a qualsiasi client utilizzi il tuo team, e accedi. Nota se si tratta di un accesso OAuth o di un token che devi incollare, e se il fornitore potrebbe farlo.
- Elenca gli strumentiChiedi all'agente cosa è autorizzato a fare. Leggi l'elenco per lunghezza e copertura dei moduli nel tuo risultato. Poi accedi come utente con accesso limitato e chiedi di nuovo; l'elenco dovrebbe ridursi.
- Dichiara il risultato una voltaDigita la richiesta preparata come utente con permessi completi e fermati. Rispondi solo a domande genuine dell'agente, come quale dei due clienti corrispondenti intendevi. Conta i ritorni.
- Controlla i registriApri ogni registro che la richiesta avrebbe dovuto toccare. Conferma la fattura, l'email, il movimento di magazzino, il compito. Poi esegui la stessa richiesta come utente con accesso limitato e osserva dove viene rifiutata.
- Leggi il registro e il contatoreTrova la voce del registro: chi ha chiesto, quale agente, quali strumenti, input, risultati, rifiuti. Scopri quale fosse il costo dell'esecuzione e se un limite avrebbe potuto fermarlo.
- Punteggio del giornoCompila la scheda prima di lasciare la stanza. La memoria è benevola con i buoni presentatori.
Il punteggio
Valuta ogni riga 0, 1 o 2. Zero significa che non l'hai vista; uno significa che l'hai vista con una riserva; due significa che l'hai vista chiaramente, nel tuo ambiente, con le prove davanti a te. Dieci righe, quindi il massimo è venti. Non pesare le righe prima di aver eseguito il test su almeno due prodotti; pesare in anticipo è come il marketing torna in gioco.
| Riga | Come appare un 2 | Motivo comune per un 1 o 0 |
|---|---|---|
| Risultato completato | Tutti i record corretti, nessuna persona davanti a uno schermo | Hand-back al confine di un modulo o a un Salva |
| Il tuo agente connesso | Il tuo client MCP, accesso OAuth, nessun token da incollare | Solo assistente del fornitore, o una chiave API incollata |
| La lista degli strumenti è reale | Lungo, digitato, copre i tuoi moduli, leggibile dalla macchina | Una dozzina di funzionalità, o un elenco solo su una diapositiva |
| Permessi per chiamata | Utente ristretto rifiutato alla chiamata; il resto completa | Rifiuto solo al caricamento della schermata, o un'approvazione che passa |
| Eccezione gestita | L'ambiguità piantata ha prodotto una domanda, non un'ipotesi | Correzione silenziosa, o un record errato scelto |
| Azione futura programmata | Il follow-up esiste e si svolgerà nella data | Una nota in un riepilogo, nulla nel sistema |
| Il registro è completo | Chi ha chiesto, agente, strumenti, input, risultati, rifiuti | Record modificati ma nessuna sequenza di chiamate; un utente di integrazione generico |
| La spesa è limitata | Un limite per integrazione che l'agente non può superare; costo per azione | Solo totale mensile, o nessun limite |
| Costo dell'agente proprio | Nessun costo quando il tuo agente fa il ragionamento | AI addebitato indipendentemente da chi ragiona |
| Estendibile da altri | Un'app di terze parti si installa e appare nell'elenco degli strumenti | Solo roadmap o lavoro personalizzato |
Dieci righe, due punti ciascuna. Valuta ogni fornitore sullo stesso risultato, lo stesso giorno se puoi, e confronta i totali solo dopo che ogni riga ha un numero.
Leggere il risultato
I totali contano meno del modello nelle prime quattro righe, perché quelle quattro decidono che tipo di prodotto stai esaminando. Un prodotto che ottiene zero sul risultato e zero sulla connessione del tuo agente è un assistente all'interno di uno schermo, e il resto del suo punteggio descrive controlli di cui non ha bisogno. Potrebbe comunque essere l'acquisto giusto se ciò che il tuo team desidera è uno schermo più veloce, ma dovresti acquistarlo come tale.
Un prodotto che completa il risultato ma ottiene zero sulla connessione del tuo agente è agentico con una porta chiusa. Funziona, secondo i termini del fornitore, con l'agente del fornitore, al prezzo del fornitore per il ragionamento. La domanda da porsi è cosa succede tra due anni quando l'agente del tuo team è quello che vogliono usare, e se il fornitore ha detto qualcosa sull'aprire la porta.
Un prodotto che ottiene due in tutte e quattro le aree è agent-nativo, e le restanti sei righe sono dove avviene il vero confronto: quanto bene gestisce l'eccezione che hai piantato, quanto è completo il log, se la spesa può essere limitata, quanto addebita quando il tuo agente ragiona, e se gli esterni possono estenderlo. Due prodotti agent-nativi possono differire molto su quelle sei, e sono le righe che prevedono come sarà vivere con il prodotto.
Un'altra lettura. Se un fornitore rifiuta il test, o offre una versione registrata, o chiede di sostituire la propria richiesta con la tua, assegna zero alle righe che non hai potuto osservare e spiega il motivo nelle note. Rifiutare è informazione. Un prodotto che può farlo vorrà mostrartelo.
Cosa ti mostreremmo
Sois è un prodotto contro cui potresti eseguire questa valutazione, e poiché lo costruiamo possiamo dirti cosa vedresti. Uno spazio di lavoro è un server MCP; aggiungi il suo indirizzo a Claude, ChatGPT o un altro client e accedi una volta tramite OAuth, senza token da incollare. L'elenco degli strumenti è filtrato in base al tuo ruolo prima che l'agente lo veda e controllato di nuovo quando ogni strumento viene eseguito; l'accesso fallisce chiuso. La spesa può essere limitata per integrazione, ogni azione è registrata, e quando il tuo agente fa il ragionamento la piattaforma non esegue alcuna IA per tuo conto e non addebita nulla per questo. Le app del marketplace appaiono nell'elenco degli strumenti una volta installate. Ecco il risultato della fatturazione dal flusso sopra, mentre viene eseguito.
- Lettura del lavoro fatturabile del progetto e del record del cliente.
- Fattura creata dalle righe fatturabili.
- Inviata al contatto del cliente via email.
- Sollecito programmato per la data di scadenza
Quattro strumenti tra contabilità, contatti, inbox e attività, con il log che mostra ogni chiamata. Eseguilo come un utente che non può emettere fatture e la prima scrittura viene rifiutata, con il motivo.
Poi assegnagli un punteggio sulla stessa scheda di tutti gli altri. Il punto di un test fisso è che non importa chi ha costruito il prodotto, e una valutazione che puoi difendere è quella che ha trattato ogni fornitore, incluso questo, allo stesso modo.
Domande che le persone pongono
Quanto tempo richiede questa valutazione per fornitore?
Circa un'ora una volta che il risultato è scritto e un'area di lavoro di prova con i tuoi dati esiste. Caricare dati realistici e piantare l'eccezione è la preparazione; il test stesso è una richiesta, due accessi e una lettura del log.
Cosa succede se il fornitore non può far connettere il mio agente?
Imposta a zero quella riga e esegui il test con il loro agente in modo da vedere comunque il risultato, le autorizzazioni, il registro e le righe dei costi. Poi decidi se una porta chiusa è accettabile per il tuo team e chiedi al fornitore se e quando si apre.
Dovrei ponderare le righe della scheda di valutazione?
Non prima di aver eseguito il test su almeno due prodotti. Valuta tutte e dieci le righe prima, poi decidi quali righe sono più importanti per la tua operazione. Ponderare in anticipo è il modo in cui una presentazione forte rientra in una decisione da cui il test doveva tenerla fuori.
- specifica del Model Context Protocol: strumenti elenco degli strumenti, elenco dipendente dall'autorizzazione e la raccomandazione che un umano rimanga coinvolto con la possibilità di negare le chiamate agli strumenti
- Anthropic: iniziare con connettori personalizzati utilizzando MCP remoto aggiungere un server remoto, accesso OAuth e approvazione per strumento in Claude
- OpenAI: modalità sviluppatore di ChatGPT supporto completo del client MCP in ChatGPT; le azioni di scrittura richiedono conferma per impostazione predefinita
- Documentazione Sois: il server MCP dello spazio di lavoro cosa osserva il test su un'implementazione: OAuth, strumenti filtrati per ruolo, esecuzione fail-closed, limiti di budget
Questo articolo viene revisionato quando i prodotti che descrive cambiano. Prossima revisione programmata: 4 dicembre 2026.
