Per le aziende Per le imprese Soluzioni App Prezzi Sviluppatori Blog Documentazione Avvia uno spazio di lavoro
Blog / Agentic ERP

Come valutare un ERP AI senza cadere nella trappola del marketing

Un test sopravvive a qualsiasi demo: chiedi al fornitore di completare un risultato reale, attraverso i moduli, senza nessuno davanti allo schermo, utilizzando un agente che porti. Ecco come scegliere il risultato, gestire la giornata, valutarlo e leggere cosa significa il punteggio.

Lettura di 6 minutiAggiornato 4 settembre 2026Ingegneria Sois, il team che costruisce la piattaforma

Un tavolo da riunione prima di un incontro: legno scuro, quattro proposte stampate a faccia in giù in fila, una brocca d'acqua, una sola matita, alte finestre con luce grigia del mattino
Risposta breve

Valuta un AI ERP chiedendo a ciascun fornitore di completare un risultato reale, dall'inizio alla fine, senza nessuno davanti allo schermo. Scegli tu stesso il risultato, assicurati che attraversi almeno tre moduli, porta l'agente che il tuo team utilizza già e comunica la richiesta una sola volta. Poi apri i registri, accedi come utente ristretto e ripeti, e leggi il log. Valuta ciò che hai visto su una scheda fissa. Un prodotto che ha bisogno di una persona per cliccare su parte del risultato è un assistente; un prodotto che lo completa e mostra il suo lavoro nel log, all'interno dei tuoi permessi, è un sistema agentico.

Il motivo per cui questo funziona è che tutto ciò che una slide può affermare, il test può verificare o falsificare in un'ora, nel tuo ambiente, sui tuoi dati. Ha anche la proprietà utile di essere lo stesso test per ogni fornitore, il che rende i punteggi comparabili.

L'unico test che sopravvive a una demo

Una demo è una performance. Il presentatore ha scelto i dati, ha provato la richiesta e sa quali funzionalità evitare. Nulla di tutto ciò è disonesto, e nulla di ciò ti dice cosa fa il prodotto quando si tratta dei tuoi dati e della tua richiesta. Se vuoi sapere come valutare un AI ERP, la risposta breve è togliere la richiesta al presentatore.

Scegli un risultato che conta per la tua azienda e che un junior competente potrebbe fare in un pomeriggio: fatturare un cliente e sollecitarlo, prenotare stock contro un ordine di acquisto e abbinare la fattura del fornitore, o trasformare un preventivo accettato in un lavoro, un programma e una richiesta di deposito. Porta l'agente che il tuo team utilizza già, connesso dall'esterno del prodotto del fornitore tramite il Model Context Protocol, lo standard aperto parlato dai clienti mainstream. Comunica la richiesta in un messaggio e stacca le mani dalla tastiera. Qualunque cosa accada dopo è la valutazione.

Possono succedere tre cose. L'esito si completa e i registri sono corretti. Il sistema fa parte del lavoro e passa il resto a una persona, di solito al confine di un modulo o durante un Salvataggio. Oppure l'agente del fornitore completa il lavoro, ma nulla dall'esterno può connettersi. Ognuno di questi è un prodotto diverso e ciascuno ha un punteggio diverso nella scheda qui sotto.

Scegliere il risultato

L'esito fa la maggior parte del lavoro, quindi sceglilo prima di parlare con qualsiasi fornitore e usalo per tutti loro. Dovrebbe soddisfare quattro condizioni.

  • Attraversa i moduli. Almeno tre: una richiesta che rimane all'interno di un'unica schermata testa il copilota, non l'agente. Fatturazione più contatti più email più un'attività programmata è una buona configurazione. Ricezione di magazzino più ordine d'acquisto più corrispondenza della fattura del fornitore è un'altra.
  • Contiene una scrittura. Leggere e riassumere è la parte facile. La valutazione riguarda se il sistema permetterà a un agente di modificare i registri e se verifica chi sta chiedendo prima di farlo.
  • Ha un'eccezione ovvia. Punto uno: un cliente con due registri quasi identici, o una quantità di consegna che non corrisponde all'ordine. Vuoi vedere se l'agente chiede, indovina o corregge silenziosamente.
  • Ha un seguito nel futuro. Un promemoria, un sollecito, un controllo programmato. Questo testa se l'agente può lasciare qualcosa per dopo e se il sistema lo eseguirà quando arriva la data.

Scrivi la richiesta in linguaggio semplice prima del giorno, esattamente come la scriverebbe un responsabile delle operazioni, e non lasciare che il fornitore la modifichi. Un fornitore che chiede di riformulare la richiesta ti sta indicando dove sono i confini.

Gestire la giornata

La sequenza qui sotto richiede circa un'ora per fornitore e non ha bisogno di nessuno tecnico. Insisti per farlo in uno spazio di lavoro di prova che controlli, su dati che hai caricato, con il tuo agente connesso. Se uno di questi tre viene rifiutato, quel rifiuto è un risultato e va sulla scheda.

  1. Collega il tuo agenteAggiungi il server MCP del fornitore a Claude, ChatGPT in modalità sviluppatore, o a qualsiasi client utilizzi il tuo team, e accedi. Nota se si tratta di un accesso OAuth o di un token che devi incollare, e se il fornitore potrebbe farlo.
  2. Elenca gli strumentiChiedi all'agente cosa è autorizzato a fare. Leggi l'elenco per lunghezza e copertura dei moduli nel tuo risultato. Poi accedi come utente con accesso limitato e chiedi di nuovo; l'elenco dovrebbe ridursi.
  3. Dichiara il risultato una voltaDigita la richiesta preparata come utente con permessi completi e fermati. Rispondi solo a domande genuine dell'agente, come quale dei due clienti corrispondenti intendevi. Conta i ritorni.
  4. Controlla i registriApri ogni registro che la richiesta avrebbe dovuto toccare. Conferma la fattura, l'email, il movimento di magazzino, il compito. Poi esegui la stessa richiesta come utente con accesso limitato e osserva dove viene rifiutata.
  5. Leggi il registro e il contatoreTrova la voce del registro: chi ha chiesto, quale agente, quali strumenti, input, risultati, rifiuti. Scopri quale fosse il costo dell'esecuzione e se un limite avrebbe potuto fermarlo.
  6. Punteggio del giornoCompila la scheda prima di lasciare la stanza. La memoria è benevola con i buoni presentatori.

Il punteggio

Valuta ogni riga 0, 1 o 2. Zero significa che non l'hai vista; uno significa che l'hai vista con una riserva; due significa che l'hai vista chiaramente, nel tuo ambiente, con le prove davanti a te. Dieci righe, quindi il massimo è venti. Non pesare le righe prima di aver eseguito il test su almeno due prodotti; pesare in anticipo è come il marketing torna in gioco.

RigaCome appare un 2Motivo comune per un 1 o 0
Risultato completatoTutti i record corretti, nessuna persona davanti a uno schermoHand-back al confine di un modulo o a un Salva
Il tuo agente connessoIl tuo client MCP, accesso OAuth, nessun token da incollareSolo assistente del fornitore, o una chiave API incollata
La lista degli strumenti è realeLungo, digitato, copre i tuoi moduli, leggibile dalla macchinaUna dozzina di funzionalità, o un elenco solo su una diapositiva
Permessi per chiamataUtente ristretto rifiutato alla chiamata; il resto completaRifiuto solo al caricamento della schermata, o un'approvazione che passa
Eccezione gestitaL'ambiguità piantata ha prodotto una domanda, non un'ipotesiCorrezione silenziosa, o un record errato scelto
Azione futura programmataIl follow-up esiste e si svolgerà nella dataUna nota in un riepilogo, nulla nel sistema
Il registro è completoChi ha chiesto, agente, strumenti, input, risultati, rifiutiRecord modificati ma nessuna sequenza di chiamate; un utente di integrazione generico
La spesa è limitataUn limite per integrazione che l'agente non può superare; costo per azioneSolo totale mensile, o nessun limite
Costo dell'agente proprioNessun costo quando il tuo agente fa il ragionamentoAI addebitato indipendentemente da chi ragiona
Estendibile da altriUn'app di terze parti si installa e appare nell'elenco degli strumentiSolo roadmap o lavoro personalizzato

Dieci righe, due punti ciascuna. Valuta ogni fornitore sullo stesso risultato, lo stesso giorno se puoi, e confronta i totali solo dopo che ogni riga ha un numero.

Leggere il risultato

I totali contano meno del modello nelle prime quattro righe, perché quelle quattro decidono che tipo di prodotto stai esaminando. Un prodotto che ottiene zero sul risultato e zero sulla connessione del tuo agente è un assistente all'interno di uno schermo, e il resto del suo punteggio descrive controlli di cui non ha bisogno. Potrebbe comunque essere l'acquisto giusto se ciò che il tuo team desidera è uno schermo più veloce, ma dovresti acquistarlo come tale.

Un prodotto che completa il risultato ma ottiene zero sulla connessione del tuo agente è agentico con una porta chiusa. Funziona, secondo i termini del fornitore, con l'agente del fornitore, al prezzo del fornitore per il ragionamento. La domanda da porsi è cosa succede tra due anni quando l'agente del tuo team è quello che vogliono usare, e se il fornitore ha detto qualcosa sull'aprire la porta.

Un prodotto che ottiene due in tutte e quattro le aree è agent-nativo, e le restanti sei righe sono dove avviene il vero confronto: quanto bene gestisce l'eccezione che hai piantato, quanto è completo il log, se la spesa può essere limitata, quanto addebita quando il tuo agente ragiona, e se gli esterni possono estenderlo. Due prodotti agent-nativi possono differire molto su quelle sei, e sono le righe che prevedono come sarà vivere con il prodotto.

Un'altra lettura. Se un fornitore rifiuta il test, o offre una versione registrata, o chiede di sostituire la propria richiesta con la tua, assegna zero alle righe che non hai potuto osservare e spiega il motivo nelle note. Rifiutare è informazione. Un prodotto che può farlo vorrà mostrartelo.

Cosa ti mostreremmo

Sois è un prodotto contro cui potresti eseguire questa valutazione, e poiché lo costruiamo possiamo dirti cosa vedresti. Uno spazio di lavoro è un server MCP; aggiungi il suo indirizzo a Claude, ChatGPT o un altro client e accedi una volta tramite OAuth, senza token da incollare. L'elenco degli strumenti è filtrato in base al tuo ruolo prima che l'agente lo veda e controllato di nuovo quando ogni strumento viene eseguito; l'accesso fallisce chiuso. La spesa può essere limitata per integrazione, ogni azione è registrata, e quando il tuo agente fa il ragionamento la piattaforma non esegue alcuna IA per tuo conto e non addebita nulla per questo. Le app del marketplace appaiono nell'elenco degli strumenti una volta installate. Ecco il risultato della fatturazione dal flusso sopra, mentre viene eseguito.

Claudecollegato aapp.sois.aisopra MCP
TuFattura Acme per il lavoro di settembre, invia un'email a Sarah Cole e sollecitalo se non viene pagato entro il 18.
Agente
  • Lettura del lavoro fatturabile del progetto e del record del cliente.
  • Fattura creata dalle righe fatturabili.
  • Inviata al contatto del cliente via email.
  • Sollecito programmato per la data di scadenza
Fatto.
Registrazioni Sois
INV-1064Fattura creata, Acme Ltd
Sarah ColeEmail inviata dalla casella di posta del workspace
CompitoInsegui se non pagato il 18 settembre

Quattro strumenti tra contabilità, contatti, inbox e attività, con il log che mostra ogni chiamata. Eseguilo come un utente che non può emettere fatture e la prima scrittura viene rifiutata, con il motivo.

Poi assegnagli un punteggio sulla stessa scheda di tutti gli altri. Il punto di un test fisso è che non importa chi ha costruito il prodotto, e una valutazione che puoi difendere è quella che ha trattato ogni fornitore, incluso questo, allo stesso modo.

Domande che le persone pongono

Quanto tempo richiede questa valutazione per fornitore?

Circa un'ora una volta che il risultato è scritto e un'area di lavoro di prova con i tuoi dati esiste. Caricare dati realistici e piantare l'eccezione è la preparazione; il test stesso è una richiesta, due accessi e una lettura del log.

Cosa succede se il fornitore non può far connettere il mio agente?

Imposta a zero quella riga e esegui il test con il loro agente in modo da vedere comunque il risultato, le autorizzazioni, il registro e le righe dei costi. Poi decidi se una porta chiusa è accettabile per il tuo team e chiedi al fornitore se e quando si apre.

Dovrei ponderare le righe della scheda di valutazione?

Non prima di aver eseguito il test su almeno due prodotti. Valuta tutte e dieci le righe prima, poi decidi quali righe sono più importanti per la tua operazione. Ponderare in anticipo è il modo in cui una presentazione forte rientra in una decisione da cui il test doveva tenerla fuori.

Fonti
  1. specifica del Model Context Protocol: strumenti elenco degli strumenti, elenco dipendente dall'autorizzazione e la raccomandazione che un umano rimanga coinvolto con la possibilità di negare le chiamate agli strumenti
  2. Anthropic: iniziare con connettori personalizzati utilizzando MCP remoto aggiungere un server remoto, accesso OAuth e approvazione per strumento in Claude
  3. OpenAI: modalità sviluppatore di ChatGPT supporto completo del client MCP in ChatGPT; le azioni di scrittura richiedono conferma per impostazione predefinita
  4. Documentazione Sois: il server MCP dello spazio di lavoro cosa osserva il test su un'implementazione: OAuth, strumenti filtrati per ruolo, esecuzione fail-closed, limiti di budget

Questo articolo viene revisionato quando i prodotti che descrive cambiano. Prossima revisione programmata: 4 dicembre 2026.

Inizia

Esplora la piattaforma Sois.

Come funziona la piattaforma, cosa fa il livello di autorizzazione e quali sono i costi, in termini semplici.

  • Inizia gratis
  • Porta il tuo agente
  • Nessun vincolo con il fornitore