Pour les entreprises Pour les grandes entreprises Solutions Applications Tarifs Développeurs Blog Documentation Lancer un espace de travail
Blog / Agentic ERP

Comment évaluer un ERP IA sans tomber dans le piège du marketing.

Un test survit à toute démo : demandez au fournisseur de réaliser un résultat réel, à travers les modules, sans personne devant l'écran, en utilisant un agent que vous apportez. Voici comment choisir le résultat, gérer la journée, le noter et comprendre ce que la note signifie.

Lecture de 6 minutesMis à jour 4 septembre 2026Ingénierie Sois, l'équipe qui construit la plateforme

Une table de salle de réunion avant une réunion : bois foncé, quatre propositions imprimées face cachée en rangée, une carafe d'eau, un seul crayon, de grandes fenêtres avec une lumière grise du matin
Réponse courte

Évaluez un ERP IA en demandant à chaque fournisseur de réaliser un résultat réel, de bout en bout, sans personne devant l'écran. Choisissez vous-même le résultat, faites-le traverser au moins trois modules, apportez l'agent que votre équipe utilise déjà, et formulez la demande une fois. Ensuite, ouvrez les enregistrements, connectez-vous en tant qu'utilisateur restreint et répétez, puis lisez le journal. Notez ce que vous avez vu sur une carte fixe. Un produit qui nécessite qu'une personne clique sur une partie du résultat est un assistant ; un produit qui le termine et montre son travail dans le journal, dans le cadre de vos permissions, est un système agentique.

La raison pour laquelle cela fonctionne est que tout ce qu'une diapositive peut revendiquer, le test peut le vérifier ou le falsifier en une heure, dans votre environnement, sur vos données. Il a également la propriété utile d'être le même test pour chaque fournisseur, ce qui rend les scores comparables.

Le seul test qui survit à une démo

Une démo est une performance. Le présentateur a choisi les données, a répété la demande et sait quelles fonctionnalités éviter. Rien de tout cela n'est malhonnête, et rien ne vous dit ce que le produit fait lorsque ce sont vos données et votre demande. Si vous voulez savoir comment évaluer un ERP IA, la réponse courte est de retirer la demande au présentateur.

Choisissez un résultat qui compte dans votre entreprise et qu'un junior compétent pourrait réaliser en une après-midi : facturer un client et le relancer, réserver des stocks contre un bon de commande et faire correspondre la facture du fournisseur, ou transformer un devis accepté en un travail, un planning et une demande de dépôt. Apportez l'agent que votre équipe utilise déjà, connecté depuis l'extérieur du produit du fournisseur via le Model Context Protocol, la norme ouverte que les clients principaux utilisent. Formulez la demande en un message et retirez vos mains du clavier. Quoi qu'il arrive ensuite est l'évaluation.

Trois choses peuvent se produire. Le résultat se complète et les enregistrements sont corrects. Le système en fait une partie et remet le reste à une personne, généralement à la frontière d'un module ou lors d'un enregistrement. Ou l'agent du fournisseur le complète, mais rien de l'extérieur ne peut se connecter. Chacun de ces cas est un produit différent, et chacun obtient un score différent sur la carte ci-dessous.

Choisir le résultat

Le résultat fait la majeure partie du travail, alors choisissez-le avant de parler à un fournisseur et utilisez le même pour tous. Il doit répondre à quatre conditions.

  • Il traverse les modules. Au moins trois : une demande qui reste sur un seul écran teste le copilote, pas l'agent. La facturation plus les contacts plus l'email plus une tâche planifiée est une bonne configuration. La réception de stock plus le bon de commande plus la correspondance de la facture fournisseur en est une autre.
  • Il contient une écriture. Lire et résumer est la moitié facile. L'évaluation concerne la capacité du système à permettre à un agent de modifier des enregistrements, et s'il vérifie qui demande avant de le faire.
  • Il a une exception évidente. Exemple un : un client avec deux enregistrements presque identiques, ou une quantité de livraison qui ne correspond pas à la commande. Vous voulez voir si l'agent demande, devine ou corrige silencieusement.
  • Il a un suivi dans le futur. Un rappel, une relance, un contrôle programmé. Cela teste si l'agent peut laisser quelque chose pour plus tard et si le système l'exécutera lorsque la date arrivera.

Rédigez la demande en langage simple avant le jour, exactement comme un responsable des opérations le taperait, et ne laissez pas le fournisseur l'éditer. Un fournisseur qui demande à reformuler la demande vous indique où se trouvent les limites.

Gérer la journée

La séquence ci-dessous prend environ une heure par fournisseur et ne nécessite personne de technique. Insistez pour le faire dans un espace de travail d'essai que vous contrôlez, sur des données que vous avez chargées, avec votre propre agent connecté. Si l'un de ces trois est refusé, ce refus est un résultat et figure sur la carte.

  1. Connectez votre propre agentAjoutez le serveur MCP du fournisseur à Claude, ChatGPT en mode développeur, ou à tout autre client utilisé par votre équipe, et connectez-vous. Notez s'il s'agit d'une connexion OAuth ou d'un jeton que vous devez coller, et si le fournisseur pouvait le faire du tout.
  2. Listez les outilsDemandez à l'agent ce qu'il est autorisé à faire. Lisez la liste pour la longueur et la couverture des modules dans votre résultat. Ensuite, connectez-vous en tant qu'utilisateur restreint et demandez à nouveau ; la liste devrait diminuer.
  3. Indiquez le résultat une foisTapez la demande préparée en tant qu'utilisateur avec toutes les autorisations et arrêtez-vous. Répondez uniquement aux questions authentiques de l'agent, telles que laquelle de deux clients correspondants vous vouliez dire. Comptez les retours.
  4. Vérifiez les enregistrementsOuvrez chaque enregistrement que la demande aurait dû toucher. Confirmez la facture, l'email, le mouvement de stock, la tâche. Ensuite, exécutez la même demande en tant qu'utilisateur restreint et observez où elle est refusée.
  5. Lisez le journal et le compteurTrouvez l'entrée du journal : qui a demandé, quel agent, quels outils, entrées, résultats, refus. Trouvez quel était le coût de l'exécution et si un plafond aurait pu l'arrêter.
  6. Score du jourRemplissez la carte avant de quitter la pièce. La mémoire est bienveillante envers les bons présentateurs.

Le tableau de bord

Évaluez chaque ligne de 0, 1 ou 2. Zéro signifie que vous ne l'avez pas vu ; un signifie que vous l'avez vu avec une réserve ; deux signifie que vous l'avez vu clairement, dans votre environnement, avec la preuve devant vous. Dix lignes, donc le maximum est vingt. Ne pesez pas les lignes avant d'avoir effectué le test sur au moins deux produits ; le poids à l'avance est la façon dont le marketing revient.

LigneÀ quoi ressemble un 2Raison courante pour un 1 ou un 0
Résultat complétéTous les enregistrements sont corrects, aucune personne devant un écranRetour à une limite de module ou un Enregistrement
Votre agent est connectéVotre propre client MCP, connexion OAuth, aucun jeton à collerAssistant du fournisseur uniquement, ou une clé API collée
La liste des outils est réelleLong, tapé, couvre vos modules, lisible par machineUne douzaine de fonctionnalités, ou une liste seulement sur une diapositive
Autorisations par appelUtilisateur restreint refusé à l'appel ; le reste se complèteRefus uniquement au chargement de l'écran, ou une approbation qui passe
Exception géréeL'ambiguïté semée a produit une question, pas une suppositionCorrection silencieuse, ou un mauvais enregistrement choisi
Action future planifiéeLe suivi existe et se déroulera à la dateUne note dans un résumé, rien dans le système
Le journal est completQui a demandé, agent, outils, entrées, résultats, refus refusésEnregistrements modifiés mais aucune séquence d'appel ; un utilisateur d'intégration générique
Les dépenses sont plafonnéesUn plafond par intégration que l'agent ne peut pas dépasser ; coût par actionTotal mensuel uniquement, ou pas de plafond
Coût de l'agent propreAucun frais lorsque votre agent effectue le raisonnementL'IA est facturée indépendamment de qui raisonne
Extensible par d'autresUne application tierce s'installe et apparaît dans la liste des outilsFeuille de route ou travail personnalisé uniquement

Dix lignes, deux points chacune. Évaluez chaque fournisseur sur le même résultat, le même jour si possible, et comparez les totaux uniquement après que chaque ligne ait un nombre.

Lire le résultat

Les totaux importent moins que le schéma des quatre premières lignes, car ces quatre lignes déterminent le type de produit que vous examinez. Un produit qui obtient zéro sur le résultat et zéro sur la connexion de votre agent est un assistant à l'intérieur d'un écran, et le reste de son score décrit des contrôles dont il n'a pas besoin. Cela peut toujours être le bon achat si ce que votre équipe veut est un écran plus rapide, mais vous devriez l'acheter en tant que tel.

Un produit qui complète le résultat mais obtient zéro sur la connexion de votre agent est agentique avec une porte fermée. Il fonctionne, selon les conditions du fournisseur, avec l'agent du fournisseur, au prix du fournisseur pour le raisonnement. La question à se poser est ce qui se passe dans deux ans lorsque l'agent de votre équipe est celui qu'ils veulent utiliser, et si le fournisseur a dit quoi que ce soit sur l'ouverture de la porte.

Un produit qui obtient deux sur les quatre est agent-natif, et les six lignes restantes sont là où la véritable comparaison se fait : comment il gère l'exception que vous avez plantée, à quel point le journal est complet, si les dépenses peuvent être plafonnées, ce qu'il facture lorsque votre agent raisonne, et si des tiers peuvent l'étendre. Deux produits agent-natifs peuvent différer beaucoup sur ces six, et ce sont les lignes qui prédisent à quoi ressemblera la vie avec le produit.

Une lecture de plus. Si un fournisseur refuse le test, ou propose une version enregistrée, ou demande à substituer sa demande par la vôtre, notez les lignes que vous n'avez pas pu observer comme zéro et expliquez pourquoi dans les notes. Refuser est une information. Un produit qui peut faire cela voudra vous le montrer.

Ce que nous vous montrerions

Sois est un produit contre lequel vous pourriez effectuer cette évaluation, et comme nous le construisons, nous pouvons dire ce que vous verriez. Un espace de travail est un serveur MCP ; vous ajoutez son adresse à Claude, ChatGPT ou un autre client et vous vous connectez une fois via OAuth, sans token à coller. La liste des outils est filtrée par votre rôle avant que l'agent ne la voie et vérifiée à nouveau lorsque chaque outil fonctionne ; l'accès échoue en mode fermé. Les dépenses peuvent être plafonnées par intégration, chaque action est enregistrée, et lorsque votre propre agent fait le raisonnement, la plateforme n'effectue aucune IA en votre nom et ne facture rien pour cela. Les applications du marché apparaissent dans la liste des outils une fois installées. Voici le résultat de facturation du flux ci-dessus, tel qu'il s'exécute.

Claudeconnecté àapp.sois.aivia MCP
VousFacturez Acme pour le travail de septembre, envoyez un e-mail à Sarah Cole, et relancez si ce n'est pas payé d'ici le 18.
Agent
  • Lecture du travail facturable du projet et du dossier client
  • Facture créée à partir des lignes facturables
  • Envoyé au contact client par e-mail
  • Relance prévue pour la date d'échéance
Fait.
Enregistrements Sois
INV-1064Facture créée, Acme Ltd
Sarah ColeEmail envoyé depuis la boîte de réception de l'espace de travail
TâcheRelancer si non payé le 18 septembre

Quatre outils à travers la comptabilité, les contacts, la boîte de réception et les tâches, avec le journal montrant chaque appel. Exécutez-le en tant qu'utilisateur qui ne peut pas émettre de factures et le premier écrit est refusé, avec la raison.

Puis notez-le sur la même carte que tout le monde. L'objectif d'un test fixe est qu'il ne se soucie pas de qui a construit le produit, et une évaluation que vous pouvez défendre est celle qui a traité chaque fournisseur, y compris celui-ci, de la même manière.

Questions que les gens posent

Combien de temps cette évaluation prend-elle par fournisseur ?

Environ une heure une fois que le résultat est écrit et qu'un espace de travail d'essai avec vos données existe. Charger des données réalistes et planter l'exception est la préparation ; le test lui-même est une demande, deux connexions et une lecture du journal.

Que se passe-t-il si le fournisseur ne peut pas laisser mon propre agent se connecter ?

Attribuez un score de zéro à cette ligne et exécutez le test avec leur agent afin que vous puissiez toujours voir le résultat, les autorisations, le journal et les lignes de coût. Ensuite, décidez si une porte fermée est acceptable pour votre équipe et demandez au fournisseur si et quand elle s'ouvre.

Dois-je pondérer les lignes du tableau de scores ?

Pas avant d'avoir exécuté le test sur au moins deux produits. Attribuez un score à toutes les dix lignes d'abord, puis décidez quelles lignes sont les plus importantes pour votre opération. La pondération à l'avance est la façon dont une présentation solide revient dans une décision que le test était censé en exclure.

Sources
  1. spécification du Protocole de Contexte de Modèle : outils listes d'outils, liste dépendante de l'autorisation, et la recommandation qu'un humain reste impliqué avec la capacité de refuser les appels d'outils
  2. Anthropic : démarrer avec des connecteurs personnalisés utilisant MCP à distance ajout d'un serveur distant, connexion OAuth et approbation par outil dans Claude
  3. OpenAI : mode développeur ChatGPT prise en charge complète du client MCP dans ChatGPT ; les actions d'écriture nécessitent une confirmation par défaut
  4. Documentation Sois : le serveur MCP de l'espace de travail ce que le test observe sur une mise en œuvre : OAuth, outils filtrés par rôle, exécution en échec fermé, plafonds budgétaires

Cet article est révisé lorsque les produits qu'il décrit changent. Prochaine révision prévue : 4 décembre 2026.

Démarrer

Explorez la plateforme Sois.

Comment la plateforme fonctionne, ce que fait la couche de permission et ce que cela coûte, en termes simples.

  • Gratuit pour commencer
  • Apportez votre propre agent
  • Pas de verrouillage fournisseur