Evalúa un ERP de IA pidiendo a cada proveedor que complete un resultado real, de principio a fin, sin nadie en la pantalla. Elige el resultado tú mismo, asegúrate de que abarque al menos tres módulos, trae el agente que ya utiliza tu equipo y formula la solicitud una vez. Luego abre los registros, inicia sesión como un usuario restringido y repite, y lee el registro. Puntúa lo que viste en una tarjeta fija. Un producto que necesita que una persona haga clic en parte del resultado es un asistente; un producto que lo completa y muestra su trabajo en el registro, dentro de tus permisos, es un sistema agente.
La razón por la que esto funciona es que todo lo que una diapositiva puede afirmar, la prueba puede verificar o falsificar en una hora, en tu entorno, con tus datos. También tiene la propiedad útil de ser la misma prueba para cada proveedor, lo que hace que las puntuaciones sean comparables.
La única prueba que sobrevive a una demostración
Una demostración es una actuación. El presentador eligió los datos, ensayó la solicitud y sabe de qué características debe alejarse. Nada de eso es deshonesto, y nada de ello te dice lo que hace el producto cuando son tus datos y tu solicitud. Si quieres saber cómo evaluar un ERP de IA, la respuesta corta es quitar la solicitud al presentador.
Elige un resultado que sea importante para tu negocio y que un junior competente pueda hacer en una tarde: facturar a un cliente y hacer seguimiento, reservar stock contra un pedido de compra y conciliar la factura del proveedor, o convertir un presupuesto aceptado en un trabajo, un calendario y una solicitud de depósito. Trae el agente que ya utiliza tu equipo, conectado desde fuera del producto del proveedor a través del Model Context Protocol, el estándar abierto que utilizan los clientes principales. Formula la solicitud en un mensaje y quita las manos del teclado. Lo que suceda a continuación es la evaluación.
Pueden ocurrir tres cosas. El resultado se completa y los registros son correctos. El sistema hace parte de ello y entrega el resto a una persona, generalmente en un límite de módulo o al guardar. O el propio agente del proveedor lo completa, pero nada externo puede conectarse. Cada uno de esos es un producto diferente, y cada uno puntúa de manera diferente en la tarjeta a continuación.
Elegir el resultado
El resultado hace la mayor parte del trabajo, así que elígelo antes de hablar con cualquier proveedor y usa el mismo para todos ellos. Debe cumplir cuatro condiciones.
- Cruza módulos. Al menos tres: una solicitud que se queda dentro de una pantalla prueba al copiloto, no al agente. La facturación más contactos más correo electrónico más una tarea programada es una buena forma. La recepción de stock más la orden de compra más la coincidencia de la factura del proveedor es otra.
- Contiene una escritura. Leer y resumir es la mitad fácil. La evaluación trata sobre si el sistema permitirá que un agente cambie registros y si verifica quién está pidiendo antes de hacerlo.
- Tiene una excepción obvia. Planta uno: un cliente con dos registros casi idénticos, o una cantidad de entrega que no coincide con el pedido. Quieres ver si el agente pregunta, adivina o corrige en silencio.
- Tiene un seguimiento en el futuro. Un recordatorio, un seguimiento, un chequeo programado. Eso prueba si el agente puede dejar algo para más tarde y si el sistema lo ejecutará cuando llegue la fecha.
Escribe la solicitud en un lenguaje sencillo antes del día, exactamente como lo haría un líder de operaciones, y no dejes que el proveedor la edite. Un proveedor que pide reformular la solicitud te está indicando dónde están los límites.
Ejecutar el día
La secuencia a continuación toma aproximadamente una hora por proveedor y no necesita a nadie técnico. Insiste en hacerlo en un espacio de trabajo de prueba que controles, con datos que cargaste, y con tu propio agente conectado. Si cualquiera de esos tres es rechazado, ese rechazo es un resultado y se anota en la tarjeta.
- Conecta tu propio agenteAñade el servidor MCP del proveedor a Claude, ChatGPT en modo desarrollador, o al cliente que utilice tu equipo, e inicia sesión. Toma nota de si es un inicio de sesión OAuth o un token que debes pegar, y si el proveedor podría hacerlo en absoluto.
- Lista las herramientasPregunta al agente qué se le permite hacer. Lee la lista para conocer la longitud y la cobertura de los módulos en tu resultado. Luego inicia sesión como usuario restringido y pregunta de nuevo; la lista debería reducirse.
- Indica el resultado una vezEscribe la solicitud preparada como el usuario con permisos completos y detente. Responde solo a preguntas genuinas del agente, como cuál de los dos clientes coincidentes querías decir. Cuenta las devoluciones.
- Revisa los registrosAbre cada registro que la solicitud debería haber tocado. Confirma la factura, el correo electrónico, el movimiento de stock, la tarea. Luego ejecuta la misma solicitud como usuario restringido y observa dónde se rechaza.
- Lee el registro y el medidorEncuentra la entrada del registro: quién preguntó, qué agente, qué herramientas, entradas, resultados, rechazos. Encuentra cuál fue el coste de la ejecución y si un límite podría haberlo detenido.
- Puntuación del díaCompleta la tarjeta antes de salir de la sala. La memoria es benévola con los buenos presentadores.
El cuadro de mando
Califica cada fila con 0, 1 o 2. Cero significa que no lo viste; uno significa que lo viste con una salvedad; dos significa que lo viste claramente, en tu entorno, con la evidencia delante de ti. Diez filas, así que el máximo es veinte. No ponderes las filas antes de haber realizado la prueba en al menos dos productos; ponderar por adelantado es cómo el marketing vuelve a entrar.
| Fila | Cómo es un 2 | Razón común para un 1 o 0 |
|---|---|---|
| Resultado completado | Todos los registros correctos, sin persona en la pantalla | Hand-back en un límite de módulo o un Guardar |
| Tu agente conectado | Tu propio cliente MCP, inicio de sesión OAuth, sin token que pegar | Asistente del proveedor solamente, o una clave API pegada |
| La lista de herramientas es real | Largo, escrito, cubre tus módulos, legible por máquina | Una docena de funciones, o una lista solo en una diapositiva |
| Permisos por llamada | Usuario restringido rechazado en la llamada; el resto completa | Rechazo solo al cargar la pantalla, o una aprobación que se procesa |
| Excepción gestionada | La ambigüedad sembrada produjo una pregunta, no una suposición | Corrección silenciosa, o un registro incorrecto elegido |
| Acción futura programada | El seguimiento existe y se ejecutará en la fecha | Una nota en un resumen, nada en el sistema |
| El registro está completo | ¿Quién preguntó, agente, herramientas, entradas, resultados, rechazos? | Registros cambiados pero sin secuencia de llamadas; un usuario de integración genérico |
| El gasto está limitado | Un límite por integración que el agente no puede superar; coste por acción | Total mensual únicamente, o sin límite |
| Coste del propio agente | No se cobra nada cuando tu agente realiza el razonamiento | Se cobra a la IA independientemente de quién razone |
| Ampliable por otros | Una aplicación de terceros se instala y aparece en la lista de herramientas | Solo hoja de ruta o trabajo personalizado |
Diez filas, dos puntos cada una. Puntúa a cada proveedor en el mismo resultado, el mismo día si puedes, y compara totales solo después de que cada fila tenga un número.
Leer el resultado
Los totales importan menos que el patrón en las primeras cuatro filas, porque esas cuatro deciden qué tipo de producto estás evaluando. Un producto que obtiene cero en el resultado y cero en la conexión de tu agente es un asistente dentro de una pantalla, y el resto de su puntuación describe controles que no necesita. Aún puede ser la compra correcta si lo que tu equipo quiere es una pantalla más rápida, pero deberías comprarlo como eso.
Un producto que completa el resultado pero obtiene cero en la conexión de tu agente es agente con una puerta cerrada. Funciona, en los términos del proveedor, con el agente del proveedor, al precio del proveedor para el razonamiento. La pregunta que debes hacerte es qué sucederá en dos años cuando el agente de tu equipo sea el que quieran usar, y si el proveedor ha dicho algo sobre abrir la puerta.
Un producto que obtiene dos en las cuatro es nativo-agente, y las seis filas restantes son donde ocurre la verdadera comparación: qué tan bien maneja la excepción que plantaste, cuán completo es el registro, si se puede limitar el gasto, qué cobra cuando tu agente razona, y si los externos pueden extenderlo. Dos productos nativos-agente pueden diferir mucho en esas seis, y son las filas que predicen cómo será vivir con el producto.
Una lectura más. Si un proveedor rechaza la prueba, o ofrece una versión grabada, o pide sustituir su solicitud por la tuya, puntúa las filas que no pudiste observar como cero y explica por qué en las notas. Rechazar es información. Un producto que puede hacer esto querrá mostrártelo.
Lo que te mostraríamos
Sois es un producto contra el que podrías realizar esta evaluación, y dado que lo construimos, podemos decirte lo que verías. Un espacio de trabajo es un servidor MCP; añades su dirección a Claude, ChatGPT u otro cliente y inicias sesión una vez a través de OAuth, sin necesidad de pegar un token. La lista de herramientas se filtra según tu rol antes de que el agente la vea y se verifica de nuevo cuando cada herramienta se ejecuta; el acceso falla cerrado. El gasto se puede limitar por integración, cada acción se registra, y cuando tu propio agente realiza el razonamiento, la plataforma no realiza ninguna IA en tu nombre y no cobra nada por ello. Las aplicaciones del mercado aparecen en la lista de herramientas una vez instaladas. Aquí está el resultado de facturación del flujo anterior, a medida que se ejecuta.
- Leyendo el trabajo facturable del proyecto y el registro del cliente.
- Factura creada a partir de las líneas facturables.
- Enviada al contacto del cliente por correo electrónico.
- Persecución programada para la fecha de vencimiento
Cuatro herramientas en contabilidad, contactos, bandeja de entrada y tareas, con el registro mostrando cada llamada. Ejecútalo como un usuario que no puede emitir facturas y la primera escritura es rechazada, con la razón.
Luego puntúalo en la misma tarjeta que los demás. El objetivo de una prueba fija es que no le importa quién construyó el producto, y una evaluación que puedes defender es aquella que trató a cada proveedor, incluido este, de la misma manera.
Preguntas que la gente hace
¿Cuánto tiempo lleva esta evaluación por proveedor?
Aproximadamente una hora una vez que el resultado está escrito y existe un espacio de trabajo de prueba con tus datos. Cargar datos realistas y plantar la excepción es la preparación; la prueba en sí es una solicitud, dos inicios de sesión y una lectura del registro.
¿Qué pasa si el proveedor no puede permitir que mi propio agente se conecte?
Puntuación de esa fila en cero y ejecuta la prueba con su agente para que aún veas el resultado, permisos, registro y filas de coste. Luego decide si una puerta cerrada es aceptable para tu equipo y pregunta al proveedor si y cuándo se abre.
¿Debería ponderar las filas de la tarjeta de puntuación?
No antes de haber ejecutado la prueba en al menos dos productos. Puntúa las diez filas primero, luego decide cuáles son las más importantes para tu operación. Ponderar por adelantado es cómo una presentación sólida vuelve a entrar en una decisión de la que la prueba estaba destinada a mantenerla fuera.
- especificación del Protocolo de Contexto del Modelo: herramientas listas de herramientas, listado dependiente de autorización y la recomendación de que un humano permanezca en el circuito con la capacidad de denegar llamadas a herramientas
- Anthropic: comenzando con conectores personalizados utilizando MCP remoto añadiendo un servidor remoto, inicio de sesión OAuth y aprobación por herramienta en Claude
- OpenAI: modo desarrollador de ChatGPT soporte completo de cliente MCP en ChatGPT; las acciones de escritura requieren confirmación por defecto
- Documentación de Sois: el servidor MCP del espacio de trabajo lo que la prueba observa en una implementación: OAuth, herramientas filtradas por rol, ejecución de fallo cerrado, límites de presupuesto
Este artículo se revisa cuando cambian los productos que describe. Próxima revisión programada: 4 de diciembre de 2026.
