Evalúa un ERP de IA pidiendo a cada proveedor que complete un resultado real, de principio a fin, sin nadie en la pantalla. Elige el resultado tú mismo, asegúrate de que abarque al menos tres módulos, trae el agente que tu equipo ya utiliza y formula la solicitud una vez. Luego abre los registros, inicia sesión como un usuario restringido y repite, y lee el registro. Puntúa lo que viste en una tarjeta fija. Un producto que necesita que una persona haga clic en parte del resultado es un asistente; un producto que lo completa y muestra su trabajo en el registro, dentro de tus permisos, es un sistema agente.
La razón por la que esto funciona es que todo lo que una diapositiva puede afirmar, la prueba puede verificar o falsificar en una hora, en tu entorno, con tus datos. También tiene la propiedad útil de ser la misma prueba para cada proveedor, lo que hace que las puntuaciones sean comparables.
La única prueba que sobrevive a una demostración
Una demostración es una actuación. El presentador eligió los datos, ensayó la solicitud y sabe de qué características alejarse. Nada de eso es deshonesto, y nada de ello te dice lo que el producto hace cuando son tus datos y tu solicitud. Si quieres saber cómo evaluar un ERP de IA, la respuesta corta es quitar la solicitud al presentador.
Elige un resultado que sea importante para tu negocio y que un junior competente pueda hacer en una tarde: facturar a un cliente y hacer seguimiento, reservar stock contra una orden de compra y conciliar la factura del proveedor, o convertir una cotización aceptada en un trabajo, un cronograma y una solicitud de depósito. Trae el agente que tu equipo ya utiliza, conectado desde fuera del producto del proveedor a través del Model Context Protocol, el estándar abierto que utilizan los clientes principales. Formula la solicitud en un mensaje y quita las manos del teclado. Lo que suceda a continuación es la evaluación.
Pueden ocurrir tres cosas. El resultado se completa y los registros son correctos. El sistema hace parte de ello y entrega el resto a una persona, generalmente en un límite de módulo o al guardar. O el propio agente del proveedor lo completa, pero nada externo puede conectarse. Cada uno de esos es un producto diferente, y cada uno puntúa de manera diferente en la tarjeta a continuación.
Eligiendo el resultado
El resultado hace la mayor parte del trabajo, así que elígelo antes de hablar con cualquier proveedor y usa el mismo para todos ellos. Debe cumplir cuatro condiciones.
- Cruza módulos. Al menos tres: una solicitud que se queda dentro de una pantalla prueba al copiloto, no al agente. La facturación más contactos más correo electrónico más una tarea programada es una buena forma. La recepción de stock más la orden de compra más la coincidencia de la factura del proveedor es otra.
- Tiene una escritura en ella. Leer y resumir es la mitad fácil. La evaluación trata sobre si el sistema permitirá que un agente cambie registros, y si verifica quién está pidiendo antes de hacerlo.
- Tiene una excepción obvia. Planta uno: un cliente con dos registros casi idénticos, o una cantidad de entrega que no coincide con el pedido. Quieres ver si el agente pregunta, adivina o corrige en silencio.
- Tiene un seguimiento en el futuro. Un recordatorio, un seguimiento, un chequeo programado. Eso prueba si el agente puede dejar algo para más tarde y si el sistema lo ejecutará cuando llegue la fecha.
Escribe la solicitud en un lenguaje sencillo antes del día, exactamente como lo haría un líder de operaciones, y no dejes que el proveedor la edite. Un proveedor que pide reformular la solicitud te está diciendo dónde están los límites.
Ejecutando el día
La secuencia a continuación toma aproximadamente una hora por proveedor y no necesita a nadie técnico. Insiste en hacerlo en un espacio de trabajo de prueba que controlas, con datos que cargaste, y con tu propio agente conectado. Si cualquiera de esos tres es rechazado, ese rechazo es un resultado y va en la tarjeta.
- Conecta tu propio agenteAgrega el servidor MCP del proveedor a Claude, ChatGPT en modo desarrollador, o al cliente que use tu equipo, e inicia sesión. Toma nota de si es un inicio de sesión OAuth o un token que debes pegar, y si el proveedor podría hacerlo en absoluto.
- Lista las herramientasPregunta al agente qué se le permite hacer. Lee la lista para conocer la extensión y cobertura de los módulos en tu resultado. Luego inicia sesión como un usuario restringido y pregunta de nuevo; la lista debería reducirse.
- Indica el resultado una vezEscribe la solicitud preparada como el usuario con permisos completos y detente. Responde solo a preguntas genuinas del agente, como cuál de los dos clientes coincidentes te referías. Cuenta las devoluciones.
- Revisa los registrosAbre cada registro que la solicitud debería haber tocado. Confirma la factura, el correo electrónico, el movimiento de stock, la tarea. Luego ejecuta la misma solicitud como el usuario restringido y observa dónde se niega.
- Lee el registro y el medidorEncuentra la entrada del registro: quién preguntó, qué agente, qué herramientas, entradas, resultados, rechazos. Encuentra cuál fue el costo de la ejecución y si un límite podría haberlo detenido.
- Puntuación del díaCompleta la tarjeta antes de salir de la sala. La memoria es benévola con los buenos presentadores.
El tablero de puntuación
Califica cada fila con 0, 1 o 2. Cero significa que no lo viste; uno significa que lo viste con una salvedad; dos significa que lo viste claramente, en tu entorno, con la evidencia frente a ti. Diez filas, así que el máximo es veinte. No ponderes las filas antes de haber realizado la prueba en al menos dos productos; ponderar por adelantado es cómo el marketing vuelve a entrar.
| Fila | ¿Cómo se ve un 2? | Razón común para un 1 o 0 |
|---|---|---|
| Resultado completado | Todos los registros son correctos, no hay persona en la pantalla | Devolución en un límite de módulo o un Guardar |
| Tu agente se conectó | Tu propio cliente MCP, inicio de sesión OAuth, sin token que pegar | Asistente del proveedor solamente, o una clave API pegada |
| La lista de herramientas es real | Largo, escrito, cubre tus módulos, legible por máquina | Una docena de características, o una lista solo en una diapositiva |
| Permisos por llamada | Usuario restringido rechazado en la llamada; el resto completa | Rechazo solo al cargar la pantalla, o una aprobación que se procesa |
| Excepción manejada | La ambigüedad sembrada produjo una pregunta, no una suposición | Corrección silenciosa, o un registro incorrecto elegido |
| Acción futura programada | El seguimiento existe y se ejecutará en la fecha | Una nota en un resumen, nada en el sistema |
| El registro está completo | ¿Quién preguntó, agente, herramientas, insumos, resultados, rechazos? | Registros cambiados pero sin secuencia de llamadas; un usuario de integración genérico |
| El gasto está limitado | Un límite por integración que el agente no puede exceder; costo por acción | Total mensual solamente, o sin límite |
| Costo del propio agente | No se cobra nada cuando tu agente hace el razonamiento | Se cobra a la IA independientemente de quién razone |
| Ampliable por otros | Una aplicación de terceros se instala y aparece en la lista de herramientas | Solo hoja de ruta o trabajo personalizado |
Diez filas, dos puntos cada una. Califica a cada proveedor en el mismo resultado, el mismo día si puedes, y compara totales solo después de que cada fila tenga un número.
Leyendo el resultado
Los totales importan menos que el patrón en las primeras cuatro filas, porque esas cuatro deciden qué tipo de producto estás analizando. Un producto que obtiene cero en el resultado y cero en la conexión de tu agente es un asistente dentro de una pantalla, y el resto de su puntuación describe controles que no necesita. Aún puede ser la compra correcta si lo que tu equipo quiere es una pantalla más rápida, pero deberías comprarlo como eso.
Un producto que completa el resultado pero obtiene cero en la conexión de tu agente es agente-nativo con una puerta cerrada. Funciona, en los términos del proveedor, con el agente del proveedor, al precio del proveedor para el razonamiento. La pregunta que debes hacerte es qué sucede en dos años cuando el agente de tu equipo sea el que quieren usar, y si el proveedor ha dicho algo sobre abrir la puerta.
Un producto que obtiene dos en las cuatro es agente-nativo, y las seis filas restantes son donde ocurre la verdadera comparación: qué tan bien maneja la excepción que plantaste, qué tan completo es el registro, si se puede limitar el gasto, qué cobra cuando tu agente razona, y si los externos pueden extenderlo. Dos productos agente-nativos pueden diferir mucho en esas seis, y son las filas que predicen cómo será vivir con el producto.
Una lectura más. Si un proveedor rechaza la prueba, o ofrece una versión grabada, o pide sustituir su solicitud por la tuya, califica las filas que no pudiste observar como cero y explica por qué en las notas. Rechazar es información. Un producto que puede hacer esto querrá mostrártelo.
Lo que te mostraríamos
Sois es un producto contra el cual podrías realizar esta evaluación, y dado que lo construimos, podemos decirte lo que verías. Un espacio de trabajo es un servidor MCP; agregas su dirección a Claude, ChatGPT u otro cliente y inicias sesión una vez a través de OAuth, sin token que pegar. La lista de herramientas se filtra por tu rol antes de que el agente la vea y se verifica nuevamente cuando cada herramienta se ejecuta; el acceso falla cerrado. El gasto se puede limitar por integración, cada acción se registra, y cuando tu propio agente realiza el razonamiento, la plataforma no realiza ninguna IA en tu nombre y no cobra nada por ello. Las aplicaciones del mercado aparecen en la lista de herramientas una vez instaladas. Aquí está el resultado de facturación del flujo anterior, a medida que se ejecuta.
- Leyendo el trabajo facturable del proyecto y el registro del cliente.
- Factura creada a partir de las líneas facturables.
- Enviada al contacto del cliente por correo electrónico.
- Persecución programada para la fecha de vencimiento
Cuatro herramientas en contabilidad, contactos, bandeja de entrada y tareas, con el registro mostrando cada llamada. Ejecútalo como un usuario que no puede generar facturas y la primera escritura es rechazada, con la razón.
Luego califícalo en la misma tarjeta que todos los demás. El objetivo de una prueba fija es que no le importa quién construyó el producto, y una evaluación que puedes defender es aquella que trató a cada proveedor, incluido este, de la misma manera.
Preguntas que la gente hace
¿Cuánto tiempo toma esta evaluación por proveedor?
Aproximadamente una hora una vez que el resultado está escrito y existe un espacio de trabajo de prueba con tus datos. Cargar datos realistas y plantar la excepción es la preparación; la prueba en sí es una solicitud, dos inicios de sesión y una lectura del registro.
¿Qué pasa si el proveedor no puede permitir que mi propio agente se conecte?
Puntuación cero en esa fila y ejecuta la prueba con su agente para que aún veas el resultado, permisos, registros y filas de costos. Luego decide si una puerta cerrada es aceptable para tu equipo y pregunta al proveedor si y cuándo se abre.
¿Debería ponderar las filas del cuadro de puntuación?
No antes de haber ejecutado la prueba en al menos dos productos. Puntúa las diez filas primero, luego decide cuáles son las más importantes para tu operación. Ponderar de antemano es cómo una presentación sólida vuelve a una decisión de la que la prueba estaba destinada a mantenerla fuera.
- especificación del Protocolo de Contexto del Modelo: herramientas listas de herramientas, listado dependiente de autorización y la recomendación de que un humano permanezca en el circuito con la capacidad de denegar llamadas a herramientas
- Anthropic: comenzando con conectores personalizados usando MCP remoto agregar un servidor remoto, inicio de sesión OAuth y aprobación por herramienta en Claude
- OpenAI: modo desarrollador de ChatGPT soporte completo de cliente MCP en ChatGPT; las acciones de escritura requieren confirmación por defecto
- documentación de Sois: el servidor MCP del espacio de trabajo lo que la prueba observa en una implementación: OAuth, herramientas filtradas por rol, ejecución de falla cerrada, límites de presupuesto
Este artículo se revisa cuando cambian los productos que describe. Próxima revisión programada: 4 de diciembre de 2026.
