Avalie um ERP de IA pedindo a cada fornecedor para completar um resultado real, do início ao fim, sem ninguém na tela. Escolha o resultado você mesmo, faça com que abranja pelo menos três módulos, traga o agente que sua equipe já usa e declare o pedido uma vez. Em seguida, abra os registros, faça login como um usuário restrito e repita, e leia o log. Pontue o que você viu em um cartão fixo. Um produto que precisa de uma pessoa para clicar em parte do resultado é um assistente; um produto que o finaliza e mostra seu trabalho no log, dentro de suas permissões, é um sistema agente.
A razão pela qual isso funciona é que tudo o que um slide pode afirmar, o teste pode verificar ou falsificar em uma hora, em seu ambiente, com seus dados. Também tem a propriedade útil de ser o mesmo teste para cada fornecedor, o que torna as pontuações comparáveis.
O único teste que sobrevive a uma demonstração
Uma demonstração é uma performance. O apresentador escolheu os dados, ensaiou o pedido e sabe quais recursos evitar. Nada disso é desonesto, e nada disso diz o que o produto faz quando são seus dados e seu pedido. Se você quer saber como avaliar um ERP de IA, a resposta curta é retirar o pedido do apresentador.
Escolha um resultado que importe para o seu negócio e que um júnior competente possa fazer em uma tarde: faturar um cliente e cobrá-lo, reservar estoque contra um pedido de compra e combinar com a fatura do fornecedor, ou transformar um orçamento aceito em um trabalho, um cronograma e um pedido de depósito. Traga o agente que sua equipe já usa, conectado de fora do produto do fornecedor através do Model Context Protocol, o padrão aberto que os clientes principais falam. Declare o pedido em uma mensagem e tire as mãos do teclado. O que acontecer a seguir é a avaliação.
Três coisas podem acontecer. O resultado é concluído e os registros estão corretos. O sistema faz parte disso e entrega o restante a uma pessoa, geralmente em uma fronteira de módulo ou ao salvar. Ou o próprio agente do fornecedor conclui, mas nada de fora pode se conectar. Cada um deles é um produto diferente, e cada um pontua de forma diferente no cartão abaixo.
Escolhendo o resultado
O resultado faz a maior parte do trabalho, então escolha-o antes de falar com qualquer fornecedor e use o mesmo para todos eles. Ele deve atender a quatro condições.
- Ele atravessa módulos. Pelo menos três: um pedido que permanece dentro de uma tela testa o copiloto, não o agente. Faturamento mais contatos mais e-mail mais uma tarefa agendada é uma boa combinação. Recebimento de estoque mais pedido de compra mais correspondência de fatura de fornecedor é outra.
- Ele tem uma escrita nele. Ler e resumir é a parte fácil. A avaliação é sobre se o sistema permitirá que um agente altere registros e se verifica quem está perguntando antes de fazê-lo.
- Ele tem uma exceção óbvia. Planta um: um cliente com dois registros quase idênticos, ou uma quantidade de entrega que não corresponde ao pedido. Você quer ver se o agente pergunta, adivinha ou corrige silenciosamente.
- Ele tem um acompanhamento no futuro. Um lembrete, um acompanhamento, uma verificação agendada. Isso testa se o agente pode deixar algo para depois e se o sistema o executará quando a data chegar.
Escreva o pedido em linguagem simples antes do dia, exatamente como um líder de operações o digitária, e não deixe o fornecedor editá-lo. Um fornecedor que pede para reformular o pedido está lhe dizendo onde estão os limites.
Executando o dia
A sequência abaixo leva cerca de uma hora por fornecedor e não precisa de ninguém técnico. Insista em fazê-lo em um espaço de trabalho de teste que você controla, com dados que você carregou, com seu próprio agente conectado. Se qualquer um desses três for recusado, essa recusa é um resultado e vai no cartão.
- Conecte seu próprio agenteAdicione o servidor MCP do fornecedor ao Claude, ChatGPT em modo de desenvolvedor, ou qualquer cliente que sua equipe use, e faça o login. Observe se é um login OAuth ou um token que você precisa colar, e se o fornecedor poderia fazer isso.
- Liste as ferramentasPergunte ao agente o que ele está autorizado a fazer. Leia a lista para verificar a extensão e a cobertura dos módulos em seu resultado. Em seguida, faça login como um usuário restrito e pergunte novamente; a lista deve encolher.
- Declare o resultado uma vezDigite a solicitação preparada como o usuário com permissão total e pare. Responda apenas a perguntas genuínas do agente, como qual dos dois clientes correspondentes você quis dizer. Conte os retornos.
- Verifique os registrosAbra todos os registros que a solicitação deveria ter tocado. Confirme a fatura, o e-mail, o movimento de estoque, a tarefa. Em seguida, execute a mesma solicitação como o usuário restrito e observe onde ela é recusada.
- Leia o log e o medidorEncontre a entrada do log: quem perguntou, qual agente, quais ferramentas, entradas, resultados, recusas. Descubra qual foi o custo da execução e se um limite poderia tê-la impedido.
- Pontuação do diaPreencha o cartão antes de sair da sala. A memória é generosa com bons apresentadores.
O placar
Pontue cada linha de 0, 1 ou 2. Zero significa que você não viu; um significa que você viu com uma ressalva; dois significa que você viu claramente, em seu ambiente, com a evidência na sua frente. Dez linhas, então o máximo é vinte. Não pese as linhas antes de ter executado o teste em pelo menos dois produtos; pesar antecipadamente é como o marketing volta a entrar.
| Linha | Como é um 2 | Razão comum para um 1 ou 0 |
|---|---|---|
| Resultado concluído | Todos os registros corretos, nenhuma pessoa na tela | Devolução em uma fronteira de módulo ou um Salvar |
| Seu agente conectado | Seu próprio cliente MCP, login OAuth, sem token para colar | Apenas assistente do fornecedor ou uma chave de API colada |
| A lista de ferramentas é real | Longo, digitado, cobre seus módulos, legível por máquina | Uma dúzia de recursos, ou uma lista apenas em um slide |
| Permissões por chamada | Usuário restrito recusado na chamada; o restante completa | Recusa apenas na carga da tela, ou uma aprovação que passa |
| Exceção tratada | A ambiguidade plantada produziu uma pergunta, não um palpite | Correção silenciosa, ou um registro errado escolhido |
| Ação futura agendada | O acompanhamento existe e será executado na data | Uma nota em um resumo, nada no sistema |
| Registro está completo | Quem perguntou, agente, ferramentas, entradas, resultados, recusas | Registros alterados, mas sem sequência de chamadas; um usuário de integração genérico |
| Gastos são limitados | Um limite por integração que o agente não pode exceder; custo por ação | Total mensal apenas, ou sem limite |
| Custo do próprio agente | Nada é cobrado quando seu agente faz o raciocínio | IA é cobrada independentemente de quem raciocina |
| Extensível por outros | Um aplicativo de terceiros é instalado e aparece na lista de ferramentas | Apenas roadmap ou trabalho personalizado |
Dez linhas, dois pontos cada. Avalie cada fornecedor com base no mesmo resultado, no mesmo dia se possível, e compare os totais apenas após cada linha ter um número.
Lendo o resultado
Os totais importam menos do que o padrão nas quatro primeiras linhas, porque essas quatro decidem que tipo de produto você está analisando. Um produto que pontua zero no resultado e zero na conexão com seu agente é um assistente dentro de uma tela, e o restante de sua pontuação descreve controles que não são necessários. Pode ainda ser a compra certa se o que sua equipe deseja é uma tela mais rápida, mas você deve comprá-lo como tal.
Um produto que completa o resultado, mas pontua zero na conexão com seu agente, é agente com uma porta fechada. Funciona, nos termos do fornecedor, com o agente do fornecedor, ao preço do fornecedor para raciocínio. A pergunta que você deve se fazer é o que acontece em dois anos quando o agente da sua equipe for aquele que eles querem usar, e se o fornecedor disse algo sobre abrir a porta.
Um produto que pontua dois em todos os quatro é nativo do agente, e as seis linhas restantes são onde a verdadeira comparação acontece: quão bem ele lida com a exceção que você plantou, quão completo é o log, se os gastos podem ser limitados, o que ele cobra quando seu agente raciocina, e se terceiros podem estendê-lo. Dois produtos nativos do agente podem diferir muito nessas seis, e são essas linhas que preveem como será viver com o produto.
Uma leitura a mais. Se um fornecedor recusar o teste, ou oferecer uma versão gravada, ou pedir para substituir seu pedido pelo deles, pontue as linhas que você não pôde observar como zero e diga o porquê nas notas. Recusar é informação. Um produto que pode fazer isso vai querer mostrar a você.
O que mostraríamos a você
Sois é um produto contra o qual você poderia realizar essa avaliação, e como nós o construímos, podemos dizer o que você veria. Um espaço de trabalho é um servidor MCP; você adiciona seu endereço ao Claude, ChatGPT ou outro cliente e faz login uma vez via OAuth, sem token para colar. A lista de ferramentas é filtrada pelo seu papel antes que o agente a veja e verificada novamente quando cada ferramenta é executada; o acesso falha fechado. Os gastos podem ser limitados por integração, cada ação é registrada, e quando seu próprio agente faz o raciocínio, a plataforma não realiza nenhuma IA em seu nome e não cobra nada por isso. Aplicativos do marketplace aparecem na lista de ferramentas uma vez instalados. Aqui está o resultado da faturação do fluxo acima, conforme ele é executado.
- Lendo o trabalho faturável do projeto e o registro do cliente
- Fatura criada a partir das linhas faturáveis
- Enviado para o contato do cliente por e-mail
- Cobrança agendada para a data de vencimento
Quatro ferramentas em contabilidade, contatos, caixa de entrada e tarefas, com o log mostrando cada chamada. Execute como um usuário que não pode emitir faturas e a primeira escrita é recusada, com o motivo.
Então, pontue-o no mesmo cartão que todos os outros. O objetivo de um teste fixo é que ele não se importa com quem construiu o produto, e uma avaliação que você pode defender é aquela que tratou todos os fornecedores, incluindo este, da mesma forma.
Perguntas que as pessoas fazem
Quanto tempo essa avaliação leva por fornecedor?
Cerca de uma hora, uma vez que o resultado esteja escrito e um espaço de trabalho de teste com seus dados exista. Carregar dados realistas e plantar a exceção é a preparação; o teste em si é um pedido, dois logins e uma leitura do log.
E se o fornecedor não puder permitir que meu próprio agente se conecte?
Marque essa linha como zero e execute o teste com o agente deles para que você ainda veja o resultado, permissões, log e linhas de custo. Então decida se uma porta fechada é aceitável para sua equipe e pergunte ao fornecedor se e quando ela abre.
Devo ponderar as linhas do placar?
Não antes de ter executado o teste em pelo menos dois produtos. Avalie todas as dez linhas primeiro, depois decida quais linhas são mais importantes para sua operação. Ponderar antecipadamente é como uma apresentação forte volta a uma decisão que o teste deveria manter fora.
- especificação do Protocolo de Contexto do Modelo: ferramentas listas de ferramentas, listagem dependente de autorização e a recomendação de que um humano permaneça no loop com a capacidade de negar chamadas de ferramentas
- Anthropic: começando com conectores personalizados usando MCP remoto adicionando um servidor remoto, login OAuth e aprovação por ferramenta no Claude
- OpenAI: modo desenvolvedor do ChatGPT suporte completo ao cliente MCP no ChatGPT; ações de escrita requerem confirmação por padrão
- Documentação do Sois: o servidor MCP do espaço de trabalho o que o teste observa em uma implementação: OAuth, ferramentas filtradas por função, execução fail-closed, limites de orçamento
Este artigo é revisado quando os produtos que descreve mudam. Próxima revisão agendada: 4 de dezembro de 2026.
