Para negócios Para empresas Soluções Aplicativos Preços Desenvolvedores Blog Documentação Iniciar um espaço de trabalho
Blog / Agentic ERP

Como avaliar um ERP de IA sem cair no marketing

Um teste sobrevive a qualquer demonstração: peça ao fornecedor para completar um resultado real, entre módulos, sem ninguém na tela, usando um agente que você traz. Aqui está como escolher o resultado, executar o dia, pontuá-lo e ler o que a pontuação significa.

Leitura de 6 minAtualizado 4 de setembro de 2026Engenharia Sois, a equipe que constrói a plataforma

Uma mesa de sala de reuniões antes de uma reunião: madeira escura, quatro propostas impressas viradas para baixo em uma fileira, uma jarra de água, um único lápis, janelas altas com luz cinza da manhã.
Resposta curta

Avalie um ERP de IA pedindo a cada fornecedor para completar um resultado real, do início ao fim, sem ninguém na tela. Escolha o resultado você mesmo, faça com que abranja pelo menos três módulos, traga o agente que sua equipe já usa e declare o pedido uma vez. Em seguida, abra os registros, faça login como um usuário restrito e repita, e leia o log. Pontue o que você viu em um cartão fixo. Um produto que precisa de uma pessoa para clicar em parte do resultado é um assistente; um produto que o finaliza e mostra seu trabalho no log, dentro de suas permissões, é um sistema agente.

A razão pela qual isso funciona é que tudo o que um slide pode afirmar, o teste pode verificar ou falsificar em uma hora, em seu ambiente, com seus dados. Também tem a propriedade útil de ser o mesmo teste para cada fornecedor, o que torna as pontuações comparáveis.

O único teste que sobrevive a uma demonstração

Uma demonstração é uma performance. O apresentador escolheu os dados, ensaiou o pedido e sabe quais recursos evitar. Nada disso é desonesto, e nada disso diz o que o produto faz quando são seus dados e seu pedido. Se você quer saber como avaliar um ERP de IA, a resposta curta é retirar o pedido do apresentador.

Escolha um resultado que importe para o seu negócio e que um júnior competente possa fazer em uma tarde: faturar um cliente e cobrá-lo, reservar estoque contra um pedido de compra e combinar com a fatura do fornecedor, ou transformar um orçamento aceito em um trabalho, um cronograma e um pedido de depósito. Traga o agente que sua equipe já usa, conectado de fora do produto do fornecedor através do Model Context Protocol, o padrão aberto que os clientes principais falam. Declare o pedido em uma mensagem e tire as mãos do teclado. O que acontecer a seguir é a avaliação.

Três coisas podem acontecer. O resultado é concluído e os registros estão corretos. O sistema faz parte disso e entrega o restante a uma pessoa, geralmente em uma fronteira de módulo ou ao salvar. Ou o próprio agente do fornecedor conclui, mas nada de fora pode se conectar. Cada um deles é um produto diferente, e cada um pontua de forma diferente no cartão abaixo.

Escolhendo o resultado

O resultado faz a maior parte do trabalho, então escolha-o antes de falar com qualquer fornecedor e use o mesmo para todos eles. Ele deve atender a quatro condições.

  • Ele atravessa módulos. Pelo menos três: um pedido que permanece dentro de uma tela testa o copiloto, não o agente. Faturamento mais contatos mais e-mail mais uma tarefa agendada é uma boa combinação. Recebimento de estoque mais pedido de compra mais correspondência de fatura de fornecedor é outra.
  • Ele tem uma escrita nele. Ler e resumir é a parte fácil. A avaliação é sobre se o sistema permitirá que um agente altere registros e se verifica quem está perguntando antes de fazê-lo.
  • Ele tem uma exceção óbvia. Planta um: um cliente com dois registros quase idênticos, ou uma quantidade de entrega que não corresponde ao pedido. Você quer ver se o agente pergunta, adivinha ou corrige silenciosamente.
  • Ele tem um acompanhamento no futuro. Um lembrete, um acompanhamento, uma verificação agendada. Isso testa se o agente pode deixar algo para depois e se o sistema o executará quando a data chegar.

Escreva o pedido em linguagem simples antes do dia, exatamente como um líder de operações o digitária, e não deixe o fornecedor editá-lo. Um fornecedor que pede para reformular o pedido está lhe dizendo onde estão os limites.

Executando o dia

A sequência abaixo leva cerca de uma hora por fornecedor e não precisa de ninguém técnico. Insista em fazê-lo em um espaço de trabalho de teste que você controla, com dados que você carregou, com seu próprio agente conectado. Se qualquer um desses três for recusado, essa recusa é um resultado e vai no cartão.

  1. Conecte seu próprio agenteAdicione o servidor MCP do fornecedor ao Claude, ChatGPT em modo de desenvolvedor, ou qualquer cliente que sua equipe use, e faça o login. Observe se é um login OAuth ou um token que você precisa colar, e se o fornecedor poderia fazer isso.
  2. Liste as ferramentasPergunte ao agente o que ele está autorizado a fazer. Leia a lista para verificar a extensão e a cobertura dos módulos em seu resultado. Em seguida, faça login como um usuário restrito e pergunte novamente; a lista deve encolher.
  3. Declare o resultado uma vezDigite a solicitação preparada como o usuário com permissão total e pare. Responda apenas a perguntas genuínas do agente, como qual dos dois clientes correspondentes você quis dizer. Conte os retornos.
  4. Verifique os registrosAbra todos os registros que a solicitação deveria ter tocado. Confirme a fatura, o e-mail, o movimento de estoque, a tarefa. Em seguida, execute a mesma solicitação como o usuário restrito e observe onde ela é recusada.
  5. Leia o log e o medidorEncontre a entrada do log: quem perguntou, qual agente, quais ferramentas, entradas, resultados, recusas. Descubra qual foi o custo da execução e se um limite poderia tê-la impedido.
  6. Pontuação do diaPreencha o cartão antes de sair da sala. A memória é generosa com bons apresentadores.

O placar

Pontue cada linha de 0, 1 ou 2. Zero significa que você não viu; um significa que você viu com uma ressalva; dois significa que você viu claramente, em seu ambiente, com a evidência na sua frente. Dez linhas, então o máximo é vinte. Não pese as linhas antes de ter executado o teste em pelo menos dois produtos; pesar antecipadamente é como o marketing volta a entrar.

LinhaComo é um 2Razão comum para um 1 ou 0
Resultado concluídoTodos os registros corretos, nenhuma pessoa na telaDevolução em uma fronteira de módulo ou um Salvar
Seu agente conectadoSeu próprio cliente MCP, login OAuth, sem token para colarApenas assistente do fornecedor ou uma chave de API colada
A lista de ferramentas é realLongo, digitado, cobre seus módulos, legível por máquinaUma dúzia de recursos, ou uma lista apenas em um slide
Permissões por chamadaUsuário restrito recusado na chamada; o restante completaRecusa apenas na carga da tela, ou uma aprovação que passa
Exceção tratadaA ambiguidade plantada produziu uma pergunta, não um palpiteCorreção silenciosa, ou um registro errado escolhido
Ação futura agendadaO acompanhamento existe e será executado na dataUma nota em um resumo, nada no sistema
Registro está completoQuem perguntou, agente, ferramentas, entradas, resultados, recusasRegistros alterados, mas sem sequência de chamadas; um usuário de integração genérico
Gastos são limitadosUm limite por integração que o agente não pode exceder; custo por açãoTotal mensal apenas, ou sem limite
Custo do próprio agenteNada é cobrado quando seu agente faz o raciocínioIA é cobrada independentemente de quem raciocina
Extensível por outrosUm aplicativo de terceiros é instalado e aparece na lista de ferramentasApenas roadmap ou trabalho personalizado

Dez linhas, dois pontos cada. Avalie cada fornecedor com base no mesmo resultado, no mesmo dia se possível, e compare os totais apenas após cada linha ter um número.

Lendo o resultado

Os totais importam menos do que o padrão nas quatro primeiras linhas, porque essas quatro decidem que tipo de produto você está analisando. Um produto que pontua zero no resultado e zero na conexão com seu agente é um assistente dentro de uma tela, e o restante de sua pontuação descreve controles que não são necessários. Pode ainda ser a compra certa se o que sua equipe deseja é uma tela mais rápida, mas você deve comprá-lo como tal.

Um produto que completa o resultado, mas pontua zero na conexão com seu agente, é agente com uma porta fechada. Funciona, nos termos do fornecedor, com o agente do fornecedor, ao preço do fornecedor para raciocínio. A pergunta que você deve se fazer é o que acontece em dois anos quando o agente da sua equipe for aquele que eles querem usar, e se o fornecedor disse algo sobre abrir a porta.

Um produto que pontua dois em todos os quatro é nativo do agente, e as seis linhas restantes são onde a verdadeira comparação acontece: quão bem ele lida com a exceção que você plantou, quão completo é o log, se os gastos podem ser limitados, o que ele cobra quando seu agente raciocina, e se terceiros podem estendê-lo. Dois produtos nativos do agente podem diferir muito nessas seis, e são essas linhas que preveem como será viver com o produto.

Uma leitura a mais. Se um fornecedor recusar o teste, ou oferecer uma versão gravada, ou pedir para substituir seu pedido pelo deles, pontue as linhas que você não pôde observar como zero e diga o porquê nas notas. Recusar é informação. Um produto que pode fazer isso vai querer mostrar a você.

O que mostraríamos a você

Sois é um produto contra o qual você poderia realizar essa avaliação, e como nós o construímos, podemos dizer o que você veria. Um espaço de trabalho é um servidor MCP; você adiciona seu endereço ao Claude, ChatGPT ou outro cliente e faz login uma vez via OAuth, sem token para colar. A lista de ferramentas é filtrada pelo seu papel antes que o agente a veja e verificada novamente quando cada ferramenta é executada; o acesso falha fechado. Os gastos podem ser limitados por integração, cada ação é registrada, e quando seu próprio agente faz o raciocínio, a plataforma não realiza nenhuma IA em seu nome e não cobra nada por isso. Aplicativos do marketplace aparecem na lista de ferramentas uma vez instalados. Aqui está o resultado da faturação do fluxo acima, conforme ele é executado.

Claudeconectado aapp.sois.aisobre MCP
VocêFature a Acme pelo trabalho de setembro, envie um e-mail para Sarah Cole e cobre se não for pago até o dia 18.
Agente
  • Lendo o trabalho faturável do projeto e o registro do cliente
  • Fatura criada a partir das linhas faturáveis
  • Enviado para o contato do cliente por e-mail
  • Cobrança agendada para a data de vencimento
Concluído.
registros do Sois
INV-1064Fatura criada, Acme Ltd
Sarah ColeEmail enviado da caixa de entrada do espaço de trabalho
TarefaCobrar se não pago em 18 de setembro

Quatro ferramentas em contabilidade, contatos, caixa de entrada e tarefas, com o log mostrando cada chamada. Execute como um usuário que não pode emitir faturas e a primeira escrita é recusada, com o motivo.

Então, pontue-o no mesmo cartão que todos os outros. O objetivo de um teste fixo é que ele não se importa com quem construiu o produto, e uma avaliação que você pode defender é aquela que tratou todos os fornecedores, incluindo este, da mesma forma.

Perguntas que as pessoas fazem

Quanto tempo essa avaliação leva por fornecedor?

Cerca de uma hora, uma vez que o resultado esteja escrito e um espaço de trabalho de teste com seus dados exista. Carregar dados realistas e plantar a exceção é a preparação; o teste em si é um pedido, dois logins e uma leitura do log.

E se o fornecedor não puder permitir que meu próprio agente se conecte?

Marque essa linha como zero e execute o teste com o agente deles para que você ainda veja o resultado, permissões, log e linhas de custo. Então decida se uma porta fechada é aceitável para sua equipe e pergunte ao fornecedor se e quando ela abre.

Devo ponderar as linhas do placar?

Não antes de ter executado o teste em pelo menos dois produtos. Avalie todas as dez linhas primeiro, depois decida quais linhas são mais importantes para sua operação. Ponderar antecipadamente é como uma apresentação forte volta a uma decisão que o teste deveria manter fora.

Fontes
  1. especificação do Protocolo de Contexto do Modelo: ferramentas listas de ferramentas, listagem dependente de autorização e a recomendação de que um humano permaneça no loop com a capacidade de negar chamadas de ferramentas
  2. Anthropic: começando com conectores personalizados usando MCP remoto adicionando um servidor remoto, login OAuth e aprovação por ferramenta no Claude
  3. OpenAI: modo desenvolvedor do ChatGPT suporte completo ao cliente MCP no ChatGPT; ações de escrita requerem confirmação por padrão
  4. Documentação do Sois: o servidor MCP do espaço de trabalho o que o teste observa em uma implementação: OAuth, ferramentas filtradas por função, execução fail-closed, limites de orçamento

Este artigo é revisado quando os produtos que descreve mudam. Próxima revisão agendada: 4 de dezembro de 2026.

Começar

Explore a plataforma Sois.

Como a plataforma funciona, o que a camada de permissões faz e quanto custa, em termos simples.

  • Grátis para começar
  • Traga seu próprio agente
  • Sem dependência de fornecedor