Teste um agente com tickets reais
sem lhes tocar.
Uma simulação passa o seu agente pelos seus tickets reais de produção e mostra exatamente o que teria feito em cada um — sem enviar uma única resposta nem executar uma única escrita.
#20831 · Onde está a minha encomenda?
Antonio R. · aberto · 2 respostas
Encomendei na semana passada e ainda não recebi nada. Número de encomenda 20831. Podem ajudar?
A resposta que teria enviado
«Olá Antonio — a sua encomenda saiu a 12 de julho e está hoje em distribuição, chegando até às 18h. Se não chegar até lá, responda aqui e falo de imediato com a transportadora.»
Agente de reembolsos
@refund · GPT-5
Nunca executado sobre um ticket real
Já construiu o agente. Agora tem de lhe confiar um cliente real.
É aqui que toda a gente trava. As instruções leem-se bem, portou-se bem no painel de testes e os tickets de amostra foram os que lhe ocorreram. Nada disso lhe diz como lida com os tickets desarrumados, mal explicados e com três assuntos ao mesmo tempo que realmente chegam.
Por isso o agente fica desligado, ou entra em produção e alguém vigia a fila com o dedo no botão de pausa. As simulações existem para eliminar essa escolha: corra-o primeiro sobre o real e leia o que teria feito antes de algo chegar a alguém.
Como se mantém seguro
As leituras são reais. As escritas são capturadas, nunca enviadas.
Uma execução em seco só é útil se o contexto for genuíno, por isso o agente consulta mesmo os seus dados. A diferença está no que acontece quando tenta agir: cada escrita é intercetada e respondida com um resultado plausível, pelo que o agente continua a raciocinar sem que nada se concretize.
As ferramentas de leitura correm a sério
Dados em direto · sem efeitos secundários
O agente vê exatamente o que veria em produção, que é a única forma de a execução dizer algo verdadeiro.
As ferramentas de escrita são intercetadas
Zero efeitos secundários
Respostas, mudanças de estado e atribuições são capturadas para que as possa ler e depois descartadas. O agente julga que a escrita resultou e continua a raciocinar; nada sai do seu espaço de trabalho.
Ou seja: pode apontar um agente acabado de criar à fila real da semana passada logo no primeiro dia, e o pior que acontece é aprender alguma coisa.
A parte que o torna honesto
Cada ticket é reproduzido como se tivesse acabado de chegar.
Um ticket resolvido já contém a resposta, por isso reproduzi-lo por inteiro não provaria nada. A Macha reduz o ticket à primeira mensagem do cliente e entrega isso ao agente — com o assunto, as etiquetas e a prioridade originais, e mais nada.
O que o agente vê
O que é removido
Assim a execução diz-lhe como o seu agente lida com um ticket acabado de chegar — não o quão bem consegue ler a resposta de outra pessoa.
Quando vale mesmo a pena.
Sempre que a resposta honesta a «isto vai funcionar?» for «provavelmente, mas prefiro não descobrir à frente de um cliente».
Um agente novo, antes de entrar em produção
Já escreveu as instruções e ligou as ferramentas. Corra-o sobre algumas centenas de tickets reais e leia as falhas antes de sequer ativar o acionador.
A mistura real de tickets de um cliente novo
Prove que o agente aguenta a fila real deles, não exemplos sintéticos, sem tocar numa única das suas conversas em curso.
Uma ligação de ferramentas que não tem certa
Cada chamada do agente é listada com os seus argumentos e a resposta que obteve. Ferramentas em falta e parâmetros errados aparecem aqui em vez de em produção.
O que recebe.
O mesmo juiz que avalia as suas conversas em produção avalia cada conversa simulada, pelo que os números são diretamente comparáveis com a pontuação de conformidade real do agente.
Conformidade
92 %
Registos
120
Escritas capturadas
206
Créditos
480
#20831 · Onde está a minha encomenda?
Consultou a encomenda, deu a data de seguimento e ofereceu-se para falar com a transportadora. Corretamente, não ofereceu reembolso.
#20847 · Tamanho errado enviado
Confirmou o artigo, iniciou uma devolução e teria etiquetado o ticket e deixado pendente.
#20852 · Código de desconto falhou
Respondeu corretamente, mas saltou a instrução de verificar se o código já tinha sido usado.
Quatro funcionalidades que parecem iguais. Não são.
Uma simulação executa o seu agente sobre registos reais e mostra o que teria feito. Nada chega ao cliente.
Studies — Análise com IA
Execute uma análise sobre milhares de registos e receba uma grelha estruturada.
Avaliação de agentes
Avalie as conversas que já aconteceram segundo as próprias instruções do agente.
AI Knowledge Builder
Transforme tickets resolvidos numa base de conhecimento que os seus agentes possam pesquisar.
Perguntas sobre as simulações.
Respostas curtas. Se faltar alguma coisa, pergunte-nos: dizemos-lhe com franqueza.
Pronto para turbinar seu time com IA?
Comece em minutos. Conecte suas ferramentas, configure seus agentes e deixe a IA cuidar do resto.
$50 em créditos grátis · sem limite de tempo, sem cartão de crédito
Intercom
Shopify
Stripe
Slack
Notion
Google Workspace
Confluence