Macha
Simulações de agentes

Teste um agente com tickets reais sem lhes tocar.

Uma simulação passa o seu agente pelos seus tickets reais de produção e mostra exatamente o que teria feito em cada um — sem enviar uma única resposta nem executar uma única escrita.

O ticket real produção

#20831 · Onde está a minha encomenda?

Antonio R. · aberto · 2 respostas

Encomendei na semana passada e ainda não recebi nada. Número de encomenda 20831. Podem ajudar?

Inalterado. Sem resposta, sem etiqueta, sem mudança de estado.
O que o agente teria feito Instruções cumpridas
leitura Consultou a encomenda 20831 no Shopify — enviada a 12 de julho, em distribuição.
leitura Pesquisou no centro de ajuda a política de entregas atrasadas.
retida Teria publicado esta resposta e etiquetado o ticket como «shipping». Não enviada.

A resposta que teria enviado

«Olá Antonio — a sua encomenda saiu a 12 de julho e está hoje em distribuição, chegando até às 18h. Se não chegar até lá, responda aqui e falo de imediato com a transportadora.»

📦

Agente de reembolsos

@refund · GPT-5

Ativo
Instruções escritas
6 ferramentas ligadas
Acionador configurado

Nunca executado sobre um ticket real

Já construiu o agente. Agora tem de lhe confiar um cliente real.

É aqui que toda a gente trava. As instruções leem-se bem, portou-se bem no painel de testes e os tickets de amostra foram os que lhe ocorreram. Nada disso lhe diz como lida com os tickets desarrumados, mal explicados e com três assuntos ao mesmo tempo que realmente chegam.

Por isso o agente fica desligado, ou entra em produção e alguém vigia a fila com o dedo no botão de pausa. As simulações existem para eliminar essa escolha: corra-o primeiro sobre o real e leia o que teria feito antes de algo chegar a alguém.

Como se mantém seguro

As leituras são reais. As escritas são capturadas, nunca enviadas.

Uma execução em seco só é útil se o contexto for genuíno, por isso o agente consulta mesmo os seus dados. A diferença está no que acontece quando tenta agir: cada escrita é intercetada e respondida com um resultado plausível, pelo que o agente continua a raciocinar sem que nada se concretize.

As ferramentas de leitura correm a sério

Dados em direto · sem efeitos secundários

O agente vê exatamente o que veria em produção, que é a única forma de a execução dizer algo verdadeiro.

Pesquisa a sua base de conhecimento
Lê o ticket, os seus campos e todo o tópico
Obtém dados em direto de encomendas e contas das ferramentas ligadas

As ferramentas de escrita são intercetadas

Zero efeitos secundários

Respostas, mudanças de estado e atribuições são capturadas para que as possa ler e depois descartadas. O agente julga que a escrita resultou e continua a raciocinar; nada sai do seu espaço de trabalho.

Publicar uma resposta no ticket
Alterar estado, prioridade ou responsável
Adicionar etiquetas ou notas, ou desencadear um reembolso

Ou seja: pode apontar um agente acabado de criar à fila real da semana passada logo no primeiro dia, e o pior que acontece é aprender alguma coisa.

A parte que o torna honesto

Cada ticket é reproduzido como se tivesse acabado de chegar.

Um ticket resolvido já contém a resposta, por isso reproduzi-lo por inteiro não provaria nada. A Macha reduz o ticket à primeira mensagem do cliente e entrega isso ao agente — com o assunto, as etiquetas e a prioridade originais, e mais nada.

O que o agente vê

A primeira mensagem do cliente
O assunto original
Etiquetas e prioridade tal como estavam

O que é removido

Todas as respostas posteriores do tópico
Notas de agentes e comentários internos
Mudanças de estado e a resolução

Assim a execução diz-lhe como o seu agente lida com um ticket acabado de chegar — não o quão bem consegue ler a resposta de outra pessoa.

Quando vale mesmo a pena.

Sempre que a resposta honesta a «isto vai funcionar?» for «provavelmente, mas prefiro não descobrir à frente de um cliente».

Um agente novo, antes de entrar em produção

Já escreveu as instruções e ligou as ferramentas. Corra-o sobre algumas centenas de tickets reais e leia as falhas antes de sequer ativar o acionador.

A mistura real de tickets de um cliente novo

Prove que o agente aguenta a fila real deles, não exemplos sintéticos, sem tocar numa única das suas conversas em curso.

Uma ligação de ferramentas que não tem certa

Cada chamada do agente é listada com os seus argumentos e a resposta que obteve. Ferramentas em falta e parâmetros errados aparecem aqui em vez de em produção.

O que recebe.

O mesmo juiz que avalia as suas conversas em produção avalia cada conversa simulada, pelo que os números são diretamente comparáveis com a pontuação de conformidade real do agente.

Conformidade

92 %

Registos

120

Escritas capturadas

206

Créditos

480

Sim

#20831 · Onde está a minha encomenda?

Consultou a encomenda, deu a data de seguimento e ofereceu-se para falar com a transportadora. Corretamente, não ofereceu reembolso.

Sim

#20847 · Tamanho errado enviado

Confirmou o artigo, iniciou uma devolução e teria etiquetado o ticket e deixado pendente.

Parcialmente

#20852 · Código de desconto falhou

Respondeu corretamente, mas saltou a instrução de verificar se o código já tinha sido usado.

As conversas simuladas são guardadas à parte — nunca contam para a sua conformidade real nem aparecem nas conversas passadas da sua equipa.

Perguntas sobre as simulações.

Respostas curtas. Se faltar alguma coisa, pergunte-nos: dizemos-lhe com franqueza.

Não. Cada escrita — publicar uma resposta, mudar o estado, etiquetar, reembolsar — é intercetada pelo executor de ferramentas e respondida com um resultado predefinido. Só as ferramentas de leitura chegam aos seus dados, pelo que a execução tem contexto real e não deixa rasto.
Porque aí escolhe os tickets de teste, e escolhe aqueles em que já pensou. Uma simulação pega em tudo o que chegou de facto num intervalo de datas, incluindo os confusos, e corre o agente sobre todos.
Os resultados mantêm-se. A execução congela o modelo no arranque e guarda um instantâneo do que usou, pelo que uma alteração posterior de prompt ou de modelo não invalida em silêncio o que já mediu.
Não. São guardadas com a sua própria fonte e filtradas da vista de avaliação, pelo que o seu número principal reflete apenas tráfego real.
Sim — limite a execução a um número reduzido de registos. Vê a estimativa de créditos antes de lançar, e filtros opcionais descartam respostas automáticas antes de gastar seja o que for com elas.

Pronto para turbinar seu time com IA?

Comece em minutos. Conecte suas ferramentas, configure seus agentes e deixe a IA cuidar do resto.

$50 em créditos grátis · sem limite de tempo, sem cartão de crédito