Macha
Simulaciones de agentes

Prueba un agente con tickets reales sin tocarlos.

Una simulación pasa tu agente por tus tickets reales de producción y te muestra exactamente qué habría hecho en cada uno, sin enviar una sola respuesta ni ejecutar una sola escritura.

El ticket real producción

#20831 · ¿Dónde está mi pedido?

Antonio R. · abierto · 2 respuestas

Hice el pedido la semana pasada y todavía no he recibido nada. Número de pedido 20831. ¿Pueden ayudarme?

Sin cambios. Sin respuesta, sin etiqueta, sin cambio de estado.
Lo que habría hecho el agente Instrucciones cumplidas
lectura Consultó el pedido 20831 en Shopify: enviado el 12 de julio, en reparto.
lectura Buscó en el centro de ayuda la política de entregas tardías.
retenida Habría publicado esta respuesta y etiquetado el ticket como «shipping». No enviada.

La respuesta que habría enviado

«Hola Antonio: tu pedido salió el 12 de julio y hoy está en reparto, llegará antes de las 18:00. Si no llega para entonces, responde por aquí y reclamo al transportista de inmediato.»

📦

Agente de reembolsos

@refund · GPT-5

Activo
Instrucciones escritas
6 herramientas conectadas
Disparador configurado

Nunca ejecutado sobre un ticket real

Ya construiste el agente. Ahora toca confiarle un cliente real.

Ahí es donde todo el mundo se frena. Las instrucciones se leen bien, se portó bien en el panel de pruebas y los tickets de muestra fueron los que se te ocurrieron. Nada de eso te dice cómo maneja los tickets desordenados, mal explicados y con tres temas a la vez que llegan de verdad.

Así que el agente se queda apagado, o se activa y alguien vigila la cola con el dedo sobre el botón de pausa. Las simulaciones existen para eliminar esa disyuntiva: ejecútalo primero sobre lo real y lee qué habría hecho antes de que nada llegue a nadie.

Cómo se mantiene seguro

Las lecturas son reales. Las escrituras se capturan, nunca se envían.

Una ejecución en seco solo sirve si el contexto es genuino, así que el agente consulta tus datos de verdad. La diferencia está en qué ocurre cuando intenta actuar: cada escritura se intercepta y se responde con un resultado plausible, de modo que el agente sigue razonando mientras nada llega a destino.

Las herramientas de lectura se ejecutan de verdad

Datos en vivo · sin efectos secundarios

El agente ve exactamente lo que vería en producción, que es la única forma de que la ejecución diga algo cierto.

Consulta tu base de conocimiento
Lee el ticket, sus campos y todo el hilo
Obtiene datos en vivo de pedidos y cuentas de las herramientas conectadas

Las herramientas de escritura se interceptan

Cero efectos secundarios

Respuestas, cambios de estado y asignaciones se capturan para que puedas leerlas y luego se descartan. El agente cree que la escritura funcionó y sigue razonando; nada sale de tu espacio de trabajo.

Publicar una respuesta en el ticket
Cambiar estado, prioridad o responsable
Añadir etiquetas o notas, o iniciar un reembolso

Es decir: puedes apuntar un agente recién creado a la cola real de la semana pasada desde el primer día, y lo peor que puede pasar es que aprendas algo.

La parte que lo hace honesto

Cada ticket se reproduce como si acabara de entrar.

Un ticket resuelto ya contiene la respuesta, así que reproducirlo entero no probaría nada. Macha lo reduce al primer mensaje del cliente y le pasa eso al agente, con el asunto, las etiquetas y la prioridad originales, y nada más.

Lo que ve el agente

El primer mensaje del cliente
El asunto original
Etiquetas y prioridad tal como estaban

Lo que se elimina

Todas las respuestas posteriores del hilo
Notas de agentes y comentarios internos
Cambios de estado y la resolución

Así la ejecución te dice cómo maneja tu agente un ticket recién llegado, no lo bien que sabe leer la respuesta de otra persona.

Cuándo vale realmente la pena.

Siempre que la respuesta sincera a «¿esto funcionará?» sea «probablemente, pero prefiero no descubrirlo delante de un cliente».

Un agente nuevo, antes de que entre en producción

Ya escribiste las instrucciones y conectaste las herramientas. Ejecútalo sobre unos cientos de tickets reales y lee los fallos antes de activar el disparador.

La mezcla real de tickets de un cliente nuevo

Demuestra que el agente resuelve su cola real, no ejemplos sintéticos, sin tocar ni una de sus conversaciones en vivo.

Una conexión de herramientas que no tienes clara

Cada llamada que hace el agente aparece con sus argumentos y la respuesta que recibió. Las herramientas que faltan y los parámetros erróneos salen aquí, no en producción.

Lo que recibes.

El mismo juez que califica tus conversaciones en vivo califica cada una simulada, así que las cifras son directamente comparables con la puntuación de cumplimiento real del agente.

Cumplimiento

92 %

Registros

120

Escrituras capturadas

206

Créditos

480

Sí

#20831 · ¿Dónde está mi pedido?

Consultó el pedido, dio la fecha de seguimiento y ofreció reclamar al transportista. Con buen criterio, no ofreció reembolso.

Sí

#20847 · Talla equivocada enviada

Confirmó el artículo, inició una devolución y habría etiquetado el ticket y dejado en pendiente.

Parcialmente

#20852 · Falló el código de descuento

Respondió correctamente, pero se saltó la instrucción de comprobar si el código ya se había canjeado.

Las conversaciones simuladas se guardan aparte: nunca cuentan para tu cumplimiento real ni aparecen en las conversaciones pasadas de tu equipo.

Preguntas sobre las simulaciones.

Respuestas breves. Si falta algo, pregúntanos: te lo diremos sin rodeos.

No. Cada escritura —publicar una respuesta, cambiar el estado, etiquetar, reembolsar— la intercepta el ejecutor de herramientas y la responde con un resultado predefinido. Solo las herramientas de lectura llegan a tus datos, así que la ejecución tiene contexto real y no deja rastro.
Porque ahí eliges tú los tickets de prueba, y eliges los que ya has pensado. Una simulación toma todo lo que llegó de verdad en un rango de fechas, incluidos los confusos, y ejecuta el agente sobre todos.
Los resultados siguen siendo válidos. La ejecución congela el modelo al lanzarse y guarda una instantánea de lo que usó, de modo que un cambio posterior de prompt o de modelo no invalida en silencio lo que ya mediste.
No. Se guardan con su propia fuente y se filtran fuera de la vista de evaluación, así que tu cifra principal refleja solo tráfico real.
Sí: limita la ejecución a un número reducido de registros. Ves la estimación de créditos antes de lanzarla, y unos filtros opcionales descartan las respuestas automáticas antes de gastar nada en ellas.

¿Listo para potenciar a tu equipo con IA?

Empieza en minutos. Conecta tus herramientas, configura tus agentes y deja que la IA se encargue del resto.

$50 en créditos gratis · sin límite de tiempo, sin tarjeta de crédito