Problema
Una aplicación tradicional falla y normalmente puedes seguir el rastro: request, servicio, base de datos, error, log, alerta. Un agente falla de otra manera. Puede recuperar contexto incorrecto, elegir una herramienta mala, repetir una llamada, ignorar una instrucción, gastar tokens sin producir resultado o declarar éxito cuando no paso nada real.
Si solo miras input y output, el sistema parece una caja negra. Ves la pregunta y la respuesta, pero no sabes que camino tomo.
Eso no basta para operación enterprise. Un agente que actua sin traza no es autonomía; es opacidad automatizada.
Tesis
AI Traces sera una capa obligatoria para cualquier sistema agéntico serio.
No porque todos los equipos necesiten dashboards sofisticados desde el día uno, sino porque sin trazas no hay debugging, evaluación, compliance, optimización de coste ni aprendizaje.
La traza convierte un run en evidencia: que modelo se llamo, que prompt se uso, que contexto entro, que tool calls ocurrieron, que fallos aparecieron, que decisión se tomo y cuanto costo.
Framework
Una traza útil debe capturar cinco niveles:
- Modelo: proveedor, modelo, parámetros, tokens, latencia y respuesta.
- Contexto: documentos recuperados, fuente, ranking, permisos y freshness.
- Herramientas: tool call, argumentos, resultado, error, retry y side effect.
- Decisión: por que el agente eligió una ruta y no otra.
- Outcome: que cambio en el sistema externo y si fue verificado.
Mini-caso: un agente de operaciones dice que ha actualizado un CRM. Sin traza, solo ves una respuesta convincente. Con traza, ves que recupero el contacto correcto, llamo la API con el ID correcto, recibió 200, escribió el campo esperado y luego verifico el estado. Esa diferencia separa demo de operación.
Señal medible: porcentaje de runs críticos que pueden reproducirse o auditarse desde una traza completa.
Postura: un agente sin trace no debería tocar sistemas de producción.
Por que importa ahora
OpenTelemetry ya mantiene convenciones semanticas para sistemas generativos, incluyendo señales para spans de modelo, agente, framework, eventos, excepciones y métricas. LangSmith documenta observabilidad para agentes con tracing de llamadas, pasos y decisiones. OpenAI, en su guia práctica de agentes, trata guardrails, tool safeguards y output validation como componentes de producción, no como extras.
La dirección del mercado es clara: la observabilidad de IA deja de ser “guardar prompts” y empieza a parecerse a tracing distribuido con semántica de agentes.
Eso tiene implicaciones profundas. Si cada proveedor guarda trazas en su propio formato, el equipo queda atado a herramientas. Si las trazas usan convenciones compartidas, la empresa puede comparar, migrar y auditar.
Anti-ejemplo
“Guardamos todos los prompts y respuestas en una tabla.”
Es un buen comienzo, pero no es una traza. Falta la cadena causal: retrieval, herramientas, errores, retries, permisos, coste y efectos externos. El log textual cuenta que el agente dijo algo. La traza cuenta que hizo algo.
Protocolo (3 pasos)
- Traza primero los workflows con side effects. Si modifica datos, envia mensajes o ejecuta acciones, debe dejar rastro.
- Une trace y outcome. Una ejecución exitosa solo cuenta si el sistema externo confirma el cambio esperado.
- Etiqueta fallos por capa. Modelo, contexto, tool, permiso, red, criterio o verificación. Sin taxonomía, cada incidente vuelve a empezar.
| Capa | Que captura | Para que sirve |
|---|---|---|
| modelo | tokens, latencia, respuesta | coste y rendimiento |
| contexto | fuentes y permisos | confianza y compliance |
| tool | argumentos y resultado | debugging |
| decisión | ruta elegida | evaluación |
| outcome | efecto verificado | ROI real |
Relacionado
- Agent Memory from Trace: la memoria útil no vive en el chat, vive en la operación
- Token-to-Outcome: el KPI que separa IA usada de IA rentable
- Agent Reliability Score: como saber si un agente merece autonomía
Fuentes consultadas
- OpenTelemetry: Semantic conventions for generative AI systems
- LangSmith Observability
- OpenAI: A practical guide to building agents
Próximo paso
Elige un agente que ya produzca valor. No empieces mejorando prompts. Empieza instrumentando una traza completa de un run real y busca donde se pierde evidencia.