Problema
Cuando un agente falla, la reaccion habitual es tocar el prompt. Se anade una frase, se endurece una regla, se mete un ejemplo y se prueba otra vez con el caso que acaba de romperse.
Eso puede arreglar el momento. Tambien puede romper otros casos invisibles.
Sin evaluaciones, cada mejora es una apuesta.
Tesis
Eval Flywheel es el mecanismo que convierte errores agenticos en aprendizaje acumulado.
Un equipo maduro no solo ajusta prompts. Captura casos reales, los etiqueta, los convierte en datasets, mide regresiones, compara variantes y decide si un cambio mejora el sistema completo.
La diferencia entre prompt engineering y operacion de IA es memoria experimental.
Framework
El volante tiene seis pasos:
- Capture: guardar casos reales, buenos y malos.
- Label: clasificar intencion, capa de fallo y outcome esperado.
- Dataset: convertirlos en conjunto reutilizable.
- Grade: evaluar con reglas, humanos o modelos jueces.
- Compare: medir prompt, modelo, herramienta o retrieval nuevo contra baseline.
- Promote: llevar a produccion solo si mejora sin romper.
Mini-caso: un agente de ventas cualifica leads. Tras un fallo, el equipo crea cinco casos similares: uno facil, dos ambiguos, uno con datos contradictorios y uno que debe escalar a humano. El nuevo prompt solo se aprueba si mejora el conjunto, no si queda bien en una demo.
Senal medible: porcentaje de incidentes convertidos en eval de regresion.
Postura: si un bug no entra en el dataset, volvera disfrazado.
Por que importa ahora
OpenAI documenta evaluaciones para agentes con datasets, graders y evaluacion de traces. LangSmith mantiene workflows de datasets, experimentos y comparacion. Anthropic tambien publica herramientas y guias de evaluacion para probar comportamiento de Claude.
El mercado esta convergiendo: la calidad de agentes no se gobierna solo en el prompt. Se gobierna con pruebas repetibles.
Anti-ejemplo
“Probamos veinte ejemplos manuales antes de lanzar.”
Mejor que nada, pero insuficiente. Si esos ejemplos no quedan versionados, etiquetados y comparables, la siguiente mejora empieza desde cero.
Protocolo (3 pasos)
- Crea un dataset inicial de 50 casos. Reales, variados y con outcome esperado.
- Etiqueta por capa. Modelo, contexto, herramienta, permiso, criterio, formato o verificacion.
- Bloquea regresiones criticas. Un cambio no pasa si rompe casos de alto impacto.
| Activo | Funcion | Owner |
|---|---|---|
| dataset | memoria de casos | producto |
| graders | criterio repetible | IA/ops |
| trace evals | calidad del proceso | engineering |
| regression suite | evitar recaidas | QA |
| release note | explicar cambios | owner del agente |
Relacionado
- La frontera dentada de la IA: el mapa de fallos que todo equipo necesita antes de automatizar
- AI Evaluation Stack 2026: medir sin teatro
- Token-to-Outcome: el KPI que separa IA usada de IA rentable
Fuentes consultadas
Proximo paso
No cambies el proximo prompt directamente. Antes captura diez casos que quieres proteger, define el outcome correcto y crea la primera mini-suite de regresion.