# Eval Flywheel: los agentes de producción no se arreglan con prompts, se arreglan con casos

> Cada fallo relevante de un agente debería convertirse en eval, dataset y regresión. Sin ese volante, los prompts solo acumulan parches.

- Author: Viktor Berthelius (BRTHLS)
- Published: 2026-06-30
- Category: ai operating models
- Tags: evals, agents, llmops, ai-operating-models
- Language: es
- Canonical: https://www.brthls.com/magazine/eval-flywheel-agentes-produccion-no-se-arreglan-con-prompts-es
- Source: BRTHLS Magazine — https://www.brthls.com

---

## Problema

Cuando un agente falla, la reacción habitual es tocar el prompt. Se anade una frase, se endurece una regla, se mete un ejemplo y se prueba otra vez con el caso que acaba de romperse.

Eso puede arreglar el momento. También puede romper otros casos invisibles.

Sin evaluaciones, cada mejora es una apuesta.

## Tesis

`Eval Flywheel` es el mecanismo que convierte errores agénticos en aprendizaje acumulado.

Un equipo maduro no solo ajusta prompts. Captura casos reales, los etiqueta, los convierte en datasets, mide regresiones, compara variantes y decide si un cambio mejora el sistema completo.

La diferencia entre prompt engineering y operación de IA es memoria experimental.

## Framework

El volante tiene seis pasos:

- **Capture:** guardar casos reales, buenos y malos.
- **Label:** clasificar intención, capa de fallo y outcome esperado.
- **Dataset:** convertirlos en conjunto reutilizable.
- **Grade:** evaluar con reglas, humanos o modelos jueces.
- **Compare:** medir prompt, modelo, herramienta o retrieval nuevo contra baseline.
- **Promote:** llevar a producción solo si mejora sin romper.

Mini-caso: un agente de ventas cualifica leads. Tras un fallo, el equipo crea cinco casos similares: uno fácil, dos ambiguos, uno con datos contradictorios y uno que debe escalar a humano. El nuevo prompt solo se aprueba si mejora el conjunto, no si queda bien en una demo.

**Señal medible:** porcentaje de incidentes convertidos en eval de regresión.

**Postura:** si un bug no entra en el dataset, volvera disfrazado.

## Por que importa ahora

OpenAI documenta evaluaciones para agentes con datasets, graders y evaluación de traces. LangSmith mantiene workflows de datasets, experimentos y comparación. Anthropic también publica herramientas y guias de evaluación para probar comportamiento de Claude.

El mercado esta convergiendo: la calidad de agentes no se gobierna solo en el prompt. Se gobierna con pruebas repetibles.

## Anti-ejemplo

"Probamos veinte ejemplos manuales antes de lanzar."

Mejor que nada, pero insuficiente. Si esos ejemplos no quedan versionados, etiquetados y comparables, la siguiente mejora empieza desde cero.

## Protocolo (3 pasos)

1. **Crea un dataset inicial de 50 casos.** Reales, variados y con outcome esperado.
2. **Etiqueta por capa.** Modelo, contexto, herramienta, permiso, criterio, formato o verificación.
3. **Bloquea regresiones críticas.** Un cambio no pasa si rompe casos de alto impacto.

| Activo | Función | Owner |
| --- | --- | --- |
| dataset | memoria de casos | producto |
| graders | criterio repetible | IA/ops |
| trace evals | calidad del proceso | engineering |
| regressión suite | evitar recaidas | QA |
| release note | explicar cambios | owner del agente |

## Relacionado

- [La frontera dentada de la IA: el mapa de fallos que todo equipo necesita antes de automatizar](/magazine/frontera-dentada-ia-mapa-fallos-automatizar-es)
- [AI Evaluation Stack 2026: medir sin teatro](/magazine/ai-evaluation-stack-2026-medir-sin-teatro)
- [Token-to-Outcome: el KPI que separa IA usada de IA rentable](/magazine/token-to-outcome-kpi-ia-rentable-es)

## Fuentes consultadas

- [OpenAI: Evals for AI agents](https://platform.openai.com/docs/guides/agent-evals)
- [LangSmith evaluation](https://docs.langchain.com/langsmith/evaluation)
- [Anthropic: Evaluation tool](https://docs.anthropic.com/en/docs/test-and-evaluate/eval-tool)

## Próximo paso

No cambies el próximo prompt directamente. Antes captura diez casos que quieres proteger, define el outcome correcto y crea la primera mini-suite de regresión.

---

_Cite as: Berthelius, V. (2026). "Eval Flywheel: los agentes de producción no se arreglan con prompts, se arreglan con casos". BRTHLS Magazine. https://www.brthls.com/magazine/eval-flywheel-agentes-produccion-no-se-arreglan-con-prompts-es_
