Problem
Når en agent fejler, er den typiske reaktion at justere prompten. Man tilføjer en sætning, skærper en regel, indsætter et eksempel og prøver igen med den case, der lige er knækket.
Det kan fixe øjeblikket. Det kan også ødelægge andre usynlige cases.
Uden evalueringer er hver forbedring et væddemål.
Tese
Eval Flywheel er den mekanisme, der omdanner agentiske fejl til akkumuleret læring.
Et modent team justerer ikke kun prompts. Det indfanger reelle cases, mærker dem, konverterer dem til datasæt, måler regressioner, sammenligner varianter og beslutter, om en ændring forbedrer hele systemet.
Forskellen mellem prompt engineering og AI-drift er eksperimentel hukommelse.
Framework
Hjulet har seks trin:
- Capture: gem reelle cases, både gode og dårlige.
- Label: klassificér intention, fejllag og forventet outcome.
- Dataset: konvertér dem til et genanvendeligt sæt.
- Grade: evaluer med regler, mennesker eller dommer-modeller.
- Compare: mål ny prompt, model, værktøj eller retrieval mod baseline.
- Promote: bring kun i produktion, hvis det forbedrer uden at ødelægge.
Mini-case: en salgsagent kvalificerer leads. Efter en fejl opretter teamet fem lignende cases: en nem, to tvetydige, en med modstridende data og en der skal eskaleres til et menneske. Den nye prompt godkendes kun, hvis den forbedrer sættet - ikke hvis den klarer sig godt i en demo.
Målbart signal: procentdel af hændelser konverteret til regressionseval.
Holdning: hvis en fejl ikke kommer i datasættet, vender den tilbage forklædt.
Hvorfor det er vigtigt nu
OpenAI dokumenterer evalueringer for agenter med datasæt, graders og evaluering af traces. LangSmith vedligeholder workflows for datasæt, eksperimenter og sammenligning. Anthropic udgiver også værktøjer og vejledninger til evaluering for at teste Claude’s adfærd.
Markedet konvergerer: agentkvalitet styres ikke kun i prompten. Den styres med gentagelige tests.
Anti-eksempel
“Vi testede tyve manuelle eksempler før lancering.”
Bedre end ingenting, men utilstrækkeligt. Hvis disse eksempler ikke er versioneret, mærket og sammenlignelige, starter den næste forbedring forfra.
Protokol (3 trin)
- Opret et indledende datasæt på 50 cases. Reelle, varierede og med forventet outcome.
- Mærk efter lag. Model, kontekst, værktøj, tilladelse, kriterium, format eller verifikation.
- Blokér kritiske regressioner. En ændring går ikke igennem, hvis den ødelægger sager med høj effekt.
| Aktiv | Funktion | Owner |
|---|---|---|
| dataset | case-hukommelse | produkt |
| graders | gentageligt kriterium | AI/ops |
| trace evals | proceskvalitet | engineering |
| regression suite | undgå tilbagefald | QA |
| release note | forklar ændringer | agentens owner |
Relateret
- AI’s skarpe grænse: fejlkortet ethvert team har brug for før automatisering
- AI Evaluation Stack 2026: mål uden teater
- Token-to-Outcome: det KPI der adskiller brugt AI fra profitabel AI
Konsulterede kilder
Næste skridt
Ændr ikke den næste prompt direkte. Indfang først ti cases, du vil beskytte, definer det korrekte outcome og opret den første mini-regressionspakke.
Oversat fra den spanske original med AI-hjælp og gennemset for nøjagtighed. Læs originalen på spansk.