Skip to content
Tilbage til Magazine
ai-operating-models 3 min læsning

Eval Flywheel: produktionsagenter fikses ikke med prompts, de fikses med cases

Gælder dette din virksomhed?

Gratis AI-diagnose 30 min →

Nøglepunkter

  • - Capture: gem reelle cases, både gode og dårlige.
  • - Label: klassificér intention, fejllag og forventet outcome.
  • - Dataset: konvertér dem til et genanvendeligt sæt.
  • - Grade: evaluer med regler, mennesker eller dommer-modeller.

Beslutning

Afgør, hvilken styring, ejerskab eller kadence der mangler, før AI skaleres.

Møde

Ledelsesteam, AI-porteføljegennemgang, transformationsstyring.

Risiko

At forveksle aktivitet, piloter og værktøjer med reel operativ kapacitet.

Agent-prompt: kortlæg beslutningsret, KPI’er, risici og næste operative træk

Problem

Når en agent fejler, er den typiske reaktion at justere prompten. Man tilføjer en sætning, skærper en regel, indsætter et eksempel og prøver igen med den case, der lige er knækket.

Det kan fixe øjeblikket. Det kan også ødelægge andre usynlige cases.

Uden evalueringer er hver forbedring et væddemål.

Tese

Eval Flywheel er den mekanisme, der omdanner agentiske fejl til akkumuleret læring.

Et modent team justerer ikke kun prompts. Det indfanger reelle cases, mærker dem, konverterer dem til datasæt, måler regressioner, sammenligner varianter og beslutter, om en ændring forbedrer hele systemet.

Forskellen mellem prompt engineering og AI-drift er eksperimentel hukommelse.

Framework

Hjulet har seks trin:

  • Capture: gem reelle cases, både gode og dårlige.
  • Label: klassificér intention, fejllag og forventet outcome.
  • Dataset: konvertér dem til et genanvendeligt sæt.
  • Grade: evaluer med regler, mennesker eller dommer-modeller.
  • Compare: mål ny prompt, model, værktøj eller retrieval mod baseline.
  • Promote: bring kun i produktion, hvis det forbedrer uden at ødelægge.

Mini-case: en salgsagent kvalificerer leads. Efter en fejl opretter teamet fem lignende cases: en nem, to tvetydige, en med modstridende data og en der skal eskaleres til et menneske. Den nye prompt godkendes kun, hvis den forbedrer sættet - ikke hvis den klarer sig godt i en demo.

Målbart signal: procentdel af hændelser konverteret til regressionseval.

Holdning: hvis en fejl ikke kommer i datasættet, vender den tilbage forklædt.

Hvorfor det er vigtigt nu

OpenAI dokumenterer evalueringer for agenter med datasæt, graders og evaluering af traces. LangSmith vedligeholder workflows for datasæt, eksperimenter og sammenligning. Anthropic udgiver også værktøjer og vejledninger til evaluering for at teste Claude’s adfærd.

Markedet konvergerer: agentkvalitet styres ikke kun i prompten. Den styres med gentagelige tests.

Anti-eksempel

“Vi testede tyve manuelle eksempler før lancering.”

Bedre end ingenting, men utilstrækkeligt. Hvis disse eksempler ikke er versioneret, mærket og sammenlignelige, starter den næste forbedring forfra.

Protokol (3 trin)

  1. Opret et indledende datasæt på 50 cases. Reelle, varierede og med forventet outcome.
  2. Mærk efter lag. Model, kontekst, værktøj, tilladelse, kriterium, format eller verifikation.
  3. Blokér kritiske regressioner. En ændring går ikke igennem, hvis den ødelægger sager med høj effekt.
AktivFunktionOwner
datasetcase-hukommelseprodukt
gradersgentageligt kriteriumAI/ops
trace evalsproceskvalitetengineering
regression suiteundgå tilbagefaldQA
release noteforklar ændringeragentens owner

Relateret

Konsulterede kilder

Næste skridt

Ændr ikke den næste prompt direkte. Indfang først ti cases, du vil beskytte, definer det korrekte outcome og opret den første mini-regressionspakke.


Oversat fra den spanske original med AI-hjælp og gennemset for nøjagtighed. Læs originalen på spansk.

evals agents llmops ai-operating-models
Citer artiklen

Berthelius, V. (2026). “Eval Flywheel: produktionsagenter fikses ikke med prompts, de fikses med cases”. BRTHLS Magazine. https://www.brthls.com/magazine/eval-flywheel-agenter-fikses-med-cases-da

Fractional CAIO · Gratis diagnose

Er din virksomhed klar til at blive drevet med AI?

30 minutter. Ingen pitch. Et ærligt billede af, hvor du står, og hvad du skal flytte først.

Book gratis diagnose