Problem
Mange AI-piloter begynder med et værktøj og slutter med en demo. Teamet kan vise, at noget virker, men ved ikke, om det forbedrer en beslutning, reducerer en samlet omkostning eller fortjener en plads i driften.
Tese
Et nyttigt AI-eksperiment spørger ikke: ”Kan den gøre dette?” Det spørger: ”Hvilken beslutning ændres, med hvilken evidens og til hvilken tilsynsomkostning?” Fjorten dage er nok til at finde signal, når omfanget er smalt.
Framework
Design testen omkring fire elementer:
- Beslutning: det konkrete øjeblik, I vil forbedre.
- Baseline: hvordan arbejdet udføres i dag, inklusive menneskelig tid.
- Tærskel: resultatet, der vil retfærdiggøre at fortsætte.
- Grænse: den skade, fejl eller omkostning, som stopper testen.
| Fase | Dage | Leverance |
|---|---|---|
| Kortlæg | 1–3 | Beslutning, cases og baseline |
| Test | 4–10 | Log over resultater og undtagelser |
| Beslut | 11–14 | Fortsæt, korrigér eller stop |
Hvorfor det er vigtigt nu
NIST’s AI RMF organiserer risikoarbejde omkring govern, map, measure og manage. En startup behøver ikke et koncernprogram for at bruge logikken: hvert eksperiment kræver kontekst, måling, en ansvarlig og et svar på observeret risiko.
Anti-eksempel
Teamet sammenligner to modeller med tyve prompts, vælger den, der ”lyder bedst”, og integrerer den. Ingen registrerer falske positive svar, reviewtid eller påvirkede beslutninger. Demoen vinder; driften arver usikkerheden.
Protokol (3 trin)
- Skriv en brief på én side: bruger, beslutning, tilladte data, måling og stopbetingelse.
- Test virkelige cases og grænser: inkluder normale, tvetydige og vanskelige eksempler.
- Hold et beslutningsreview: fortsæt kun, hvis forbedringen overstiger samlet omkostning og observeret risiko.
Relateret
Konsulterede kilder
Næste skridt
Gør det næste ”vi bør bruge AI til…” til en eksperimentbrief. Hvis den ikke kan være på én side, er problemet endnu ikke afgrænset skarpt nok.