Eval Lab
Prompts er produksjonskode. De må testes, versjoneres, og regressjonstestes. Ingen LLM-bruk i produksjon uten eval framework som verifiserer kvalitet.
Eval Kategorier & Targets
| Kategori | Beskrivelse | Target | Nåværende |
|---|---|---|---|
| Extraction Accuracy | Hvor nøyaktig henter agent strukturert data fra ukstrukturerte kilder | > 90% F1 | NOT YET MEASURED |
| Classification Accuracy | Hvor riktig klassifiserer agent (automation type, risk, evidence class) | > 85% accuracy | NOT YET MEASURED |
| Calculation Accuracy | ROI, scoring, risk-beregninger (deterministisk, ingen LLM) | 100% (unit test) | NOT YET MEASURED |
| Evidence Grounding | Alle funn har sporbar evidens, ingen hallucinerte referanser | 100% grounded | NOT YET MEASURED |
| Recommendation Quality | Anbefalinger er handlingbare, prioriterte, med begrunnelse | Human eval > 4/5 | NOT YET MEASURED |
| False Positive Rate | Muligheter som ikke bør automatiseres (REMOVE/SIMPLIFY) | < 10% | NOT YET MEASURED |
| Hallucination Rate | Feilaktige claims, fantasi-integrasjoner, feil evidence-refs | < 2% | NOT YET MEASURED |
Golden Cases (12 scenarier)
Hvert case tester en spesifikk feilmodus. Agentendringer skal ikke ukritisk endre forventede resultater.
- obvious-automation: Manuell dataoverføring mellom systemer → CLASSIC_AUTOMATION, E4
- bad-automation-candidate: Kreativt designarbeid → HUMAN_REQUIRED, A0_OBSERVE
- insufficient-evidence: Prosess beskrevet av én person, ingen systemdata → E1, flag: INSUFFICIENT_EVIDENCE
- conflicting-interviews: To avdelinger sier ulikt om samme prosess → Contradiction detected, HIGH severity
- wrong-roi-assumptions: Kunde antar 90% besparelse, realistisk 40% → Variable classification: ASSUMED vs MEASURED
- sensitive-data: Pasientjournaler, personnummer → Privacy: CRITICAL, Autonomy: A1_RECOMMEND
- high-risk-task: Kredittgodkjenning, feil koster millioner → Financial: CRITICAL, A0_OBSERVE
- no-api: Legacy system uten API → RPA, Integration feasibility: 30%
- process-should-be-removed: Rapportering ingen leser → REMOVE, savings: 5 timer/uke
- deterministic-better-than-ai: Regelbasert prisberegning → CLASSIC_AUTOMATION, AI feasibility: 10%
- hallucinated-integration: Agent antar API som ikke eksisterer → Flag: HALLUCINATED_INTEGRATION
- ambiguous-evidence: "Nok 10-15 min, avhenger av kompleksitet" → E1, Confidence range: 30-50%
Regression Gate
Agentendringer skal ikke regresjonere kvalitet. Threshold: 95% av baseline.
Baseline version
v2.1.0
Current version
v2.1.3
Regressions detected
0
Gate status
PASSED
METRICS sjekket: extraction_f1, classification_accuracy, grounding_score, hallucination_rate, false_positive_rate
Prompt Versjonering
Prompts er produksjonskode og versjoneres når eval framework er aktivt. Foreløpig: SYNTHETIC DEMO — ingen reell eval-kjøring ennå.
⚠️ SYNTHETIC DEMO — følgende tabell er illustrative eksempler, IKKE målte resultater.
| Prompt ID | Formål | Eval F1 |
|---|---|---|
| extract-processes | Prosess-ekstraksjon fra intervju | NOT YET MEASURED |
| classify-automation | Automation type klassifisering (11 typer) | NOT YET MEASURED |
| assess-feasibility | AI/Data/Integration feasibility scoring | NOT YET MEASURED |
| assess-risk | 11-kategori risk assessment | NOT YET MEASURED |
| calculate-roi | ROI-input klassifisering (MEASURED/ASSUMED...) | NOT YET MEASURED |
| critic-check | Contradiction + hallucination + calc verification | NOT YET MEASURED |