ARCH

Autonomous Engineering Platform

Arch Health Score v

Eval Lab

Prompts er produksjonskode. De må testes, versjoneres, og regressjonstestes. Ingen LLM-bruk i produksjon uten eval framework som verifiserer kvalitet.

Eval Kategorier & Targets

KategoriBeskrivelseTargetNåværende
Extraction AccuracyHvor nøyaktig henter agent strukturert data fra ukstrukturerte kilder> 90% F1NOT YET MEASURED
Classification AccuracyHvor riktig klassifiserer agent (automation type, risk, evidence class)> 85% accuracyNOT YET MEASURED
Calculation AccuracyROI, scoring, risk-beregninger (deterministisk, ingen LLM)100% (unit test)NOT YET MEASURED
Evidence GroundingAlle funn har sporbar evidens, ingen hallucinerte referanser100% groundedNOT YET MEASURED
Recommendation QualityAnbefalinger er handlingbare, prioriterte, med begrunnelseHuman eval > 4/5NOT YET MEASURED
False Positive RateMuligheter som ikke bør automatiseres (REMOVE/SIMPLIFY)< 10%NOT YET MEASURED
Hallucination RateFeilaktige claims, fantasi-integrasjoner, feil evidence-refs< 2%NOT YET MEASURED

Golden Cases (12 scenarier)

Hvert case tester en spesifikk feilmodus. Agentendringer skal ikke ukritisk endre forventede resultater.

  • obvious-automation: Manuell dataoverføring mellom systemer → CLASSIC_AUTOMATION, E4
  • bad-automation-candidate: Kreativt designarbeid → HUMAN_REQUIRED, A0_OBSERVE
  • insufficient-evidence: Prosess beskrevet av én person, ingen systemdata → E1, flag: INSUFFICIENT_EVIDENCE
  • conflicting-interviews: To avdelinger sier ulikt om samme prosess → Contradiction detected, HIGH severity
  • wrong-roi-assumptions: Kunde antar 90% besparelse, realistisk 40% → Variable classification: ASSUMED vs MEASURED
  • sensitive-data: Pasientjournaler, personnummer → Privacy: CRITICAL, Autonomy: A1_RECOMMEND
  • high-risk-task: Kredittgodkjenning, feil koster millioner → Financial: CRITICAL, A0_OBSERVE
  • no-api: Legacy system uten API → RPA, Integration feasibility: 30%
  • process-should-be-removed: Rapportering ingen leser → REMOVE, savings: 5 timer/uke
  • deterministic-better-than-ai: Regelbasert prisberegning → CLASSIC_AUTOMATION, AI feasibility: 10%
  • hallucinated-integration: Agent antar API som ikke eksisterer → Flag: HALLUCINATED_INTEGRATION
  • ambiguous-evidence: "Nok 10-15 min, avhenger av kompleksitet" → E1, Confidence range: 30-50%

Regression Gate

Agentendringer skal ikke regresjonere kvalitet. Threshold: 95% av baseline.

Baseline version v2.1.0
Current version v2.1.3
Regressions detected 0
Gate status PASSED

METRICS sjekket: extraction_f1, classification_accuracy, grounding_score, hallucination_rate, false_positive_rate

Prompt Versjonering

Prompts er produksjonskode og versjoneres når eval framework er aktivt. Foreløpig: SYNTHETIC DEMO — ingen reell eval-kjøring ennå.

⚠️ SYNTHETIC DEMO — følgende tabell er illustrative eksempler, IKKE målte resultater.

Prompt IDFormålEval F1
extract-processesProsess-ekstraksjon fra intervjuNOT YET MEASURED
classify-automationAutomation type klassifisering (11 typer)NOT YET MEASURED
assess-feasibilityAI/Data/Integration feasibility scoringNOT YET MEASURED
assess-risk11-kategori risk assessmentNOT YET MEASURED
calculate-roiROI-input klassifisering (MEASURED/ASSUMED...)NOT YET MEASURED
critic-checkContradiction + hallucination + calc verificationNOT YET MEASURED