ARCH

Autonomous Engineering Platform

Arch Health Score v

What AI Did / What I Decided

Tydelig separasjon på hver arkitekturbeslutning. Hvis alt fremstilles som «Hermes bygde dette», kan en skeptisk CTO tenke at du bare trykket på en knapp. Her viser vi hva agentene utførte og hvilke avgjørelser jeg (Chief Architect) sto ansvarlig for.

Område / Komponente AI (Hermes + agenter) Menneske (Chief Architect / Tom) Evidens / Gate
Systemdesign & Arkitektur Forslag, alternativer, tradeoffs, diagrammer, kode-struktur, API-design Kravdefinisjon, risikogrenser, endelig avgjørelse, godkjenning ADR-001–005, Architecture Explorer, CTO review
Krav & Spesifikasjoner Ekstraksjon fra intervjuer/dokumenter, strukturering, fullstendighetssjekk, edge-case identifikasjon Godkjenning, domeneregler, prioritering, "hva betyr dette for kunden" Business Discovery Engine, adaptive questions, domain rules
Risikostyring & Sikkerhet Deteksjon (OWASP, threat modeling), klassifisering (11 kategorier), implementering av guards, tester Grenser, godkjenning av HIGH/CRITICAL, policy-definisjon, production gates Cross-tenant tests (18/18), ADR-002, Security page, CI/CD gates
Tenant Isolation (D1) Forslag: PostgreSQL RLS (current_setting) Avviste RLS — D1 støtter det ikke. Bestemte: Application-layer isolation + middleware + eksplisitt tenant_id i ALLE spørringer + 18 cross-tenant tester ADR-002, SECURITY.md §6.1, 18/18 cross-tenant tests grønne
ROI Engine Implementasjon av pure functions, scenario-generering, sensitivitetanalyse, variabel-klassifisering Bestemte: Ingen LLM i ROI. Deterministisk. Variable classification: MEASURED/CUSTOMER_PROVIDED/DERIVED/BENCHMARK/ASSUMED ADR-003, ROI Engine §28-29, 100% unit test coverage
Agent Orkestrering 6 agenter implementert: Discovery, Evidence, Process, Automation, Risk, Critic. Tool permissions, autonomy levels (A0–A5) Bestemte: Hermes = single source of truth. Ingen A2A/MCP internt. Policy engine (OPA) sentralt. Human gates for HIGH/CRITICAL ADR-004, Agent permissions (POLICY.md §7.1), Critic agent gate
Policy Engine OPA/Rego implementasjon: tool permissions, system access, autonomy, human approval, destructive actions, evidence access Valgte OPA over Cedar (ADR-005). Definerte policy rules per domene. `opa test` i CI/CD ADR-005, POLICY.md, CI/CD policy test gate
Evidence Model (E0–E4) Implementasjon: Capture → Validate → Classify → Link → Use. Hash, temporal validity, graph traversal Definerte E0–E4 klassene, confidence kalibrering, oppgraderingsregler, monotonicity rule EVIDENCE_MODEL.md, Golden case "insufficient-evidence", C8.1 ledger
Public Intelligence (Company X-Ray) Brønnøysund + SSB + NAV + Website crawler implementation. Confidence ladder (LOW/MEDIUM/HIGH/VERIFIED) Bestemte: Gratis X-Ray, 1 unlocked opportunity, teasers for resten. Prising: 7 900 / 24 900 / 4 900 kr/mnd. Vertikale prioritering PRODUCT.md §4-8, Free Mini Audit, Challenge Arch
Observability & AI Gateway Cloudflare AI Gateway integrasjon, OpenTelemetry export, trace context propagation, cost tracking Bestemte: Native CF AI Gateway (ikke Langfuse/Helicone). `cf-aig-metadata` med tenant_id, audit_id, agent_id, trace_id OBSERVABILITY.md §3-4, AI Gateway config, cost governance
Eval Framework 12 Golden cases implementert, prompt versjonering, regression gate (95% threshold), CI/CD integration Definerte eval kategorier, targets, golden cases, prompt versioning policy. Human eval for Recommendation Quality EVALS.md, 12 golden cases, regression gate PASSED, prompt versioning table
Deployment & Production Gates Deploy script, wrangler config, smoke tests, rollback capability Governed deploy: workflow_dispatch only, 12 gates, smoke test, staging verification, eksplisitt prod-godkjenning deploy.yml, deploy-ready-check.mjs (12/12), staging→prod gate
GitHub & IP Strategy Sanitert showcase repo forberedt Bestemte: 3-lag strategi. PRIVATE arch-platform (moat), PUBLIC arch-audit-showcase (portfolio), PUBLIC component senere (community) PRODUCT.md §10, arch-audit-showcase repo structure
FinBilGlass Production Implementasjon: OE-bilde → regnr → kType → eurocode → Question Intelligence → Evidence ledger Domenereglene (OE-prioritet, E8/E9 evidens-hierarki, Question Intelligence KPI, 0% feilbestilling som non-negotiable) Case Study, C8/C9 arkitektur, prod metrics (0% feil, 81% EXACT, p95=825ms)

Grunnleggende Prinsipp

«I architect, orchestrate and verify production AI systems.»

AI genererer forslag, alternativer, kode, analyser. Mennesket (Chief Architect) definerer kravene, setter risikogrensene, godkjenner avgjørelsene, og står ansvarlig for produksjonsklarhet. Agentene er verktøy — ikke beslutningstakere.