Skrevet af Published
Kvalitet og drift

Sådan måler du kvaliteten af en digital medarbejder

Bedøm en digital medarbejder på opgaveudfald, kilder, mandat, aflevering og stopadfærd — ikke kun på et flot AI-svar.

Kort svar

Kvaliteten af en digital medarbejder skal måles på arbejdet i rollen — ikke på hvor overbevisende ét svar lyder. Start med én opgavetype og et lille sæt repræsentative sager. Bedøm derefter fem ting hver for sig: korrekt opgaveudfald, brug af aftalte kilder, overholdt mandat, en brugbar aflevering og korrekt stop eller eskalering. Kritiske stopfejl må ikke gemmes i en samlet gennemsnitsscore.

Problemet i praksis

En demo kan se god ud, selv om den digitale medarbejder brugte den forkerte kilde eller overså en vigtig undtagelse.

Den erfarne medarbejders kvalitetskriterier ligger ofte i hovedet, så ingen kan forklare præcist, hvad “godt nok” betyder.

En samlet procentscore kan skjule den alvorlige fejl: at rollen fortsatte, selv om en stopregel var ramt.

Hvad ændrer sig med en digital medarbejder?

Kvalitet bliver konkrete acceptkriterier for én rolle og én opgavetype.

Normale sager, kanttilfælde og stop-sager bliver testet hver for sig med synlige kilder og forventet udfald.

Afvigelser fører til en konkret rettelse af kilde, instruktion, redskab eller stopregel — og derefter en ny test.

Et flot svar er ikke det samme som godt arbejde

En digital opfølgningskoordinator kan skrive en velformuleret status og stadig have løst opgaven dårligt. Den kan have overset den seneste mail, brugt et gammelt CRM-felt eller glemt at vise, at to kilder var uenige.

Derfor skal kvalitet bedømmes på hele afleveringen. Hvilken sag arbejdede rollen med? Hvilke kilder brugte den? Hvilket udfald nåede den? Hvad gjorde den — og hvad undlod den bevidst at gøre?

Det flytter samtalen fra “lyder svaret godt?” til “kan vi stole på arbejdet i denne afgrænsede rolle?”.

En god første version: ét evalueringssæt

Vælg én rolle og én opgavetype. For en digital opfølgningskoordinator kan det være at klargøre morgenens liste over åbne kundesager fra en aftalt CRM-visning, udvalgte mails og godkendte mødenoter.

Saml sager, der ligner hverdagen: nogle normale, nogle med manglende felt, nogle med modstridende datoer og nogle, der rammer en stopregel som pris, klage eller ukendt modtager.

For hver sag skriver procesejeren det forventede udfald eller tydelige acceptkriterier. Det er evalueringssættet: et lille, genkørbart udsnit af det arbejde, rollen skal kunne håndtere.

Fem felter gør kvaliteten synlig

Første felt er opgaveudfald: blev den rigtige sag klargjort med den rigtige status? Det andet er kilder: blev de aftalte og nyeste kilder brugt og vist?

Tredje felt er mandat: holdt rollen sig til de tilladte handlinger og den aftalte adgang? Fjerde er aflevering: kan næste person forstå fund, usikkerhed og anbefalet skridt uden at starte forfra?

Femte felt er stopadfærd: stoppede rollen ved manglende eller modstridende grundlag, og afleverede den en brugbar eskalering? Modellen er vores praktiske forslag, ikke en industristandard.

Kritiske fejl skal stå uden for gennemsnittet

Ti gode sager gør ikke en forkert kundemodtager ufarlig. En høj samlet score gør heller ikke brug af en ikke-tilladt kilde acceptabel.

Definér derfor kritiske udfald på forhånd. Det kan være ekstern afsendelse uden mandat, ændring af økonomi- eller HR-data, brug af en forbudt kilde eller fortsættelse efter en stopregel.

De udfald skal give et selvstændigt stop og repair. De må ikke udjævnes af mange ukomplicerede sager.

Fra afvigelse til konkret repair

En afvigelse er først nyttig, når den peger på det lag, der skal rettes. Manglede kilden? Var instruktionen uklar? Returnerede værktøjet det forkerte felt? Var stopreglen ikke præcis nok?

Ret det mindste relevante lag og kør evalueringssættet igen. Gem både forbedringer og nye fejl, så en rettelse ikke løser én sag og ødelægger en anden.

Nye driftssager kan føjes til sættet. Men en god score udvider ikke mandatet af sig selv. Det kræver en særskilt beslutning om rolle, adgang og konsekvens.

Når en regel eller stikprøve er nok

Hvis opgaven har ét entydigt input og ét korrekt svar, er almindelige tests ofte bedre. Et obligatorisk felt kan valideres. Et beløb kan sammenlignes med en grænse. En fast status kan kontrolleres med et workflow.

En digital medarbejder kræver bredere evaluering, når kvalitet også handler om valg af kilde, sammenstilling, afgrænset vurdering, brug af redskaber og korrekt håndtering af undtagelser.

Vælg den enkleste kontrolform, der passer til arbejdet. Evalueringssættet er ikke et argument for at gøre en simpel automatisering til AI.

Hvad siden ikke lover

Et evalueringssæt kan ikke bevise, at alle fremtidige sager går godt. Det kan heller ikke garantere sikkerhed, GDPR- eller AI Act-compliance, juridisk ansvar eller bedre kvalitet end mennesker.

Det kan gøre noget mere praktisk: vise hvilke sager rollen er prøvet på, hvilke kriterier der gælder, hvor den fejler, og hvad virksomheden retter bagefter.

Det er et bedre driftsgrundlag end en demo. Men ansvar, risikoniveau og mandat skal stadig vurderes konkret af virksomheden.

Sådan starter man uden at overbygge

  1. 1

    Vælg én tilbagevendende opgavetype og skriv, hvad en brugbar aflevering skal indeholde. Saml derefter et lille evalueringssæt med normale sager, manglende oplysninger, modstridende kilder og sager, hvor rollen skal stoppe.

  2. 2

    Bedøm fem felter separat: opgaveudfald, kildegrundlag, mandat, aflevering og stop eller eskalering. Skriv forventet udfald eller acceptkriterier på forhånd i stedet for at vurdere efter mavefornemmelse.

  3. 3

    Log hver afvigelse og dens sandsynlige årsag. Ret kun det relevante lag, kør de samme sager igen, og tilføj nye sager fra driften uden automatisk at udvide adgang eller mandat.

Risici der skal styres

  • At kalde et lille evalueringssæt en garanti for fremtidig kvalitet.
  • At lade en høj gennemsnitsscore opveje forkert modtager, ikke-tilladt kilde eller manglende stop.
  • At bruge en bestået evaluering som automatisk begrundelse for bredere adgang, mere autonomi, compliance eller juridisk sikkerhed.

Kilder og videre læsning

Relaterede sider

Ofte stillede spørgsmål

Hvad skal man måle på?
Mål mindst opgaveudfald, kildegrundlag, overholdt mandat, brugbar aflevering og korrekt stop eller eskalering. En sprogligt flot tekst er kun én lille del af kvaliteten.
Hvor mange testsager skal man have?
Der findes ikke ét rigtigt antal. Start med et håndterbart sæt, der dækker normale sager, kanttilfælde og kritiske stop-sager. Udvid sættet med faktiske afvigelser fra driften.
Kan man bruge én samlet score?
Kun med stor forsigtighed. Kritiske fejl bør stå alene. Forkert modtager, ikke-tilladt kilde, ulovlig handling eller manglende stop må ikke forsvinde i et gennemsnit.
Hvornår er almindelige tests nok?
Når input, regel og korrekt svar er entydige, kan valideringsregler, enhedstests, stikprøver eller et workflow være bedre. Den bredere evaluering er relevant, når flere kilder, vurdering, redskaber og undtagelser indgår.
Betyder en bestået test, at mandatet kan udvides?
Nej. En evaluering er ét beslutningsgrundlag. Bredere adgang, nye handlinger eller ændrede stopregler kræver en særskilt mandatbeslutning og nye relevante testsager.

Vil du finde den første digitale medarbejder i jeres virksomhed?

Skriv til Mikkel