I Goethes digt Troldmandens lærling sætter den unge lærling kosten til at bære vand, mens mesteren er ude. Det virker. Det virker fremragende. Vandet fosser ind, arbejdet går af sig selv, og lærlingen står midt i sin egen succes og opdager for sent, at han hverken kan standse kosten eller overskue, hvad der er sat i gang. Fortællingen handler ikke om en defekt kost. Den handler om en fornemmelse af magisk kontrol, der ikke svarer til den faktiske kontrol.
Den samme forskydning sker, hver gang en sprogmodel leverer et udkast på tredive sekunder. Opgaven efterlader en klar oplevelse: det gik hurtigt. Oplevelsen er givetvis ægte. Men den stemmer ikke altid overens med virkeligheden.
Forskningen finder ikke den tid, medarbejderne oplever at spare
To studier understreger gabet. I et randomiseret forsøg udført af METR løste 16 erfarne udviklere 246 rigtige opgaver i deres egne kodebaser, med og uden AI-værktøjer. De blev 19 % langsommere, når de måtte bruge AI. Bagefter vurderede de selv, at de var blevet cirka 20 % hurtigere. Afstanden mellem oplevelse og måling var altså næsten 40 procentpoint – i samme retning, hos de samme mennesker, i samme opgave. METR har siden kørt et opfølgende forsøg, der peger den anden vej, men med så brede usikkerhedsintervaller og så tydelige udvælgelsesproblemer, at forskerne selv kalder det svag evidens. Selve gabet mellem oplevelse og måling står uanfægtet. [1]
Det danske billede peger samme vej, bare i større skala. Anders Humlum og Emilie Vestergaard har koblet spørgeskemadata fra 25.000 medarbejdere på 7.000 danske arbejdspladser sammen med registerdata. Brugerne sparer i gennemsnit 2,8 % af arbejdstiden. Det er reelt, men langt fra de 15 til 50 %, som kontrollerede forsøg på enkeltopgaver finder [2]. Og effekten på løn og arbejdstid er præcist nul. [3]
Jeg læser ikke de tal som et argument mod AI. Jeg læser dem som et argument imod at bruge fornemmelsen som måltal – og imod at stirre os blinde på løfterne om effektiviseringsgevinster. Vi måler noget, der føles som fremdrift, og kalder det produktivitet.
Fornemmelsen af flow er en dårlig indikator for værdi
Hvorfor tager vi fejl af vores eget arbejde? En måde at anskue det på er, at vi forveksler friktion med besvær. Det, en sprogmodel først og fremmest fjerner, er den blanke side, ventetiden og det ubehagelige startpunkt. Det føles som om, opgaven blev mindre. Men det, der blev mindre, var modstanden i begyndelsen – ikke nødvendigvis arbejdet i sin helhed. Hvor den friktion, der dræner, og den vi vokser af ikke er den samme, er den her forskydning heller ikke uskyldig.
Tre ting flytter sig samtidig, og de trækker i hver sin retning:
- Arbejdet flytter sig fra at frembringe til at vurdere. Et udkast, der kommer på tredive sekunder, skal stadig læses, efterprøves og skæres til. Den tid ligger et andet sted i dagen, ofte hos en anden person, og den bliver sjældent registreret som en del af opgaven.
- Kvaliteten bliver sværere at bedømme. Et velformuleret svar signalerer kompetence, også når indholdet er tyndt. Forskerne bag BCG-forsøget med 758 konsulenter kalder det en takket grænse: inden for AI’s formåen løste deltagerne 12,2 % flere opgaver, 25,1 % hurtigere og med over 40 % højere kvalitet – men på en opgave lige uden for grænsen var de 19 procentpoint mindre tilbøjelige til at svare rigtigt. [4] Hjælpen og fejlen føles ens undervejs.
- Og arbejdet kan flytte sig til kollegaen. Harvard Business Review satte i 2025 navn på fænomenet med begrebet workslop: AI-genereret materiale, der ser færdigt ud, men er tomt. 41 % af de adspurgte havde modtaget det inden for en måned, og hver hændelse kostede omkring to timers oprydning. [5] Afsenderen sparede tid. Organisationen gjorde ikke.
Klarhed bliver forstærket med AI. Men det gør uklarhed altså også.
Gabet er ikke en fejl hos medarbejderne, men et vilkår ved ny teknologi
Jeg vil gerne holde fast i, at ingen lyver i det her regnestykke. Udviklerne i METR-forsøget var erfarne fagfolk, der svarede ærligt om deres egen dag. Det er ikke holdningen, der svigter, men instrumentet: mennesker er dårlige til at måle deres eget tidsforbrug, og allerbedst til at huske de øjeblikke, hvor noget gik let.
Økonomerne Erik Brynjolfsson, Daniel Rock og Chad Syverson har beskrevet mønstret som en J-kurve. Generelle teknologier kræver store komplementære investeringer – nye processer, nye kompetencer, nye måder at organisere arbejdet på – og de investeringer er usynlige i regnskabet, mens de finder sted. Derfor ser produktiviteten først ud til at falde, og senere til at stige mere, end den egentlig gør. Gabet mellem oplevet og målt effekt er med andre ord ikke et tegn på, at noget er gået galt. Det er formen på selve overgangen. [6]
Men – og det er her, ansvaret ligger hos os – et vilkår er ikke det samme som en undskyldning. J-kurven forklarer, hvorfor gevinsten er forsinket. Den lover ikke, at den kommer af sig selv.
Ledelsesopgaven er at gøre gevinsten til et valg frem for en fornemmelse
Kan fornemmelsen ikke bære beslutningen, må noget andet gøre det. Tre greb rækker langt, og ingen af dem kræver nye systemer eller et måleapparat, ingen orker at bruge.
- Det første er en baseline på én konkret opgave. Ikke en organisationsdækkende måling af AI-modenhed, men et enkelt, velafgrænset arbejde: hvor lang tid tager det i dag, hvor mange led er der, hvor ofte skal det rettes. Uden et startpunkt bliver enhver senere påstand om effekt et spørgsmål om temperament.
- Det andet er at flytte verifikationen tilbage til afsenderen. Den, der sender et AI-assisteret udkast videre, har ansvaret for at have læst det, tjekket kilderne og stået inde for det. Det lyder banalt, men det er netop den regel, der afgør, om tidsbesparelsen bliver i organisationen eller bare flytter hen til den næste i kæden.
- Det tredje er at beslutte, hvad den frigjorte tid skal bruges til. Sparet tid, som ingen har taget stilling til, forsvinder i hverdagen. I de danske data flytter 80 % af brugerne tidsbesparelsen til andre arbejdsopgaver, mens færre end 10 % bruger den på pauser [3] – hvilket er helt rimeligt, men det betyder også, at gevinsten aldrig bliver synlig som andet end en fornemmelse af at nå mere. Om tiden skal tages som besparelse eller flyttes til opgaver, organisationen ellers ikke nåede, er et ledelsesvalg. Det skal træffes, siges højt og følges op.
Ingen af de tre greb handler om teknologien. De handler om dømmekraft, om hvad vi vil bruge den til, og om at turde se efter, om det passer. Det samme gælder motivation og AI-kompetencer: det er mennesker, ikke værktøjer, der afgør udbyttet.
Det, vi kan mærke, og det, vi kan svare for
Troldmandens lærling ender med at kalde på mesteren. Pointen er ikke, at han skulle have ladet være med at bruge kosten. Pointen er, at han satte den i gang uden at kunne vurdere, hvad der skete, mens det skete.
Det er den fase, vi står i. Vi har fået et redskab, der føles som fart, ind i organisationer, der sjældent måler, hvor de startede.
Tre spørgsmål er værd at tage med ind i ledergruppen:
- Hvilken konkret opgave kan vi måle før og efter – og hvem ejer den måling?
- Hvor i vores arbejdsgange bliver tid sparet ét sted og brugt et andet, uden at nogen ser det?
- Og hvad skulle vi bruge tiden til, hvis vi faktisk fik den – har vi besluttet det, eller regner vi med, at den nok viser sig?
Organisationer, der stiller de spørgsmål, kommer længere end dem, der bare køber flere licenser. Ikke fordi målingen i sig selv skaber værdi – men fordi den tvinger os til at sige højt, hvad vi ville opnå. Det er også det, der adskiller ledelse af AI i organisationen fra implementering af et værktøj.
Noter og kilder
[1] METR: Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity, juli 2025. Randomiseret forsøg med 16 erfarne bidragydere til store open source-projekter, 246 reelle opgaver. Med AI-værktøjer tog opgaverne 19 % længere tid. Deltagerne forventede på forhånd en hastighedsgevinst på 24 % og mente bagefter, at de var blevet 20 % hurtigere. METR fulgte op med et nyt forsøg, der begyndte i august 2025 med 57 udviklere og over 800 opgaver i 143 kodebaser. Det viser en hastighedsgevinst: 18 % kortere tid blandt de tilbagevendende deltagere (usikkerhedsinterval fra 38 % hurtigere til 9 % langsommere) og 4 % blandt de nye (fra 15 % hurtigere til 9 % langsommere). METR understreger selv, at resultatet er svag evidens: deltagere sprang fra for ikke at arbejde uden AI, og de indsendte fortrinsvis opgaver, hvor AI kunne hjælpe. Tallet for selve hastigheden står altså åbent i begge retninger, mens forskellen mellem oplevet og målt tid fra det første forsøg ikke er trukket tilbage. Det første forsøg · opfølgningen, februar 2026
[2] Noy og Zhang: Experimental evidence on the productivity effects of generative artificial intelligence, Science, 2023. I et skriveeksperiment faldt tidsforbruget 40 %, og den gennemsnitlige karakter steg 18 %. Brynjolfsson, Li og Raymond finder 14 % flere løste sager i timen i kundeservice. Spandet 15 til 50 % er den sammenligning, Humlum og Vestergaard selv bruger om kontrollerede forsøg. CEPR’s gennemgang · Brynjolfsson, Li og Raymond
[3] Humlum og Vestergaard: Large Language Models, Small Labor Market Effects, NBER working paper 33777. Cirka 25.000 medarbejdere på 7.000 danske arbejdspladser i 11 fag, koblet til registerdata, spørgeskemaer fra 2023 og 2024. Brugerne rapporterer i gennemsnit 2,8 % sparet arbejdstid, fra 0,6 % blandt lærere uden opfordring fra arbejdsgiveren til 6,8 % blandt marketingfolk med. Effekten på løn og arbejdstid kan afvises som større end 1 %. 80 % flytter den sparede tid til andre arbejdsopgaver, under 10 % bruger den på pauser, og 25 % bruger mere tid på de samme opgaver, de sparede tid på. NBER
[4] Dell’Acqua m.fl.: Navigating the Jagged Technological Frontier, Harvard Business School og BCG, 2023. 758 konsulenter, cirka 7 % af BCG’s konsulenter på medarbejderniveau. Inden for AI’s formåen: 12,2 % flere opgaver, 25,1 % hurtigere og over 40 % højere kvalitet. Uden for: 19 procentpoint lavere sandsynlighed for et korrekt svar. De svageste deltagere forbedrede sig 43 %, de stærkeste 17 %. SSRN
[5] Niederhoffer m.fl.: AI-Generated “Workslop” Is Destroying Productivity, Harvard Business Review, september 2025, baseret på undersøgelse fra BetterUp Labs og Stanford Social Media Lab blandt 1.150 amerikanske kontoransatte. 41 % havde modtaget workslop inden for en måned, hver hændelse kostede cirka to timer, svarende til 186 dollar per medarbejder om måneden. HBR
[6] Brynjolfsson, Rock og Syverson: The Productivity J-Curve: How Intangibles Complement General Purpose Technologies, American Economic Journal: Macroeconomics, 2021. Generelle teknologier kræver komplementære, immaterielle investeringer, som ikke måles, mens de foretages. Derfor undervurderes produktivitetsvæksten først og overvurderes den siden. AEA · fri NBER-version
