Skip to main content
Key Takeaways

Mätblindhet: Användningsmått visar hur AI används, men kan inte avslöja om medarbetare förbättras, försämras eller överlåter sitt omdöme till AI.

Självbedömning: Medarbetare bedömer ofta fel hur AI påverkar deras prestation, vilket gör enkäter och självrapporterade fördelar till opålitliga bevis.

Signaler på omdöme: Omdöme i AI-användning kan mätas genom mönster av att acceptera, ändra och avvisa, genom att så in fel och genom att utvärdera trovärdiga konkurrerande svar.

Risk för juniora medarbetare: AI kan hindra juniora medarbetare från att öva på grundläggande arbete, vilket fördröjer kompetensutvecklingen och döljer svagheter tills kritiska beslut ska fattas.

Utforma först: Organisationer bör mäta mänsklig kompetens innan arbetet görs om, annars kan automatisering permanent befästa en oupptäckt kompetensförsämring.

Din AI-instrumentpanel visar hur många personer som använder verktygen. Den kan inte visa vad verktygen gör med dem.

Det var ett återkommande tema i många av sessionerna jag deltog i förra veckan på AI4 i Las Vegas. 

Organisationer har ägnat två år åt att bygga rapportering kring aktiverade platser, veckovisa aktiva användare, inskickade promptar och rapporterade sparade timmar. De siffrorna besvarade en fråga som ledningen ställde 2023: skulle någon faktiskt använda det? Användningen var risken, så det var rimligt att mäta användningen.

Continue Reading for Free

Create a free account to finish this article, plus get ongoing access to timely insights and practical resources.

Den frågan behöver inte längre besvaras. Men det mätverktyg som byggdes för att besvara den finns kvar och riktas nu mot ett problem som det faktiskt inte är utformat för att upptäcka.

En av sessionerna jag deltog i hette "Bortom användning: Att bygga AI-omdöme i arbetsflödet". Sharahn McClungs formulering var den tydligaste versionen av detta som jag har hört. Företag mäter snabbhet. De mäter användning. Sedan antar de förbättring. De två första räknas. Det tredje härleds.

Forskning som BCG publicerade i juni antyder att den slutsatsen ofta är fel, tillräckligt ofta för att det ska spela roll. I en studie av 70 ledare på högsta ledningsnivå och högre chefer uppgav hälften att de redan ser färdigheter urholkas i sina egna organisationer, och mer än 60 % förväntar sig att det ska bli ett betydande hot inom tre till fem år. Endast en av tio hade en organisationsövergripande strategi eller riktade initiativ på gång. En tredjedel hade inte diskuterat det alls.

Om du lyssnar på vår podd har du förmodligen hört mig prata om behovet av att ledare ska vara lite mer filosofiska i dessa tider. Men här blir frågan mer praktisk än filosofisk. Om du ville veta om AI gjorde dina medarbetare bättre eller sämre, var skulle du leta?

Börja med att utesluta det uppenbara svaret

Instinkten är att fråga dem.

Det finns en anledning att misstro den instinkten, och den kommer från en studie av personer som borde ha haft bäst förutsättningar att svara.

I juli 2025 genomförde METR ett randomiserat försök med 16 erfarna utvecklare av programvara med öppen källkod, som arbetade med 246 verkliga problem i kodbaser de kände utan och innan. Innan de började förutspådde utvecklarna att AI-verktyg skulle göra dem ungefär 24 % snabbare. De var 19 % långsammare. Efteråt, när de hade gått igenom hela upplevelsen, uppskattade de fortfarande att de hade varit omkring 20 % snabbare.

Det finns två saker med det resultatet som är värda att hålla fast vid.

METR beskriver nu resultatet som historiskt, och en uppföljning i februari 2026 fann vissa belägg för en hastighetsökning med nyare modeller. Den specifika siffran för försämringen kanske inte beskriver de verktyg som dina team använder i dag.

Det som kvarstår är det andra resultatet, som ändå är det mer användbara. Det här var experter inom sitt område, på välbekant mark, med ett resultat som var direkt synligt för dem, och avståndet mellan deras uppfattning och deras uppmätta prestation uppgick till nästan 40 procentenheter. Ingenting med bättre modeller gör människor bättre på att bedöma sin egen prestation.

Varje mätmetod som bygger på självrapportering ärver det problemet. Medarbetarundersökningar som frågar om AI hjälper kommer att ge svar. Svaren kommer att vara uppriktiga. De kommer också att vara ungefär lika tillförlitliga som dessa utvecklares uppskattningar.

Två kurvor, samma form

Föreställ dig två team med identiska användningskurvor. Båda ökar stadigt och visar en sund användning enligt varje mätvärde som du för närvarande samlar in.

Det ena teamet har lärt sig när modellen är värd att lita på och när den behöver åsidosättas. Deras förmåga förstärks kumulativt. Det andra har accepterat resultaten som fakta i månader. Deras förmåga töms underifrån, trots en stigande kurva.

Det finns ingen version av ett användningsmått som skiljer dessa team åt.

En arbetsrapport från Wharton från januari mätte hur stora skillnaderna faktiskt är. Steven Shaw och Gideon Nave genomförde tre förhandsregistrerade experiment med omkring 1 400 deltagare i fler än 9 000 försök, där de slumpmässigt avgjorde om en AI-assistent skulle ge korrekta eller felaktiga svar genom dolda startpromptar.

Jämfört med en baslinje bestående av deltagare utan tillgång till AI ökade träffsäkerheten med 25 procentenheter när AI:n hade rätt. När den gjorde fel sjönk träffsäkerheten 15 procentenheter under baslinjen utan AI.

Du läste rätt, under nivån hos de personer som aldrig hade tillgång till verktyget. För de uppgifter där modellen var opålitlig gjorde tillgången till den deltagarna sämre än om de inte hade haft den alls.

Självförtroendet ökade under båda förhållandena, även efter fel.

Shaw och Nave kallar beteendet ”kognitiv kapitulation”, vilket innebär att man accepterar AI-resultat med minimal granskning och samtidigt åsidosätter både intuition och eftertanke. De beskriver artificiell kognition som ett tredje system som verkar utanför hjärnan, ett system som kan komplettera mänskligt tänkande eller ersätta det.

Detta var en laboratoriestudie med resonemangsproblem, inte med anställda som utförde sina arbetsuppgifter, och den skillnaden är värd att hålla fast vid. Studien fastställer mekanismen och dess omfattning under kontrollerade förhållanden.

BCG:s ledare beskriver samma mönster inifrån verkliga organisationer. Nästan 90 % identifierade team som accepterar AI-resultat utan stresstestning som ett symptom på försämrad kompetens. Mer än hälften beskrev hur ägarskapet urholkades samtidigt. En av dem uttryckte det rakt på sak och sade att när resultatet inte är positivt läggs ansvaret på AI:n.

Each week, AI Signal takes one meaningful shift in AI and helps people leaders understand what changed, why it matters, and what to consider next.

Vad omdöme består av

Omdöme låter som något som inte låter sig mätas. McClungs session var värdefull eftersom den avvisade det antagandet och bröt ner ordet i observerbara handlingar.

Att lita på ett bra svar och gå vidare. Att ompröva ett korrekt resultat är en egen form av slöseri. Ett team som verifierar allt två gånger utövar inte omdöme, utan misslyckas med att utveckla något sådant. Effektiv acceptans hör till listan över sådant man vill uppnå.

Att åsidosätta ett självsäkert felaktigt svar. Det svåra. Resultatet är välformulerat, modellen visar ingen tvekan och det krävs tillräckliga självständiga kunskaper för att upptäcka att något inte stämmer. Det är den handling som först fallerar och den som inget användningsmått kan se.

Att veta när man inte ska använda verktyget alls. McClungs version av detta var sessionens mest mänskliga ögonblick. Hon beskrev hur hon ibland började skriva en prompt och insåg halvvägs att allt tänkande redan hade ägt rum genom själva skrivandet, vilket lämnade inget att göra med svaret som kom tillbaka.

Jag vet inte hur det är med dig, men personligen är jag rädd för en tom sida. Jag tittar på den och vet inte var jag ska börja. Och ibland upptäcker jag att jag redan har gått igenom hela processen och tänkt igenom allt i prompten när jag väl har skrivit den, och att jag faktiskt inte behöver verktyget.

Var och en av dessa är ett beslut som en person fattar innan något resultat skickas vidare. Ingen av dem förbättras för att användningen ökar. De är förmågor som en organisation måste bygga upp, och att behandla dem som biprodukter av införandet är det som leder fram till den situation som BCG:s respondenter beskriver.

Det förklarar också varför omdöme och beslutsfattande hade den högsta risken för kompetensförlust av alla färdigheter i deras studie. De låg jämsides med problemförståelse och problemformulering, som samma ledare bedömde vara den enskilt viktigaste färdigheten för organisationens långsiktiga resultat.

Tre sätt att se omdöme

Ord­nade efter hur snart du kan börja.

Acceptera, ändra, avvisa.

Varje AI-session genererar en redogörelse för vad som efterfrågades, vad som kom tillbaka och vad personen gjorde med det därefter. Att acceptera ett korrekt svar och att acceptera ett felaktigt svar ger identiska användningsdata men representerar motsatta former av omdöme. En ändring är ett tecken på att någon läste resultatet och tänkte igenom det innan det skickades vidare.

Sammanräknat för ett team över flera månader slutar den kvoten att vara en anekdot och blir något som går att följa över tid.

Sessionsutskrifter är en signal

Sessionsutskrifter är en signal

“Varje session är en utskrift”, sade McClung. “Den visar vad personen frågade, hur personen svarade, hur personen hittar ett problem, vad AI:n returnerade och när personen faktiskt byggde det, samt i realtid om personen accepterade svaret som det var, ändrade det eller avvisade AI:n. Så signalen acceptera, ändra, avvisa gör omdömet synligt.

 

“Tänk tillbaka på problemet med användningsinstrumentpanelen. Att acceptera ditt korrekta svar och att acceptera ett felaktigt svar ser identiskt ut i användningsdata. Utskriften är det som låter oss skilja dem åt. Att ändra är alltså beviset på att någon läste och tänkte kritiskt och skyddade sitt resultat, samlat på ett ställe.”

Hindret är åtkomst. De flesta HR-funktioner kan för närvarande inte se dessa data, och att få tillgång till dem kräver ett samtal med IT och de AI-plattformsansvariga, snarare än något du kan lansera nästa vecka. De organisationer som når dit först kommer att vara de där personalfunktionen och plattformsteamet redan samarbetade.

Det inplanterade felet

Ta en verklig arbetsuppgift. Plantera in ett känt fel i det modellen returnerar, valt på förhand. En felaktig siffra, ett överhoppat steg, ett påstående som inte håller. Upptäcker personen det innan det förs vidare?

Styrkan jämfört med vilket test som helst är att detta genomförs på verkliga leveranser och bedöms på samma sätt varje gång. Eftersom felet valdes i förväg finns det ingen oklarhet kring bedömningen, och du kan enkelt jämföra en månad med en annan.

Känsligheten är dock verklig. Om det genomförs dåligt uppfattas detta som en fälla och förgiftar förtroendet omedelbart. Det fungerar när teamen känner till att metoden finns, förstår varför den används och ser att resultaten används för utveckling snarare än bestraffning.

Bedömande omdöme

Två svar, båda flytande, båda plausibla, men det ena subtilt felaktigt. Kan personen identifiera vilket och förklara varför?

Det här ligger närmast det som expertarbete kräver och är dyrast att genomföra, eftersom det krävs någon med genuin domänexpertis för att skapa facit med plausibla men bristfälliga alternativ. Var ärlig mot dig själv om den kostnaden innan du bestämmer dig för detta.

De versioner som redan används

Vissa organisationer har gått vidare utan att vänta på perfekta mätinstrument.

På CNIL, Frankrikes dataskyddsmyndighet, ansvarar cheferna för att bedöma om medarbetarna kan ifrågasätta AI-resultat, inte bara använda dem. Kritisk granskning blev en synlig och utvärderad prestationsdimension.

Det är den jag skulle låna först. Den kräver inga nya verktyg och flyttar frågan in i prestationssystemet, som HR redan ansvarar för. Den löser också ett problem som BCG identifierar på annat håll i sin forskning: certifieringsgraden stiger medan den faktiska förmågan kanske inte gör det.

Shell byggde om sina lärandespår för juniorer så att nyanställda självständigt formulerar problemet, testar antaganden och tar fram en baslinjeanalys innan AI berör arbetet. De tidiga resultaten som rapporterades omfattade bättre frågor och tydligare resonemang bakom besluten.

Vissa företag genomför övningar i AI-misslyckanden och introducerar medvetet hallucinationer och oväntade vändningar i utbildningen, så att det blir en reflex att ifrågasätta resultaten snarare än en instruktion att följa. En indisk bank håller den första fredagen varje månad ett strukturerat arbetsmöte utan AI inom alla funktioner.

Inget av detta är exakt mätning. Det är den praktik som mätningen skulle visa om ni behöver.

Problemet visar sig sent

Femtioåtta procent av de ledare som BCG undersökte pekade på att juniora talanger utvecklas långsammare.

Det analytiska grovarbetet är där omdömet traditionellt byggs upp. Efterforskningen, de första utkasten, felsökningen, det långsamma arbetet med att bryta ner ett problem och upptäcka vilka delar man hade fel om. Ingen tycker om dessa upprepningar, men alla behöver dem.

Det arbetet är det första organisationer lämnar över till AI. Och de personer som tidigare lärde sig genom det förväntas nu prestera utan det, i vissa fall på en nivå som en av BCG:s respondenter beskrev som den nivå en medarbetare med fem till tio års erfarenhet skulle hålla.

Det finns dock en mätmässig komplikation här. Allt ovan upptäcker försämring jämfört med en baslinje. För erfarna personer fungerar det, eftersom baslinjen finns och man kan följa hur den förändras.

För någon som anställdes förra året finns ingen baslinje. Förmågan utvecklades aldrig, och frånvaron ser identisk ut med normal prestation tidigt i karriären tills det ögonblick då personen behöver fatta ett beslut utan stöd. Ni mäter inte en urholkning. Ni mäter något som aldrig uppstod, och inget av dagens instrument är byggt för det.

Det innebär att det är i den juniora gruppen som detta kostar mest och visar sig senast.

Varför ordningsföljden spelar roll

Arbetsomformning är initiativet för de kommande två kvartalen i många av de organisationer jag talar med. Kartläggning av uppgifter, pilotprojekt med agenter, organisationsscheman utformade kring vad maskiner hanterar och vad människor behåller.

De besluten stelnar. De avgör vilka förmågor som värderas och vilka förmågor era medarbetare sannolikt kommer att öva på under flera år därefter, samt vilka som permanent faller ur bruk.

Om ni fattar dem ovanpå en omätt nedgång bygger ni in nedgången i strukturen. Ni skulle besluta vad människor bör fortsätta göra utan att ha en ärlig bild av vad era medarbetare fortfarande kan göra och var deras förmågor har försvagats.

Jag tycker inte att instrumentet måste vara perfekt innan ni börjar. Testet med inplanterade fel skulle kunna genomföras inom en månad i de flesta funktioner. CNIL:s metod kräver ett samtal med cheferna och en rad i en mall för utvecklingssamtal.

Innan jag godkände en omformning skulle jag vilja ha ett svar på en fråga och beläggen bakom det.

Om ni stängde av AI i hela teamet i morgon, skulle era medarbetare vara bättre än innan ni införde den, eller sämre?