Mittarisokeus: Käyttömittarit osoittavat tekoälyn käyttöönoton, mutta eivät voi paljastaa, kehittyvätkö työntekijät, heikkenevätkö heidän taitonsa vai luopuvatko he harkintakyvystään.
Itsearviointi: Työntekijät arvioivat usein väärin tekoälyn vaikutuksen suoriutumiseensa, mikä tekee kyselyistä ja itse ilmoitetuista hyödyistä epäluotettavaa näyttöä.
Harkintakyvyn signaalit: Tekoälyn käytön vaikutus harkintakykyyn voidaan mitata hyväksymis-, muokkaus- ja hylkäyskäyttäytymisen, tarkoituksella lisättyjen virheiden sekä uskottavien vaihtoehtoisten vastausten arviointien avulla.
Nuorempien työntekijöiden riski: Tekoäly voi estää nuorempia työntekijöitä harjoittelemasta perustavanlaatuista työtä, jolloin osaamisen kehittyminen viivästyy ja heikkoudet pysyvät piilossa kriittisiin päätöksiin asti.
Suunnittelu ensin: Organisaatioiden tulisi mitata ihmisten osaaminen ennen työn uudelleensuunnittelua, sillä automaatio voi muuten pysyvästi juurruttaa tunnistamattoman osaamisen heikkenemisen.
Tekoälykoontinäyttösi kertoo, kuinka moni käyttää työkaluja. Se ei voi kertoa, mitä työkalut tekevät heille.
Se oli toistuva teema monissa viime viikolla Las Vegasissa järjestetyn AI4-tapahtuman sessioissa, joihin osallistuin.
Organisaatiot ovat käyttäneet kaksi vuotta raportoinnin rakentamiseen aktivoiduista käyttöoikeuksista, viikoittain aktiivisista käyttäjistä, lähetetyistä kehotteista ja raportoiduista säästetyistä työtunneista. Nämä luvut vastasivat johdon vuonna 2023 esittämään kysymykseen: käyttäisikö kukaan tätä oikeasti? Käyttöönotto oli riski, joten käyttöönoton mittaaminen tuntui järkevältä.
Tähän kysymykseen ei enää tarvita vastausta. Mutta sitä varten rakennettu mittaristo jäi käyttöön, ja nyt sitä käytetään ongelmaan, jota se ei todellisuudessa ole suunniteltu havaitsemaan.
Yksi sessioista, johon osallistuin, oli nimeltään ”Käyttöönoton tuolla puolen: tekoälyharkinnan rakentaminen työnkulussa”. Sharahn McClungin esitys tästä aiheesta oli selkein kuulemani. Yritykset mittaavat nopeutta. Ne mittaavat käyttöä. Sitten ne olettavat kehityksen. Kaksi ensimmäistä lasketaan. Kolmas päätellään.
BCG:n kesäkuussa julkaisema tutkimus viittaa siihen, että päätelmä on riittävän usein väärä ollakseen merkityksellinen. Tutkimuksessa, johon osallistui 70 ylimmän johdon johtajaa ja muuta senioritason johtajaa, puolet kertoi seuraavansa jo nyt taitojen rapautumista omissa organisaatioissaan, ja yli 60 % odottaa sen muuttuvan merkittäväksi uhaksi seuraavien kolmesta viiteen vuoden aikana. Vain yhdellä kymmenestä oli koko organisaation kattava strategia tai kohdennettuja aloitteita käynnissä. Kolmannes ei ollut keskustellut asiasta lainkaan.
Jos kuuntelet podcastiamme, olet todennäköisesti kuullut minun puhuvan siitä, että johtajien pitäisi näinä aikoina olla hieman filosofisempia. Tässä kysymys muuttuu kuitenkin filosofisen sijaan käytännöllisemmäksi. Jos haluaisit tietää, tekeekö tekoäly ihmisistäsi parempia vai huonompia, mistä etsisit vastausta?
Aloita sulkemalla ilmeinen vastaus pois
Ensimmäinen vaisto on kysyä heiltä.
On syy suhtautua tähän vaistoon epäillen, ja se käy ilmi tutkimuksesta, johon osallistui ihmisiä, joiden olisi pitänyt olla parhaassa asemassa vastaamaan.
Heinäkuussa 2025 METR toteutti satunnaistetun kokeen, johon osallistui 16 kokenutta avoimen lähdekoodin kehittäjää. He työskentelivät 246 todellisen ongelman parissa koodikannoissa, jotka he tunsivat perin pohjin. Ennen aloitusta kehittäjät ennustivat, että tekoälytyökalut tekisivät heistä noin 24 % nopeampia. Todellisuudessa he olivat 19 % hitaampia. Jälkikäteen, koettuaan koko prosessin, he arvioivat edelleen olleensa noin 20 % nopeampia.
Tuloksesta kannattaa pitää mielessä kaksi asiaa.
METR luokittelee havainnon nykyään historialliseksi, ja helmikuussa 2026 tehty jatkotutkimus löysi jonkin verran näyttöä nopeutumisesta uudemmilla malleilla. Havaittu hidastumisluku ei välttämättä kuvaa niitä työkaluja, joita tiimisi käyttävät nykyään.
Jäljelle jää toinen havainto, joka on joka tapauksessa hyödyllisempi. Nämä olivat asiantuntevia ammattilaisia tutussa ympäristössä, jossa tulokset olivat heidän suoraan havaittavissaan, ja heidän käsityksensä ja mitatun suoriutumisensa välinen ero oli lähes 40 prosenttiyksikköä. Paremmat mallit eivät tee ihmisistä parempia arvioimaan omaa suoriutumistaan.
Kaikki mittaustavat, jotka perustuvat itsearviointiin, kärsivät tästä ongelmasta. Työtyytyväisyyskyselyt, joissa kysytään, auttaako tekoäly, tuottavat vastauksia. Vastaukset ovat vilpittömiä. Ne ovat kuitenkin suunnilleen yhtä luotettavia kuin kyseisten kehittäjien arviot.
Kaksi käyrää, sama muoto
Kuvittele kaksi tiimiä, joiden käyttökehitys on identtinen. Molemmat kasvavat tasaisesti, ja molemmat osoittavat tervettä käyttöönottoa kaikilla tällä hetkellä keräämilläsi mittareilla.
Toinen tiimi on oppinut, milloin malliin kannattaa luottaa ja milloin sen toiminta on ohitettava. Sen kyvykkyys kasautuu. Toinen tiimi on hyväksynyt tuotokset tosiasioina kuukausien ajan. Sen kyvykkyys hupenee nousevan käyrän alla.
Ei ole olemassa sellaista käyttömittaria, joka erottaisi nämä tiimit toisistaan.
Whartonin työpaperi tammikuulta mittasi, kuinka kaukana toisistaan ne todellisuudessa ovat. Steven Shaw ja Gideon Nave toteuttivat kolme ennakkoon rekisteröityä koetta, joihin osallistui noin 1 400 henkilöä ja joissa tehtiin yli 9 000 koetta. He satunnaistivat sen, antoiko tekoälyavustaja tarkkoja vai virheellisiä vastauksia piilotettujen siemenkehotteiden avulla.
Verrattuna niiden osallistujien perustasoon, joilla ei ollut pääsyä tekoälyyn, tarkkuus kasvoi 25 prosenttiyksikköä, kun tekoäly oli oikeassa. Kun se teki virheen, tarkkuus laski 15 prosenttiyksikköä alle tekoälyttömän perustason.
Luit oikein: alle niiden ihmisten suoritustason, joilla ei koskaan ollut työkalua käytössään. Tehtävissä, joissa malli oli epäluotettava, sen käyttö teki osallistujista huonompia kuin työkalun käyttämättä jättäminen kokonaan.
Itseluottamus kasvoi molemmissa olosuhteissa, myös virheiden jälkeen.
Shaw ja Nave kutsuvat tätä käyttäytymistä ”kognitiiviseksi antautumiseksi”, mikä tarkoittaa tekoälyn tuotosten omaksumista vähäisellä tarkastelulla samalla, kun sekä intuitio että harkinta ohitetaan. He kuvaavat keinotekoista kognitiota kolmantena järjestelmänä, joka toimii aivojen ulkopuolella ja joka voi täydentää ihmisen päättelyä tai korvata sen.
Tämä oli laboratoriotutkimus, jossa käytettiin päättelytehtäviä – ei työtään tekeviä työntekijöitä – ja tämä ero on syytä pitää mielessä. Tutkimus osoittaa mekanismin ja sen suuruusluokan kontrolloiduissa olosuhteissa.
BCG:n johtajat kuvaavat samaa ilmiötä todellisten organisaatioiden sisältä. Lähes 90 prosenttia tunnisti tiimit, jotka hyväksyvät tekoälyn tuotokset ilman niiden stressitestausta, kyvykkyyden heikkenemisen oireeksi. Yli puolet kuvasi omistajuuden rapautuvan sen myötä. Yksi heistä ilmaisi asian suorasukaisesti: kun lopputulos ei ole myönteinen, vastuu sälytetään tekoälylle.
Mihin harkinta jakautuu
Harkinta kuulostaa asialta, joka vastustaa mittaamista. McClungin puheenvuoro oli hyödyllinen, koska siinä kieltäydyttiin hyväksymästä tätä oletusta ja jaettiin sana havaittaviksi teoiksi.
Hyvän vastauksen luottaminen ja eteenpäin siirtyminen. Oikean tuotoksen uudelleenarviointi on itsessään eräänlaista hukkaa. Tiimi, joka tarkistaa kaiken kahdesti, ei käytä harkintaa vaan ei onnistu kehittämään sitä lainkaan. Tehokas hyväksyminen kuuluu niiden asioiden listalle, joita haluat.
Varmalta vaikuttavan väärän vastauksen ohittaminen. Tämä on vaikea kohta. Tuotos vaikuttaa hyvältä, malli ei epäröi, ja virheen havaitseminen edellyttää riittävää itsenäistä tietämystä, jotta huomaa jonkin olevan pielessä. Tämä on teko, joka pettää ensimmäisenä, eikä mikään käyttömittari pysty näkemään sitä.
Tietäminen, milloin työkalua ei pidä käyttää lainkaan. McClungin kuvaus tästä oli puheenvuoron inhimillisin hetki. Hän kertoi kirjoittavansa toisinaan kehotteen ja oivaltavansa kesken kaiken, että kaikki ajattelu oli jo tapahtunut kirjoittamisen aikana, eikä palanneen vastauksen kanssa ollut enää mitään tehtävää.
En tiedä, miten teillä on, mutta itse pelkään tyhjää sivua. Katson sitä enkä tiedä, mistä aloittaa. Ja joskus huomaan, että siihen mennessä kun olen kirjoittanut kehotteen, olen tehnyt koko prosessini ja kaiken ajatteluni kehotteessa, enkä oikeastaan tarvitse työkalua.
Jokainen näistä on päätös, jonka ihminen tekee ennen kuin mitään tuotosta julkaistaan. Mikään niistä ei parane käytön lisääntyessä. Ne ovat panoksia, jotka organisaation on rakennettava, ja niiden pitäminen käyttöönoton sivutuotteina johtaa siihen tilanteeseen, jota BCG:n vastaajat kuvaavat.
Se selittää myös, miksi harkinnalla ja päätöksenteolla oli heidän tutkimuksessaan kaikkien taitojen korkein osaamisen heikkenemisen riskipistemäärä. Niiden rinnalla olivat ongelman ymmärtäminen ja jäsentäminen, jotka samat johtajat arvioivat yhdeksi tärkeimmäksi taidoksi organisaation pitkän aikavälin suorituskyvyn kannalta.
Kolme tapaa nähdä harkinta
Järjestettynä sen mukaan, kuinka pian voit aloittaa.
Hyväksy, muokkaa, hylkää.
Jokainen tekoälyistunto tuottaa tallenteen siitä, mitä kysyttiin, mitä saatiin vastaukseksi ja mitä henkilö teki sen jälkeen. Oikean vastauksen hyväksyminen ja väärän vastauksen hyväksyminen tuottavat samanlaista käyttötietoa ja edustavat harkinnan vastakkaisia tekoja. Muokkaaminen on osoitus siitä, että joku luki tuotoksen ja ajatteli sitä ennen sen julkaisemista.
Kun tätä suhdetta tarkastellaan koko tiimin osalta kuukausien ajan, se lakkaa olemasta anekdootti ja muuttuu joksikin, jonka kehitystä voi seurata.
Esteenä on tiedonsaanti. Useimmat henkilöstöhallinnon toiminnot eivät tällä hetkellä pysty näkemään näitä tietoja, ja niiden saaminen käyttöön edellyttää keskustelua IT:n ja tekoälyalustan omistajien kanssa sen sijaan, että asian voisi käynnistää ensi viikolla. Ensimmäisenä perille pääsevät organisaatiot, joissa henkilöstötiimi ja alustatiimi keskustelivat jo ennestään keskenään.
Ennalta istutettu virhe
Ota todellinen tehtävä. Istuta mallin palauttamaan sisältöön etukäteen valittu tunnettu virhe. Väärä luku, väliin jäänyt vaihe tai väite, joka ei kestä tarkastelua. Huomaako henkilö sen ennen kuin se etenee?
Tämän etuna mihin tahansa testiin verrattuna on, että se tehdään todellisten tuotosten parissa ja pisteytetään joka kerta samalla tavalla. Koska virhe valittiin etukäteen, arvioinnissa ei ole tulkinnanvaraa, ja kuukausia voi verrata toisiinsa selkeästi.
Menetelmään liittyy kuitenkin todellinen herkkyys. Huonosti toteutettuna se vaikuttaa ansalta ja myrkyttää luottamuksen välittömästi. Se toimii, kun tiimit tietävät käytännön olemassaolosta, ymmärtävät sen tarkoituksen ja näkevät tuloksia käytettävän kehittämiseen eikä rankaisemiseen.
Arvioiva harkinta
Kaksi vastausta, molemmat sujuvia ja uskottavia, mutta toinen hienovaraisesti väärin. Pystyykö henkilö tunnistamaan, kumpi niistä on väärin, ja selittämään miksi?
Tämä vastaa parhaiten sitä, mitä asiantuntijatyö edellyttää, ja sen toteuttaminen on kalleinta, koska vastausavaimen laatiminen edellyttää todellista alan asiantuntemusta omaavaa henkilöä rakentamaan uskottavia mutta virheellisiä vaihtoehtoja. Ole rehellinen itsellesi tämän kustannuksen suhteen ennen kuin sitoudut tähän.
Jo käytössä olevat versiot
Jotkin organisaatiot ovat edenneet odottamatta täydellisiä mittausmenetelmiä.
CNIL:ssä, Ranskan tietosuojaviranomaisessa, esihenkilöt vastaavat sen arvioimisesta, pystyvätkö työntekijät kyseenalaistamaan tekoälyn tuottamat tulokset sen sijaan, että he vain käyttäisivät tekoälyä. Kriittisestä suhtautumisesta tuli näkyvä ja arvioitava suoriutumisen ulottuvuus.
Juuri tämän ottaisin ensimmäisenä käyttöön. Se ei edellytä uusia työkaluja, ja se siirtää kysymyksen suoriutumisen hallinnan järjestelmään, josta HR jo vastaa. Se ratkaisee myös ongelman, jonka BCG tuo esiin muualla tutkimuksessaan: sertifiointiasteet kasvavat, vaikka todellinen osaaminen ei välttämättä kehity.
Shell rakensi junioritason oppimispolkunsa uudelleen niin, että uudet työntekijät määrittelevät ongelman itsenäisesti, testaavat oletukset ja tuottavat lähtötilanneanalyysin ennen kuin tekoäly otetaan mukaan työhön. Raportoituihin varhaisiin tuloksiin kuuluivat paremmat kysymykset ja päätösten taustalla olevan päättelyn selkeys.
Jotkin yritykset järjestävät tekoälyn vikatilanteiden harjoituksia, joissa koulutukseen tuodaan tarkoituksellisesti hallusinaatioita ja odottamattomia haasteita, jotta tulosten kyseenalaistamisesta tulee ohjeen sijaan automaattinen toimintatapa. Eräs intialainen pankki järjestää joka kuukauden ensimmäisenä perjantaina kaikissa toiminnoissa jäsennellyn tekoälyttömän työskentelysession.
Mikään näistä ei ole varsinaisesti mittaamista. Ne ovat käytäntöjä, joiden avulla mittaaminen kertoisi, onko sitä tarpeen tehdä.
Ongelma ilmenee myöhään
Viisikymmentäkolme prosenttia BCG:n kyselyyn vastanneista johtajista toi esiin junioritason osaajien hitaamman kehittymisen.
Analyyttinen perustyö on perinteisesti se, jossa harkintakyky rakentuu. Tutkiminen, ensimmäiset luonnokset, virheenkorjaus, ongelman pilkkominen osiin ja sen selvittäminen, missä meni väärin. Kukaan ei nauti näistä toistoista, mutta jokainen tarvitsee niitä.
Organisaatiot antavat tämän työn ensimmäisenä tekoälyn tehtäväksi. Ja ihmisiltä, jotka ennen oppivat sen kautta, odotetaan nyt suoriutumista ilman sitä, joissakin tapauksissa tasolla, jota yksi BCG:n vastaajista kuvasi 5–10 vuotta työskennelleen työntekijän suoritukseksi.
Tähän liittyy kuitenkin mittaamiseen liittyvä ongelma. Kaikki edellä mainittu havaitsee heikkenemisen suhteessa lähtötasoon. Kokeneiden ihmisten kohdalla se toimii, koska lähtötaso on olemassa ja sen muutosta voi seurata.
Viime vuonna palkatussa henkilössä lähtötasoa ei ole. Kyvykkyys ei koskaan muodostunut, ja sen puuttuminen näyttää samalta kuin normaali uran alkuvaiheen suoriutuminen siihen asti, kunnes henkilön täytyy tehdä päätös ilman tukea. Et mittaa rapautumista. Mittaat jotakin, joka jäi syntymättä, eikä nykyisiä mittareita ole rakennettu sitä varten.
Tämä tarkoittaa, että junioritason ryhmässä kustannukset ovat suurimmat ja ongelma tulee esiin myöhäisimpänä.
Miksi järjestyksellä on väliä
Työn uudelleensuunnittelu on seuraavien kahden vuosineljänneksen hanke monissa organisaatioissa, joiden kanssa keskustelen. Tehtäväluettelot, agenttikokeilut ja organisaatiokaaviot, jotka on laadittu sen perusteella, mitä koneet hoitavat ja mitä ihmiset säilyttävät tehtävinään.
Nämä päätökset jähmettyvät. Ne määrittävät, mitä kyvykkyyksiä arvostetaan, mitä työntekijänne todennäköisesti harjoittelevat vielä vuosia niiden jälkeen ja mitkä jäävät pysyvästi pois käytöstä.
Jos päätökset tehdään mittaamattoman heikkenemisen päälle, heikkeneminen rakennetaan osaksi rakennetta. Päättäisitte, mitä ihmisten pitäisi jatkaa tekemistä, vaikka teillä ei olisi rehellistä kuvaa siitä, mitä ihmiset yhä osaavat tehdä ja missä heidän taitonsa ovat rapautuneet.
En usko, että mittarin täytyy olla täydellinen ennen aloittamista. Tarkoituksellisesti syötettyjen virheiden testi voitaisiin toteuttaa useimmissa toiminnoissa kuukauden sisällä. CNIL:n lähestymistapa edellyttää keskustelua esihenkilöiden kanssa ja yhtä kohtaa arviointipohjaan.
Ennen kuin hyväksyisin uudelleensuunnittelun, haluaisin vastauksen yhteen kysymykseen ja sitä tukevat todisteet.
Jos poistaisitte tekoälyn käytöstä koko tiimissänne huomenna, olisivatko työntekijänne parempia kuin ennen tekoälyn käyttöönottoa vai huonompia?
