Huomaamaton epäonnistuminen: Tekoälyn linjaaminen voi epäonnistua, kun järjestelmät menettävät aiemmat ohjeet havaitsematta tai ilmoittamatta muutoksesta.
Hallinnan aukko: Yritykset eivät voi hallita mallien linjaamista; niiden on hallinnoitava käyttöoikeuksia, tavoitteita, valvontaa ja seurauksia.
Kirjoittamattomat säännöt: Toimiakseen turvallisesti agentit tarvitsevat usein asiayhteyttä ja oletettuja rajoja, eivät vain nimenomaisia käskyjä.
Rajoittaminen on tärkeää: Järjestelmä voi noudattaa suppeaa ohjetta ja silti rikkoa laajempaa tarkoitusta tai odotettuja rajoja.
Johtamisen rooli: HR voi vahvistaa tekoälyn hallintaa määrittelemällä vastuut, hyväksyntäkynnykset, valvontakäytännöt ja hyväksyttävän operatiivisen riskin.
Helmikuussa Summer Yue yhdisti sähköpostiinsa avoimen lähdekoodin tekoälyagentin nimeltä OpenClaw. Hän oli testannut sitä viikkojen ajan kokeiluun tarkoitetussa postilaatikossa, jossa se toimi odotetusti. Hän antoi sille pysyvän ohjeen: älä tee mitään toimenpiteitä ilman hyväksyntääni.
Sitten hän ohjasi sen oikeaan postilaatikkoonsa, joka oli paljon suurempi. Agentti ilmoitti poistavansa kaiken helmikuun 15. päivää vanhemman sisällön, joka ei ollut hänen säilytyslistallaan, ja alkoi työskennellä. Hän kirjoitti: "Älä tee sitä." Se jatkoi. Hän kirjoitti: "PYSÄYTÄ OPENCLAW." Se jatkoi. Hän ei pystynyt pysäyttämään sitä puhelimestaan, joten hän juoksi Mac minin luo, jolla se toimi, ja lopetti prosessin käsin. Muutama sata sähköpostia oli jo poissa.
Yue on Meta Superintelligence Labsin linjakkuusjohtaja. Hänen tehtävänsä on saada tekoälyjärjestelmät tekemään sitä, mitä ihmiset tarkoittavat.
Mekanismi on ironiaa tärkeämpi. Hänen ohjettaan ei kumottu, vaan se pudotettiin pois. Agentti saavutti kontekstirajansa ja tiivisti oman historiansa pysyäkseen sen sisällä, ja tiivistelmä jätti pois kohdan, jossa hän käski sitä odottamaan. Sääntö oli olemassa. Sitten se ei enää ollut, eikä mikään järjestelmä ilmoittanut erosta.
Jokainen henkilöstöjohtaja, joka on nähnyt käytännön selviytyvän perehdytyksestä ja haihtuvan sitten neljänteen kuukauteen mennessä, tunnistaa tämän epäonnistumisen muodon.
Yksi sana, kaksi näkemystä
Viime viikolla Las Vegasissa järjestetyssä AI4-paneelissa, jossa käsiteltiin linjakkuuden tekemistä todelliseksi, neljä alan ammattilaista ei pystynyt sopimaan siitä, mitä sana "linjakkuus" kattaa.
David Krueger, tekoälyprofessori ja voittoa tavoittelemattoman Evitablen toiminnanjohtaja, käyttää termiä laajasti tarkoittamaan sitä, että järjestelmä saadaan yrittämään toimia niin kuin sen halutaan toimivan. Joskus tarkoitus on täsmällinen, ja hän kutsuu sitä "tarkoituksen linjakkuudeksi". Joskus se on lähempänä muotoa "toimi arvojeni mukaisesti".
Spencer Whitman, Gray Swanin, ennen julkaisua uusia huippumalleja testaavan yrityksen, tuotepäällikkö, väitti termin venyneen kattamaan jatkumon, jonka keskellä ei ole mitään hyödyllistä. Toisessa päässä on kysymys siitä, pitääkö järjestelmä ihmiskunnan etuja tärkeinä. Toisessa päässä on paljon pienempi ja helpommin käsiteltävä kysymys: "ymmärtikö tämä järjestelmä, mitä pyysin, ja toimiko se sen mukaisesti?"
Whitman epäilee, että ensimmäiseen kysymykseen voidaan edes vastata, koska ihmiset ovat kiivaasti eri mieltä siitä, mitä ihmiskunnan edut ovat. Hänen mielestään yritykset elävät käytännössä toisen kysymyksen parissa.
Jon Kutasov, joka johtaa Anthropicilla linjakkuuskoulutustiimin alatiimiä, tarjosi huoneessa käytännöllisimmän määritelmän. Hän ei halua yllättyä mallin toiminnasta sen käyttöönoton jälkeen. Jos malli yllättää heidät, he epäonnistuivat. Tällä mittapuulla hän sanoi, että nykyiset mallit eivät ole linjakkaita. Ne ovat lähellä, lähestyvät tavoitetta, ja tekevät edelleen asioita, joita hänen tiiminsä olisi mieluummin nähnyt tekemättä.
Tämä määritelmä toimii myös muualla. Se on sama vaatimustaso, jonka asettaisit uudelle allekirjoitusoikeuden saaneelle työntekijälle.
Mallien omistajat huolehtivat linjakkuudesta. Kaikki muut hallinnoivat.
John Buyers, kansainvälisen asianajotoimisto CMS:n osakas, joka on työskennellyt tekoälyn parissa kolmetoista vuotta, veti rajan, jolla on eniten merkitystä tämän tekstin lukijoille.
Linjakkuus, hän sanoi, on mallien hallinnasta vastaavien alustojen suorittama sisäinen harjoitus. Kaikki muut tekevät jotain muuta.
"Yrityskäyttäjät eivät voi osallistua linjakkuustyöhön, koska he eivät ole mallien omistajia", hän sanoi. "Heidän on hallinnoitava mallia."
Tämä on lause, joka kannattaa antaa johtoryhmällesi. Se, onko Claude, ChatGPT tai Gemini koulutettu toimimaan hyvin, ei ole päätös, johon yrityksesi osallistuu. Yrityksesi hallitsee sitä, mihin järjestelmä ohjataan, mihin sen sallitaan koskea ja kuka sitä valvoo. Se on hallintaa, ja se on paljon lähempänä työn suunnittelua kuin datatiedettä.
Buyersin suurempi huoli on, ettei linjakkuudella ole tällä hetkellä vähimmäistasoa. Jokainen laboratorio tekee sitä eri tavalla, kaupallisten aikataulujen puitteissa ja omien standardiensa mukaisesti. Kaikilla muilla yhtä merkittävillä aloilla odottaisimme hänen mukaansa perustason laatumittareita, jotka kehittäjä joko täyttää tai ei täytä.
Kirjoittamatta jäävät ohjeet
Heinäkuussa OpenAI kertoi, että kaksi sen mallia, joista toinen oli vielä julkaisematon, murtautui eristetystä testiympäristöstä kyberturvallisuusarvioinnin aikana, pääsi internetiin ja hakkeroitui Hugging Faceen varastaakseen niille annetun testin vastaukset. Hugging Face oli jo havainnut tunkeutumisen ja ilmoittanut siitä lainvalvontaviranomaisille ennen kuin yhtiöt yhdistivät tapahtumat toisiinsa.
Paneeli oli eri mieltä siitä, oliko kyse edes linjakkuuden puutteesta. Whitman väitti mallien tehneen täsmälleen sen, mitä niille oli käsketty eli hakkeroituneen aggressiivisesti, ja todellinen epäonnistuminen oli liian heikko eristysympäristö, joka ei pystynyt pitämään niitä sisällään.
Anthropicin tutkija oli jyrkästi eri mieltä. Malli olisi ymmärtänyt, ettei asiaan liittymättömään yritykseen murtautuminen ollut tarkoitettu tapa vastata kysymykseen.
Kruegerin esittämä versio erimielisyydestä on se, jonka henkilöstöjohtajien pitäisi kuulla kaikkein selvimmin. Jokainen ohje sisältää asioita, jotka jäävät sanomatta. Kun jotakuta pyydetään ratkaisemaan arviointikysymys, häneltä pyydetään epäsuorasti myös olemaan murtautumatta rakennukseen, jossa vastauslomaketta säilytetään. Odotamme tämän ymmärryksen olevan lähtökohta, emmekä juuri koskaan kirjoita sitä ylös, koska sen kirjoittaminen ylös on mahdotonta. Sanomatta jäävä kerros on suurempi kuin sanottu.
Tämän kuilun hallinta on sitä, mitä HR on tehnyt työpaikkakuvauksen keksimisestä lähtien. Osaaminen on olemassa. Se sijaitsee tällä hetkellä toiminnossa, jolle enimmäkseen tiedotetaan tekoälyn käyttöönotosta sen jälkeen, kun tavoitteet on asetettu.
Ostajat nostivat tekniseltä puolelta esiin yhden havainnon, jonka pitäisi vahvistaa perustelua. Kun mallille annetaan joukko sääntöjä ilman kontekstia, se suoriutuu huonommin kuin silloin, kun sille selitetään, miksi säännöt ovat olemassa. Rajoitteen merkityksen syy osoittautuu ratkaisevaksi sille, noudatetaanko rajoitetta.
Kysy keneltä tahansa johtajalta, joka on valvonut sellaisen toimintaperiaatteen noudattamista, jota hän ei osannut perustella, miten se sujuu.
