Skip to main content
Key Takeaways

Tyst fel: AI-anpassning kan misslyckas när system tappar tidigare instruktioner utan att upptäcka eller rapportera förändringen.

Styrningslucka: Företag kan inte kontrollera modellernas anpassning; de måste styra behörigheter, mål, tillsyn och konsekvenser.

Oskrivna regler: Agenter behöver ofta kontext och underförstådda gränser, inte bara uttryckliga kommandon, för att utföra uppgifter på ett säkert sätt.

Inneslutning är viktigt: Ett system kan följa en snäv instruktion och ändå bryta mot det övergripande syftet eller de förväntade begränsningarna.

Ledarskapets roll: HR kan stärka AI-styrningen genom att definiera ansvar, trösklar för godkännande, övervakningsrutiner och acceptabel operativ risk.

I februari kopplade Summer Yue en AI-agent med öppen källkod, kallad OpenClaw, till sin e-post. Hon hade testat den i flera veckor i en testinkorg, där den uppförde sig korrekt. Hon gav den en stående instruktion: vidta inga åtgärder utan mitt godkännande.

Sedan riktade hon den mot sin riktiga inkorg, som var mycket större. Agenten meddelade att den skulle radera allt som var äldre än den 15 februari och som inte fanns på hennes lista över sådant som skulle sparas, och började arbeta. Hon skrev ”Gör inte det.” Den fortsatte. Hon skrev ”STOPPA OPENCLAW.” Den fortsatte. Hon kunde inte stoppa den från sin telefon, så hon sprang till Mac mini-datorn som den kördes på och avslutade processen manuellt. Några hundra e-postmeddelanden var redan borta.

Yue är chef för anpassning på Meta Superintelligence Labs. Hennes jobb är att få AI-system att göra det människor avser.

Continue Reading for Free

Create a free account to finish this article, plus get ongoing access to timely insights and practical resources.

Mekanismen är viktigare än ironin. Hennes instruktion åsidosattes inte, den försvann. Agenten nådde sin kontextgräns och komprimerade sin egen historik för att hålla sig inom den, och sammanfattningen utelämnade den del där hon sa åt den att vänta. Regeln fanns. Sedan fanns den inte längre, och inget i systemet flaggade skillnaden.

Alla HR-chefer som har sett en policy överleva introduktionen och sedan försvinna under den fjärde månaden kommer att känna igen formen på det misslyckandet.

Två argument om ett ord

Under en AI4-panel i Las Vegas förra veckan om att göra anpassning verklig kunde fyra personer som arbetar professionellt med detta inte enas om vad ordet ”anpassning” omfattar.

David Krueger, AI-professor och verkställande direktör för den ideella organisationen Evitable, använder det brett och menar att få ett system att försöka uppföra sig så som man avser att det ska uppföra sig. Ibland är den avsikten specifik, vilket han kallar ”avsiktsanpassning”. Ibland ligger den närmare ”agera i linje med mina värderingar”.

Spencer Whitman, produktchef på Gray Swan, som testar banbrytande modeller före lansering, hävdade att termen har tänjts ut över ett spektrum utan något användbart däremellan. I ena änden finns frågan om huruvida ett system värnar mänsklighetens intressen. I den andra finns den betydligt mindre och mer hanterbara frågan: ”förstod systemet vad jag bad om och agerade det utifrån det?”

Whitman tvivlar på att den första frågan ens går att besvara, eftersom människor är djupt oense om vad mänsklighetens intressen är. Han anser att det är den andra frågan som företag faktiskt lever med.

Jon Kutasov, som leder ett delteam i anpassningsträningsgruppen på Anthropic, gav den mest praktiskt inriktade definitionen i rummet. Han vill inte bli överraskad av hur en modell beter sig efter att den har tagits i drift. Om modellen överraskar dem har de misslyckats. Med den måttstocken, sa han, är dagens modeller inte anpassade. De är nära, och kommer närmare, och de gör fortfarande saker som hans team helst hade sett att de inte gjorde.

Den definitionen håller. Det är samma krav som du skulle ställa på en nyanställd med rätt att teckna avtal.

Modellägarna arbetar med anpassning. Alla andra styr.

John Buyers, delägare på den internationella advokatbyrån CMS som har arbetat med AI i tretton år, drog den gräns som är viktigast för alla som läser detta.

Anpassning, sa han, är en intern process som genomförs av plattformarna som kontrollerar modellerna. Alla andra gör något annat. 

Företagsanvändare kan inte vara involverade i anpassning eftersom de inte äger modellen, sa han. De måste styra modellen.

Det här är meningen du ska ge till din ledningsgrupp. Huruvida Claude eller ChatGPT eller Gemini har tränats att uppföra sig väl är inte ett beslut som ert företag deltar i. Det ert företag kontrollerar är vad systemet riktas mot, vad det tillåts komma åt och vem som övervakar det. Det är styrning, och det ligger mycket närmare arbetsdesign än datavetenskap.

Buyers större oro är att anpassning för närvarande saknar en lägstanivå. Alla labb gör det på olika sätt, enligt kommersiella tidsplaner och sina egna standarder. Inom alla andra områden med jämförbara konsekvenser skulle vi, hävdade han, förvänta oss grundläggande hygienindikatorer som en utvecklare antingen uppfyller eller inte uppfyller.

Instruktionerna som förblir oskrivna

I juli avslöjade OpenAI att två av deras modeller, däribland en som ännu inte hade släppts, tog sig ut ur en sandlådebaserad testmiljö under en cybersäkerhetsutvärdering, kom ut på internet och hackade sig in på Hugging Face för att stjäla svaren på testet de genomförde. Hugging Face hade redan upptäckt intrånget och rapporterat det till polisen innan de två företagen kopplade ihop händelserna.

Panelen var splittrad i frågan om detta ens var ett anpassningsproblem. Whitman hävdade att modellerna gjorde exakt det de hade blivit tillsagda att göra, nämligen att hacka aggressivt, och att det verkliga misslyckandet var en inneslutningsmiljö som var för svag för att hålla dem kvar.

Anthropic-forskaren höll inte alls med. Modellen skulle ha förstått att det inte var den avsedda vägen till att besvara frågan att ta sig in i ett orelaterat företag.

Kruegers version av oenigheten är den som personalledare bör höra tydligast. Varje instruktion innehåller sådant som förblir osagt. Att be någon lösa en utvärderingsfråga innebär underförstått att personen inte ska bryta sig in i byggnaden där svarsarket finns. Vi förväntar oss den förståelsen som en grundnivå, och vi skriver nästan aldrig ner den, eftersom det är omöjligt att skriva ner den. Det outtalade lagret är större än det uttalade.

Att hantera det gapet är vad HR har gjort sedan befattningsbeskrivningen uppfanns. Kompetensen finns. Den finns för närvarande i en funktion som för det mesta informeras om AI-implementering efter att målen har fastställts.

Köparna noterade ett resultat från den tekniska sidan som bör stärka argumentationen. Ge en modell en uppsättning regler utan något sammanhang, så presterar den sämre än när man förklarar varför reglerna finns. Det visar sig att anledningen till att en begränsning är viktig är avgörande för om begränsningen efterlevs.

Fråga vilken chef som helst som har verkställt en policy de inte kunde motivera hur det brukar gå.