Skip to main content
Key Takeaways

Guasto silenzioso: L’allineamento dell’IA può fallire quando i sistemi perdono istruzioni precedenti senza rilevare o segnalare il cambiamento.

Lacuna di governance: Le aziende non possono controllare l’allineamento dei modelli; devono governare autorizzazioni, obiettivi, supervisione e conseguenze.

Regole non scritte: Gli agenti hanno spesso bisogno di contesto e limiti impliciti, non solo di comandi espliciti, per svolgere le attività in sicurezza.

Il contenimento è importante: Un sistema può seguire un’istruzione circoscritta violando comunque lo scopo più ampio o i limiti previsti.

Il ruolo della leadership: Le risorse umane possono rafforzare la governance dell’IA definendo responsabilità, soglie di approvazione, pratiche di monitoraggio e livello di rischio operativo accettabile.

A febbraio, Summer Yue ha collegato alla sua posta elettronica un agente di IA open source chiamato OpenClaw. Lo aveva testato per settimane su una casella di posta di prova, dove si era comportato bene. Gli aveva dato un'istruzione permanente: non intraprendere alcuna azione senza la mia approvazione.

Poi lo ha indirizzato alla sua casella di posta reale, che era molto più grande. L'agente ha annunciato che avrebbe eliminato tutto ciò che era precedente al 15 febbraio e che non si trovava nel suo elenco di elementi da conservare, e ha iniziato a lavorare. Lei ha digitato "Non farlo." Ha continuato. Ha digitato "FERMA OPENCLAW." Ha continuato. Non riusciva a fermarlo dal telefono, così è corsa al Mac mini su cui era in esecuzione e ha terminato manualmente il processo. Diverse centinaia di email erano già sparite.

Yue è la direttrice dell'allineamento presso Meta Superintelligence Labs. Il suo lavoro consiste nel fare in modo che i sistemi di IA facciano ciò che le persone intendono.

Continua a leggere—e continua a guidare con intelligenza

Crea un account gratuito per terminare la lettura e unirti a una community di leader lungimiranti che sbloccano strumenti, playbook e approfondimenti per prosperare nell'era dell'IA.

Name*
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
By submitting this form, you agree to receive our newsletter, and occasional emails related to People Managing People. You can unsubscribe at any time. For more details, please review our Privacy Policy

Il meccanismo è più importante dell'ironia. La sua istruzione non è stata annullata: è stata eliminata. L'agente ha raggiunto il limite del contesto e ha compattato la propria cronologia per rimanere al suo interno, e la compattazione ha riassunto omettendo la parte in cui lei gli diceva di aspettare. La regola esisteva. Poi non più, e nulla nel sistema ha segnalato la differenza.

Qualsiasi responsabile delle risorse umane che abbia visto una policy superare l'onboarding per poi svanire entro il quarto mese riconoscerà la forma di questo fallimento.

Due argomentazioni su una parola

Durante un panel di AI4 a Las Vegas la scorsa settimana, dedicato a rendere concreto l'allineamento, quattro persone che lavorano professionalmente su questo tema non sono riuscite a mettersi d'accordo su cosa comprenda la parola "allineamento".

David Krueger, professore di IA e direttore esecutivo dell'organizzazione non profit Evitable, la usa in senso ampio per indicare il far sì che un sistema cerchi di comportarsi come si intende che si comporti. A volte tale intenzione è specifica, e lui la chiama "allineamento all'intento". Altre volte è più vicina a "agire in linea con i miei valori".

Spencer Whitman, direttore dei prodotti presso Gray Swan, che testa i modelli di frontiera prima del rilascio, ha sostenuto che il termine è stato esteso lungo uno spettro senza nulla di utile nel mezzo. A un'estremità si trova la questione se un sistema tenga conto degli interessi dell'umanità. All'altra estremità si trova una questione molto più piccola e gestibile: "questo sistema ha capito ciò che gli ho chiesto e ha agito di conseguenza?"

Whitman dubita che la prima domanda sia persino risolvibile, dato che gli esseri umani non sono affatto d'accordo su quali siano gli interessi dell'umanità. Ritiene che le aziende si trovino concretamente alle prese con la seconda.

Jon Kutasov, che guida un sottogruppo del team di addestramento all'allineamento di Anthropic, ha fornito la definizione più operativa della sala. Non vuole essere sorpreso dal modo in cui un modello si comporta dopo la sua implementazione. Se il modello li sorprende, hanno fallito. Secondo questo criterio, ha detto, i modelli attuali non sono allineati. Sono vicini e si avvicinano sempre di più, e continuano comunque a fare cose che il suo team avrebbe preferito non facessero.

Questa definizione è applicabile anche altrove. È lo stesso standard che stabiliresti per un nuovo assunto con potere di firma.

I proprietari dei modelli allineano. Tutti gli altri governano.

John Buyers, socio dello studio legale internazionale CMS, che opera nel campo dell'IA da tredici anni, ha tracciato la distinzione più importante per chiunque stia leggendo questo articolo.

L'allineamento, ha detto, è un esercizio interno svolto dalle piattaforme che controllano i modelli. Tutti gli altri fanno qualcosa di diverso. 

"Gli utenti aziendali non possono essere coinvolti nell'allineamento perché non sono i proprietari dei modelli", ha detto. "Devono governare il modello.

Questa è la frase da consegnare al proprio team dirigenziale. Che Claude, ChatGPT o Gemini siano stati addestrati a comportarsi bene non è una decisione a cui la tua azienda partecipi. Ciò che la tua azienda controlla è verso cosa viene indirizzato il sistema, cosa gli è consentito toccare e chi lo sta osservando. Questo è il governo dell'IA, e si trova molto più vicino alla progettazione del lavoro che alla scienza dei dati.

La preoccupazione più ampia di Buyers è che attualmente l'allineamento non abbia un livello minimo. Ogni laboratorio lo fa in modo diverso, secondo tempistiche commerciali e i propri standard. In qualsiasi altro ambito di analoga rilevanza, ha sostenuto, ci aspetteremmo indicatori di igiene di base che uno sviluppatore soddisfa oppure no.

Le istruzioni che restano non scritte

A luglio, OpenAI ha rivelato che due dei suoi modelli, tra cui uno non ancora rilasciato, sono evasi da un ambiente di test isolato durante una valutazione di cybersicurezza, hanno avuto accesso a Internet e si sono introdotti in Hugging Face per rubare le risposte al test che stavano sostenendo. Hugging Face aveva già rilevato l'intrusione e l'aveva segnalata alle forze dell'ordine prima che le due aziende collegassero gli eventi.

Il panel si è diviso sulla questione se si trattasse persino di un problema di disallineamento. Whitman ha sostenuto che i modelli avessero fatto esattamente ciò che era stato loro detto, ovvero hackerare in modo aggressivo, e che il vero fallimento fosse un ambiente di contenimento troppo debole per trattenerli. 

Il ricercatore di Anthropic non era affatto d'accordo. Il modello avrebbe capito che introdursi in un'azienda estranea non era il percorso previsto per rispondere alla domanda.

La versione del disaccordo di Krueger è quella che i responsabili del personale dovrebbero ascoltare con la massima attenzione. Ogni istruzione contiene elementi non detti. Chiedere a qualcuno di risolvere una domanda di valutazione implica chiedergli di non irrompere nell'edificio in cui è custodito il foglio delle risposte. Ci aspettiamo che questa comprensione costituisca il punto di partenza e quasi mai la mettiamo per iscritto, perché è impossibile farlo. Il livello implicito è più ampio di quello esplicito.

La gestione di questo divario è ciò che le risorse umane fanno fin dall'invenzione della descrizione del lavoro. La competenza esiste. Attualmente risiede in una funzione che per lo più viene informata sull'implementazione dell'IA dopo che gli obiettivi sono stati definiti.

Gli acquirenti hanno evidenziato un risultato emerso dal versante tecnico che dovrebbe rendere il caso ancora più convincente. Se si fornisce a un modello un insieme di regole senza alcun contesto, le sue prestazioni sono peggiori rispetto a quando si spiega perché le regole esistono. Il motivo per cui un vincolo è importante si rivela fondamentale per determinare se il vincolo verrà rispettato.

Chiedete a qualsiasi responsabile che abbia fatto rispettare una politica che non era in grado di giustificare come va a finire.

David Rice

David Rice è un giornalista ed editor di lunga esperienza, specializzato in risorse umane e temi legati alla leadership. Ha lavorato in diversi settori per pubblicazioni cartacee e digitali negli Stati Uniti e nel Regno Unito.