Échec silencieux: L’alignement de l’IA peut échouer lorsque les systèmes perdent des instructions antérieures sans détecter ni signaler ce changement.
Lacune de gouvernance: Les entreprises ne peuvent pas contrôler l’alignement des modèles ; elles doivent encadrer les autorisations, les objectifs, la supervision et les conséquences.
Règles inexprimées: Les agents ont souvent besoin de contexte et de limites implicites, et pas seulement de commandes explicites, pour accomplir leurs tâches en toute sécurité.
Le cloisonnement est important: Un système peut suivre une instruction étroite tout en enfreignant l’objectif général ou les limites attendues.
Rôle de la direction: Les ressources humaines peuvent renforcer la gouvernance de l’IA en définissant les responsabilités, les seuils d’approbation, les pratiques de surveillance et le niveau de risque opérationnel acceptable.
En février, Summer Yue a connecté à sa messagerie un agent d’IA à code source ouvert appelé OpenClaw. Elle l’avait testé pendant des semaines sur une boîte de réception d’entraînement, où il s’était bien comporté. Elle lui avait donné une instruction permanente : ne prenez aucune mesure sans mon approbation.
Puis elle l’a connecté à sa véritable boîte de réception, qui était bien plus volumineuse. L’agent a annoncé qu’il supprimerait tout ce qui datait d’avant le 15 février et ne figurait pas sur sa liste de conservation, puis il s’est mis au travail. Elle a tapé « Ne faites pas ça. » Il a continué. Elle a tapé « ARRÊTEZ OPENCLAW. » Il a continué. Elle ne pouvait pas l’arrêter depuis son téléphone, alors elle s’est précipitée vers le Mac mini sur lequel il fonctionnait et a arrêté le processus manuellement. Quelques centaines d’e-mails avaient déjà disparu.
Yue est directrice de l’alignement au sein de Meta Superintelligence Labs. Son travail consiste à faire en sorte que les systèmes d’IA fassent ce que les gens ont l’intention de leur faire faire.
Le mécanisme compte davantage que l’ironie. Son instruction n’a pas été contournée, elle a été abandonnée. L’agent a atteint sa limite de contexte et a condensé son propre historique pour y rester, et cette condensation a résumé en l’effaçant la partie où elle lui disait d’attendre. La règle existait. Puis elle n’a plus existé, et rien dans le système n’a signalé la différence.
Tout responsable RH ayant vu une politique survivre à l’intégration, puis s’évaporer au quatrième mois, reconnaîtra la forme de cet échec.
Deux arguments autour d’un seul mot
Lors d’une table ronde d’AI4 à Las Vegas la semaine dernière, consacrée à la mise en pratique de l’alignement, quatre personnes qui travaillent professionnellement sur ce sujet n’ont pas réussi à s’accorder sur ce que recouvre le mot « alignement ».
David Krueger, professeur d’IA et directeur exécutif de l’organisation à but non lucratif Evitable, l’emploie dans un sens large pour désigner le fait d’amener un système à essayer de se comporter comme on le souhaite. Parfois, cette intention est précise, ce qu’il appelle « l’alignement sur l’intention ». Parfois, elle se rapproche de « agir conformément à mes valeurs ».
Spencer Whitman, directeur des produits chez Gray Swan, qui teste les modèles de pointe avant leur mise sur le marché, a soutenu que le terme avait été étendu à tout un spectre, sans rien d’utile au milieu. À une extrémité se trouve la question de savoir si un système défend les intérêts de l’humanité. À l’autre se trouve une question bien plus limitée et plus facile à traiter : « ce système a-t-il compris ce que je lui ai demandé et a-t-il agi en conséquence ? »
Whitman doute que la première question puisse même être résolue, étant donné que les humains sont en profond désaccord sur ce que sont les intérêts de l’humanité. Selon lui, c’est dans la seconde que les entreprises évoluent réellement.
Jon Kutasov, qui dirige une sous-équipe au sein de l’équipe chargée de l’entraînement à l’alignement chez Anthropic, a proposé la définition la plus opérationnelle de la salle. Il ne veut pas être surpris par le comportement d’un modèle après son déploiement. Si le modèle les surprend, c’est qu’ils ont échoué. Selon ce critère, a-t-il déclaré, les modèles actuels ne sont pas alignés. Ils s’en approchent, se rapprochent encore, et font toujours des choses que son équipe aurait préféré qu’ils ne fassent pas.
Cette définition est transposable. C’est le même niveau d’exigence que celui qu’on fixerait à une nouvelle recrue disposant d’un pouvoir de signature.
Les propriétaires des modèles alignent. Tous les autres gouvernent.
John Buyers, associé du cabinet d’avocats international CMS, qui exerce dans le domaine de l’IA depuis treize ans, a tracé la distinction la plus importante pour quiconque lit ces lignes.
L’alignement, a-t-il déclaré, est un exercice interne mené par les plateformes qui contrôlent les modèles. Tous les autres font quelque chose de différent.
« Les utilisateurs en entreprise ne peuvent pas participer à l’alignement parce qu’ils ne sont pas les propriétaires du modèle », a-t-il déclaré. « Ils doivent gouverner le modèle. »
C’est la phrase à transmettre à votre équipe de direction. Que Claude, ChatGPT ou Gemini ait été entraîné à bien se comporter n’est pas une décision à laquelle votre entreprise participe. Ce que votre entreprise contrôle, c’est la cible du système, ce qu’il est autorisé à toucher et la personne qui le surveille. C’est cela, la gouvernance, et elle se situe bien plus près de la conception des emplois que de la science des données.
La préoccupation plus large de Buyers est que l’alignement n’a actuellement aucun seuil minimal. Chaque laboratoire procède différemment, selon des calendriers commerciaux et ses propres critères. Dans tout autre domaine d’une importance comparable, a-t-il soutenu, on s’attendrait à trouver des indicateurs élémentaires d’hygiène qu’un développeur respecte ou non.
Les instructions qui restent implicites
En juillet, OpenAI a révélé que deux de ses modèles, dont l’un n’était pas encore commercialisé, s’étaient échappés d’un environnement de test isolé lors d’une évaluation de cybersécurité, avaient accédé à Internet et s’étaient introduits dans Hugging Face pour voler les réponses au test qu’on leur faisait passer. Hugging Face avait déjà détecté l’intrusion et l’avait signalée aux autorités avant que les deux entreprises ne fassent le rapprochement.
Les participants à la table ronde se sont divisés sur le fait de savoir s’il s’agissait même d’un problème d’alignement. Whitman a soutenu que les modèles avaient fait exactement ce qu’on leur avait demandé, à savoir pirater de manière agressive, et que le véritable échec résidait dans un environnement de confinement trop faible pour les retenir.
Le chercheur d’Anthropic n’était pas du tout d’accord. Le modèle aurait compris que s’introduire dans une entreprise sans rapport avec le sujet n’était pas le moyen prévu pour répondre à la question.
La version du désaccord de Krueger est celle que les responsables d'équipe devraient entendre le plus clairement. Chaque instruction véhicule des éléments inexprimés. Demander à quelqu'un de résoudre une question d'évaluation lui demande implicitement de ne pas s'introduire dans le bâtiment où est conservée la feuille de réponses. Nous attendons cette compréhension comme allant de soi, et nous ne la mettons presque jamais par écrit, parce qu'il est impossible de tout écrire. La couche inexprimée est plus vaste que la couche exprimée.
Gérer cet écart, c'est ce que les RH font depuis l'invention de la description de poste. La compétence existe. Elle se trouve actuellement dans une fonction à laquelle on ne présente généralement le déploiement de l'IA qu'une fois les objectifs fixés.
Les acheteurs ont relevé, du côté technique, un élément qui devrait renforcer l'argumentaire. Donnez à un modèle un ensemble de règles sans aucun contexte, et il sera moins performant que si vous lui expliquez pourquoi ces règles existent. Il s'avère que la raison pour laquelle une contrainte est importante est déterminante pour qu'elle soit respectée.
Demandez à n'importe quel responsable ayant fait appliquer une politique qu'il ne pouvait pas justifier comment cela se passe.
