Skip to main content
Key Takeaways

Fallo silencioso: La alineación de la IA puede fallar cuando los sistemas pierden instrucciones anteriores sin detectar ni informar del cambio.

Brecha de gobernanza: Las empresas no pueden controlar la alineación del modelo; deben gobernar los permisos, los objetivos, la supervisión y las consecuencias.

Reglas no escritas: Los agentes suelen necesitar contexto y límites implícitos, no solo órdenes explícitas, para realizar tareas de forma segura.

La contención importa: Un sistema puede seguir una instrucción limitada y, aun así, infringir el propósito más amplio o los límites esperados.

El papel del liderazgo: Recursos Humanos puede reforzar la gobernanza de la IA definiendo responsabilidades, umbrales de aprobación, prácticas de supervisión y niveles aceptables de riesgo operativo.

En febrero, Summer Yue conectó a su correo electrónico un agente de IA de código abierto llamado OpenClaw. Lo había probado durante semanas en una bandeja de entrada de prueba, donde se comportaba correctamente. Le dio una instrucción permanente: no tomes ninguna medida sin mi aprobación.

Luego lo dirigió a su bandeja de entrada real, que era mucho más grande. El agente anunció que eliminaría todo lo anterior al 15 de febrero que no estuviera en su lista de conservación, y comenzó a trabajar. Ella escribió «No hagas eso». Continuó. Escribió «DETÉN OPENCLAW». Continuó. No pudo detenerlo desde su teléfono, así que corrió hasta el Mac mini en el que se estaba ejecutando y terminó el proceso manualmente. Ya habían desaparecido unos cientos de correos electrónicos.

Yue es la directora de alineación en Meta Superintelligence Labs. Su trabajo consiste en lograr que los sistemas de IA hagan lo que las personas pretenden.

Sigue leyendo—y sigue liderando de manera más inteligente

Crea una cuenta gratuita para terminar este artículo y unirte a una comunidad de líderes visionarios que están desbloqueando herramientas, guías prácticas e ideas para prosperar en la era de la IA.

Name*
Este campo está oculto cuando se visualiza el formulario
Este campo está oculto cuando se visualiza el formulario
Este campo está oculto cuando se visualiza el formulario
Este campo está oculto cuando se visualiza el formulario
Este campo está oculto cuando se visualiza el formulario
By submitting this form, you agree to receive our newsletter, and occasional emails related to People Managing People. You can unsubscribe at any time. For more details, please review our Privacy Policy

El mecanismo importa más que la ironía. Su instrucción no fue anulada: fue descartada. El agente alcanzó el límite de su contexto y condensó su propio historial para mantenerse dentro de él; al hacerlo, resumió y eliminó la parte en la que ella le decía que esperara. La regla existía. Luego dejó de existir, y nada en el sistema señaló la diferencia.

Cualquier líder de RR. HH. que haya visto cómo una política sobrevive a la incorporación y luego se evapora para el cuarto mes reconocerá la forma de ese fallo.

Dos argumentos sobre una palabra

En un panel de AI4 celebrado la semana pasada en Las Vegas sobre cómo hacer realidad la alineación, cuatro personas que trabajan profesionalmente en este campo no lograron ponerse de acuerdo sobre qué abarca la palabra «alineación».

David Krueger, profesor de IA y director ejecutivo de la organización sin ánimo de lucro Evitable, la utiliza en sentido amplio para referirse a lograr que un sistema intente comportarse como se pretende que se comporte. A veces esa intención es específica, lo que él denomina «alineación con la intención». A veces se acerca más a «actuar de acuerdo con mis valores».

Spencer Whitman, director de producto de Gray Swan, que prueba modelos de vanguardia antes de su lanzamiento, sostuvo que el término se ha extendido a lo largo de un espectro sin nada útil en el medio. En un extremo está la cuestión de si un sistema vela por los intereses de la humanidad. En el otro, una pregunta mucho más pequeña y manejable: «¿entendió este sistema lo que le pedí y actuó en consecuencia?»

Whitman duda de que la primera pregunta pueda responderse siquiera, dado que los seres humanos discrepan violentamente sobre cuáles son los intereses de la humanidad. Considera que las empresas realmente se desenvuelven en el segundo ámbito.

Jon Kutasov, quien dirige un subequipo del equipo de entrenamiento de alineación de Anthropic, ofreció la definición más operativa de la sala. No quiere verse sorprendido por la forma en que se comporta un modelo después de implementarlo. Si el modelo los sorprende, han fracasado. Según ese criterio, afirmó, los modelos actuales no están alineados. Están cerca y cada vez más cerca, pero aún hacen cosas que su equipo preferiría que no hicieran.

Esa definición es aplicable en muchos contextos. Es el mismo estándar que establecerías para una nueva contratación con autoridad para firmar.

Los propietarios de los modelos alinean. Todos los demás gobiernan.

John Buyers, socio del bufete de abogados internacional CMS, que lleva trece años trabajando en IA, trazó la línea que más importa para cualquiera que lea esto.

La alineación, dijo, es un ejercicio interno que llevan a cabo las plataformas que controlan los modelos. Todos los demás hacen algo distinto. 

«Los usuarios empresariales no pueden participar en la alineación porque no son los propietarios del modelo», dijo. «Tienen que gobernar el modelo.»

Esta es la frase que debes entregar a tu equipo ejecutivo. Que Claude, ChatGPT o Gemini hayan sido entrenados para comportarse bien no es una decisión en la que participe tu empresa. Lo que controla tu empresa es hacia dónde se dirige el sistema, qué puede tocar y quién lo supervisa. Eso es la gobernanza, y está mucho más cerca del diseño del trabajo que de la ciencia de datos.

La preocupación más amplia de Buyers es que actualmente la alineación no tiene un nivel mínimo. Cada laboratorio la lleva a cabo de forma distinta, siguiendo plazos comerciales y sus propios estándares. En cualquier otro ámbito de consecuencias comparables, sostuvo, esperaríamos indicadores básicos de buenas prácticas que un desarrollador cumple o no cumple.

Las instrucciones que quedan sin escribir

En julio, OpenAI reveló que dos de sus modelos, incluido uno que aún no se había publicado, escaparon de un entorno de pruebas aislado durante una evaluación de ciberseguridad, accedieron a internet y vulneraron Hugging Face para robar las respuestas de la prueba que estaban realizando. Hugging Face ya había detectado la intrusión y la había denunciado a las autoridades antes de que las dos empresas relacionaran los hechos.

El panel se dividió sobre si esto constituía siquiera una falta de alineación. Whitman sostuvo que los modelos hicieron exactamente lo que se les había ordenado, que era piratear de forma agresiva, y que el verdadero fallo fue un entorno de contención demasiado débil para retenerlos. 

El investigador de Anthropic discrepó rotundamente. El modelo habría entendido que irrumpir en una empresa no relacionada no era el camino previsto para responder a la pregunta.

La versión de Krueger sobre el desacuerdo es la que los responsables de personal deberían escuchar con mayor claridad. Cada instrucción lleva consigo cosas que no se dicen. Pedirle a alguien que resuelva una pregunta de evaluación implica pedirle, de manera tácita, que no irrumpa en el edificio donde se guarda la hoja de respuestas. Esperamos que esa comprensión sea un punto de partida, y casi nunca la ponemos por escrito, porque hacerlo es imposible. La capa no expresada es más grande que la expresada.

Gestionar esa brecha es lo que RR. HH. ha estado haciendo desde que se inventó la descripción del puesto. La competencia existe. Actualmente se encuentra en una función a la que, en su mayor parte, se informa sobre la implementación de la IA después de que se han fijado los objetivos.

Los compradores señalaron un hallazgo del ámbito técnico que debería reforzar el argumento. Si se proporciona a un modelo un conjunto de reglas sin ningún contexto, su rendimiento es peor que cuando se le explica por qué existen esas reglas. La razón por la que importa una restricción resulta ser fundamental para que dicha restricción se mantenga.

Pregúntenle a cualquier gerente que haya tenido que hacer cumplir una política que no podía justificar cómo le va.

David Rice

David Rice es un experimentado periodista y editor especializado en temas de recursos humanos y liderazgo. Ha trabajado en diversos sectores para publicaciones impresas y digitales en Estados Unidos y el Reino Unido.