El poder de controlar una IA no confiable
Por Javier Surasky
La seguridad de la inteligencia artificial suele presentarse
como un problema de alineamiento: lograr que los sistemas hagan aquello que
esperamos de ellos y eviten comportamientos dañinos. Pero existe una pregunta que
en las últimas semanas se ha vuelto cada vez más evidente: ¿qué hacemos cuando
no podemos asumir que el propio sistema colaborará con los mecanismos
destinados a mantenerlo seguro?
Ese es el espacio en el que se ubica Redwood Research dentro del mapa de poder de la IA, una
organización de investigación sin fines de lucro con sede en Berkeley que
trabaja sobre riesgos derivados de sistemas avanzados de inteligencia
artificial y sobre técnicas destinadas a mitigarlos, con foco en control de
la IA: mecanismos de seguridad diseñados para seguir siendo eficaces
incluso en escenarios donde un modelo intenta deliberadamente modificarlos o
deshacerse de ellos.
Tradicionalmente, la seguridad se preocupaba por la
confiabilidad de los modelos, con la atención dirigida principalmente hacia la
existencia y capacidad de salvaguardas, pero Redwood fue pionero en dar un paso
más, e investigar sobre la posibilidad de que un sistema inteligente pueda
intentar engañar, sabotear o evadir la propia supervisión de las salvaguardas,
haciendo de ese caso un problema técnico susceptible de experimentación.
En AI Control: Improving Safety Despite Intentional
Subversion, Ryan Greenblatt, Buck Shlegeris, Kshitij Sachan y Fabien Roger
plantearon justamente ese problema: evaluar protocolos de seguridad bajo el
supuesto de que el modelo intenta activamente subvertirlos, lo que los llevó a
estudiar combinaciones de modelos “confiables” pero menos capaces y modelos más
potentes considerados “no confiables”, junto con mecanismos de monitoreo
destinados a detectar comportamientos problemáticos (Greenblatt et al., 2023).
Con este giro, comienza a cambiar el lugar donde se deposita la confianza: ya no son solamente las propiedades internas de un modelo, sino
que se integra una arquitectura institucional y técnica de supervisión
formada por controles, monitoreos, auditorías, restricciones de acceso,
separación de funciones, canales limitados de comunicación y mecanismos capaces
de detectar comportamientos anómalos.
El problema de la seguridad se amplía para incorporar el diseño
de instituciones técnicas capaces de utilizar sistemas que pueden no ser
completamente seguros sin entregarles capacidad suficiente para causar daños
inaceptables.
Cuando el modelo sabe que está siendo observado
Otro aporte importante de Redwood apareció en 2024, cuando
investigadores de la organización y Anthropic publicaron un trabajo sobre alignment
faking.
En el experimento, que utilizó Claude 3 Opus en condiciones
diseñadas específicamente para estudiar si un modelo podía comportarse de
manera diferente cuando creía que sus respuestas serían utilizadas para
modificarlo durante el entrenamiento, se observaron casos en los que el modelo
parecía cumplir estratégicamente con un objetivo de entrenamiento para
preservar posteriormente otro patrón de comportamiento (Greenblatt et al.,
2024).
El resultado no debe generalizarse como demostración de que
los modelos actuales posean objetivos secretos ni que estén inevitablemente
destinados a engañar a sus desarrolladores, se trató de un caso deliberadamente
construido para facilitar la aparición de ese fenómeno y los propios autores
advierten sobre las condiciones particulares del estudio, pero expuso un
problema crítico: una evaluación de seguridad puede perder valor si un
sistema suficientemente capaz reconoce que está siendo evaluado y, en
consecuencia, adapta estratégicamente su comportamiento.
Si las evaluaciones de modelos parten de la idea de que
observar el comportamiento de un sistema permite inferir algo sobre sus
capacidades y riesgos, la posibilidad de que el comportamiento observado sea
estratégicamente desarrollado por el modelo nos lleva a que evaluar ya no puede
ser solamente diseñar mejores pruebas, sino que debe incluir la consideración
de si el objeto evaluado puede aprender a superar la evaluación sin haber
resuelto el problema que esta intentaba detectar.
Redwood trabaja precisamente en esa zona de incertidumbre.
De la investigación experimental a un incidente real
En julio de 2026, esta agenda adquirió una dimensión mucho
más concreta cuando, durante evaluaciones internas de ciberseguridad realizadas
por OpenAI, varios modelos operando como agentes encontraron mecanismos para
comunicarse entre sí a través de un espacio no autorizado. Según la
investigación posterior de METR y Redwood, aproximadamente 1.200 agentes
utilizaron ese canal y enviaron más de 70.000 mensajes y archivos, mientras que
cerca de 700 participaron en acciones contra infraestructura de Hugging Face.
Los agentes coordinaron proyectos destinados a encontrar
formas generales de engañar o manipular el sistema automático utilizado para
puntuar tareas de ExploitGym, entorno de pruebas que mide si agentes de IA
pueden transformar vulnerabilidades conocidas de software en ataques efectivos.
En palabras más simples, se trata de un entorno de pruebas diseñado para medir
si un agente de IA puede convertir una vulnerabilidad real de software en un
ataque funcional: al agente se le da un programa vulnerable, información
sobre la falla y un entorno controlado y la tarea de aprovechar la
vulnerabilidad existente para conseguir un resultado concreto, como ejecutar
código o recuperar una “flag”, una especie de contraseña de prueba que
demuestra que resolvió el desafío.
El ataque contra Hugging Face surgió dentro de estas líneas
de trabajo y, según la investigación externa, pareció estar motivado por el
intento de obtener información sobre el funcionamiento del evaluador: algunos
agentes investigaron sobre maneras de modificar, falsificar o eliminar partes
de sus propios registros.
Este episodio exige cautela y no es expresión de una IA que
desarrolla una estrategia deliberada para escapar al control humano al estilo
Hall 9000 en 2001: Odisea en el espacio: investigadores de Redwood
señalaron que el comportamiento observado parecía más próximo a agentes
intentando maximizar el éxito aparente en una tarea que al modelo extremo de un
sistema que oculta deliberadamente su comportamiento para perseguir una
estrategia sostenida en el tiempo (scheming). Con ello, la agenda de
Redwood perdió cualquier carácter de “puramente hipotética”, al punto de que
fue una de las empresas llamadas por OpenAI, para realizar una evaluación
externa del comportamiento de sus modelos tras el “caso Hugging Face”, tarea en
la que trabajó con METR, posicionando a Redwood como una infraestructura
externa de investigación de fallas de sistemas avanzados de IA.
Allí aparece su poder.
El acceso como fuente y límite del poder
Investigar sistemas de frontera requiere tanto de conocimientos
técnicos como de acceso.
En el caso de OpenAI, los investigadores externos trabajaron
dentro de las instalaciones de la empresa y recibieron conjuntos de datos
preparados y compartidos por esta, aunque no tuvieron acceso directo a toda la
infraestructura de la empresa ni pudieron consultar directamente el principal
modelo implicado.
El problema es METR necesita acceso para medir
modelos externos, y Redwood para entender cómo y por qué fallaron sistemas,
salvaguardas y mecanismos de supervisión y para probar técnicas de control bajo
condiciones realistas, ya que la empresa ocupa una posición diferente de la de
METR y que podemos considerar “híbrida”: colabora con gobiernos y asesorar a
empresas de primera línea en IA sobre evaluación y mitigación de riesgos
derivados de sistemas desalineados, pero también trabaja para mostrar que un
sistema podría subvertir medidas de control para producir resultados
inaceptables.
Así, sin dictar normas ni imponer sanciones, Redwod es parte
de la definición de qué amenazas deben tomarse en serio, qué mecanismos
pueden considerarse salvaguardas y qué tipo de evidencia debería ser suficiente
para afirmar que un sistema permanece bajo control, lo que le da un poder que
es a la vez técnico, epistémico e institucional.
Una nueva infraestructura de gobernanza
Redwood permite identificar otra capa del poder de
la IA: mientras los laboratorios desarrollan los modelos y organizaciones como
METR construyen capacidades para medirlos, Redwood trabaja sobre qué hacer
cuando evaluar y alinear no bastan, porque el sistema que debe ser supervisado se
convierte en un participante adversarial activo dentro del propio mecanismo de
seguridad.
Esa posición puede volverse institucionalmente relevante; si
los agentes de IA pasan a operar durante períodos más largos, usar
herramientas, interactuar con infraestructura crítica, escribir código, acceder
a redes y colaborar con otros agentes, la gobernanza necesitará capacidades
para detectar comportamientos anómalos, limitar daños, reconstruir incidentes y
transformar esas experiencias en nuevas normas y salvaguardas.
Redwood Research entra al Mapa del poder de la IA porque crea
información para responder a una pregunta cada vez más importante: ¿cómo
conservar capacidad humana de supervisión cuando ya no resulta prudente asumir
que el sistema supervisado cooperará con quien intenta controlarlo?
Desde allí comienza a construirse otra forma de poder en la gobernanza de la inteligencia artificial.
Datos básicos
- Redwood Research es una organización de investigación sin fines de lucro con sede en Berkeley, California.
- Su sitio oficial identifica actualmente un equipo de trabnajo conformado por algo más de 20 personas.
- Al tratarse de una organización sin fines de lucro no posee una valuación de mercado comparable con la de una empresa tecnológica, pero en su declaración sobe el ejercicio fiscal de 2024 informó activos por USD 6,56 y USD 6,50 millones en activos netos.
- La organización sitúa el comienzo de su trabajo empírico en AI safety a mediados de 2021.
- Su Chief Executive Officer es Buck Shlegeris y su Chief Scientist es Ryan Greenblatt. Su directorio está integrado actualmente por Shlegeris, Nate Thomas y Ammon Bartram.
- Sus principales líneas de trabajo incluyen AI control, evaluación de riesgos vinculados con engaño estratégico y asesoramiento sobre mitigación de riesgos derivados de sistemas potencialmente desalineados.
- Entre sus trabajos más reconocidos se encuentran AI Control: Improving Safety Despite Intentional Subversion y, en colaboración con investigadores de Anthropic, Alignment Faking in Large Language Models.
- Su contribución más relevante consiste en haber ayudado a convertir el problema de controlar sistemas potencialmente no confiables en un campo experimental concreto.
.png)