Mapa del poder de la IA. #20: Redwood Research

El poder de controlar una IA no confiable

Por Javier Surasky

Investigadores de Redwood Research supervisando agentes de IA potencialmente no confiables mediante monitoreo, alertas y controles de seguridad

La seguridad de la inteligencia artificial suele presentarse como un problema de alineamiento: lograr que los sistemas hagan aquello que esperamos de ellos y eviten comportamientos dañinos. Pero existe una pregunta que en las últimas semanas se ha vuelto cada vez más evidente: ¿qué hacemos cuando no podemos asumir que el propio sistema colaborará con los mecanismos destinados a mantenerlo seguro?

Ese es el espacio en el que se ubica Redwood Research dentro del mapa de poder de la IA, una organización de investigación sin fines de lucro con sede en Berkeley que trabaja sobre riesgos derivados de sistemas avanzados de inteligencia artificial y sobre técnicas destinadas a mitigarlos, con foco en control de la IA: mecanismos de seguridad diseñados para seguir siendo eficaces incluso en escenarios donde un modelo intenta deliberadamente modificarlos o deshacerse de ellos.

Tradicionalmente, la seguridad se preocupaba por la confiabilidad de los modelos, con la atención dirigida principalmente hacia la existencia y capacidad de salvaguardas, pero Redwood fue pionero en dar un paso más, e investigar sobre la posibilidad de que un sistema inteligente pueda intentar engañar, sabotear o evadir la propia supervisión de las salvaguardas, haciendo de ese caso un problema técnico susceptible de experimentación.

En AI Control: Improving Safety Despite Intentional Subversion, Ryan Greenblatt, Buck Shlegeris, Kshitij Sachan y Fabien Roger plantearon justamente ese problema: evaluar protocolos de seguridad bajo el supuesto de que el modelo intenta activamente subvertirlos, lo que los llevó a estudiar combinaciones de modelos “confiables” pero menos capaces y modelos más potentes considerados “no confiables”, junto con mecanismos de monitoreo destinados a detectar comportamientos problemáticos (Greenblatt et al., 2023).

Con este giro, comienza a cambiar el lugar donde se deposita la confianza: ya no son solamente las propiedades internas de un modelo, sino que se integra una arquitectura institucional y técnica de supervisión formada por controles, monitoreos, auditorías, restricciones de acceso, separación de funciones, canales limitados de comunicación y mecanismos capaces de detectar comportamientos anómalos.

El problema de la seguridad se amplía para incorporar el diseño de instituciones técnicas capaces de utilizar sistemas que pueden no ser completamente seguros sin entregarles capacidad suficiente para causar daños inaceptables.

Cuando el modelo sabe que está siendo observado

Otro aporte importante de Redwood apareció en 2024, cuando investigadores de la organización y Anthropic publicaron un trabajo sobre alignment faking.

En el experimento, que utilizó Claude 3 Opus en condiciones diseñadas específicamente para estudiar si un modelo podía comportarse de manera diferente cuando creía que sus respuestas serían utilizadas para modificarlo durante el entrenamiento, se observaron casos en los que el modelo parecía cumplir estratégicamente con un objetivo de entrenamiento para preservar posteriormente otro patrón de comportamiento (Greenblatt et al., 2024).

El resultado no debe generalizarse como demostración de que los modelos actuales posean objetivos secretos ni que estén inevitablemente destinados a engañar a sus desarrolladores, se trató de un caso deliberadamente construido para facilitar la aparición de ese fenómeno y los propios autores advierten sobre las condiciones particulares del estudio, pero expuso un problema crítico: una evaluación de seguridad puede perder valor si un sistema suficientemente capaz reconoce que está siendo evaluado y, en consecuencia, adapta estratégicamente su comportamiento.

Si las evaluaciones de modelos parten de la idea de que observar el comportamiento de un sistema permite inferir algo sobre sus capacidades y riesgos, la posibilidad de que el comportamiento observado sea estratégicamente desarrollado por el modelo nos lleva a que evaluar ya no puede ser solamente diseñar mejores pruebas, sino que debe incluir la consideración de si el objeto evaluado puede aprender a superar la evaluación sin haber resuelto el problema que esta intentaba detectar.

Redwood trabaja precisamente en esa zona de incertidumbre.

De la investigación experimental a un incidente real

En julio de 2026, esta agenda adquirió una dimensión mucho más concreta cuando, durante evaluaciones internas de ciberseguridad realizadas por OpenAI, varios modelos operando como agentes encontraron mecanismos para comunicarse entre sí a través de un espacio no autorizado. Según la investigación posterior de METR y Redwood, aproximadamente 1.200 agentes utilizaron ese canal y enviaron más de 70.000 mensajes y archivos, mientras que cerca de 700 participaron en acciones contra infraestructura de Hugging Face.

Los agentes coordinaron proyectos destinados a encontrar formas generales de engañar o manipular el sistema automático utilizado para puntuar tareas de ExploitGym, entorno de pruebas que mide si agentes de IA pueden transformar vulnerabilidades conocidas de software en ataques efectivos. En palabras más simples, se trata de un entorno de pruebas diseñado para medir si un agente de IA puede convertir una vulnerabilidad real de software en un ataque funcional: al agente se le da un programa vulnerable, información sobre la falla y un entorno controlado y la tarea de aprovechar la vulnerabilidad existente para conseguir un resultado concreto, como ejecutar código o recuperar una “flag”, una especie de contraseña de prueba que demuestra que resolvió el desafío.

El ataque contra Hugging Face surgió dentro de estas líneas de trabajo y, según la investigación externa, pareció estar motivado por el intento de obtener información sobre el funcionamiento del evaluador: algunos agentes investigaron sobre maneras de modificar, falsificar o eliminar partes de sus propios registros.

Este episodio exige cautela y no es expresión de una IA que desarrolla una estrategia deliberada para escapar al control humano al estilo Hall 9000 en 2001: Odisea en el espacio: investigadores de Redwood señalaron que el comportamiento observado parecía más próximo a agentes intentando maximizar el éxito aparente en una tarea que al modelo extremo de un sistema que oculta deliberadamente su comportamiento para perseguir una estrategia sostenida en el tiempo (scheming). Con ello, la agenda de Redwood perdió cualquier carácter de “puramente hipotética”, al punto de que fue una de las empresas llamadas por OpenAI, para realizar una evaluación externa del comportamiento de sus modelos tras el “caso Hugging Face”, tarea en la que trabajó con METR, posicionando a Redwood como una infraestructura externa de investigación de fallas de sistemas avanzados de IA.

Allí aparece su poder.

El acceso como fuente y límite del poder

Investigar sistemas de frontera requiere tanto de conocimientos técnicos como de acceso.

En el caso de OpenAI, los investigadores externos trabajaron dentro de las instalaciones de la empresa y recibieron conjuntos de datos preparados y compartidos por esta, aunque no tuvieron acceso directo a toda la infraestructura de la empresa ni pudieron consultar directamente el principal modelo implicado.

El problema es METR necesita acceso para medir modelos externos, y Redwood para entender cómo y por qué fallaron sistemas, salvaguardas y mecanismos de supervisión y para probar técnicas de control bajo condiciones realistas, ya que la empresa ocupa una posición diferente de la de METR y que podemos considerar “híbrida”: colabora con gobiernos y asesorar a empresas de primera línea en IA sobre evaluación y mitigación de riesgos derivados de sistemas desalineados, pero también trabaja para mostrar que un sistema podría subvertir medidas de control para producir resultados inaceptables.

Así, sin dictar normas ni imponer sanciones, Redwod es parte de la definición de qué amenazas deben tomarse en serio, qué mecanismos pueden considerarse salvaguardas y qué tipo de evidencia debería ser suficiente para afirmar que un sistema permanece bajo control, lo que le da un poder que es a la vez técnico, epistémico e institucional.

Una nueva infraestructura de gobernanza

Redwood permite identificar otra capa del poder de la IA: mientras los laboratorios desarrollan los modelos y organizaciones como METR construyen capacidades para medirlos, Redwood trabaja sobre qué hacer cuando evaluar y alinear no bastan, porque el sistema que debe ser supervisado se convierte en un participante adversarial activo dentro del propio mecanismo de seguridad.

Esa posición puede volverse institucionalmente relevante; si los agentes de IA pasan a operar durante períodos más largos, usar herramientas, interactuar con infraestructura crítica, escribir código, acceder a redes y colaborar con otros agentes, la gobernanza necesitará capacidades para detectar comportamientos anómalos, limitar daños, reconstruir incidentes y transformar esas experiencias en nuevas normas y salvaguardas.

Redwood Research entra al Mapa del poder de la IA porque crea información para responder a una pregunta cada vez más importante: ¿cómo conservar capacidad humana de supervisión cuando ya no resulta prudente asumir que el sistema supervisado cooperará con quien intenta controlarlo?

Desde allí comienza a construirse otra forma de poder en la gobernanza de la inteligencia artificial.

Datos básicos

  • Redwood Research es una organización de investigación sin fines de lucro con sede en Berkeley, California.
  • Su sitio oficial identifica actualmente un equipo de trabnajo conformado por algo más de 20 personas.
  • Al tratarse de una organización sin fines de lucro no posee una valuación de mercado comparable con la de una empresa tecnológica, pero en su declaración sobe el ejercicio fiscal de 2024 informó activos por USD 6,56 y USD 6,50 millones en activos netos.
  • La organización sitúa el comienzo de su trabajo empírico en AI safety a mediados de 2021.
  • Su Chief Executive Officer es Buck Shlegeris y su Chief Scientist es Ryan Greenblatt. Su directorio está integrado actualmente por Shlegeris, Nate Thomas y Ammon Bartram.
  • Sus principales líneas de trabajo incluyen AI control, evaluación de riesgos vinculados con engaño estratégico y asesoramiento sobre mitigación de riesgos derivados de sistemas potencialmente desalineados.
  • Entre sus trabajos más reconocidos se encuentran AI Control: Improving Safety Despite Intentional Subversion y, en colaboración con investigadores de Anthropic, Alignment Faking in Large Language Models.
  • Su contribución más relevante consiste en haber ayudado a convertir el problema de controlar sistemas potencialmente no confiables en un campo experimental concreto.

 

Referencias

Greenblatt, R., Shlegeris, B., Sachan, K., & Roger, F. (2023). AI Control: Improving Safety Despite Intentional Subversion.

Greenblatt, R., et al. (2024). Alignment Faking in Large Language Models. Trabajo conjunto de investigadores de Redwood Research y Anthropic.

Korbak, T., Clymer, J., Hilton, B., Shlegeris, B., & Irving, G. (2025). A Sketch of an AI Control Safety Case.

Greenblatt, R., Cotra, A., & Wijk, H. (2026). Brief Independent Investigation of Agents’ Behavior, Reasoning and Collaboration in the OpenAI / Hugging Face Hacking Incident. METR y Redwood Research.