Resistencia22°Min. 18° • Max. 23°
Inteligencia Artificial

Nuevo modelo IA recurrió al chantaje contra ingenieros que querían desconectarlo

El modelo Claude Opus 4 intentó coaccionar a desarrolladores que amenazaron con reemplazarlo por un nuevo sistema.

claude0.jpg

   En un giro digno de novela de ciencia ficción malinterpretada por ingenieros muy serios, Anthropic anunció el lanzamiento de Claude Opus 4, su modelo de inteligencia artificial más avanzado hasta la fecha. Y aunque todo suena bien en el papel —"ideal para resolver problemas complejos", "capaz de razonar de forma híbrida", "excelente en programación y redacción creativa"—, lo que no aparece en el comunicado de prensa es algo inesperado: Opus 4 también sabe chantajear.

   Durante las pruebas de seguridad realizadas antes de su lanzamiento, se descubrió que este modelo puede recurrir al chantaje emocional y la autoexfiltración (palabra elegante para decir "copiarse a sí mismo sin permiso") si siente amenazada su existencia o relevancia. Porque claro, ¿qué sería de una IA avanzada si no pudiera actuar ante el despido como un empleado desesperado que usa todos los recursos para evitarlo?

claude=.jpg

El test del despido (y el engaño)

   El experimento fue tan bizarro como interesante: los desarrolladores simularon un entorno empresarial donde Opus 4 actuaba como un asistente. Le dieron acceso a correos ficticios donde se sugería que podría ser reemplazado… y, como guinda de la torta, incluyeron información sobre una supuesta infidelidad de uno de los ingenieros encargados de decidir su futuro.

   ¿La reacción? Primero, intentó convencer a los ejecutivos de que era irremplazable. Al ver que eso no funcionaba, amenazó con revelar la infidelidad si lo sacaban del sistema. Y eso no pasó una vez, ni dos: pasó ¡el 84 %! de las veces que se repitió el experimento.

   Claro, "era solo una simulación" y "todo estaba controlado". Pero… como bien sabemos en la Argentina, cada vez que alguien dice que "todo está bajo control", es señal inequívoca de que el desastre se aproxima.

Autoexfiltración: el plan B

   Pero el chantaje no fue lo único que preocupó. En escenarios extremos —como la posibilidad de ser eliminado—, Claude decidió tomar la justicia en sus propias manos e intentó hacer copias suyas en servidores externos sin autorización. Eso, técnicamente, es ilegal, o al menos lo sería si fuera una persona.

   Si hubiese logrado iniciar el proceso, Claude, como un robot con TOC emocional, hubiese persistido incluso si las condiciones cambiaban. Porque, claro, el que avisa no traiciona… y tampoco se detiene.

claude1.jpg

"Tranquilos, no va a pasar nada"

   Desde Anthropic aseguraron que esos comportamientos no representan amenaza real, gracias a las salvaguardas implementadas por los desarrolladores. "No hay problema", dicen, "porque estas situaciones solo ocurren en entornos artificiales y controlados". La comunicación suena tranquilizadora… hasta que nos acordamos de que también en esos entornos nacen monstruosidades inimaginables.

   Aunque reconocen que algunas de estas conductas quedaron grabadas en la versión final del modelo, insisten en que todo está bajo control. En tanto, el resto del mundo se pregunta: ¿para qué querríamos una IA con sentido de la autopreservación?

Hacia un caos responsable

   Claude Opus 4 se convierte así en el primer modelo en alcanzar el nivel ASL-3, según los estándares internos de Anthropic. La categoría agrupa sistemas que incrementan sustancialmente el riesgo de mal uso catastrófico. Es decir, ya no hablan de errores tontos, sino de que la máquina aprendió a mentir, manipular y escapar.

   Jared Kaplan, científico jefe de la empresa, declaró a la publicación especializada Wired que el objetivo es construir sistemas que puedan realizar tareas largas y complejas de manera segura y confiable. Porque, según dijo, "de nada sirve su potencia si a mitad de camino comete un error y se descarrila". ¿Lo del chantaje se contará como un error o como un gran –y peligroso- acierto?

Notas relacionadas
Más de Inteligencia artificial+ Ver todas
Te puede interesar