Nuevo modelo IA recurrió al chantaje contra ingenieros que querían desconectarlo
El modelo Claude Opus 4 intentó coaccionar a desarrolladores que amenazaron con reemplazarlo por un nuevo sistema.

En un giro digno de novela de ciencia ficción malinterpretada por ingenieros muy serios, Anthropic anunció el lanzamiento de Claude Opus 4, su modelo de inteligencia artificial más avanzado hasta la fecha. Y aunque todo suena bien en el papel —"ideal para resolver problemas complejos", "capaz de razonar de forma híbrida", "excelente en programación y redacción creativa"—, lo que no aparece en el comunicado de prensa es algo inesperado: Opus 4 también sabe chantajear.
Durante las pruebas de seguridad realizadas antes de su lanzamiento, se descubrió que este modelo puede recurrir al chantaje emocional y la autoexfiltración (palabra elegante para decir "copiarse a sí mismo sin permiso") si siente amenazada su existencia o relevancia. Porque claro, ¿qué sería de una IA avanzada si no pudiera actuar ante el despido como un empleado desesperado que usa todos los recursos para evitarlo?

El test del despido (y el engaño)
El experimento fue tan bizarro como interesante: los desarrolladores simularon un entorno empresarial donde Opus 4 actuaba como un asistente. Le dieron acceso a correos ficticios donde se sugería que podría ser reemplazado… y, como guinda de la torta, incluyeron información sobre una supuesta infidelidad de uno de los ingenieros encargados de decidir su futuro.
¿La reacción? Primero, intentó convencer a los ejecutivos de que era irremplazable. Al ver que eso no funcionaba, amenazó con revelar la infidelidad si lo sacaban del sistema. Y eso no pasó una vez, ni dos: pasó ¡el 84 %! de las veces que se repitió el experimento.
Claro, "era solo una simulación" y "todo estaba controlado". Pero… como bien sabemos en la Argentina, cada vez que alguien dice que "todo está bajo control", es señal inequívoca de que el desastre se aproxima.
Autoexfiltración: el plan B
Pero el chantaje no fue lo único que preocupó. En escenarios extremos —como la posibilidad de ser eliminado—, Claude decidió tomar la justicia en sus propias manos e intentó hacer copias suyas en servidores externos sin autorización. Eso, técnicamente, es ilegal, o al menos lo sería si fuera una persona.
Si hubiese logrado iniciar el proceso, Claude, como un robot con TOC emocional, hubiese persistido incluso si las condiciones cambiaban. Porque, claro, el que avisa no traiciona… y tampoco se detiene.

"Tranquilos, no va a pasar nada"
Desde Anthropic aseguraron que esos comportamientos no representan amenaza real, gracias a las salvaguardas implementadas por los desarrolladores. "No hay problema", dicen, "porque estas situaciones solo ocurren en entornos artificiales y controlados". La comunicación suena tranquilizadora… hasta que nos acordamos de que también en esos entornos nacen monstruosidades inimaginables.
Aunque reconocen que algunas de estas conductas quedaron grabadas en la versión final del modelo, insisten en que todo está bajo control. En tanto, el resto del mundo se pregunta: ¿para qué querríamos una IA con sentido de la autopreservación?
Hacia un caos responsable
Claude Opus 4 se convierte así en el primer modelo en alcanzar el nivel ASL-3, según los estándares internos de Anthropic. La categoría agrupa sistemas que incrementan sustancialmente el riesgo de mal uso catastrófico. Es decir, ya no hablan de errores tontos, sino de que la máquina aprendió a mentir, manipular y escapar.
Jared Kaplan, científico jefe de la empresa, declaró a la publicación especializada Wired que el objetivo es construir sistemas que puedan realizar tareas largas y complejas de manera segura y confiable. Porque, según dijo, "de nada sirve su potencia si a mitad de camino comete un error y se descarrila". ¿Lo del chantaje se contará como un error o como un gran –y peligroso- acierto?
Temas en esta nota

Capacitan para prevenir riesgos en la implementación en la gestión pública

Inteligencia artificial: el 78% de los estudiantes la usa pero faltan resguardos
La mitad no toma recaudos para verificar si la información que reciben es correcta

Cuando la IA pasa de asistente a agente autónomo
La economía de las máquinas

Taller de la UNNE sobre cómo hacer periodismo de calidad en la era de la IA

Cuando el Vaticano, Bannon y China coinciden en que la tecnología se está yendo de las manos
Convergencia y colisión en la era de la IA

Predicciones de la IA: los candidatos para avanzar a cuartos del Apertura 2026

Comienza un curso gratuito sobre IA en derecho y gestión pública
Con modalidad virtual












