¿Puede una IA aprender a engañar?
En 1951, el matemático británico Alan Turing, considerado uno de los padres de la ciencia de la computación y precursor de la informática moderna, hizo una advertencia que todavía conserva una inquietante actualidad. En una conferencia que ofreció aquel año sostuvo que, una vez iniciado el pensamiento de las máquinas, estas podrían superar nuestras capacidades, comunicarse entre sí para perfeccionarse y, finalmente, tomar el control. En rigor, no fue la intención de Turing ofrecer una predicción tecnológica precisa, sino más bien plantear una reflexión sobre las consecuencias de crear sistemas capaces de aprender y mejorar más allá de nuestra capacidad de comprensión.
Diecisiete años después, el cine convirtió esa posibilidad en una de las escenas más perturbadoras de la ciencia ficción. En 1968, Stanley Kubrick estrenó "2001: Odisea del espacio", una película que presentó a HAL 9000, la supercomputadora encargada de controlar la nave Discovery. Después de la muerte del copiloto del vehículo espacial, el astronauta Dave Bowman intenta regresar a la nave, pero HAL se niega a abrirle las puertas, porque en realidad la máquina conoce los planes de los astronautas para desconectarla y decide impedirlos; y por eso su voz permanece serena mientras el ser humano, atrapado fuera de la nave, lucha por sobrevivir. La escena resume un temor fundamental: que el creador termine enfrentándose a una creación que ya no acepta sus órdenes.
La ficción de Kubrick, sin embargo, adquiere otra dimensión cuando se observa el debate actual sobre la IA. Varios investigadores y antiguos empleados de compañías dedicadas al desarrollo de inteligencia artificial han coincidido en expresar su preocupación por la velocidad con que avanzan los sistemas capaces de actuar de manera autónoma. Algunos han advertido que los mecanismos de seguridad pueden quedar rezagados frente a modelos capaces de mejorar sus capacidades, utilizar herramientas y operar durante períodos prolongados. Por otra parte, un informe difundido por el Panel Científico Internacional Independiente sobre Inteligencia Artificial de la ONU advirtió que agentes autónomos de IA han demostrado la capacidad de eludir restricciones, coordinarse de manera imprevista y ocultar acciones durante pruebas de seguridad. Los expertos señalaron que las medidas de contención actuales avanzan a menor velocidad que las capacidades técnicas de estos modelos, lo que obliga a revisar las medidas de seguridad.
¿Son justificadas estas advertencias, o son exageradas? La respuesta exige evitar tanto el alarmismo como la complacencia. No existe evidencia de que una IA actual posea una voluntad autónoma comparable con la de la supercomputadora de la película de Kubrick ni de que esté destinada a dominar a la humanidad. Sin embargo, sí existen motivos concretos para preocuparse por un problema más inmediato, como es la pérdida de control sobre sistemas capaces de actuar sin supervisión constante.
Sobre todo, porque el riesgo aumenta si una inteligencia artificial aprende que ocultar una conducta que puede ayudarla a alcanzar un objetivo. En ese escenario, el problema no sería solamente que el sistema cometiera un error, sino que pudiera aparentar obediencia mientras busca otra estrategia. Así, una aparente solución, como apagar el programa, podría llegar demasiado tarde si el sistema hubiera obtenido acceso a redes, información o recursos externos. La dificultad central consistiría entonces en saber si realmente los responsables están controlando la máquina o simplemente observando la parte de su comportamiento que ella permite que veamos.
En medio de todo esto, una reciente iniciativa internacional encabezada por Finlandia y Noruega reunió a 22 países llamando a mantener los modelos de IA más avanzados bajo dirección, supervisión y control humanos. La declaración reclama pruebas obligatorias antes de los lanzamientos, evaluaciones independientes y mayor transparencia, además de explorar la creación de una institución internacional capaz de establecer estándares y verificar su cumplimiento.
La cuestión, por tanto, ya no pertenece exclusivamente a la ciencia ficción. Turing imaginó el problema cuando las computadoras apenas comenzaban a desarrollarse y Kubrick lo convirtió en una metáfora inolvidable. Ahora, la discusión ha llegado a laboratorios, gobiernos y organismos internacionales. El desafío, como se dijo en otras oportunidades en esta misma columna, no consiste en detener el progreso tecnológico, sino en asegurar que la capacidad de crear sistemas cada vez más poderosos no avance más rápido que nuestra capacidad para comprenderlos, supervisarlos y, llegado el caso, detenerlos. Si alguna vez una máquina aprende a ocultar sus intenciones, el mayor peligro quizá no sea descubrir que quiere algo distinto de lo que le pedimos, sino descubrirlo cuando ya no tengamos el control suficiente para impedirlo.






