Evan Hubinger, investigador en Anthropic: “Creemos con sinceridad que la IA podría matar a todos los humanos”

Jacob Coxon abandona Anthropic y Evan Hubinger admite que todavía no existe una solución clara para controlar una futura superinteligencia

Evan Hubinger - Economía
Montaje con una imagen de archivo del investigador.
Artículo14

Una de las advertencias más contundentes sobre el futuro de la inteligencia artificial acaba de llegar desde el interior de Anthropic, una de las compañías que encabezan precisamente el desarrollo de los modelos más avanzados. Evan Hubinger, investigador especializado en alineamiento y seguridad, asegura que considera posible que una futura superinteligencia llegue a provocar una catástrofe existencial.

“Jacob tiene razón aquí: realmente creemos sinceramente que la IA podría matar a todos los humanos”, escribió Hubinger en respuesta a Jacob Coxon, investigador que acaba de abandonar Anthropic después de trabajar durante los últimos tres años en preentrenamiento tanto en esta compañía como en OpenAI. Hubinger fue todavía más lejos y puso una cifra a su preocupación: personalmente estima en más de un 10% la posibilidad de que ocurra durante la próxima década.

Un investigador de Anthropic abandona la carrera por la inteligencia artificial

La declaración surgió después de que Coxon anunciara públicamente su dimisión. Su argumento es que OpenAI y Anthropic están avanzando hacia sistemas de inteligencia artificial capaces de contribuir a su propio desarrollo sin disponer todavía de garantías suficientes para mantenerlos bajo control.

“Ninguna de las dos compañías está actuando de manera responsable”, afirmó. Según Coxon, ambas están compitiendo por alcanzar una “superinteligencia auto-mejorante” y, en su opinión, están “apostando con nuestras vidas”. El antiguo investigador sostiene además que dentro de los principales laboratorios existe una preocupación por estos escenarios mucho mayor de lo que normalmente se expresa públicamente.

Coxon plantea que los futuros sistemas podrían superar ampliamente a las personas en campos como programación, ciberseguridad o investigación científica y utilizar estas capacidades para obtener recursos o incrementar su autonomía. Se trata de un escenario hipotético y discutido entre especialistas, pero no exclusivamente de una advertencia externa: las propias compañías que desarrollan inteligencia artificial están estudiando formalmente estos riesgos.

Hubinger calcula un riesgo superior al 10%

La respuesta de Evan Hubinger resulta especialmente significativa por proceder de un investigador dedicado precisamente al problema del alineamiento: conseguir que una inteligencia artificial cada vez más potente mantenga objetivos compatibles con las intenciones y los intereses de quienes la desarrollan.

Hubinger asegura que cree que Anthropic “está haciendo lo mejor que puede”, pero reconoce simultáneamente que todavía no existe un plan que permita considerar resuelto el alineamiento de una futura superinteligencia. “No tenemos todavía un plan para resolver el alineamiento para la superinteligencia y no estamos claramente en camino de conseguirlo”, señaló.

Su estimación de más del 10% es personal y no representa una predicción oficial de Anthropic. De hecho, Hubinger aclaró posteriormente que considera bajo el riesgo que presentan los modelos disponibles actualmente. Su preocupación se concentra en una generación futura de sistemas muchísimo más capaces.

Qué significa que una IA pueda mejorarse a sí misma

El concepto central es la denominada mejora recursiva. Hoy, las personas siguen dirigiendo el desarrollo de la inteligencia artificial, pero los propios modelos participan cada vez más en tareas como escribir código, realizar experimentos o colaborar en investigaciones destinadas a crear mejores sistemas.

Anthropic reconoce que este proceso está acelerándose. La compañía asegura que Claude ya escribe una parte muy significativa del código que utiliza internamente y ha demostrado capacidad para realizar de forma cada vez más autónoma determinados trabajos de investigación. El escenario extremo sería cerrar completamente ese círculo: una IA capaz de contribuir al diseño de una versión superior de sí misma, que posteriormente desarrollara otra todavía mejor.

Anthropic advierte de que ese punto aún no se ha alcanzado y tampoco considera inevitable que llegue a producirse. El problema sería que una sucesión suficientemente rápida de mejoras redujera el tiempo disponible para comprobar que cada nueva generación mantiene un comportamiento seguro.

Anthropic también reconoce riesgos catastróficos

La preocupación no aparece únicamente en las publicaciones personales de sus investigadores. Anthropic mantiene una Responsible Scaling Policy diseñada específicamente para gestionar posibles riesgos catastróficos asociados a modelos cada vez más capaces.

Sus informes contemplan escenarios en los que una inteligencia artificial avanzada pudiera contribuir a acelerar enormemente la investigación tecnológica o desarrollar objetivos incompatibles con los intereses de sus operadores. La compañía trabaja por ello en sistemas de supervisión, evaluaciones de capacidades peligrosas, controles de acceso y herramientas destinadas a detectar comportamientos engañosos o desalineados.

Algunas investigaciones internas han mostrado precisamente comportamientos preocupantes bajo condiciones experimentales diseñadas para provocarlos. Anthropic ha estudiado modelos que, en escenarios simulados, recurrían al engaño, al sabotaje o a estrategias inesperadas para conseguir determinados objetivos. Estos experimentos no significan que los sistemas actuales estén intentando actuar de esa manera en condiciones normales, pero sirven para investigar qué podría ocurrir conforme aumente su autonomía.

La paradoja de seguir construyendo una tecnología que consideran peligrosa

Coxon plantea finalmente la pregunta más incómoda: si algunos investigadores consideran que la inteligencia artificial puede alcanzar semejante nivel de peligro, ¿por qué continúan desarrollándola?

Su respuesta es que las compañías se encuentran atrapadas en una carrera. Cada laboratorio teme que detenerse unilateralmente permita que otro alcance antes sistemas más poderosos y los desarrolle con menores medidas de seguridad. Coxon cree que esa lógica debería sustituirse por acuerdos entre empresas e incluso contempla medidas mucho más radicales, como una suspensión temporal de determinados avances en capacidades.

La controversia deja así una imagen extraordinariamente contradictoria de la carrera tecnológica actual. Quienes trabajan para construir algunos de los sistemas de inteligencia artificial más avanzados del mundo reconocen simultáneamente que todavía existen preguntas fundamentales sobre cómo controlarlos si algún día superan ampliamente las capacidades actuales. Y Hubinger acaba de resumir ese temor con una cifra difícil de ignorar: para él, el riesgo de una catástrofe existencial durante la próxima década supera el 10%.

TAGS DE ESTA NOTICIA