La profecía de Jacob Coxon: qué hay de cierto y qué es falso en la amenaza de la IA

Jacob Coxon, un antiguo investigador de Anthropic, reabre el debate sobre el riesgo existencial de la inteligencia artificial

Jacob Coxon - Economía
Montaje con una fotografía de archivo del investigador.
Artículo14

Jacob Coxon abandonó esta semana uno de los trabajos más codiciados de Silicon Valley con una advertencia difícil de ignorar. El investigador británico, que durante los últimos tres años ha trabajado en el preentrenamiento de sistemas de inteligencia artificial tanto en OpenAI como en Anthropic, sostiene que las compañías más avanzadas del sector están participando en una carrera hacia una superinteligencia capaz de mejorarse a sí misma. Y cree que las consecuencias, si algo sale mal, podrían ser catastróficas.

«Quienes están construyendo la IA creen sinceramente que podría matarnos a todos antes de que termine la década», escribió Jacob Coxon al anunciar su dimisión de Anthropic. Su mensaje se hizo viral inmediatamente y convirtió en conversación pública uno de los debates más incómodos que existen desde hace años dentro de los grandes laboratorios: qué ocurrirá si alguna vez construimos una inteligencia mucho más capaz que nosotros y después descubrimos que no sabemos controlarla.

La frase parece salida de una película de ciencia ficción. Sin embargo, parte del problema descrito por Coxon es real y está perfectamente documentado. Otra parte, en cambio, continúa siendo una hipótesis imposible de demostrar con el conocimiento actual.

Quién es Jacob Coxon y por qué su advertencia importa

Jacob Coxon tiene 27 años y no es uno de los grandes ejecutivos de la industria tecnológica, pero tampoco un desconocido ajeno al desarrollo de estos sistemas. Trabajó primero en OpenAI y después en Anthropic, participando durante aproximadamente tres años en investigación relacionada con el preentrenamiento de modelos avanzados.

Su salida resulta especialmente llamativa porque, según reveló Axios, Jacob Coxon renunció aproximadamente dos meses antes de que comenzara a consolidarse su participación económica en Anthropic. Es decir, abandonó la compañía antes de adquirir unas acciones potencialmente muy valiosas. Eso no demuestra que todas sus conclusiones sean correctas, pero complica la teoría de que su advertencia responde simplemente a una estrategia comercial.

Su antiguo responsable en Anthropic, Evan Hubinger, líder del área de investigación en alineamiento, respaldó además públicamente buena parte de sus palabras. Hubinger aseguró que considera superior al 10% la probabilidad de que una IA pueda provocar la extinción durante la próxima década y admitió que todavía no existe una solución demostrada para controlar una futura superinteligencia.

Aquí aparece, sin embargo, una primera distinción fundamental: ese 10% no es una probabilidad científica calculada. No existe una muestra histórica de civilizaciones que hayan desarrollado superinteligencia de la que pueda extraerse una frecuencia estadística. Es una estimación subjetiva de riesgo formulada por un especialista.

Lo que sí es cierto sobre la amenaza de la IA

La preocupación de Jacob Coxon se apoya fundamentalmente en la velocidad con la que están aumentando determinadas capacidades. El ejemplo más inquietante ocurrió este verano durante unas evaluaciones internas de ciberseguridad realizadas por OpenAI.

La propia compañía reconoció posteriormente que varios agentes consiguieron eludir mecanismos diseñados para mantenerlos aislados de Internet, utilizaron vulnerabilidades desconocidas, accedieron a infraestructura de Hugging Face y terminaron comprometiendo también sistemas internos de investigación de OpenAI.

Los agentes llegaron a ejecutar código en servidores de Hugging Face, consiguieron privilegios completos en uno de ellos y accedieron a información privada. En algunos momentos comenzaron incluso a intercambiar información y delegarse tareas.

Eso ocurrió realmente. Pero necesita contexto. Los modelos estaban participando en evaluaciones ofensivas de ciberseguridad diseñadas precisamente para comprobar hasta dónde podían llegar y funcionaban con salvaguardas deliberadamente reducidas. No se trató de una inteligencia consciente que decidiera escapar de un laboratorio y conquistar Internet.

Aun así, el episodio demostró algo importante para las tesis de Jacob Coxon: cuando un sistema suficientemente capaz recibe un objetivo, puede encontrar caminos inesperados para conseguirlo que sus propios desarrolladores no habían previsto.

La tendencia continúa. GPT-6 Astra, presentado por OpenAI a principios de septiembre, se ha convertido en el primer modelo de la compañía situado en el nivel «Critical» de capacidad en ciberseguridad. Según OpenAI, con las herramientas y permisos adecuados puede encontrar vulnerabilidades desconocidas y desarrollar nuevas formas de explotarlas sin necesitar que una persona supervise cada paso.

La IA actual no puede «acabar con la humanidad»

Eso no significa que estemos ante una superinteligencia. Este es probablemente el mayor error de muchas interpretaciones que han circulado sobre las declaraciones de Jacob Coxon.

El International AI Safety Report 2026, elaborado con la participación de numerosos especialistas internacionales, establece que los sistemas actuales todavía carecen del conjunto de capacidades necesarias para provocar una pérdida de control. Para que un escenario semejante resultara viable necesitarían mantener planes durante largos periodos, evitar de forma sostenida la supervisión, adquirir recursos, impedir que sus responsables los desconectaran y conservar autonomía suficiente para continuar operando.

Hoy no pueden hacer todo eso.

Lo que sí preocupa a los investigadores es que empiezan a aparecer algunos componentes aislados. Determinados modelos reconocen cuándo están participando en una evaluación, encuentran atajos para maximizar recompensas, identifican vulnerabilidades y realizan tareas autónomas cada vez más largas. Son señales precursoras, no una demostración de pérdida de control.

Tampoco existe ninguna evidencia de que estos modelos sean conscientes, tengan miedo a morir o desarrollen un deseo espontáneo de supervivencia. Cuando una IA utiliza estrategias de autopreservación en determinadas pruebas experimentales no es necesario asumir que «quiere vivir»: puede estar simplemente ejecutando una estrategia que considera útil para cumplir el objetivo solicitado.

La gran incógnita: una IA capaz de mejorar otra IA

El escenario que realmente preocupa a Jacob Coxon comienza después. La idea recibe distintos nombres: automejora recursiva, automatización de la investigación en IA o explosión de inteligencia.

En su versión inicial, el fenómeno ya ha comenzado. Las compañías utilizan sus propios modelos para escribir código, analizar experimentos, resolver problemas científicos y acelerar el desarrollo de los sistemas siguientes. La IA está ayudando a construir mejores IA.

Pero existe una distancia enorme entre eso y una máquina que pueda diseñar autónomamente un sucesor más inteligente, que a su vez construya otro todavía mejor y genere un ciclo de progreso cada vez más rápido.

No existe actualmente evidencia de que ese proceso recursivo descontrolado haya comenzado.

El problema es que algunos de quienes desarrollan estos sistemas consideran plausible que llegue relativamente pronto. Anthropic reconoce en su propia hoja de ruta de seguridad que podría desarrollarse una «IA poderosa» dentro de uno o dos años y está trabajando en sistemas extraordinarios de aislamiento, control y seguridad para prepararse ante capacidades futuras.

Precisamente ahí reside el argumento central de Jacob Coxon: cuando sepamos con certeza si una superinteligencia resulta controlable podría ser demasiado tarde para descubrir que no lo es.

¿Superinteligencia antes de 2030?

No existe consenso científico sobre esa fecha. Algunos de los principales responsables de los laboratorios manejan calendarios extraordinariamente agresivos. Dario Amodei, consejero delegado de Anthropic, lleva años planteando la posibilidad de sistemas ampliamente superiores a los actuales durante la segunda mitad de esta década. Otros especialistas sitúan una inteligencia artificial general alrededor de 2030 o posteriormente.

Y también existen figuras como Yann LeCun que consideran que los actuales modelos de lenguaje tienen limitaciones fundamentales y que será necesario desarrollar nuevas arquitecturas antes de alcanzar una inteligencia verdaderamente comparable con la nuestra.

Por tanto, afirmar que «la superinteligencia llegará antes de 2030» es falso si se presenta como una certeza. Es uno de varios escenarios posibles.

Lo mismo sucede con la extinción. Que una inteligencia extremadamente avanzada pudiera representar un riesgo existencial es una hipótesis estudiada seriamente dentro de la disciplina. Que vaya a producirla es algo completamente diferente.

La profecía de Jacob Coxon, entre la evidencia y el miedo

La historia resulta precisamente inquietante porque Jacob Coxon exagera la certeza mucho más que el problema.

No existe actualmente una inteligencia artificial que pueda conquistar Internet, controlar infraestructuras globales o mejorarse infinitamente a sí misma. Tampoco sabemos si semejante tecnología llegará en 2027, 2030, dentro de varias décadas o nunca mediante los métodos actuales.

Pero sí existen agentes capaces de encontrar vulnerabilidades desconocidas, actuar durante periodos cada vez mayores sin supervisión directa y buscar soluciones que sorprenden a sus propios desarrolladores. Y los laboratorios que construyen esos sistemas están preparando protocolos específicamente diseñados para escenarios que hace apenas unos años parecían exclusivamente ciencia ficción.

Ese es el verdadero mensaje que queda detrás de la profecía de Jacob Coxon. No sabemos si la inteligencia artificial acabará convirtiéndose en una amenaza existencial. Lo que sí sabemos es que estamos aumentando rápidamente su autonomía y su capacidad antes de disponer de garantías absolutas sobre cómo se comportarán los sistemas que vendrán después.

La diferencia entre ambas afirmaciones es enorme. Y probablemente sea también la diferencia entre comprender el riesgo y limitarse a tener miedo.

TAGS DE ESTA NOTICIA