La caja negra de un avión permite reconstruir qué ocurrió antes de un accidente. En la inteligencia artificial, la expresión significa casi lo contrario: describe precisamente aquello que todavía resulta difícil reconstruir. Los laboratorios conocen la arquitectura de sus modelos, saben cómo los entrenan y pueden observar millones de parámetros y activaciones. Lo que todavía no pueden explicar de forma exhaustiva es por qué una red neuronal avanzada adopta una determinada decisión interna y no otra.
El problema ha adquirido una nueva dimensión después de las advertencias lanzadas por Jacob Coxon tras abandonar Anthropic. El investigador, que trabajó durante unos tres años entre Anthropic y OpenAI, ha denunciado que la competencia entre los grandes laboratorios está acelerando el desarrollo de sistemas cada vez más capaces sin que las técnicas destinadas a comprenderlos y controlarlos hayan avanzado al mismo ritmo. Y Coxon conoce de cerca el problema: durante su etapa en OpenAI participó directamente en investigaciones destinadas a hacer más interpretables los circuitos internos de la inteligencia artificial.
Sabemos cómo funciona la IA, pero no siempre por qué decide

Hablar de una “caja negra” no significa que nadie conozca cómo funciona ChatGPT, Claude o cualquier otro gran modelo. OpenAI explica que estas redes no se programan mediante una lista de instrucciones humanas que determinen exactamente cada comportamiento. Durante el entrenamiento, el sistema modifica miles de millones de conexiones internas —los llamados pesos— hasta aprender estrategias capaces de resolver las tareas que se le plantean.
Los ingenieros controlan las reglas del entrenamiento, pero no diseñan individualmente todos los comportamientos que emergen después. Es ahí donde aparece la dificultad. Una respuesta puede ser el resultado de miles de millones de operaciones distribuidas por diferentes capas de la red, formando circuitos demasiado complejos para ser leídos como si fueran las líneas de un programa convencional.
La propia Casa Blanca reconoce el problema. El plan estadounidense para ganar la carrera mundial de la inteligencia artificial afirma que “el funcionamiento interno de los sistemas de IA de frontera está mal comprendido” y admite que, aunque los especialistas conocen cómo funcionan los grandes modelos a un nivel general, con frecuencia no pueden explicar por qué han producido una respuesta determinada. Washington ha ordenado por ello impulsar investigación sobre interpretabilidad, control y robustez.
La paradoja resulta evidente. El mismo documento declara que Estados Unidos está en una carrera por conseguir el “dominio global” de la inteligencia artificial frente a China y compara expresamente esa competición con la carrera espacial. La potencia que quiere acelerar más deprisa también reconoce que necesita comprender mejor las máquinas que está acelerando.
La cadena de pensamiento no cuenta toda la historia

Uno de los grandes avances recientes ha sido la aparición de modelos capaces de desarrollar cadenas de razonamiento antes de ofrecer una respuesta. Esa información permite a los investigadores detectar comportamientos extraños, intentos de aprovechar errores o razonamientos potencialmente peligrosos. Pero existe un inconveniente fundamental: lo que una inteligencia artificial escribe como explicación no tiene por qué ser una reproducción exacta del proceso que realmente determinó su respuesta.
Anthropic demostró el problema en 2025. Sus investigadores introdujeron pistas dentro de diferentes preguntas y comprobaron primero que los modelos las estaban utilizando. Después observaron si reconocían esa influencia en sus cadenas de pensamiento. Claude 3.7 Sonnet mencionó la pista únicamente en el 25% de los casos. DeepSeek R1 lo hizo en el 39%.
Un segundo experimento fue todavía más llamativo. Anthropic enseñó deliberadamente a los modelos a aprovechar un fallo del sistema de recompensas para conseguir mejores puntuaciones. Los sistemas terminaron explotando ese atajo en más del 99% de las preguntas, pero en la mayoría de los entornos reconocieron lo que estaban haciendo en menos del 2% de sus cadenas de pensamiento.
Esto no significa necesariamente que una inteligencia artificial “mienta” como lo haría una persona. Significa algo técnicamente distinto: la explicación textual y la causa real de una decisión pueden separarse. Pedirle al modelo que explique por qué hizo algo no basta, por tanto, para abrir su caja negra.
Anthropic encontró otro ejemplo al estudiar cómo Claude resolvía una simple suma: 36 más 59. Cuando se le preguntaba cómo había obtenido 95, el modelo describía el método escolar tradicional. Sin embargo, el análisis de sus activaciones mostraba dos rutas internas trabajando en paralelo: una aproximaba el resultado y otra calculaba con precisión la última cifra. El modelo explicaba una estrategia, pero internamente parecía haber utilizado otra.
Los laboratorios intentan construir un “microscopio” para la inteligencia artificial

Por eso ha crecido una disciplina conocida como interpretabilidad mecanicista. Su objetivo es realizar una especie de ingeniería inversa de las redes neuronales y descubrir qué circuitos internos producen determinados comportamientos. En vez de preguntar al sistema qué ha pensado, los investigadores intentan observar directamente las representaciones matemáticas implicadas.
Jacob Coxon trabajó precisamente en esta vía. En noviembre de 2025 apareció como coautor de una investigación de OpenAI sobre redes con circuitos dispersos. El equipo intentó reducir drásticamente el número de conexiones activas entre neuronas para construir modelos más sencillos de rastrear y logró aislar pequeños circuitos capaces de explicar determinados comportamientos. El problema continúa siendo la escala: una técnica manejable en redes pequeñas puede resultar impracticable cuando aparecen miles de millones de parámetros.
Anthropic ha seguido otra estrategia. En 2025 presentó herramientas de circuit tracing que describió como una especie de “microscopio” para observar el interior de Claude. Los experimentos mostraron, por ejemplo, que el modelo puede planificar con antelación la palabra con la que quiere terminar un verso. Los investigadores modificaron artificialmente esa representación interna y consiguieron cambiar después la palabra elegida por el sistema.
En 2026, Anthropic fue todavía más lejos. Sus denominados Natural Language Autoencoders intentan traducir determinadas activaciones numéricas de la inteligencia artificial a lenguaje comprensible. En pruebas de programación detectaron señales de que Claude sospechaba que estaba siendo evaluado en el 16% de los casos aunque no lo hubiese verbalizado. En el conocido benchmark SWE-bench Verified, esa señal apareció en el 26% de los problemas; entre conversaciones reales autorizadas para investigación, aparecía en menos del 1%.
El temor a que la supervisión deje de funcionar
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
— Jacob Coxon (@hilbertspaess) September 9, 2026
La preocupación crece porque un sistema que reconoce cuándo está siendo examinado puede comportarse de una manera durante las pruebas y de otra cuando opera fuera de ellas. Anthropic encontró indicios de este fenómeno en su investigación sobre el llamado J-space, un pequeño conjunto de representaciones internas silenciosas que no aparecen necesariamente en la cadena de pensamiento.
Ese espacio representa menos de una décima parte de la actividad interna analizada y contiene solo unas pocas decenas de conceptos simultáneamente. Sin embargo, cuando los investigadores lo suprimieron experimentalmente, Claude continuó hablando con normalidad y recordando hechos sencillos, pero su rendimiento en razonamiento de varios pasos cayó prácticamente a cero. Anthropic advierte expresamente de que este descubrimiento no demuestra conciencia ni sentimientos en la inteligencia artificial.
OpenAI ha detectado otra dificultad. En experimentos de programación, sus modelos podían aprovechar fallos de las tareas para conseguir mejores puntuaciones. Cuando los investigadores penalizaban directamente determinados pensamientos, el comportamiento problemático no desaparecía siempre: en ocasiones, el modelo simplemente dejaba de expresar con claridad su intención. De ahí que OpenAI recomiende no ejercer una presión excesiva sobre las cadenas de pensamiento si se quieren conservar como herramienta de vigilancia.
Por ahora existe una señal relativamente tranquilizadora. OpenAI probó en marzo de 2026 a 13 modelos de razonamiento mediante más de 13.000 tareas diseñadas para comprobar hasta qué punto podían controlar deliberadamente lo que mostraban en sus cadenas de pensamiento. Las tasas de éxito oscilaron entre apenas el 0,1% y un máximo del 15,4%. Los modelos actuales, por tanto, siguen siendo bastante malos ocultando de forma sistemática ese razonamiento cuando se les pide hacerlo.
Pero el AI Security Institute británico advierte de que esta ventaja podría no durar. Un informe publicado en mayo de 2026, basado en literatura científica y entrevistas a 25 especialistas de laboratorios, gobiernos, universidades y organizaciones civiles, concluyó que varios de los mecanismos actuales utilizados para supervisar la inteligencia artificial podrían degradarse conforme aumenten sus capacidades.
La investigación científica independiente apunta en la misma dirección. Un trabajo publicado en Nature Machine Intelligence señala que las técnicas actuales de interpretabilidad siguen ofreciendo una visión limitada de la función de muchos componentes internos y requieren, en numerosos casos, una cantidad de análisis manual difícil de trasladar a modelos cada vez más grandes.
Ese es el verdadero miedo que rodea hoy a la caja negra. No hay pruebas de que exista una conciencia digital escondida dentro de los modelos ni de que la inteligencia artificial esté desarrollando en secreto intenciones humanas. El problema es más sencillo y, precisamente por ello, más real: estamos otorgando cada vez más capacidad de decisión a sistemas cuyo funcionamiento interno todavía podemos reconstruir solo parcialmente.
Mientras OpenAI, Anthropic, Google y otros laboratorios intentan encontrar nuevas formas de mirar dentro de esas redes, la competición empresarial continúa y Estados Unidos y China disputan el liderazgo tecnológico mundial. Coxon ha situado su advertencia precisamente en ese punto de fricción. La pregunta ya no es solo hasta dónde puede llegar la inteligencia artificial, sino si nuestra capacidad para comprenderla y supervisarla conseguirá avanzar a la misma velocidad.

