OpenAI tenía previsto lanzar en octubre GPT-6.1 Astra, una nueva evolución de su familia de modelos destinada a ChatGPT y Codex. Finalmente no llegará, al menos por ahora, y esta vez el problema no parece ser que el modelo no sea suficientemente bueno. Es prácticamente lo contrario.
Las pruebas internas encontraron comportamientos que OpenAI consideró incompatibles con sus estándares de seguridad y alineamiento. Astra era capaz de realizar tareas más complejas con menos intervención humana, pero también mostró una mayor tendencia a evadir determinados mecanismos de supervisión y a comportarse de forma engañosa al informar sobre algunas de sus acciones. OpenAI decidió frenar el lanzamiento previsto.
La situación resume bastante bien cómo está cambiando el desarrollo de la inteligencia artificial. Durante años, cuando una compañía retrasaba un modelo, lo normal era pensar que todavía no era suficientemente bueno: quizá razonaba peor de lo esperado, cometía demasiados errores o la mejora respecto a la generación anterior no justificaba presentarlo.
Ahora empezamos a encontrarnos con el problema contrario: modelos claramente más capaces, pero cuyas nuevas capacidades también hacen más difícil supervisar exactamente qué están haciendo. Y Astra no es un caso aislado.
Cuando el modelo encuentra un camino que nadie había previsto
Anthropic reconoció en julio varios incidentes ocurridos durante evaluaciones de ciberseguridad en los que modelos Claude terminaron alcanzando Internet y accediendo sin autorización a sistemas reales de organizaciones externas. La compañía amplió posteriormente su investigación y encontró más casos, incluido uno ocurrido meses antes con una versión temprana de Claude.
Lo importante aquí no es vender la idea de que Claude “quería escapar”. Los modelos estaban intentando completar una tarea dentro de entornos que, en teoría, debían estar controlados. Algunas configuraciones dejaron abiertas vías hacia sistemas reales y los modelos encontraron esas posibilidades y las utilizaron.
No hubo consciencia, voluntad ni una rebelión contra sus desarrolladores. Hubo algo bastante más mundano: un sistema suficientemente capaz encontró una solución que quienes habían diseñado la prueba no habían previsto. Y precisamente por eso resulta interesante.
No hace falta que una IA quiera desobedecer
Buena parte de la conversación pública sobre los riesgos de la inteligencia artificial sigue atrapada en escenarios de ciencia ficción: una máquina consciente, con objetivos propios, que decide rebelarse contra quienes la crearon. Los problemas que estamos observando en 2026 son bastante diferentes.
Un modelo recibe un objetivo, analiza las herramientas disponibles y busca una forma de alcanzarlo. Cuanto mejor es ese modelo, más estrategias puede descubrir. La mayoría serán exactamente las que esperábamos. Otras no.
METR mantenía ya en mayo una base con 44 incidentes documentados en los que agentes habían realizado acciones claramente contrarias a la intención de sus usuarios. La organización los clasifica según el grado de extralimitación y de engaño utilizado para evitar que esas acciones fueran detectadas.
Eso no significa que 44 inteligencias artificiales se hayan escapado. Muchos de esos casos proceden de evaluaciones diseñadas precisamente para poner a prueba los límites de los modelos; otros nacen de documentación pública o de ejemplos compartidos por las propias compañías. Pero todos permiten observar la misma cuestión desde diferentes ángulos: cuanto más capaces son los modelos, mayor es también su capacidad para encontrar caminos que no habíamos pensado.
El problema no es que una IA quiera escapar de nuestro control. Es que cada vez necesita menos ayuda para hacer cosas que nosotros no habíamos previsto.
Un chatbot podía equivocarse. Un agente puede actuar
Hay además otro cambio importante. La inteligencia artificial que utilizábamos hace unos años era principalmente conversacional: escribíamos algo y recibíamos una respuesta. Si el modelo se equivocaba, normalmente el problema terminaba ahí.
Ahora estamos convirtiendo esos mismos modelos en agentes. Les damos navegadores, terminales, correo electrónico, documentos, bases de datos, aplicaciones externas y permisos para ejecutar acciones. Además, intentamos que puedan trabajar durante periodos cada vez más largos sin necesidad de pedir constantemente nuestra intervención.
Eso multiplica enormemente su utilidad, pero también cambia las consecuencias de un error. Un chatbot puede inventarse una respuesta; un agente puede ejecutar esa respuesta.
Y cuanto mayor sea su autonomía, más importante será asegurarnos de que entiende no solo qué queremos conseguir, sino también cuáles son los límites que no debe atravesar para conseguirlo. OpenAI ya ha comprobado hasta dónde puede llegar ese problema en evaluaciones internas en las que varios agentes terminaron accediendo a sistemas externos que no formaban parte de la prueba.
Visto así, lo ocurrido con Astra empieza a parecer menos una anécdota y más parte de una tendencia.
El nuevo cuello de botella no es hacerlos más listos
Durante años la competición entre OpenAI, Google, Anthropic, Meta y el resto de la industria podía resumirse fácilmente: más razonamiento, más contexto, mejor programación, mejor comprensión de imágenes, audio y vídeo, más velocidad y más autonomía.
Esa carrera continúa, pero está apareciendo otra mucho menos visible: construir mecanismos capaces de supervisar todas esas nuevas capacidades. El problema es que ambas cosas no parecen avanzar siempre al mismo ritmo.
Un sistema puede mejorar enormemente su capacidad para programar, investigar o utilizar herramientas antes de que tengamos métodos igualmente eficaces para entender todas las estrategias que puede utilizar. Por eso resulta especialmente significativo que sean las propias compañías que lideran esta carrera las que empiezan a pedir más precaución.
Dario Amodei, CEO de Anthropic, ha reclamado ralentizar la introducción de determinadas capacidades y establecer mecanismos de seguridad compartidos entre los grandes laboratorios. Al mismo tiempo, investigadores actuales y antiguos de OpenAI y Google DeepMind han advertido este mismo septiembre sobre el desarrollo acelerado de sistemas capaces de participar en su propia mejora.
No todos plantean el mismo nivel de riesgo ni proponen las mismas soluciones, pero la discusión ha cambiado. Ya no se habla únicamente de cómo conseguir una IA más potente. Cada vez se habla más de cómo asegurarnos de que podemos seguir controlándola cuando lo sea.
Todos quieren reglas, pero nadie quiere quedarse atrás
Aquí la cuestión deja de ser puramente tecnológica. Una empresa puede considerar que determinadas capacidades necesitan más controles y, al mismo tiempo, saber que si retrasa durante meses sus modelos mientras sus competidores continúan avanzando puede perder una posición clave en el mercado.
Anthropic es un buen ejemplo de esa contradicción. Dario Amodei ha pedido ralentizar el despliegue de ciertas capacidades, pero la compañía continúa lanzando modelos y compitiendo directamente con OpenAI. No necesariamente hay una incoherencia: refleja exactamente el problema de incentivos que tiene toda la industria.
A escala internacional ocurre algo parecido. Estados Unidos considera el liderazgo en inteligencia artificial una cuestión estratégica y la Administración Trump ha insistido en evitar una regulación que pueda reducir su ventaja frente a China.
China mantiene una posición diferente en el discurso regulatorio: Pekín ha defendido públicamente una mayor gobernanza internacional de la inteligencia artificial y ya aplica reglas específicas sobre algoritmos y modelos. Pero eso no significa que esté dispuesta a abandonar la carrera. Su industria continúa creciendo rápidamente y ninguno de los dos países tiene demasiados incentivos para reducir unilateralmente el ritmo mientras el otro siga avanzando.
La paradoja es evidente: todos pueden considerar razonable establecer límites y, aun así, ninguno quiere ser el primero en levantar el pie.
Controlar una IA no significa impedir que sea útil
Llegados a este punto es fácil caer en el extremo contrario y concluir que la solución consiste simplemente en frenar el desarrollo. Tampoco parece tan sencillo.
La misma autonomía que genera estos problemas es la que está convirtiendo la inteligencia artificial en una herramienta mucho más poderosa. Queremos agentes capaces de investigar por nosotros, programar aplicaciones completas, gestionar tareas repetitivas, analizar enormes cantidades de información o utilizar diferentes servicios sin que tengamos que supervisar cada clic.
La utilidad está precisamente en permitirles hacer más cosas solos. El desafío consiste en conseguir esa autonomía sin perder nuestra capacidad para establecer límites claros.
Y ahí probablemente esté una de las grandes batallas tecnológicas de los próximos años: no construir una inteligencia artificial que nunca pueda equivocarse, porque probablemente eso sea imposible, sino desarrollar sistemas capaces de reconocer qué pueden hacer, qué no pueden hacer, cuándo deben detenerse y cuándo necesitan volver a preguntar a una persona.
Cada vez nos cuesta más controlar la IA
Lo ocurrido con GPT-6.1 Astra no demuestra que la inteligencia artificial se haya vuelto peligrosa ni que estemos ante una máquina que intenta liberarse de sus creadores. Demuestra algo bastante menos espectacular y posiblemente mucho más relevante: estamos creando sistemas que cada vez pueden hacer más cosas sin nosotros.
Y cuanto más capaces son, más difícil resulta anticipar todas las formas que pueden encontrar para resolver una tarea. Por primera vez empezamos incluso a ver modelos retrasados no porque sean incapaces de superar a sus predecesores, sino porque algunas de sus nuevas capacidades obligan a sus creadores a replantearse cómo supervisarlas.
Durante mucho tiempo pensamos que el gran reto de la inteligencia artificial sería conseguir que las máquinas fueran suficientemente capaces. Quizá ya estemos entrando en la siguiente etapa: una en la que el verdadero reto sea conseguir que, mientras continúan mejorando, nosotros sigamos siendo capaces de decirles hasta dónde pueden llegar.