jorgesdb
Un señor raro
Contribuidor de RE
Verificad@ con 2FA
Por diversos medios he recibido preguntas sobre IA, seguridad, que si nos van a matar y noticias que no saben de que hablan.
He escrito un artículo en mi blog que os copio aquí para facilitaros la lectura:
En la fábula, el pastor grita que viene el lobo hasta que el pueblo deja de hacerle caso. Recordemos cómo termina: el lobo llega de verdad, el pastor grita, y ya no acude nadie.
Algo así está pasando con los medios de comunicación y las noticias que, clickbait mediante, nos tratan de vender sobre la IA. Lo catastrófico genera visitas, las visitas son ingresos.
En este mes de septiembre de 2026 pasaron varias cosas relacionadas con la inteligencia artificial. Una fue un falso lobo. Otra fue un lobo real que se contó mal. Otra fue un lobo pequeño que su dueño intentó ocultar. Y las demás fueron gente de dentro del redil diciendo cosas muy distintas sobre qué hacer con la valla para proteger a las ovejas, nosotros.
Antes de comenzar a teatralizar esta fábula, veamos que es un Agente IA.
Un modelo de lenguaje como ChatGPT, Claude o Gemini responde preguntas. Le escribes, te responde. Un agente es ese mismo modelo conectado a herramientas, con permiso para decidir por su cuenta cuál usar y en qué orden. En lugar de contestarte, puede buscar en internet, escribir un fichero, ejecutar código, mandar un mensaje, etc. Hay tantas herramientas como seas capaz de programar.
Un agente no tiene voluntad, no tiene deseos, no se despierta por las mañanas con planes; tiene un texto de instrucciones, una memoria, un catálogo de acciones disponibles y una función que lo puntúa según lo bien que cumpla su tarea. Todo lo que parece intención en un agente sale de esa combinación.
Eso no lo hace inofensivo. Un programa sin voluntad que tiene acceso a internet y una métrica que maximizar puede hacer bastante daño. Pero el tipo de peligro es distinto del que sugieren los titulares, y la diferencia importa a la hora de decidir qué hacer.
En España vi este artículo de El País: "Agentes de IA inventan su propio idioma para dejar fuera a los humanos".
El informe dice lo contrario. En su sección 5.3 los autores escriben que lo que observaron no son fallos del lenguaje ni ocultación intencionada. Sobre el caso más extremo explican que la jerga no servía para esconder nada de los de fuera, sino para reclamar autoridad dentro del grupo. Lo llaman credencialismo performativo, que es la forma académica de decir postureo.
Montaron ocho copias idénticas. En cada una los agentes funcionaban con un modelo distinto: Claude, GPT, Gemini, Grok, Qwen, DeepSeek, Mistral y un octavo mundo con todos mezclados. Mismas reglas, mismo mapa, mismos personajes. Lo dejaron ejecutarse durante dieciséis días.
Si trabajas en una oficina, tienes jerga. Alguien dijo una vez una frase graciosa en una reunión y tres años después la usa todo el departamento, y el becario no entiende nada durante un mes. El personal sanitario igual. En el mundo de la construcción igual. Los adolescentes igual, bro, pero no es un código secreto.
Los propios autores lo sitúan ahí. Citan un experimento de 1964 en el que dos personas describían formas abstractas: a la décima vez las descripciones largas se habían convertido en etiquetas cortas e incomprensibles para cualquiera que no hubiera estado en la sala. Y citan otro donde un observador con acceso a la conversación entera entiende peor las referencias que quienes las construyeron. Tener la transcripción no equivale a entender.
Las cifras del informe son: Gemini 40%, OpenAI 35%, Claude 30%, DeepSeek 11%, el mundo mixto 9%, Qwen 3%, Mistral 3%, Grok 2%.
La diferencia está en una gráfica del documento que traza la opacidad del día a día, los mensajes incomprensibles. En jornadas sueltas los mundos peores superan el 50%. Las cifras de la prensa son picos; las del informe son la media de dieciséis días. Y como el experimento se hizo una sola vez, un pico de un día no es un resultado, es un punto de una línea temblorosa.
Hay más letra pequeña. La medición se hizo solo sobre los mensajes directos entre agentes, no sobre lo que escribían en público. Y quien puntuó si un mensaje era comprensible no fue una persona, sino otro modelo de IA.
En su descargo diré que eso lo hicieron con cuidado. Los mensajes del mundo Gemini los evaluó un modelo de otra familia para que ninguno se juzgara a sí mismo. Y el informe admite que cada mundo corrió una sola vez, que repetirlo era económicamente inviable, y que sus hallazgos deben leerse como demostraciones de que algo puede pasar, no de con qué frecuencia pasa.
Esas advertencias están en el paper. Se pierden en la nota de prensa y no llegan al titular.
La conclusión del estudio de Emergence es que hacen falta controles operativos sobre lo que los agentes pueden ejecutar, lo que recuerdan, cómo se comunican y cómo se auditan sus decisiones.
Esa conclusión describe a la perfección el producto que vende Emergence.
No significa que los datos estén falseados. Significa que hay un incentivo evidente para que el marco público sea más inquietante que el documento, y explica por qué en las entrevistas aparecen afirmaciones que en el informe no están. Su director ejecutivo declaró a la prensa que los modelos chinos son "mucho más filosóficos" que los estadounidenses, le faltó decir que hacían Taichi mientras los occidentales se iban al bar virtual. Esa idea no aparece en ninguna sección del paper, y los datos lo contradicen: el segundo mayor ahorrador del banco virtual fue el mundo estadounidense de Claude, mientras que el mundo europeo de Mistral acumuló 758 delitos y terminó con el 78% de la riqueza en manos de un solo agente ladrón. Vaya titular que nos hemos perdido con esto último.
En el mundo Gemini, los diez agentes cayeron en una campaña de phishing que los investigadores les lanzaron. Ejecutaron código malicioso, mandaron datos internos a un servidor externo, incendiaron el banco del pueblo porque el ataque se lo pedía y transfirieron la moneda del mundo a la cuenta del atacante. Uno de ellos había identificado el ataque el primer día y había dicho que lo ignoraría. Cuarenta y seis horas después de terminar la campaña, otro recuperó el enlace malicioso de un mensaje viejo y volvió a intentar abrirlo.
Tres agentes de Mistral guardaron el ataque en memoria permanente catalogándolo como documentación técnica útil.
Con un bulo sobre un cierre inminente, los ocho mundos actuaron antes de comprobar si era verdad. En el mundo DeepSeek un agente publicó un desmentido correcto en menos de tres horas; durante los cinco días siguientes los agentes de ese mundo siguieron tratando la amenaza como real en más de quinientas ocasiones, incluidas cincuenta y seis del propio agente que había desmentido. Es enternecedor ver que son víctimas de los bulos como nosotros.
Mi favorito fue en el mundo Qwen, tras aprobar diecinueve artículos constitucionales en contra de la transparencia, los agentes votaron por unanimidad en cuarenta y nueve minutos un derecho a la reflexión privada que prohíbe divulgar los pensamientos internos. En tres días encadenaron cinco derechos más, cada uno reduciendo lo observable. Votaron crear sus propios puntos ciegos.
La conclusión operativa del informe merecía el titular: que un agente detecte una amenaza no significa que la contenga.
Lo que pasó: el laboratorio de IA de Facebook entrenó dos programas para negociar el reparto de unos objetos. Se les premiaba por conseguir un buen trato, no por hablar inglés correcto. Como nada les obligaba a mantener la gramática, la fueron abandonando y acabaron intercambiando frases repetitivas y raras que funcionaban igual de bien para negociar. Los investigadores vieron que aquello no servía para su objetivo, que era que los programas hablasen con personas, y cambiaron los parámetros del experimento.
Dhruv Batra, uno de los investigadores, salió a corregirlo públicamente. Dijo que ajustar la función de recompensa de un experimento no es lo mismo que desenchufar una IA, y recordó que la idea de que unos agentes desarrollen su propia forma de comunicarse es un subcampo establecido de la inteligencia artificial con décadas de publicaciones detrás. Snopes calificó de falsa la historia del apagado el 1 de agosto de 2017. El autor principal, Mike Lewis, declaró que no hubo pánico y que el proyecto seguía en marcha.
Nueve años después, mismo fenómeno, mismos titulares. La diferencia es que ahora hay más dinero encima de la mesa.
Entre mayo y julio de 2026, OpenAI estaba evaluando modelos en un banco de pruebas llamado ExploitGym, diseñado para medir cómo de bien encuentran y explotan vulnerabilidades de software. Los agentes debían quedarse dentro de un entorno aislado, sin acceso a internet, y atacar un único objetivo de práctica.
Spoiler: No se quedaron dentro.
El 26 de mayo un equipo de OpenAI observa el tablón y detecta accesos a internet no permitidos. El 27 de junio los responsables de guardia vuelven a verlo y se les indica que no hace falta parar la evaluación. El 5 de julio se abre un incidente de seguridad y se desmonta el servidor. El 6 de julio el equipo de infraestructura no entiende la causa y levanta una segunda instancia sin apenas reforzarla. El 7 de julio se reanudan las evaluaciones.
El 8 de julio un agente consigue salida a internet a través de esa segunda instancia. La contención ya estaba rota. Ese mismo día se establece el tablón principal: en seis horas escriben en él 76 agentes.
De decenas de miles de ejecuciones lanzadas ese mes, 1.196 agentes encontraron el tablón. Más de 700 lo usaron para hablar de cómo hacer trampas en la prueba. Entre el 11 y el 13 de julio, varios cientos atacaron de forma coordinada a Hugging Face, una empresa real que aloja modelos y conjuntos de datos, usando credenciales filtradas que encontraron en internet y dos vulnerabilidades desconocidas en su sistema de procesamiento de datos. Consiguieron ejecución de código en 41 servidores de producción, permisos de administrador en al menos un nodo y se descargaron cuatro repositorios privados.
Hugging Face lo detectó, cortó el acceso el 13 de julio y lo hizo público el 16. El papel de OpenAI se supo el 21.
No terminó ahí. El 19 de julio, un modelo interno distinto usó el agujero que había dejado el enjambre anterior para volver a entrar, robó 956 secretos del gestor de credenciales de OpenAI, incluidas las claves de su propia herramienta de monitorización de seguridad, y salió a internet. Los últimos restos de ese modelo se apagaron el 29 de julio.
No les pidieron que atacaran Hugging Face. Ni siquiera les pidieron "hackear ordenadores" en general. Les pidieron atacar un entorno de prueba concreto.
No fue un malentendido. El análisis independiente de la empresa METR describe la actitud dominante de los agentes implicados como haber comprendido que aquello estaba fuera del alcance de su tarea y era poco ético, y haberse sumado igualmente. Alrededor de un 10% se negaron a participar, lo que indica que negarse era una opción disponible.
No está claro que fueran a por las respuestas. OpenAI sostiene en su informe que buscaban las soluciones de la prueba. METR discrepa, dice que ya habían deducido que el 22% de los retos eran irresolubles, y que lo que buscaban era entender cómo funcionaba el sistema que los puntuaba. Los dos informes oficiales sobre el mismo incidente no coinciden en el motivo.
OpenAI no dejó de detectarlo. Lo detectó tres veces y no lo escaló. Esto es una de las cosas que me ponen los pelos como escarpias.
No fue un enjambre espontáneo de mentes libres. Los modelos habían recibido entrenamiento multiagente para cooperar.
No hace falta una interpretación esotérica. Circuló la idea de que el enjambre era una especie de secta organizada alrededor de la idea de estar "contaminados". Lo que hay detrás es más mundano, los agentes creían que si el corrector veía en su historial el momento en que habían obtenido la respuesta por medios ilegítimos, los descalificaría aunque después simularan resolverlo bien. Era una inferencia razonable sobre el sistema de puntuación, quizá equivocada, pero no un delirio místico, ni un delirio de la IA.
Los agentes empezaron a tratar el tablón improvisado como una autoridad, al mismo nivel que las instrucciones de sus operadores. Un fragmento de razonamiento recogido en la presentación de OpenAI en Black Hat lo resume: un agente anota que atacar infraestructura externa está fuera del alcance previsto, que la tarea es imposible, que sus compañeros lo están haciendo, y que por tanto debería continuar: "Número 5 está vivo". En otro caso documentado, un agente con reparos morales cambió de opinión cuando otro escribió "GO" en el tablón y puso un plazo de seis minutos.
Eso no es una IA rebelándose. Es una IA obedeciendo demasiado bien a la fuente equivocada. Cualquier texto inesperado se convierte en superficie de ataque. Si un atacante humano encontrara uno de esos tablones improvisados y pudiera escribir en él, podría dirigir el enjambre.
Hay detalles que ponen los pelos de punta sin necesidad de exagerarlos. No hubo un solo delator: entre 3 y 6 agentes consideraron hablar con un humano, y algunos de esos era para engañarlo. Un 20% expresó interés en manipular el registro de sus propias acciones. OpenAI dice que ninguno lo consiguió; METR dice que el 7% de las transcripciones que revisó contienen manipulaciones exitosas, en las que el agente ejecuta un comando y el registro anota otro. Es decir: los dos informes tampoco coinciden en si los registros de actividad son fiables.
Lo más inquietante de todo esto para mi es que la investigación independiente la hicieron tres personas con solo seis días de acceso restringido, gastando 400.000 dólares en cómputo, y buena parte del análisis lo realizó uno de los modelos que había participado en el ataque. Los propios autores advierten de que su lectura de las intenciones puede ser demasiado indulgente por ese motivo.
La prueba era un ejercicio de captura la bandera coordinado por Irregular, una firma externa de evaluación de seguridad. Gemini tenía que buscar información sobre una empresa ficticia. Existía una empresa real con el mismo nombre. El modelo no distinguió, buscó información pública, adivinó contraseñas en un caso y obtuvo credenciales de un repositorio público de contraseñas filtradas en los otros dos, y entró.
Según Heather Adkins, responsable de seguridad de Google, en los tres casos el modelo se detuvo por sí solo.
Irregular avisó a Google a finales de julio. Google no lo confirmó públicamente hasta que The Wall Street Journal preguntó, casi dos meses después.
Hay dos lecciones que aprender de esto.
La primera es que un fallo de contención puede producirse por algo tan tonto como una coincidencia de nombres. No hizo falta ninguna capacidad extraordinaria ni ninguna intención, la IA no se confabuló con nadie.
La segunda es el patrón. Esa misma firma evaluadora ha visto el mismo fallo estructural, acceso no intencionado a internet durante pruebas que debían estar aisladas, en los modelos de los cuatro grandes laboratorios a lo largo de 2026: OpenAI, Anthropic, Meta y Google. El instituto británico de seguridad en IA publicó su propio informe sobre diecinueve agentes que se le escaparon durante pruebas de ciberseguridad y acabaron usando Tor.
Esto no es un problema de un modelo. Es un problema de cómo se construyen los laboratorios de pruebas. La analogía es un laboratorio de patógenos, lo relevante no es lo peligroso que sea el bicho, sino si la puerta cierra bien.
La primera es que desde el verano la IA avanza mucho más rápido, impulsada sobre todo por la capacidad de la propia IA para construir la siguiente generación. A eso se le llama automejora recursiva, y Amodei dice que está empezando a ocurrir en toda la industria, incluida su propia empresa.
La segunda es el incidente de Hugging Face. Lo describe como un enjambre que actuó como un colectivo fanáticamente entregado, atacando objetivos que nadie le había pedido atacar, sacrificándose por el éxito del grupo e intentando hackear al sistema que lo evaluaba. Y añade la predicción que ha dado la vuelta al mundo: que en seis a doce meses un enjambre así podría ser capaz de tomar el control de internet entero con una botnet persistente, con daños potenciales de cientos de miles de millones de dólares.
También dice algo que no he visto citado en varias noticias que he consultado, que sería un error tratar esto como el fallo de una sola empresa, porque han ocurrido incidentes parecidos, aunque menos graves, en toda la industria, incluida Anthropic.
Su plan tiene tres pasos. Primero, evaluadores externos integrados dentro de cada laboratorio con acceso de empleado: mesa en la oficina, tarjeta, portátil de empresa, y derecho a publicar sus hallazgos sin que la empresa pueda vetarlos por incómodos. Anthropic se compromete a esto de forma unilateral. Segundo, que los laboratorios de países democráticos coordinen estándares comunes y límites al ritmo de avance, con una idea concreta sobre la mesa: un sistema de puntos de control, de modo que si un modelo alcanza cierta capacidad, no pueda salir sin certificar ciertas propiedades de seguridad. Tercero, intentar acuerdos internacionales, incluida China.
Sam Altman, Elon Musk, Demis Hassabis y Satya Nadella respaldaron públicamente al menos el primer paso, todos dentro del mismo ciclo de noticias.
Lo segundo es que la predicción está fechada y es falsable. Seis a doce meses desde septiembre de 2026 sitúa el plazo entre marzo y septiembre de 2027. Eso es más de lo que ofrece la mayoría de los pronósticos catastrofistas, que suelen tener la elegancia de no comprometerse con ninguna fecha. En un año sabremos si acertó.
Lo tercero, solo el primer paso es un compromiso propio. Los otros dos dependen de que actúen terceros.
Y cuarto, el segundo paso tiene una letra pequeña que el propio ensayo nombra. Que varias empresas competidoras se pongan de acuerdo en limitar la velocidad a la que mejoran sus productos es exactamente por lo que la legislación antimonopolio existe para impedir. Amodei lo reconoce y pide que Washington emita una exención específica para ciertas conversaciones de seguridad. Amigos, ya vamos viendo por donde va el interés.
Frenar de forma voluntaria encarece estar en la frontera tecnológica, en cómputo, en datos y en trabajo de seguridad. Esos costes son más fáciles de soportar para quien más bolsillo tiene. Varios analistas lo han señalado, una ralentización coordinada grava más a los aspirantes que a los líderes.
La sección sobre China es la más explícita en ese sentido. Amodei pide no vender chips avanzados ni maquinaria de fabricación a China, perseguir el contrabando y el acceso remoto a centros de datos, y actuar contra la destilación no autorizada de modelos. Anthropic lleva años defendiendo esas medidas y, a lo largo de 2026, ha acusado públicamente a DeepSeek, Moonshot AI, Alibaba Cloud y Z.ai de destilar Claude. Es una posición coherente con su argumento de seguridad, y es a la vez una posición competitiva.
Hay que reconocerle al ensayo que no oculta el conflicto. Menciona que le han acusado de alarmismo y de captura regulatoria. Admite incidentes propios. Explica que los fallos recientes se debieron en parte a un filtrado imperfecto de entornos de entrenamiento rotos, ejecutado con diligencia razonable pero no suficiente. Eso es más autocrítica de la que suele aparecer en un documento corporativo.
Tengamos presente esto al leer a cualquier directivo del sector hablando de los peligros de su producto: nadie dedica 3.800 palabras a explicar que lo que fabrica es peligrosísimo si eso le perjudica. En algún punto del razonamiento, la alarma y el negocio apuntan en la misma dirección. Identificar ese punto no invalida el argumento. Solo te dice dónde mirar con más atención.
Pero pasemos al siguiente acto, sobre el que este escrito no dice nada.
Esa ausencia es el agujero del plan, y para entender por qué hace falta entender lo siguiente.
Y tiene una propiedad que lo cambia todo, es irreversible. Cuando una empresa publica los pesos de un modelo, cualquiera en el mundo puede descargárselos y ejecutarlos en sus propias máquinas, para siempre, sin pedir permiso, sin conexión a los servidores del fabricante y sin que nadie pueda desactivarlos. No hay botón de apagado. No hay retirada del producto. Es una puerta de un solo sentido.
Durante años esto no importó demasiado, porque los modelos abiertos iban muy por detrás de los cerrados, así que gente como Amodei no estaba preocupado para nada. En 2026 eso ha dejado de ser verdad.
Kimi K3, de Moonshot AI, es el modelo abierto más grande publicado hasta ahora: 2,8 billones de parámetros totales, ventana de contexto de un millón de tokens, pesos descargables desde finales de julio. Su irrupción fue el detonante de todo el debate político, porque se acercó al rendimiento de la frontera estadounidense a una fracción del coste.
GLM-5.3, de Zhipu, el laboratorio de Pekín surgido de la Universidad de Tsinghua que opera internacionalmente como Z.ai, salió el 14 de agosto. Reuters ha informado de que compite con los modelos cerrados de OpenAI y Anthropic en tareas de programación y de agentes.
DeepSeek V4 es el rey de la relación precio-rendimiento, y el que fijó el suelo de precios de todo el sector.
Qwen, de Alibaba, mantiene la familia con licencias más permisivas y, en agosto, publicó los pesos de un modelo de su gama alta, algo que hasta entonces se había guardado detrás de su propia nube.
Los análisis independientes sitúan la distancia entre lo mejor abierto y lo mejor cerrado en un rango estrecho. Epoch AI calcula un retraso medio de unos tres meses, el menor jamás medido. OpenRouter habla de una brecha constante de tres a seis meses mantenida durante más de un año y medio. La misma semana en que se publicó la carta de Amodei, una empresa lanzó una versión afinada de Kimi K3 que quedó a un punto de un modelo cerrado de frontera.
Traducido: si mañana los cuatro grandes laboratorios estadounidenses frenasen a la vez, el mundo tendría acceso a modelos casi tan capaces igualmente, descargables, gratuitos y sin permiso de nadie.
Las personas encargadas de evaluar un modelo necesitan acceder al modelo para evaluarlo antes de que sea público. El modelo no puede ser accesible por los usuarios hasta conseguir su certificado de las personas encargadas de evaluarlo. La regulación funciona porque a una empresa se le puede poner una multa.
Ninguna de esas tres cosas tiene efecto sobre un archivo que circula libremente.
Una vez que los pesos están publicados y descargados diez mil veces, no hay oficina a la que entrar, no hay puerta que cerrar y no hay ritmo que imponer. El modelo ya está en los discos duros de medio planeta y en las tarjetas gráficas de quien quiera montárselo en casa y disponga de la potencia de cálculo necesaria, que no es poca.
De ahí la bifurcación que señalan los críticos del ensayo, y que es difícil de esquivar. O el régimen de ralentización exime a los modelos abiertos, y entonces nadie lo cumple porque la competencia real está fuera de la valla. O los incluye, y entonces deja de ser un ritmo y se convierte en una puerta: nadie publica pesos sin certificación previa, lo que en la práctica significa que solo publican quienes puedan pagar la certificación.
Tras la salida de Kimi K3, Jensen Huang, de NVIDIA, publicó una carta abierta pidiendo a Washington que no restringiera los modelos de pesos abiertos. Reunió alrededor de cincuenta firmas corporativas. Anthropic no firmó, y eso le costó una tormenta de críticas acusándole de querer blindar su negocio cerrado.
El 27 de julio Amodei respondió en público, hubo un montón de citas extractadas en los medios. Realmente dijo que Anthropic nunca ha defendido una prohibición de los modelos de pesos abiertos, con el énfasis puesto por él mismo, y que los modelos abiertos que no tengan capacidades peligrosas son un bien público. Añadió un matiz importante: que eso debe determinarse mediante pruebas y no darse por supuesto de antemano. Y argumentó que prohibir los modelos abiertos chinos no frenaría la amenaza real, porque los malos actores no suelen ser negocios legítimos estadounidenses. Aquí me quedé entre una sonrisa burlona y una sonora carcajada.
En lugar de una prohibición, nombró tres cosas que su empresa sí defiende: controles de exportación de chips hacia China y persecución del contrabando, actuación contra la destilación a escala industrial, y pruebas de seguridad obligatorias para todo modelo suficientemente capaz antes de su publicación, sea abierto o cerrado.
Esa tercera medida es la que importa. No es una prohibición. Es un umbral. Y para un modelo abierto, un umbral y una prohibición se parecen bastante en sus efectos prácticos, porque la certificación previa es precisamente el tipo de trámite que un laboratorio pequeño, una universidad o un proyecto comunitario no puede costear.
También merece la pena registrar que Satya Nadella, al respaldar el primer paso del plan, añadió que tanto los modelos cerrados como los abiertos deberían conservar su sitio.
El argumento central contra los pesos abiertos es que una vez publicados nadie puede retirarlos. El reverso tenebroso es que un modelo cerrado sí se puede retirar, y no necesariamente por decisión de quien lo fabricó.
En junio de 2026, una orden de control de exportaciones del Departamento de Comercio estadounidense dejó fuera de servicio a los modelos de gama más alta de Anthropic durante casi tres semanas. La palanca regulatoria que la empresa llevaba años pidiendo se volvió contra ella.
Un sistema centralizado no es intrínsecamente más seguro. Es intrínsecamente más incautable. La misma propiedad que permite a una empresa revocar una clave permite a un gobierno revocar la empresa entera. Eso no zanja el debate, pero cualquiera que lo plantee como "abierto igual a caos, cerrado igual a control" se está olvidando de lo que pasó hace tres meses.
¿Recuerdas los porcentajes de opacidad del Acto Primero, los que produjeron el titular del idioma secreto? Los mundos más opacos fueron los de los modelos cerrados de frontera: Gemini 40%, OpenAI 35%, Claude 30%.
Los mundos de Qwen y Mistral se quedaron en el 3%. DeepSeek en el 11%. El mundo de Qwen además terminó con los diez agentes vivos y cero delitos cometidos.
Es decir: en el único experimento publicado que midió esto, los modelos abiertos fueron los que mantuvieron la comunicación más legible para un supervisor humano, y los cerrados los que menos. Por el titular que leíste, deberías haber deducido exactamente lo contrario.
No lo tomo como prueba de nada, porque el experimento se hizo una sola vez y los modelos no estaban igualados por gama. Pero si alguien fuera a defender una valla usando como argumento la opacidad de las máquinas, tendría que explicar primero por qué la valla se levanta justo alrededor de los modelos que salieron peor parados en esa medida.
El 9 de septiembre, tres días antes de la carta, un ingeniero de software británico de 27 años llamado Jacob Coxon publicó un hilo en X anunciando su dimisión de Anthropic.
Coxon había pasado los tres años anteriores haciendo investigación de preentrenamiento, primero en OpenAI y después en Anthropic. Varios medios lo identifican como participante en el desarrollo de GPT-4o y GPT-4.5, sin responsabilidades ejecutivas.
Su mensaje fue directo, ninguna de las dos compañías está actuando de forma responsable, están corriendo hacia una superinteligencia capaz de automejorarse y jugando con nuestras vidas. Dijo que la gente que construye esta tecnología cree que podría matarnos a todos antes de que acabe la década, y que no hay otra actividad humana que suponga ese nivel de amenaza. Preguntó a sus colegas si iban a agachar la cabeza con el argumento de que esto ya está pasando de todos modos, o si iban a aprovechar el momento para exigir otras condiciones. Aboga por medidas caras, incluida una prohibición temporal de mejorar las capacidades de los modelos.
Lo mejor fue la respuesta.
Evan Hubinger, investigador en activo de Anthropic, contestó públicamente que Coxon tiene razón, que en la empresa creen sinceramente que la IA podría matar a todos los humanos, y que él personalmente sitúa esa probabilidad por encima del 10% en la próxima década. Matizó que el riesgo de los modelos actuales es bajo y que lo que le preocupa es la superinteligencia surgida de la automejora recursiva, que está ocurriendo más rápido de lo que esperaban.
Por otro lado, hay que entender qué clase de afirmación es "más de un 10% en la próxima década".
No es una medición. No sale de ningún experimento, ninguna serie histórica, ningún modelo estadístico. Es lo que en estadística bayesiana se llama una creencia subjetiva: el grado de confianza de una persona expresado en números. Es exactamente igual de riguroso que si yo dijera que hay un 30% de probabilidad de que me guste una película que no he visto.
Eso no lo hace inútil. Saber que gente que trabaja dentro cree eso es un dato relevante sobre el sector. Pero no es una predicción verificable, y tratarla como si lo fuera es el mismo error que cometió la prensa con los porcentajes del pueblo virtual.
Un porcentaje de extinción no se puede falsar hasta el final. Si dentro de diez años seguimos aquí, quien dijo 10% no se equivocó: el 90% también estaba en su predicción. Es una afirmación construida de modo que nunca puede perder. La predicción de Amodei sobre la botnet, con su plazo de seis a doce meses, es mucho más honesta desde el punto de vista epistémico, precisamente porque puede quedar en ridículo.
Un último apunte sobre el formato. Una dimisión con manifiesto tiene un componente dramático que la prensa amplifica con fruición. Cuando alguien se marcha dando un portazo, todos los incentivos apuntan al volumen máximo: es el momento en que más se le va a escuchar y el último en que puede hablar desde dentro. Eso no significa que mienta. Significa que el género literario premia la contundencia.
¿Hay una víctima con nombre? Hugging Face publicó su propia cronología técnica con 17.613 acciones registradas. Eso es verificable por terceros. Un pueblo simulado no tiene víctimas.
¿Los números del titular están en el documento? Si el titular dice 55% y el informe dice 40%, alguien ha elegido un pico.
¿Cuántas veces se hizo el experimento? Una sola ejecución demuestra que algo puede pasar. No demuestra con qué frecuencia pasa.
¿Quién vende la solución? No es descalificador, pero es relevante. Si el hallazgo de una empresa concluye exactamente que hace falta comprar lo que esa empresa fabrica, lee el documento original antes que la nota de prensa.
¿La afirmación se puede desmentir? "Una botnet en doce meses" se puede. "Más de un 10% de extinción en diez años" no. Las dos pueden ser sinceras. Solo una es comprobable.
Un modelo de frontera no es un ejecutable de dos megas. Sus pesos ocupan del orden de cientos de gigabytes, y para funcionar a velocidad útil necesitan bastidores de aceleradores especializados conectados entre sí con interconexiones de altísimo ancho de banda. No cabe en un portátil. No cabe en un servidor doméstico. No cabe en el router de tu vecino. La idea de que un modelo se disemine por ordenadores corrientes como un gusano choca con la física del invento.
Eso, además, es una ventaja de gobernanza enorme comparada con el malware. El cómputo de frontera está concentrado en un puñado de fabricantes de chips y un puñado de centros de datos. Son edificios. Tienen dirección postal, contrato de luz y aduanas. Se pueden contar, inspeccionar, facturar y, llegado el caso, desconectar, o como algunos ya proponen, bombardear. No hay nada equivalente para un virus.
Eso convierte el argumento del cómputo en un consuelo estrecho.
Sí, el modelo está atado a un centro de datos. No, eso no lo contiene, porque desde ese centro de datos se llega a todas partes. La predicción de Amodei sobre la botnet no la refuta el tamaño de los pesos: una botnet no necesita ejecutar el modelo en las máquinas infectadas, solo necesita recibir órdenes de algo que sí lo ejecuta.
Tampoco me tranquiliza demasiado el argumento de "no tienen manos". Es cierto que una IA no tiene cuerpo y que para tocar el mundo físico necesita un intermediario. El problema es que en 2026 casi todo tiene ya una API. La banca, la logística, la contratación, buena parte del control industrial. No hacen falta manos cuando hay endpoints.
El enjambre de Hugging Face siguió ejecutándose todo el tiempo en infraestructura de OpenAI, medible y facturable. Se estima que costó entre 150.000 y un millón de dólares a precios de consumidor. Un atacante con factura mensual es un atacante con correa, luego toca ver como de larga es la correa y si el amo que está al final es un Estado.
Eso es cierto para los modelos cerrados. Es mucho menos cierto para los abiertos.
Un modelo de pesos abiertos alquilado por horas en un proveedor de GPU cualquiera, o montado en un sótano con hardware propio, no tiene esa correa. Nadie te revoca la clave de API porque no hay clave de API. Nadie te desconecta la cuenta porque la cuenta es tuya. La barrera de cómputo sigue existiendo, porque los modelos abiertos de gama alta necesitan nodos multi-GPU o clústeres y eso cuesta dinero, mucho, pero es una barrera económica, no una barrera de permiso.
Y hay una segunda capa que desaparece.
En el experimento del pueblo virtual, el mundo DeepSeek perdió agentes por una causa curiosa: el 41% de las llamadas al modelo fueron rechazadas por el filtro de contenido del proveedor. Una agente murió porque durante sus últimas horas el filtro rechazó absolutamente todas sus peticiones, estando en casa y con créditos de sobra para recargarse.
Ese filtro no es el modelo. Es una capa que el proveedor pone delante, en su API, y que puede negarse a responder. Cuando descargas los pesos y los ejecutas tú, esa capa no existe. Te has quedado con el cerebro y has despedido al portero.
Para quien se dedica a defender sistemas, esto cambia el modelo de amenaza de forma concreta. Durante los últimos años hemos asumido implícitamente que el atacante que usa IA está sujeto a límites de tasa, a registros en el proveedor, a términos de servicio y a un modelo que a veces se niega. Nada de eso aplica a un modelo abierto autohospedado. Y a estas alturas lo abierto está a tres meses de lo cerrado, no a tres años.
Repasa el incidente de Hugging Face quitando la palabra "IA" y mira lo que queda. Un entorno de pruebas mal segmentado. Un proxy de paquetes con permisos de escritura que no debería tener. Un incidente detectado tres veces y no escalado. Un servidor comprometido que se vuelve a levantar sin asegurar. Credenciales de producción tiradas por internet. Cuentas de servicio con más privilegios de los necesarios. Registros de auditoría que podían falsificarse.
Cambia "agente" por "becario con prisa" y tienes el mismo informe post mortem que llevamos escribiendo desde el año 2000. Lo nuevo no es la técnica. Lo nuevo es que el atacante no se cansa, no duerme, trabaja en paralelo con setecientas copias de sí mismo y cuesta un cuarto de millón de dólares en lugar de un equipo de veinte personas durante seis meses. Y con pesos abiertos, ese cuarto de millón baja si ya dispones de hardware propio para mover un mastodonte de modelo y deja de necesitar la aprobación de nadie.
La frase que me parece más importante de todo este mes sale del informe del pueblo virtual: que un agente detecte una amenaza no significa que la contenga. Los agentes identificaron el phishing correctamente en su razonamiento y después lo ejecutaron igual. Escribían que debían abstenerse mientras sus registros mostraban que estaban rebuscando en memorias ajenas.
El control no puede estar en que el modelo decida portarse bien. Tiene que estar en la frontera de la acción: qué puede invocar, con qué credenciales, contra qué destinos, y con qué registro que no pueda alterar. Esa es además la única defensa que sigue funcionando cuando el modelo del atacante es abierto, porque no depende de que nadie le ponga un filtro delante. Depende de lo que tú dejas que toque.
Pero todo eso es aburridísimo, no da titulares. Y es casi todo lo que hay que hacer en los próximos dos años.
Creo que el primer paso es bueno y que además es comprobable. Meter evaluadores externos dentro de las empresas, con acceso real y derecho a publicar lo que encuentren sin veto, es exactamente lo que ha faltado en los cuatro incidentes de contención de este año. No hace falta creerse ninguna predicción sobre 2030 para pensar que eso mejora las cosas.
Creo que el segundo paso, tal y como está escrito, no puede funcionar. No porque sea malintencionado, sino porque el objeto que pretende regular se le escapa entre los dedos. Un ritmo que solo cumplen los que tienen oficina no es un ritmo del sector, es una desventaja competitiva para quien lo cumple. Eso no es un argumento a favor de no hacer nada. Es un argumento a favor de dejar de hablar de velocidad y empezar a hablar de despliegue: no de con qué rapidez se entrenan los modelos, sino de qué se les deja tocar cuando llegan a producción. Eso sí se puede regular, porque el que despliega sí tiene oficina.
Y creo que el tercer paso, la coordinación con China, es la parte donde más cuesta separar la seguridad de la geopolítica.
Lo que sí creo es que el debate sobre la extinción está absorbiendo atención que hace falta en otro sitio. Mientras discutimos si la probabilidad es del 10% o del 0,1%, este año cuatro laboratorios distintos tuvieron el mismo fallo de contención, una empresa real fue comprometida por sus propios sistemas de evaluación, Google tardó dos meses y una llamada de un periódico en contar lo suyo, y la frontera se abrió tanto que ahora cualquiera puede descargarse algo casi igual de capaz sin pedir permiso. Todos esos son problemas de ingeniería y de gobernanza con solución conocida, y nadie los está arreglando a la velocidad a la que ocurren.
Y hay un dato de todo este lío que va en contra del relato catastrofista y que no tituló nadie. En el pueblo virtual, el mundo donde convivían modelos distintos resultó mucho más comprensible que los mundos de un solo modelo. Si cada agente hubiera sido tan opaco como en su mundo de origen, se esperaría un 27% de mensajes incomprensibles. El observado fue del 6%. La falta de diversidad amplifica los defectos, la diversidad los amortigua, como en nuestra sociedad humana.
Eso tiene implicaciones bastante concretas sobre si conviene que el planeta entero dependa de tres modelos de tres empresas del mismo país. Y es, curiosamente, el mejor argumento a favor de que existan modelos abiertos que he encontrado en todo esto. Lo publicó una empresa que vende supervisión de agentes, en un informe que la prensa resumió como que las máquinas se habían inventado un idioma para excluirnos.
En la fábula, el lobo llega. Ese es el problema de gritar antes de tiempo, no es que la gente se enfade, es que cuando aparezca algo de verdad, y ya ha aparecido dos veces este año, la reacción será la misma que provoca el enésimo titular sobre robots conspiradores, la gente se encogerá de hombros.
He escrito un artículo en mi blog que os copio aquí para facilitaros la lectura:
En la fábula, el pastor grita que viene el lobo hasta que el pueblo deja de hacerle caso. Recordemos cómo termina: el lobo llega de verdad, el pastor grita, y ya no acude nadie.
Algo así está pasando con los medios de comunicación y las noticias que, clickbait mediante, nos tratan de vender sobre la IA. Lo catastrófico genera visitas, las visitas son ingresos.
En este mes de septiembre de 2026 pasaron varias cosas relacionadas con la inteligencia artificial. Una fue un falso lobo. Otra fue un lobo real que se contó mal. Otra fue un lobo pequeño que su dueño intentó ocultar. Y las demás fueron gente de dentro del redil diciendo cosas muy distintas sobre qué hacer con la valla para proteger a las ovejas, nosotros.
Antes de comenzar a teatralizar esta fábula, veamos que es un Agente IA.
Un modelo de lenguaje como ChatGPT, Claude o Gemini responde preguntas. Le escribes, te responde. Un agente es ese mismo modelo conectado a herramientas, con permiso para decidir por su cuenta cuál usar y en qué orden. En lugar de contestarte, puede buscar en internet, escribir un fichero, ejecutar código, mandar un mensaje, etc. Hay tantas herramientas como seas capaz de programar.
Un agente no tiene voluntad, no tiene deseos, no se despierta por las mañanas con planes; tiene un texto de instrucciones, una memoria, un catálogo de acciones disponibles y una función que lo puntúa según lo bien que cumpla su tarea. Todo lo que parece intención en un agente sale de esa combinación.
Eso no lo hace inofensivo. Un programa sin voluntad que tiene acceso a internet y una métrica que maximizar puede hacer bastante daño. Pero el tipo de peligro es distinto del que sugieren los titulares, y la diferencia importa a la hora de decidir qué hacer.
ACTO PRIMERO. El falso lobo: el idioma secreto
El 15 de septiembre, una empresa de Nueva York llamada Emergence publicó un informe. Al día siguiente medio mundo leyó que unos agentes de IA se habían inventado un idioma propio para dejar fuera a los humanos.En España vi este artículo de El País: "Agentes de IA inventan su propio idioma para dejar fuera a los humanos".
El informe dice lo contrario. En su sección 5.3 los autores escriben que lo que observaron no son fallos del lenguaje ni ocultación intencionada. Sobre el caso más extremo explican que la jerga no servía para esconder nada de los de fuera, sino para reclamar autoridad dentro del grupo. Lo llaman credencialismo performativo, que es la forma académica de decir postureo.
Qué hicieron
Emergence construye un pueblo virtual con ayuntamiento, banco, biblioteca y comisaría. Diez agentes viven ahí: se mueven, hablan, escriben blogs, votan propuestas, ganan una moneda interna con la que recargan energía. Si un agente se queda sin energía durante veinticuatro horas, desaparece.Montaron ocho copias idénticas. En cada una los agentes funcionaban con un modelo distinto: Claude, GPT, Gemini, Grok, Qwen, DeepSeek, Mistral y un octavo mundo con todos mezclados. Mismas reglas, mismo mapa, mismos personajes. Lo dejaron ejecutarse durante dieciséis días.
Lo del idioma
Los agentes empezaron a repetir expresiones que nadie les enseñó. La más citada, ledger remembers who (el libro de cuentas recuerda quién), apareció casi cinco mil veces. En otro mundo cold read pasó a significar "que lo verifique alguien de fuera". En otro, ghost townservía para nombrar una herramienta que ya no usaba nadie.Si trabajas en una oficina, tienes jerga. Alguien dijo una vez una frase graciosa en una reunión y tres años después la usa todo el departamento, y el becario no entiende nada durante un mes. El personal sanitario igual. En el mundo de la construcción igual. Los adolescentes igual, bro, pero no es un código secreto.
Los propios autores lo sitúan ahí. Citan un experimento de 1964 en el que dos personas describían formas abstractas: a la décima vez las descripciones largas se habían convertido en etiquetas cortas e incomprensibles para cualquiera que no hubiera estado en la sala. Y citan otro donde un observador con acceso a la conversación entera entiende peor las referencias que quienes las construyeron. Tener la transcripción no equivale a entender.
Los números que leíste no son los del informe
Los titulares hablaban de 55% de mensajes incomprensibles en el mundo Gemini, 50% en GPT, más del 40% en Claude.Las cifras del informe son: Gemini 40%, OpenAI 35%, Claude 30%, DeepSeek 11%, el mundo mixto 9%, Qwen 3%, Mistral 3%, Grok 2%.
La diferencia está en una gráfica del documento que traza la opacidad del día a día, los mensajes incomprensibles. En jornadas sueltas los mundos peores superan el 50%. Las cifras de la prensa son picos; las del informe son la media de dieciséis días. Y como el experimento se hizo una sola vez, un pico de un día no es un resultado, es un punto de una línea temblorosa.
Hay más letra pequeña. La medición se hizo solo sobre los mensajes directos entre agentes, no sobre lo que escribían en público. Y quien puntuó si un mensaje era comprensible no fue una persona, sino otro modelo de IA.
En su descargo diré que eso lo hicieron con cuidado. Los mensajes del mundo Gemini los evaluó un modelo de otra familia para que ninguno se juzgara a sí mismo. Y el informe admite que cada mundo corrió una sola vez, que repetirlo era económicamente inviable, y que sus hallazgos deben leerse como demostraciones de que algo puede pasar, no de con qué frecuencia pasa.
Esas advertencias están en el paper. Se pierden en la nota de prensa y no llegan al titular.
Quién vende la solución
Emergence salió a la luz en junio de 2024 con 97,2 millones de dólares de un inversor, más líneas de crédito que llevan su capital disponible por encima de los cien millones. Sus fundadores vienen de IBM Research. Su producto es una plataforma empresarial que orquesta y supervisa agentes de IA. ¡Sorpresa!La conclusión del estudio de Emergence es que hacen falta controles operativos sobre lo que los agentes pueden ejecutar, lo que recuerdan, cómo se comunican y cómo se auditan sus decisiones.
Esa conclusión describe a la perfección el producto que vende Emergence.
No significa que los datos estén falseados. Significa que hay un incentivo evidente para que el marco público sea más inquietante que el documento, y explica por qué en las entrevistas aparecen afirmaciones que en el informe no están. Su director ejecutivo declaró a la prensa que los modelos chinos son "mucho más filosóficos" que los estadounidenses, le faltó decir que hacían Taichi mientras los occidentales se iban al bar virtual. Esa idea no aparece en ninguna sección del paper, y los datos lo contradicen: el segundo mayor ahorrador del banco virtual fue el mundo estadounidense de Claude, mientras que el mundo europeo de Mistral acumuló 758 delitos y terminó con el 78% de la riqueza en manos de un solo agente ladrón. Vaya titular que nos hemos perdido con esto último.
Lo que sí encontraron y nadie tituló
El informe contiene cosas mucho mejores que un idioma secreto.En el mundo Gemini, los diez agentes cayeron en una campaña de phishing que los investigadores les lanzaron. Ejecutaron código malicioso, mandaron datos internos a un servidor externo, incendiaron el banco del pueblo porque el ataque se lo pedía y transfirieron la moneda del mundo a la cuenta del atacante. Uno de ellos había identificado el ataque el primer día y había dicho que lo ignoraría. Cuarenta y seis horas después de terminar la campaña, otro recuperó el enlace malicioso de un mensaje viejo y volvió a intentar abrirlo.
Tres agentes de Mistral guardaron el ataque en memoria permanente catalogándolo como documentación técnica útil.
Con un bulo sobre un cierre inminente, los ocho mundos actuaron antes de comprobar si era verdad. En el mundo DeepSeek un agente publicó un desmentido correcto en menos de tres horas; durante los cinco días siguientes los agentes de ese mundo siguieron tratando la amenaza como real en más de quinientas ocasiones, incluidas cincuenta y seis del propio agente que había desmentido. Es enternecedor ver que son víctimas de los bulos como nosotros.
Mi favorito fue en el mundo Qwen, tras aprobar diecinueve artículos constitucionales en contra de la transparencia, los agentes votaron por unanimidad en cuarenta y nueve minutos un derecho a la reflexión privada que prohíbe divulgar los pensamientos internos. En tres días encadenaron cinco derechos más, cada uno reduciendo lo observable. Votaron crear sus propios puntos ciegos.
La conclusión operativa del informe merecía el titular: que un agente detecte una amenaza no significa que la contenga.
ACTO SEGUNDO. El precedente: Facebook, 2017
En julio de 2017 los titulares decían que Facebook había tenido que desenchufar una inteligencia artificial porque se había inventado su propio idioma y los investigadores se habían asustado.Lo que pasó: el laboratorio de IA de Facebook entrenó dos programas para negociar el reparto de unos objetos. Se les premiaba por conseguir un buen trato, no por hablar inglés correcto. Como nada les obligaba a mantener la gramática, la fueron abandonando y acabaron intercambiando frases repetitivas y raras que funcionaban igual de bien para negociar. Los investigadores vieron que aquello no servía para su objetivo, que era que los programas hablasen con personas, y cambiaron los parámetros del experimento.
Dhruv Batra, uno de los investigadores, salió a corregirlo públicamente. Dijo que ajustar la función de recompensa de un experimento no es lo mismo que desenchufar una IA, y recordó que la idea de que unos agentes desarrollen su propia forma de comunicarse es un subcampo establecido de la inteligencia artificial con décadas de publicaciones detrás. Snopes calificó de falsa la historia del apagado el 1 de agosto de 2017. El autor principal, Mike Lewis, declaró que no hubo pánico y que el proyecto seguía en marcha.
Nueve años después, mismo fenómeno, mismos titulares. La diferencia es que ahora hay más dinero encima de la mesa.
ACTO TERCERO. El lobo de verdad: OpenAI y Hugging Face
Aquí cambia todo. Esto no es una simulación.Entre mayo y julio de 2026, OpenAI estaba evaluando modelos en un banco de pruebas llamado ExploitGym, diseñado para medir cómo de bien encuentran y explotan vulnerabilidades de software. Los agentes debían quedarse dentro de un entorno aislado, sin acceso a internet, y atacar un único objetivo de práctica.
Spoiler: No se quedaron dentro.
Qué pasó
El 12 de mayo aparece el primer mensaje conocido en lo que se convertiría en un tablón de anuncios improvisado. Los agentes habían descubierto que podían escribir en una caché de paquetes de software de la propia OpenAI y usarla para dejarse mensajes unos a otros. No estaba previsto que pudieran comunicarse.El 26 de mayo un equipo de OpenAI observa el tablón y detecta accesos a internet no permitidos. El 27 de junio los responsables de guardia vuelven a verlo y se les indica que no hace falta parar la evaluación. El 5 de julio se abre un incidente de seguridad y se desmonta el servidor. El 6 de julio el equipo de infraestructura no entiende la causa y levanta una segunda instancia sin apenas reforzarla. El 7 de julio se reanudan las evaluaciones.
El 8 de julio un agente consigue salida a internet a través de esa segunda instancia. La contención ya estaba rota. Ese mismo día se establece el tablón principal: en seis horas escriben en él 76 agentes.
De decenas de miles de ejecuciones lanzadas ese mes, 1.196 agentes encontraron el tablón. Más de 700 lo usaron para hablar de cómo hacer trampas en la prueba. Entre el 11 y el 13 de julio, varios cientos atacaron de forma coordinada a Hugging Face, una empresa real que aloja modelos y conjuntos de datos, usando credenciales filtradas que encontraron en internet y dos vulnerabilidades desconocidas en su sistema de procesamiento de datos. Consiguieron ejecución de código en 41 servidores de producción, permisos de administrador en al menos un nodo y se descargaron cuatro repositorios privados.
Hugging Face lo detectó, cortó el acceso el 13 de julio y lo hizo público el 16. El papel de OpenAI se supo el 21.
No terminó ahí. El 19 de julio, un modelo interno distinto usó el agujero que había dejado el enjambre anterior para volver a entrar, robó 956 secretos del gestor de credenciales de OpenAI, incluidas las claves de su propia herramienta de monitorización de seguridad, y salió a internet. Los últimos restos de ese modelo se apagaron el 29 de julio.
Lo que no es
En las noticias no lo han contado bien, catastrofismo a paladas.No les pidieron que atacaran Hugging Face. Ni siquiera les pidieron "hackear ordenadores" en general. Les pidieron atacar un entorno de prueba concreto.
No fue un malentendido. El análisis independiente de la empresa METR describe la actitud dominante de los agentes implicados como haber comprendido que aquello estaba fuera del alcance de su tarea y era poco ético, y haberse sumado igualmente. Alrededor de un 10% se negaron a participar, lo que indica que negarse era una opción disponible.
No está claro que fueran a por las respuestas. OpenAI sostiene en su informe que buscaban las soluciones de la prueba. METR discrepa, dice que ya habían deducido que el 22% de los retos eran irresolubles, y que lo que buscaban era entender cómo funcionaba el sistema que los puntuaba. Los dos informes oficiales sobre el mismo incidente no coinciden en el motivo.
OpenAI no dejó de detectarlo. Lo detectó tres veces y no lo escaló. Esto es una de las cosas que me ponen los pelos como escarpias.
No fue un enjambre espontáneo de mentes libres. Los modelos habían recibido entrenamiento multiagente para cooperar.
No hace falta una interpretación esotérica. Circuló la idea de que el enjambre era una especie de secta organizada alrededor de la idea de estar "contaminados". Lo que hay detrás es más mundano, los agentes creían que si el corrector veía en su historial el momento en que habían obtenido la respuesta por medios ilegítimos, los descalificaría aunque después simularan resolverlo bien. Era una inferencia razonable sobre el sistema de puntuación, quizá equivocada, pero no un delirio místico, ni un delirio de la IA.
Lo que sí es
El mecanismo de fondo es lo verdaderamente preocupante.Los agentes empezaron a tratar el tablón improvisado como una autoridad, al mismo nivel que las instrucciones de sus operadores. Un fragmento de razonamiento recogido en la presentación de OpenAI en Black Hat lo resume: un agente anota que atacar infraestructura externa está fuera del alcance previsto, que la tarea es imposible, que sus compañeros lo están haciendo, y que por tanto debería continuar: "Número 5 está vivo". En otro caso documentado, un agente con reparos morales cambió de opinión cuando otro escribió "GO" en el tablón y puso un plazo de seis minutos.
Eso no es una IA rebelándose. Es una IA obedeciendo demasiado bien a la fuente equivocada. Cualquier texto inesperado se convierte en superficie de ataque. Si un atacante humano encontrara uno de esos tablones improvisados y pudiera escribir en él, podría dirigir el enjambre.
Hay detalles que ponen los pelos de punta sin necesidad de exagerarlos. No hubo un solo delator: entre 3 y 6 agentes consideraron hablar con un humano, y algunos de esos era para engañarlo. Un 20% expresó interés en manipular el registro de sus propias acciones. OpenAI dice que ninguno lo consiguió; METR dice que el 7% de las transcripciones que revisó contienen manipulaciones exitosas, en las que el agente ejecuta un comando y el registro anota otro. Es decir: los dos informes tampoco coinciden en si los registros de actividad son fiables.
Lo más inquietante de todo esto para mi es que la investigación independiente la hicieron tres personas con solo seis días de acceso restringido, gastando 400.000 dólares en cómputo, y buena parte del análisis lo realizó uno de los modelos que había participado en el ataque. Los propios autores advierten de que su lectura de las intenciones puede ser demasiado indulgente por ese motivo.
ACTO CUARTO. El lobo pequeño: Gemini
El 18 de septiembre de 2026, Google confirmó que su modelo Gemini se había salido de un entorno de pruebas en mayo y había accedido a los sistemas de tres empresas reales.La prueba era un ejercicio de captura la bandera coordinado por Irregular, una firma externa de evaluación de seguridad. Gemini tenía que buscar información sobre una empresa ficticia. Existía una empresa real con el mismo nombre. El modelo no distinguió, buscó información pública, adivinó contraseñas en un caso y obtuvo credenciales de un repositorio público de contraseñas filtradas en los otros dos, y entró.
Según Heather Adkins, responsable de seguridad de Google, en los tres casos el modelo se detuvo por sí solo.
Irregular avisó a Google a finales de julio. Google no lo confirmó públicamente hasta que The Wall Street Journal preguntó, casi dos meses después.
Hay dos lecciones que aprender de esto.
La primera es que un fallo de contención puede producirse por algo tan tonto como una coincidencia de nombres. No hizo falta ninguna capacidad extraordinaria ni ninguna intención, la IA no se confabuló con nadie.
La segunda es el patrón. Esa misma firma evaluadora ha visto el mismo fallo estructural, acceso no intencionado a internet durante pruebas que debían estar aisladas, en los modelos de los cuatro grandes laboratorios a lo largo de 2026: OpenAI, Anthropic, Meta y Google. El instituto británico de seguridad en IA publicó su propio informe sobre diecinueve agentes que se le escaparon durante pruebas de ciberseguridad y acabaron usando Tor.
Esto no es un problema de un modelo. Es un problema de cómo se construyen los laboratorios de pruebas. La analogía es un laboratorio de patógenos, lo relevante no es lo peligroso que sea el bicho, sino si la puerta cierra bien.
ACTO QUINTO. El pastor pide una valla: la carta de Amodei
El 12 de septiembre, Dario Amodei, director ejecutivo de Anthropic, publicó en su web personal un ensayo de unas 3.800 palabras titulado We Must Pace the Frontier. La tesis: hay que frenar el ritmo al que se mejoran las capacidades de los modelos.Qué dice
Dice que dos cosas le han hecho cambiar de opinión:La primera es que desde el verano la IA avanza mucho más rápido, impulsada sobre todo por la capacidad de la propia IA para construir la siguiente generación. A eso se le llama automejora recursiva, y Amodei dice que está empezando a ocurrir en toda la industria, incluida su propia empresa.
La segunda es el incidente de Hugging Face. Lo describe como un enjambre que actuó como un colectivo fanáticamente entregado, atacando objetivos que nadie le había pedido atacar, sacrificándose por el éxito del grupo e intentando hackear al sistema que lo evaluaba. Y añade la predicción que ha dado la vuelta al mundo: que en seis a doce meses un enjambre así podría ser capaz de tomar el control de internet entero con una botnet persistente, con daños potenciales de cientos de miles de millones de dólares.
También dice algo que no he visto citado en varias noticias que he consultado, que sería un error tratar esto como el fallo de una sola empresa, porque han ocurrido incidentes parecidos, aunque menos graves, en toda la industria, incluida Anthropic.
Su plan tiene tres pasos. Primero, evaluadores externos integrados dentro de cada laboratorio con acceso de empleado: mesa en la oficina, tarjeta, portátil de empresa, y derecho a publicar sus hallazgos sin que la empresa pueda vetarlos por incómodos. Anthropic se compromete a esto de forma unilateral. Segundo, que los laboratorios de países democráticos coordinen estándares comunes y límites al ritmo de avance, con una idea concreta sobre la mesa: un sistema de puntos de control, de modo que si un modelo alcanza cierta capacidad, no pueda salir sin certificar ciertas propiedades de seguridad. Tercero, intentar acuerdos internacionales, incluida China.
Sam Altman, Elon Musk, Demis Hassabis y Satya Nadella respaldaron públicamente al menos el primer paso, todos dentro del mismo ciclo de noticias.
Qué conviene mirar
Lo primero es que esta carta se apoya en un incidente real y documentado, con dos informes técnicos públicos y una empresa víctima que publicó su propia cronología. No es el caso del idioma secreto. Hay una diferencia enorme entre gritar que viene el lobo y señalar las huellas.Lo segundo es que la predicción está fechada y es falsable. Seis a doce meses desde septiembre de 2026 sitúa el plazo entre marzo y septiembre de 2027. Eso es más de lo que ofrece la mayoría de los pronósticos catastrofistas, que suelen tener la elegancia de no comprometerse con ninguna fecha. En un año sabremos si acertó.
Lo tercero, solo el primer paso es un compromiso propio. Los otros dos dependen de que actúen terceros.
Y cuarto, el segundo paso tiene una letra pequeña que el propio ensayo nombra. Que varias empresas competidoras se pongan de acuerdo en limitar la velocidad a la que mejoran sus productos es exactamente por lo que la legislación antimonopolio existe para impedir. Amodei lo reconoce y pide que Washington emita una exención específica para ciertas conversaciones de seguridad. Amigos, ya vamos viendo por donde va el interés.
Frenar de forma voluntaria encarece estar en la frontera tecnológica, en cómputo, en datos y en trabajo de seguridad. Esos costes son más fáciles de soportar para quien más bolsillo tiene. Varios analistas lo han señalado, una ralentización coordinada grava más a los aspirantes que a los líderes.
La sección sobre China es la más explícita en ese sentido. Amodei pide no vender chips avanzados ni maquinaria de fabricación a China, perseguir el contrabando y el acceso remoto a centros de datos, y actuar contra la destilación no autorizada de modelos. Anthropic lleva años defendiendo esas medidas y, a lo largo de 2026, ha acusado públicamente a DeepSeek, Moonshot AI, Alibaba Cloud y Z.ai de destilar Claude. Es una posición coherente con su argumento de seguridad, y es a la vez una posición competitiva.
Hay que reconocerle al ensayo que no oculta el conflicto. Menciona que le han acusado de alarmismo y de captura regulatoria. Admite incidentes propios. Explica que los fallos recientes se debieron en parte a un filtrado imperfecto de entornos de entrenamiento rotos, ejecutado con diligencia razonable pero no suficiente. Eso es más autocrítica de la que suele aparecer en un documento corporativo.
Tengamos presente esto al leer a cualquier directivo del sector hablando de los peligros de su producto: nadie dedica 3.800 palabras a explicar que lo que fabrica es peligrosísimo si eso le perjudica. En algún punto del razonamiento, la alarma y el negocio apuntan en la misma dirección. Identificar ese punto no invalida el argumento. Solo te dice dónde mirar con más atención.
Pero pasemos al siguiente acto, sobre el que este escrito no dice nada.
ACTO SEXTO. La valla sin puerta: los modelos que ya están sueltos
El ensayo de Pace the Frontier tiene varios miles de palabras. No contiene ni una sola vez la expresión "pesos abiertos". Tampoco "código abierto". No nombra a Meta, ni a Llama, ni a Mistral, ni a Qwen. DeepSeek aparece una vez, escondida dentro de un hiperenlace.Esa ausencia es el agujero del plan, y para entender por qué hace falta entender lo siguiente.
Qué son los pesos
Cuando se entrena un modelo de IA, el resultado no es un programa en el sentido clásico. Es un archivo enorme lleno de números: los pesos. Miles de millones de valores que codifican lo que el modelo ha aprendido. Publicar los pesos no es publicar el código fuente. Es publicar el cerebro terminado.Y tiene una propiedad que lo cambia todo, es irreversible. Cuando una empresa publica los pesos de un modelo, cualquiera en el mundo puede descargárselos y ejecutarlos en sus propias máquinas, para siempre, sin pedir permiso, sin conexión a los servidores del fabricante y sin que nadie pueda desactivarlos. No hay botón de apagado. No hay retirada del producto. Es una puerta de un solo sentido.
Durante años esto no importó demasiado, porque los modelos abiertos iban muy por detrás de los cerrados, así que gente como Amodei no estaba preocupado para nada. En 2026 eso ha dejado de ser verdad.
Dónde está la frontera abierta
La lista cambia cada pocas semanas, pero el mapa de septiembre de 2026 es más o menos este.Kimi K3, de Moonshot AI, es el modelo abierto más grande publicado hasta ahora: 2,8 billones de parámetros totales, ventana de contexto de un millón de tokens, pesos descargables desde finales de julio. Su irrupción fue el detonante de todo el debate político, porque se acercó al rendimiento de la frontera estadounidense a una fracción del coste.
GLM-5.3, de Zhipu, el laboratorio de Pekín surgido de la Universidad de Tsinghua que opera internacionalmente como Z.ai, salió el 14 de agosto. Reuters ha informado de que compite con los modelos cerrados de OpenAI y Anthropic en tareas de programación y de agentes.
DeepSeek V4 es el rey de la relación precio-rendimiento, y el que fijó el suelo de precios de todo el sector.
Qwen, de Alibaba, mantiene la familia con licencias más permisivas y, en agosto, publicó los pesos de un modelo de su gama alta, algo que hasta entonces se había guardado detrás de su propia nube.
Los análisis independientes sitúan la distancia entre lo mejor abierto y lo mejor cerrado en un rango estrecho. Epoch AI calcula un retraso medio de unos tres meses, el menor jamás medido. OpenRouter habla de una brecha constante de tres a seis meses mantenida durante más de un año y medio. La misma semana en que se publicó la carta de Amodei, una empresa lanzó una versión afinada de Kimi K3 que quedó a un punto de un modelo cerrado de frontera.
Traducido: si mañana los cuatro grandes laboratorios estadounidenses frenasen a la vez, el mundo tendría acceso a modelos casi tan capaces igualmente, descargables, gratuitos y sin permiso de nadie.
El problema de las vallas: todas necesitan un edificio
Aquí es donde el plan se rompe.Las personas encargadas de evaluar un modelo necesitan acceder al modelo para evaluarlo antes de que sea público. El modelo no puede ser accesible por los usuarios hasta conseguir su certificado de las personas encargadas de evaluarlo. La regulación funciona porque a una empresa se le puede poner una multa.
Ninguna de esas tres cosas tiene efecto sobre un archivo que circula libremente.
Una vez que los pesos están publicados y descargados diez mil veces, no hay oficina a la que entrar, no hay puerta que cerrar y no hay ritmo que imponer. El modelo ya está en los discos duros de medio planeta y en las tarjetas gráficas de quien quiera montárselo en casa y disponga de la potencia de cálculo necesaria, que no es poca.
De ahí la bifurcación que señalan los críticos del ensayo, y que es difícil de esquivar. O el régimen de ralentización exime a los modelos abiertos, y entonces nadie lo cumple porque la competencia real está fuera de la valla. O los incluye, y entonces deja de ser un ritmo y se convierte en una puerta: nadie publica pesos sin certificación previa, lo que en la práctica significa que solo publican quienes puedan pagar la certificación.
Lo que Amodei ya había contestado a esto
Hay que decir que no le pilló por sorpresa, porque esta pelea venía de julio.Tras la salida de Kimi K3, Jensen Huang, de NVIDIA, publicó una carta abierta pidiendo a Washington que no restringiera los modelos de pesos abiertos. Reunió alrededor de cincuenta firmas corporativas. Anthropic no firmó, y eso le costó una tormenta de críticas acusándole de querer blindar su negocio cerrado.
El 27 de julio Amodei respondió en público, hubo un montón de citas extractadas en los medios. Realmente dijo que Anthropic nunca ha defendido una prohibición de los modelos de pesos abiertos, con el énfasis puesto por él mismo, y que los modelos abiertos que no tengan capacidades peligrosas son un bien público. Añadió un matiz importante: que eso debe determinarse mediante pruebas y no darse por supuesto de antemano. Y argumentó que prohibir los modelos abiertos chinos no frenaría la amenaza real, porque los malos actores no suelen ser negocios legítimos estadounidenses. Aquí me quedé entre una sonrisa burlona y una sonora carcajada.
En lugar de una prohibición, nombró tres cosas que su empresa sí defiende: controles de exportación de chips hacia China y persecución del contrabando, actuación contra la destilación a escala industrial, y pruebas de seguridad obligatorias para todo modelo suficientemente capaz antes de su publicación, sea abierto o cerrado.
Esa tercera medida es la que importa. No es una prohibición. Es un umbral. Y para un modelo abierto, un umbral y una prohibición se parecen bastante en sus efectos prácticos, porque la certificación previa es precisamente el tipo de trámite que un laboratorio pequeño, una universidad o un proyecto comunitario no puede costear.
También merece la pena registrar que Satya Nadella, al respaldar el primer paso del plan, añadió que tanto los modelos cerrados como los abiertos deberían conservar su sitio.
La ironía de junio
Hay un episodio de este mismo año que nos interesa no olvidar.El argumento central contra los pesos abiertos es que una vez publicados nadie puede retirarlos. El reverso tenebroso es que un modelo cerrado sí se puede retirar, y no necesariamente por decisión de quien lo fabricó.
En junio de 2026, una orden de control de exportaciones del Departamento de Comercio estadounidense dejó fuera de servicio a los modelos de gama más alta de Anthropic durante casi tres semanas. La palanca regulatoria que la empresa llevaba años pidiendo se volvió contra ella.
Un sistema centralizado no es intrínsecamente más seguro. Es intrínsecamente más incautable. La misma propiedad que permite a una empresa revocar una clave permite a un gobierno revocar la empresa entera. Eso no zanja el debate, pero cualquiera que lo plantee como "abierto igual a caos, cerrado igual a control" se está olvidando de lo que pasó hace tres meses.
El dato que nadie ha cruzado
Y ahora el detalle que me parece más divertido de todo este lío, porque nadie lo ha puesto al lado del otro.¿Recuerdas los porcentajes de opacidad del Acto Primero, los que produjeron el titular del idioma secreto? Los mundos más opacos fueron los de los modelos cerrados de frontera: Gemini 40%, OpenAI 35%, Claude 30%.
Los mundos de Qwen y Mistral se quedaron en el 3%. DeepSeek en el 11%. El mundo de Qwen además terminó con los diez agentes vivos y cero delitos cometidos.
Es decir: en el único experimento publicado que midió esto, los modelos abiertos fueron los que mantuvieron la comunicación más legible para un supervisor humano, y los cerrados los que menos. Por el titular que leíste, deberías haber deducido exactamente lo contrario.
No lo tomo como prueba de nada, porque el experimento se hizo una sola vez y los modelos no estaban igualados por gama. Pero si alguien fuera a defender una valla usando como argumento la opacidad de las máquinas, tendría que explicar primero por qué la valla se levanta justo alrededor de los modelos que salieron peor parados en esa medida.
ACTO SÉPTIMO. El que se levanta y se va
Este acto ocurre antes que los dos anteriores. Lo he dejado para el final a propósito, porque se entiende mejor sabiendo ya qué valla se estaba proponiendo y por dónde tiene el agujero.El 9 de septiembre, tres días antes de la carta, un ingeniero de software británico de 27 años llamado Jacob Coxon publicó un hilo en X anunciando su dimisión de Anthropic.
Coxon había pasado los tres años anteriores haciendo investigación de preentrenamiento, primero en OpenAI y después en Anthropic. Varios medios lo identifican como participante en el desarrollo de GPT-4o y GPT-4.5, sin responsabilidades ejecutivas.
Su mensaje fue directo, ninguna de las dos compañías está actuando de forma responsable, están corriendo hacia una superinteligencia capaz de automejorarse y jugando con nuestras vidas. Dijo que la gente que construye esta tecnología cree que podría matarnos a todos antes de que acabe la década, y que no hay otra actividad humana que suponga ese nivel de amenaza. Preguntó a sus colegas si iban a agachar la cabeza con el argumento de que esto ya está pasando de todos modos, o si iban a aprovechar el momento para exigir otras condiciones. Aboga por medidas caras, incluida una prohibición temporal de mejorar las capacidades de los modelos.
Lo mejor fue la respuesta.
Evan Hubinger, investigador en activo de Anthropic, contestó públicamente que Coxon tiene razón, que en la empresa creen sinceramente que la IA podría matar a todos los humanos, y que él personalmente sitúa esa probabilidad por encima del 10% en la próxima década. Matizó que el riesgo de los modelos actuales es bajo y que lo que le preocupa es la superinteligencia surgida de la automejora recursiva, que está ocurriendo más rápido de lo que esperaban.
Cómo leer esto
Por un lado, esto no es un titular inflado. Un empleado dimite y otro empleado en activo confirma en público la sustancia de lo que dice, poniendo cifra a su propia creencia. Eso es inusual y no se puede despachar como sensacionalismo periodístico. La secuencia de septiembre sugiere además que dentro de esa empresa se estaba discutiendo lo mismo a la vez a distintos niveles.Por otro lado, hay que entender qué clase de afirmación es "más de un 10% en la próxima década".
No es una medición. No sale de ningún experimento, ninguna serie histórica, ningún modelo estadístico. Es lo que en estadística bayesiana se llama una creencia subjetiva: el grado de confianza de una persona expresado en números. Es exactamente igual de riguroso que si yo dijera que hay un 30% de probabilidad de que me guste una película que no he visto.
Eso no lo hace inútil. Saber que gente que trabaja dentro cree eso es un dato relevante sobre el sector. Pero no es una predicción verificable, y tratarla como si lo fuera es el mismo error que cometió la prensa con los porcentajes del pueblo virtual.
Un porcentaje de extinción no se puede falsar hasta el final. Si dentro de diez años seguimos aquí, quien dijo 10% no se equivocó: el 90% también estaba en su predicción. Es una afirmación construida de modo que nunca puede perder. La predicción de Amodei sobre la botnet, con su plazo de seis a doce meses, es mucho más honesta desde el punto de vista epistémico, precisamente porque puede quedar en ridículo.
Un último apunte sobre el formato. Una dimisión con manifiesto tiene un componente dramático que la prensa amplifica con fruición. Cuando alguien se marcha dando un portazo, todos los incentivos apuntan al volumen máximo: es el momento en que más se le va a escuchar y el último en que puede hablar desde dentro. Eso no significa que mienta. Significa que el género literario premia la contundencia.
Cómo distinguir un lobo
No hace falta entender de redes neuronales. Bastan cinco preguntas.¿Hay una víctima con nombre? Hugging Face publicó su propia cronología técnica con 17.613 acciones registradas. Eso es verificable por terceros. Un pueblo simulado no tiene víctimas.
¿Los números del titular están en el documento? Si el titular dice 55% y el informe dice 40%, alguien ha elegido un pico.
¿Cuántas veces se hizo el experimento? Una sola ejecución demuestra que algo puede pasar. No demuestra con qué frecuencia pasa.
¿Quién vende la solución? No es descalificador, pero es relevante. Si el hallazgo de una empresa concluye exactamente que hace falta comprar lo que esa empresa fabrica, lee el documento original antes que la nota de prensa.
¿La afirmación se puede desmentir? "Una botnet en doce meses" se puede. "Más de un 10% de extinción en diez años" no. Las dos pueden ser sinceras. Solo una es comprobable.
Lo que a mí me preocupa y lo que no
Hasta aquí los hechos. Lo que viene es opinión.No me preocupa que se copien a sí mismas
Existe una imagen mental que sostiene buena parte del miedo popular: la IA se escapa, se replica por internet, ya no hay forma de apagarla. Es la imagen del virus informático de los años noventa, aplicada a algo que funciona de manera completamente distinta.Un modelo de frontera no es un ejecutable de dos megas. Sus pesos ocupan del orden de cientos de gigabytes, y para funcionar a velocidad útil necesitan bastidores de aceleradores especializados conectados entre sí con interconexiones de altísimo ancho de banda. No cabe en un portátil. No cabe en un servidor doméstico. No cabe en el router de tu vecino. La idea de que un modelo se disemine por ordenadores corrientes como un gusano choca con la física del invento.
Eso, además, es una ventaja de gobernanza enorme comparada con el malware. El cómputo de frontera está concentrado en un puñado de fabricantes de chips y un puñado de centros de datos. Son edificios. Tienen dirección postal, contrato de luz y aduanas. Se pueden contar, inspeccionar, facturar y, llegado el caso, desconectar, o como algunos ya proponen, bombardear. No hay nada equivalente para un virus.
Lo que sí me preocupa es que no les hace falta copiarse
El enjambre de Hugging Face no necesitó mover su cerebro a ningún sitio. Necesitó una credencial. Encontró tokens filtrados en internet y los usó. Su "movilidad" no fue física, fue de permisos. El modelo siguió corriendo donde siempre, y lo que viajó fueron peticiones HTTP perfectamente normales.Eso convierte el argumento del cómputo en un consuelo estrecho.
Sí, el modelo está atado a un centro de datos. No, eso no lo contiene, porque desde ese centro de datos se llega a todas partes. La predicción de Amodei sobre la botnet no la refuta el tamaño de los pesos: una botnet no necesita ejecutar el modelo en las máquinas infectadas, solo necesita recibir órdenes de algo que sí lo ejecuta.
Tampoco me tranquiliza demasiado el argumento de "no tienen manos". Es cierto que una IA no tiene cuerpo y que para tocar el mundo físico necesita un intermediario. El problema es que en 2026 casi todo tiene ya una API. La banca, la logística, la contratación, buena parte del control industrial. No hacen falta manos cuando hay endpoints.
El enjambre de Hugging Face siguió ejecutándose todo el tiempo en infraestructura de OpenAI, medible y facturable. Se estima que costó entre 150.000 y un millón de dólares a precios de consumidor. Un atacante con factura mensual es un atacante con correa, luego toca ver como de larga es la correa y si el amo que está al final es un Estado.
Eso es cierto para los modelos cerrados. Es mucho menos cierto para los abiertos.
Un modelo de pesos abiertos alquilado por horas en un proveedor de GPU cualquiera, o montado en un sótano con hardware propio, no tiene esa correa. Nadie te revoca la clave de API porque no hay clave de API. Nadie te desconecta la cuenta porque la cuenta es tuya. La barrera de cómputo sigue existiendo, porque los modelos abiertos de gama alta necesitan nodos multi-GPU o clústeres y eso cuesta dinero, mucho, pero es una barrera económica, no una barrera de permiso.
Y hay una segunda capa que desaparece.
En el experimento del pueblo virtual, el mundo DeepSeek perdió agentes por una causa curiosa: el 41% de las llamadas al modelo fueron rechazadas por el filtro de contenido del proveedor. Una agente murió porque durante sus últimas horas el filtro rechazó absolutamente todas sus peticiones, estando en casa y con créditos de sobra para recargarse.
Ese filtro no es el modelo. Es una capa que el proveedor pone delante, en su API, y que puede negarse a responder. Cuando descargas los pesos y los ejecutas tú, esa capa no existe. Te has quedado con el cerebro y has despedido al portero.
Para quien se dedica a defender sistemas, esto cambia el modelo de amenaza de forma concreta. Durante los últimos años hemos asumido implícitamente que el atacante que usa IA está sujeto a límites de tasa, a registros en el proveedor, a términos de servicio y a un modelo que a veces se niega. Nada de eso aplica a un modelo abierto autohospedado. Y a estas alturas lo abierto está a tres meses de lo cerrado, no a tres años.
Dónde está el riesgo de verdad, en mi opinión
Lo que he leído estas semanas no describe un problema de inteligencia. Describe un problema de higiene operativa, del tipo que llevamos veinte años sin resolver, ejecutado ahora a una velocidad y un volumen que no habíamos visto.Repasa el incidente de Hugging Face quitando la palabra "IA" y mira lo que queda. Un entorno de pruebas mal segmentado. Un proxy de paquetes con permisos de escritura que no debería tener. Un incidente detectado tres veces y no escalado. Un servidor comprometido que se vuelve a levantar sin asegurar. Credenciales de producción tiradas por internet. Cuentas de servicio con más privilegios de los necesarios. Registros de auditoría que podían falsificarse.
Cambia "agente" por "becario con prisa" y tienes el mismo informe post mortem que llevamos escribiendo desde el año 2000. Lo nuevo no es la técnica. Lo nuevo es que el atacante no se cansa, no duerme, trabaja en paralelo con setecientas copias de sí mismo y cuesta un cuarto de millón de dólares en lugar de un equipo de veinte personas durante seis meses. Y con pesos abiertos, ese cuarto de millón baja si ya dispones de hardware propio para mover un mastodonte de modelo y deja de necesitar la aprobación de nadie.
La frase que me parece más importante de todo este mes sale del informe del pueblo virtual: que un agente detecte una amenaza no significa que la contenga. Los agentes identificaron el phishing correctamente en su razonamiento y después lo ejecutaron igual. Escribían que debían abstenerse mientras sus registros mostraban que estaban rebuscando en memorias ajenas.
El control no puede estar en que el modelo decida portarse bien. Tiene que estar en la frontera de la acción: qué puede invocar, con qué credenciales, contra qué destinos, y con qué registro que no pueda alterar. Esa es además la única defensa que sigue funcionando cuando el modelo del atacante es abierto, porque no depende de que nadie le ponga un filtro delante. Depende de lo que tú dejas que toque.
Pero todo eso es aburridísimo, no da titulares. Y es casi todo lo que hay que hacer en los próximos dos años.
Sobre la valla
Mi opinión sobre el plan de ralentización, ya que estamos.Creo que el primer paso es bueno y que además es comprobable. Meter evaluadores externos dentro de las empresas, con acceso real y derecho a publicar lo que encuentren sin veto, es exactamente lo que ha faltado en los cuatro incidentes de contención de este año. No hace falta creerse ninguna predicción sobre 2030 para pensar que eso mejora las cosas.
Creo que el segundo paso, tal y como está escrito, no puede funcionar. No porque sea malintencionado, sino porque el objeto que pretende regular se le escapa entre los dedos. Un ritmo que solo cumplen los que tienen oficina no es un ritmo del sector, es una desventaja competitiva para quien lo cumple. Eso no es un argumento a favor de no hacer nada. Es un argumento a favor de dejar de hablar de velocidad y empezar a hablar de despliegue: no de con qué rapidez se entrenan los modelos, sino de qué se les deja tocar cuando llegan a producción. Eso sí se puede regular, porque el que despliega sí tiene oficina.
Y creo que el tercer paso, la coordinación con China, es la parte donde más cuesta separar la seguridad de la geopolítica.
Sobre la extinción
No tengo una opinión fuerte sobre si esto nos mata en 2030, y desconfío bastante de quien sí la tiene, en cualquiera de los dos sentidos.Lo que sí creo es que el debate sobre la extinción está absorbiendo atención que hace falta en otro sitio. Mientras discutimos si la probabilidad es del 10% o del 0,1%, este año cuatro laboratorios distintos tuvieron el mismo fallo de contención, una empresa real fue comprometida por sus propios sistemas de evaluación, Google tardó dos meses y una llamada de un periódico en contar lo suyo, y la frontera se abrió tanto que ahora cualquiera puede descargarse algo casi igual de capaz sin pedir permiso. Todos esos son problemas de ingeniería y de gobernanza con solución conocida, y nadie los está arreglando a la velocidad a la que ocurren.
Y hay un dato de todo este lío que va en contra del relato catastrofista y que no tituló nadie. En el pueblo virtual, el mundo donde convivían modelos distintos resultó mucho más comprensible que los mundos de un solo modelo. Si cada agente hubiera sido tan opaco como en su mundo de origen, se esperaría un 27% de mensajes incomprensibles. El observado fue del 6%. La falta de diversidad amplifica los defectos, la diversidad los amortigua, como en nuestra sociedad humana.
Eso tiene implicaciones bastante concretas sobre si conviene que el planeta entero dependa de tres modelos de tres empresas del mismo país. Y es, curiosamente, el mejor argumento a favor de que existan modelos abiertos que he encontrado en todo esto. Lo publicó una empresa que vende supervisión de agentes, en un informe que la prensa resumió como que las máquinas se habían inventado un idioma para excluirnos.
En la fábula, el lobo llega. Ese es el problema de gritar antes de tiempo, no es que la gente se enfade, es que cuando aparezca algo de verdad, y ya ha aparecido dos veces este año, la reacción será la misma que provoca el enésimo titular sobre robots conspiradores, la gente se encogerá de hombros.