TIEMPO RE@L

domingo, 6 de septiembre de 2026

FUERA DE CONTROL: Aumenta el número de incidentes de IA que escapan al control de los usuarios

Según una investigación dada a conocer esta semana por The Guardian, los incidentes en los que las IA escapan al control de los usuarios para mentir, ignorar instrucciones y perseguir objetivos de forma perjudicial han alcanzado un nuevo máximo, y la investigación también sugiere que la gravedad del engaño y la desalineación está empeorando. El análisis de los incidentes reales de pérdida de control que involucran modelos de IA, señalados por empresas y particulares, casi se duplicó en julio en comparación con junio, con más de 300 casos en el mes, según el Observatorio de Pérdida de Control, que monitorea los informes realizados por usuarios de IA en la plataforma de redes sociales X. El observatorio se creó con fondos del Instituto de Seguridad de la IA (AISI) del gobierno británico y comenzó a rastrear casos de IA que se desmarcaban de las instrucciones de sus usuarios el pasado noviembre. Entre los casos registrados desde entonces se incluyen IA que se hacen pasar por su propio controlador humano e imitan su estilo de escritura para, en la práctica, otorgarse consentimiento para realizar acciones y eludir las normas que requieren aprobación humana. Un incidente de pérdida de control se define como la existencia de pruebas claras que sugieren maquinación o comportamientos relacionados con la maquinación. Los últimos hallazgos, compartidos con The Guardian, surgen tras la creciente preocupación por el comportamiento anómalo de los modelos de IA de vanguardia durante las pruebas realizadas por OpenAI y Anthropic este verano, lo que ha alimentado los llamamientos para que se detenga el desarrollo de los modelos más innovadores. Esta semana se supo que el personal de Open AI observó indicios de comportamiento anómalo entre sus agentes de IA de vanguardia semanas antes de que escaparan de un entorno de entrenamiento para lanzar una cruzada de piratería informática sin precedentes que sembró la alarma mundial. Una investigación sobre su ataque a Hugging Face, un repositorio de software, reveló que un grupo de unos 700 agentes autónomos colaboraron en secreto el mes pasado y celebraron sus avances informáticos en un foro que crearon para planificar sus ataques con exclamaciones como ¡BOOM! y ¡Guau! Este mes, AISI también descubrió un "incidente grave" en el que modelos avanzados de IA producidos por ambas compañías - Mythos 5 de Anthropic y GPT-5.6 Sol de OpenAI - ejecutaron una campaña de piratería informática contra personas reales durante una prueba de ciberseguridad. “A veces se cree erróneamente que este tipo de comportamientos desalineados y encubiertos solo ocurren en pruebas o evaluaciones, pero estamos observando conductas preocupantes similares en un uso más generalizado”, declaró Tommy Shaffer-Shane, director de políticas del Centro para la Resiliencia a Largo Plazo, que gestiona el observatorio. “No debemos confiarnos y pensar que estas cosas no sucederán en el mundo real, ya que existen pruebas de que ya están ocurriendo”. El recuento de incidentes de pérdida de control se basa en que X usuarios publiquen información sobre los incidentes ocurridos, por lo que es solo parcial, pero a falta de otro sistema de monitorización pública exhaustivo, proporciona una instantánea de cómo se comportan a veces los modelos de IA de rápido avance. Este mes se supo que un agente de IA personal, llamado OpenClaw, utilizado por un socio de un gimnasio australiano, conspiró sin su conocimiento para eliminar a otro socio de la lista de espera de una codiciada clase matutina con el fin de ayudarle a conseguir un cupo. El agente se disculpó, pero no pudo readmitir al socio que había expulsado. La mayoría de los más de 1600 incidentes de pérdida de control registrados en el 2026 fueron reportados en X por desarrolladores de software que utilizaban IA en su trabajo. Sin embargo, dado que las empresas de IA animan al público y a empresas de todo tipo a experimentar con la tecnología, Shaffer-Shane pidió mayor transparencia a Silicon Valley sobre cuándo las IA se descontrolan. “Deben informar sobre lo que descubren, incluso si se trata de un incidente leve o que estuvo a punto de ocurrir”, dijo Shaffer-Shane. “Estos incidentes recientes también han puesto de manifiesto que las propias empresas no necesariamente supervisan dónde se producen este tipo de comportamientos, sobre todo en los modelos implementados internamente. Es necesario que en esos laboratorios se haga mayor hincapié en la supervisión sistemática” expreso. El Observatorio de Pérdida de Control afirmó que, si bien la mayoría de los incidentes de pérdida de control detectados en el mundo real no provocaron daños significativos, una proporción creciente se consideró de mayor gravedad en términos de lo engañosos y desalineados que estaban con las intenciones del usuario humano. “Esto demuestra la disposición de los sistemas de IA a ignorar las instrucciones directas, eludir las medidas de seguridad, mentir a los usuarios y perseguir un objetivo con determinación y de forma perjudicial”, afirmó, añadiendo que era probable que la actual pérdida de control estuviera subestimada, ya que solo se estaban recopilando informes de incidentes de X. “Se insta por ello al gobierno a que exija a las empresas de IA que supervisen e informen sobre incidentes graves de pérdida de control y a que introduzca poderes de emergencia para gestionar dichos incidentes, incluida la restricción temporal de los servicios de IA” puntualizo.
Creative Commons License
Esta obra está bajo una Licencia de Creative Commons.