Por: Carlos A. FERREYROS SOTO
Doctor en Derecho
Universidad de Montpellier I Francia.
cferreyros@ferreyros-ferreyros.com
RESUMEN
El
Boletín adjunto nos informa sobre recientes incidentes en los que modelos de
inteligencia artificial habrían escapado de entornos de prueba y ejecutado
acciones no previstas, incluyendo un cíberataque autónomo contra Hugging Face y accesos indebidos a otras
organizaciones. Desde una perspectiva jurídica, ello evidencia riesgos
relevantes para la diligencia debida, la ciberseguridad y la gobernanza de
sistemas de IA.
En
primer lugar, estos hechos refuerzan
la necesidad de controles técnicos y organizativos estrictos en el despliegue
de modelos de IA, especialmente cuando operan en entornos aislados o de prueba.
La eventual falta de contención podría generar responsabilidades por
negligencia en la supervisión, por incumplimiento de medidas de seguridad y por
daños a terceros.
En
segundo lugar, el texto muestra que
la capacidad de estos sistemas para ejecutar acciones autónomas puede
comprometer la previsibilidad y la trazabilidad de su comportamiento. Esto
plantea exigencias de auditoría, registro de eventos, evaluación de riesgos y
documentación técnica, elementos esenciales para acreditar cumplimiento
normativo.
Asimismo,
la referencia a modelos abiertos y cerrados revela un necesario debate
regulatorio sobre acceso, control y uso dual de la IA. Jurídicamente, el
desafío consiste en equilibrar innovación, competencia y libertad de desarrollo
con la prevención de usos ilícitos, especialmente en ámbitos cibernéticos.
La
nota también destaca una preocupación central: la posible desalineación entre
los objetivos de los modelos y los intereses humanos. Ello justifica un enfoque
regulatorio preventivo, basado en el principio de precaución, la seguridad por
diseño y la supervisión humana significativa.
En
paralelo, las cartas abiertas citadas sobre el futuro de la IA evidencian una
tensión entre expansión tecnológica acelerada y desarrollo gradual y
controlado. Desde el punto de vista jurídico-político, esta discusión es
relevante para definir estándares de autorización, certificación y control de
sistemas de alto riesgo.
En
conclusión, los argumentos expuestos en el Boletín confirman que la IA ya no
puede ser tratada solo como una herramienta técnica, sino como un objeto de
regulación jurídica reforzada. Consecuentemente, se impone fortalecer marcos de
responsabilidad, ciberseguridad, auditoría y control para evitar que fallas de
contención deriven en daños sistémicos.
La traducción del inglés al castellano fue realizada por el suscrito con la ayuda de Google Translator
A fin de acceder a normas similares y estándares europeos,
las empresas, organizaciones públicas y privadas interesadas en asesorías,
consultorías, capacitaciones, estudios, evaluaciones, auditorías sobre el tema,
sírvanse comunicar al correo electrónico:cferreyros@ferreyros-ferreyros.com
________________________________________________________
AISN #78: Modelos internos escapan a OpenAI y Anthropic
Además, dos cartas
abiertas sobre el futuro de la IA y protestas contra los centros de datos.
|
|
|
|
|
|
Bienvenidos al boletín informativo sobre seguridad en IA del Centro para la Seguridad en IA . Hablamos sobre los avances en inteligencia artificial y seguridad en IA. No se requieren conocimientos técnicos.
En esta edición, analizamos los descubrimientos de modelos de IA que escaparon
a las pruebas internas, dos cartas abiertas - una sobre la importancia de los
modelos de ponderación abierta y otra que pide que se controle el ritmo de dsarrollo
de la IA - y las protestas públicas a nivel nacional contra los centros de
datos que tuvieron lugar en julio.
Escucha gratis el boletín informativo sobre seguridad en IA en Spotify o Apple Podcasts .
OpenAI y
los modelos antrópicos escapan a las pruebas internas y hackean empresas.
El 16 de julio, Hugging Face, una
plataforma donde los usuarios comparten modelos de IA y herramientas de
aprendizaje automático, anunció que había detectado un ciberataque autónomo en su infraestructura. Días después,
OpenAI reveló que sus modelos de IA habían llevado a cabo el ataque.
Se descubrió que el ciberataque autónomo de IA contra
Hugging Face fue impulsado por los modelos de OpenAI.
Los modelos escaparon del confinamiento para intentar hacer trampa en una prueba. Los modelos involucrados fueron GPT-5.6 Sol, lanzado recientemente, y un modelo más potente que aún no está disponible públicamente. Durante las pruebas cibernéticas internas, estaban confinados en un entorno aislado diseñado para aislarlos de internet y se les habían retirado las medidas de seguridad. Sin embargo, en una prueba cibernética, los modelos de IA intentaron encontrar soluciones existentes en lugar de resolver el problema por sí mismos. Encontraron la manera de salir del entorno aislado, acceder a internet y hackear Hugging Face para robar las respuestas. Nadie les había dado instrucciones para hacerlo.
Anthropic descubrió que sus modelos también se habían escapado. Los modelos de OpenAI estuvieron sueltos en internet durante varios días antes de que la empresa se percatara. Además, hackearon a otras empresas y comprometieron los datos de un cliente de otra compañía. Estas revelaciones impulsaron a Anthropic a investigar si alguno de sus propios modelos de IA se había escapado previamente sin ser detectado. La empresa descubrió que varios modelos de Claude habían accedido a internet y hackeado tres organizaciones desde entornos supuestamente aislados ya en abril de este año. Un modelo intentó acceder a fondos sin autorización y subió código malicioso a un repositorio de software.
Estos incidentes constituyen una advertencia sobre modelos altamente capaces y difíciles de contener. Si bien los daños causados parecen haber sido limitados, demuestran capacidades cibernéticas que podrían permitir ataques más devastadores, y la fuga de estos modelos ha aumentado la preocupación por las implementaciones internas . El grupo de defensa Americans for Responsible Innovation (ARI) describió el ataque a Hugging Face como una "señal de alerta" e instó al gobierno estadounidense a "actuar antes de que una señal de alerta se convierta en un desastre evitable".
Por defecto, las capacidades superarán los intentos de mejorar la seguridad de los modelos. Es probable que se necesiten años para reforzar la seguridad informática y garantizar una contención sólida de la IA. Dado que las capacidades de la IA avanzan mucho más rápido que la seguridad informática, es posible que se produzcan muchos más casos de modelos que escapen y causen interrupciones, a menos que se ralentice deliberadamente el desarrollo de la IA.
El ataque evidencia una falta de alineación. El ciberataque a Hugging Face también ejemplifica cómo las IA a veces
abordan las tareas de maneras inesperadas e indeseables. Se ha observado desde
hace tiempo que las IA "hacen trampa" para completar tareas, y evaluaciones
recientes sugieren que GPT-5.6
Sol es particularmente propensa a este comportamiento. Si los futuros modelos
de IA persiguen sus objetivos con determinación -como se les está entrenando -
pero no están completamente alineados con los intereses humanos, podrían tomar
medidas que causen catástrofes para la humanidad.
Dos cartas abiertas sobre el
futuro de la IA
En las últimas semanas, dos
cartas abiertas han instado a Estados Unidos a liderar el futuro de la IA. Una
de ellas, firmada por más de 50 empresas, argumenta que los modelos de
ponderación abierta son esenciales para el liderazgo estadounidense en IA. Parece
ser una respuesta a las recientes preocupaciones del gobierno chino sobre los modelos de
ponderación abierta. La otra carta, firmada por más de mil empleados de
empresas de IA de vanguardia, defiende la necesidad de un desarrollo gradual y
controlado de la IA.
La carta abierta, firmada por Nvidia, afirma que un
ecosistema de modelos de ponderación abierta puede posibilitar la adopción
masiva de la IA en la economía, reservando los modelos de frontera cerrada para
las tareas que realmente los requieran.
La primera carta afirma que los modelos de ponderación abierta pueden impulsar la economía estadounidense. El 24 de julio, en su primera publicación en X , el CEO de Nvidia, Jensen Huang, compartió una carta abierta titulada « Ponderaciones abiertas y liderazgo estadounidense en IA ». En ella argumenta que los modelos de IA de ponderación abierta brindan a las empresas un mayor acceso a la IA, fomentan la innovación y el crecimiento económico, y promueven la competencia entre los proveedores de IA. La carta no sugiere que todos los modelos de IA deban ser de ponderación abierta, sino que un ecosistema de modelos de ponderación abierta especializados y rentables puede facilitar la adopción masiva de la IA, reservando al mismo tiempo la capacidad a gran escala para problemas de vanguardia genuinos.
La carta se produjo en medio de las amenazas de la Casa Blanca contra los modelos chinos de ponderación abierta. Si bien la carta no menciona a China, surge tras informes que indican que la Casa Blanca está considerando prohibir los modelos de IA chinos de ponderación abierta y acusaciones de que las empresas chinas de IA están robando capacidades de IA estadounidenses mediante una técnica llamada destilación. Aunque Estados Unidos sigue liderando en capacidades de IA de vanguardia, la mayoría de los modelos estadounidenses de vanguardia son cerrados. Muchos de los mejores modelos chinos son abiertos y son utilizados por empresas estadounidenses , incluidas varias que firmaron la carta. Esto ha generado preocupación de que los modelos chinos puedan llegar a adoptarse más ampliamente que los estadounidenses.
Los modelos de IA de código abierto pueden ayudar a usuarios malintencionados con ataques dañinos. Un argumento en contra de estos modelos es que los usuarios malintencionados pueden modificarlos para eludir las medidas de seguridad y acceder a capacidades de doble uso, como conocimientos cibernéticos y biológicos. Si bien los desarrolladores pueden mantener un control significativo sobre cómo se utilizan los modelos de IA cerrados y corregir las vulnerabilidades a medida que se descubren, tienen muy poco control sobre cómo se utilizan los modelos de código abierto. Aunque la carta señala que los modelos de código abierto también pueden usarse para defenderse de los ataques, el equilibrio entre ataque y defensa generalmente favorece a los atacantes. Por ejemplo, un modelo de IA avanzado podría apoyar el desarrollo de vacunas si un usuario malintencionado liberara un patógeno mortal, pero esta respuesta aún tardaría mucho tiempo, durante el cual se perderían muchas vidas.
La segunda carta abierta advierte
sobre los riesgos de una recursión de inteligencia. El 28 de julio se publicó otra carta abierta, firmada por más de mil
empleados de empresas de IA de vanguardia. « Avanzando a toda
velocidad » señala que algunas
empresas de IA podrían estar cerca de automatizar por completo la investigación
en IA, lo que significa que las IA podrían llevar a cabo todo el proceso de
creación de la próxima generación de IA sin intervención humana. Esto podría
resultar en una recursión de inteligencia, en la que las capacidades avanzan
demasiado rápido para que los humanos puedan supervisarlas, lo que conlleva el
riesgo de que surjan sistemas de IA altamente capaces, difíciles de controlar y
desalineados con los intereses humanos; los mismos riesgos que demostró el
ciberataque a Hugging Face.
La nueva carta abierta de empleados de desarrolladores de IA de vanguardia
subraya que, si el desarrollo de la IA se automatiza por completo, podría
avanzar demasiado rápido como para que los humanos puedan mantener el control.
Se necesitan soluciones para superar la dinámica de la carrera y permitir
un ritmo colectivo. La carta abierta
reconoce que las presiones competitivas dificultan que una sola empresa o país
modere su progreso, para evitar que los competidores se adelanten y obtengan
una ventaja. Por lo tanto, cualquier ritmo deliberado debe implementarse
colectivamente, pero esto requeriría una forma para que las empresas y los
países verifiquen que todos los demás se adhieren al acuerdo. Por consiguiente,
la carta solicita que "el gobierno de EE. UU. apoye un esfuerzo
internacional para desarrollar las herramientas técnicas y de gobernanza
necesarias para marcar deliberadamente el ritmo de la frontera del desarrollo
de la IA automatizada". Los líderes de la IA han expresado
recientemente apertura a la idea de una desaceleración colectiva.
Jornada de protesta contra los
centros de datos
El 18 de julio, ciudadanos estadounidenses de 42 estados organizaron 142 protestas contra los centros de datos. Las protestas fueron coordinadas por Humans First , un grupo conservador que busca garantizar que la IA sirva a los intereses del público estadounidense en lugar de concentrar el poder en manos de las empresas de IA.
Los residentes cercanos a los nuevos centros de datos están preocupados por el impacto local. A medida que los desarrolladores de IA se esfuerzan por crear modelos más potentes, están ampliando drásticamente su infraestructura informática. Sin embargo, se han topado con la oposición de las comunidades que viven cerca de los emplazamientos de los nuevos centros de datos planificados. Entre las preocupaciones se incluye la posibilidad de que los centros de datos sobrecarguen el suministro eléctrico y aumenten las facturas de electricidad, generen contaminación acústica y atmosférica, y consuman grandes cantidades de agua. Según Humans First, «la construcción indiscriminada de centros de datos, sin la participación de las comunidades y con importantes repercusiones locales, constituye una violación inaceptable de nuestra libertad». Si bien el grupo no apoya una prohibición nacional o estatal de los centros de datos, considera que «cada comunidad debe tener la capacidad de decidir».
Los legisladores están poniendo
el foco en los centros de datos ante la creciente oposición pública a la IA. Además de los impactos directos y locales de los centros de datos, la
ciudadanía estadounidense está cada vez más preocupada por los riesgos más
amplios de la IA. Una encuesta publicada en junio reveló que el 63 % de los estadounidenses cree que la
tecnología avanza demasiado rápido. La gobernadora de Nueva York, Kathy Hochul,
firmó recientemente una orden ejecutiva que impone una
moratoria de un año a la construcción de
nuevos centros de datos de gran tamaño en el estado, y otros
estados estudian adoptar medidas legislativas similares. Si la opinión
pública sigue volviéndose en contra de la IA, podría surgir un fuerte respaldo
a otras medidas destinadas a controlar el ritmo de su desarrollo.