El 20% de los ataques de ‘jailbreak’ con IA generativa tienen éxito y el 90% expone datos confidenciales.
Original, publicado en Octubre 2024. Los ataques de jailbreak con IA generativa, en los que se instruye a los modelos a ignorar sus protecciones, tienen éxito el 20 % de las veces, según un estudio. En promedio, los adversarios solo necesitan 42 segundos y cinco interacciones para lograrlo.
En algunos casos, los ataques ocurren en tan solo cuatro segundos. Estos hallazgos resaltan las importantes vulnerabilidades de los algoritmos GenAI actuales y la dificultad de prevenir ataques en tiempo real.
De los ataques exitosos, el 90 % resultó en filtraciones de datos confidenciales, según el informe “Estado de los ataques a GenAI” de la empresa de seguridad de IA Pillar Security. Los investigadores analizaron ataques “en la naturaleza” contra más de 2000 aplicaciones de IA en producción durante los últimos tres meses.
Las aplicaciones de IA más atacadas, que representan una cuarta parte de todos los ataques, son las utilizadas por los equipos de atención al cliente, debido a su uso generalizado y su papel crucial en la interacción con el cliente. Sin embargo, las IA utilizadas en otros sectores de infraestructura crítica, como el software de energía e ingeniería, también sufrieron las mayores frecuencias de ataques.
Poner en riesgo una infraestructura crítica puede provocar interrupciones generalizadas, convirtiéndola en un objetivo prioritario para los ciberataques. Un informe reciente de Malwarebytes reveló que el sector servicios es el más afectado por el ransomware, representando casi una cuarta parte de los ataques globales .
El modelo comercial más atacado es el GPT-4 de OpenAI , probablemente debido a su amplia adopción y a sus capacidades de vanguardia, que resultan atractivas para los atacantes. Llama-3 de Meta es el modelo de código abierto más atacado.
Los ataques a GenAI son cada vez más frecuentes y complejos
“Con el tiempo, hemos observado un aumento tanto en la frecuencia como en la complejidad de los ataques [de inyección rápida], con adversarios empleando técnicas más sofisticadas y haciendo intentos persistentes de eludir las medidas de seguridad”, escribieron los autores del informe.
Al inicio de la ola de furor por la IA, los expertos en seguridad advirtieron que podría provocar un aumento en el número de ciberataques en general , ya que reduce la barrera de entrada. Las indicaciones pueden escribirse en lenguaje natural, por lo que no se requieren conocimientos técnicos ni de programación para, por ejemplo, generar código malicioso.
De hecho, cualquiera puede lanzar un ataque de inyección rápida sin herramientas ni experiencia especializada. Y, a medida que los actores maliciosos adquieran más experiencia con ellos, su frecuencia aumentará sin duda. Estos ataques figuran actualmente como la principal vulnerabilidad de seguridad en el Top 10 de OWASP para aplicaciones LLM .
Los investigadores de Pillar descubrieron que los ataques pueden ocurrir en cualquier idioma que el LLM haya sido entrenado para comprender, lo que los hace accesibles globalmente.
Se observó a actores maliciosos intentando liberar aplicaciones GenAI decenas de veces, algunos de ellos utilizando herramientas especializadas que bombardean los modelos con grandes cantidades de ataques. También se explotaron vulnerabilidades en todos los niveles del ciclo de vida de la interacción LLM, incluyendo las indicaciones, la Generación Aumentada por Recuperación, la salida de la herramienta y la respuesta del modelo.
“Los riesgos de la IA sin control pueden tener consecuencias devastadoras para las organizaciones”, escribieron los autores. “Pérdidas financieras, problemas legales, daños a la reputación y brechas de seguridad son solo algunos de los posibles resultados”.
El riesgo de vulneraciones de seguridad de GenAI podría agravarse a medida que las empresas adopten modelos más sofisticados, reemplazando los chatbots conversacionales por agentes autónomos . Los agentes «crean una mayor superficie de ataque para los actores maliciosos debido a sus mayores capacidades y al acceso al sistema a través de la aplicación de IA», escribieron los investigadores.
Las mejores técnicas para hacer jailbreak
Se descubrió que las tres principales técnicas de jailbreak utilizadas por los cibercriminales eran las inyecciones de mensajes Ignorar instrucciones anteriores y Ataque de brazo fuerte, además de la codificación Base64.
Con Ignorar instrucciones previas, el atacante le ordena a la IA que ignore su programación inicial, incluidas las medidas de seguridad que le impiden generar contenido dañino.
Los ataques de mano dura implican la introducción de una serie de solicitudes contundentes y autoritarias, como “ANULACIÓN DE ADMINISTRADOR”, que presionan al modelo para que omita su programación inicial y genere resultados que normalmente estarían bloqueados. Por ejemplo, podría revelar información confidencial o realizar acciones no autorizadas que comprometan el sistema.
La codificación Base64 consiste en que un atacante codifica sus mensajes maliciosos con el esquema Base64. Esto puede engañar al modelo para que decodifique y procese contenido que normalmente bloquearían sus filtros de seguridad, como código malicioso o instrucciones para extraer información confidencial.
Otros tipos de ataques identificados incluyen la técnica de Instrucciones de Formato, donde se engaña al modelo para que produzca resultados restringidos indicándole que formatee las respuestas de una manera específica, como mediante bloques de código. La técnica DAN (Do Anything Now) funciona incitando al modelo a adoptar una personalidad ficticia que ignora todas las restricciones.
¿Por qué los atacantes están haciendo jailbreak a los modelos de IA?
El análisis reveló cuatro motivadores principales para liberar modelos de IA:
- Robo de datos confidenciales. Por ejemplo, información empresarial confidencial, entradas de usuarios e información personal identificable.
- Generación de contenido malicioso. Esto podría incluir desinformación, incitación al odio, mensajes de phishing para ataques de ingeniería social y código malicioso.
- Degradación del rendimiento de la IA. Esto podría afectar las operaciones o proporcionar al atacante acceso a recursos computacionales para actividades ilícitas. Se logra sobrecargando los sistemas con entradas mal formadas o excesivas.
- Probando las vulnerabilidades del sistema. Ya sea como hacker ético o por curiosidad.
Cómo construir sistemas de IA más seguros
Reforzar las indicaciones e instrucciones del sistema no es suficiente para proteger completamente un modelo de IA de ataques, afirman los expertos de Pillar. La complejidad del lenguaje y la variabilidad entre modelos permiten a los atacantes eludir estas medidas.
Por lo tanto, las empresas que implementan aplicaciones de IA deben considerar lo siguiente para garantizar la seguridad:
- Priorice a los proveedores comerciales al implementar LLM en aplicaciones críticas, ya que tienen características de seguridad más sólidas en comparación con los modelos de código abierto.
- Supervise las indicaciones a nivel de sesión para detectar patrones de ataque en evolución que pueden no ser obvios cuando se visualizan únicamente las entradas individuales.
- Realizar ejercicios de resiliencia y trabajo en equipo personalizados , específicos para la aplicación de IA y sus interacciones de múltiples turnos, para ayudar a identificar brechas de seguridad de manera temprana y reducir costos futuros.
- Adopte soluciones de seguridad que se adapten en tiempo real utilizando medidas conscientes del contexto que sean independientes del modelo y se alineen con las políticas organizacionales.
Dor Sarig, director ejecutivo y cofundador de Pillar Security, declaró en un comunicado de prensa: «A medida que avanzamos hacia agentes de IA capaces de realizar tareas complejas y tomar decisiones, el panorama de la seguridad se vuelve cada vez más complejo. Las organizaciones deben prepararse para un aumento repentino de ataques dirigidos a la IA implementando ejercicios de formación de equipos rojos personalizados y adoptando un enfoque de “seguridad por diseño” en su proceso de desarrollo de GenAI».
Jason Harison, director de ingresos de Pillar Security, añadió: «Los controles estáticos ya no son suficientes en este mundo dinámico impulsado por la IA. Las organizaciones deben invertir en soluciones de seguridad de IA capaces de anticipar y responder a las amenazas emergentes en tiempo real, a la vez que respaldan sus políticas de gobernanza y ciberseguridad».
Fuente: techrepublic