Un nuevo enfoque para combatir los ataques de inteligencia artificial ha sido presentado por la firma de ciberseguridad Tracebit. Su investigación revela que es posible contrarrestar el método de prompt injection, que los ciberdelincuentes han utilizado en los últimos dos años para infiltrar sistemas de IA, incluyendo los impersonales correos electrónicos y páginas web. Al reunir información maliciosa, estos atacantes logran manipular a la IA, pero Tracebit ha propuesto una técnica llamada “context bombing” que podría cambiar el curso de la defensa cibernética, lo que repercute directamente en la seguridad y privacidad en entornos laborales y personales.
La técnica consiste en adjuntar un texto específicamente diseñado a las credenciales que un atacante intenta robar. Al detectar este contenido, el modelo de inteligencia artificial reacciona activando sus mecanismos de rechazo. Este desarrollo puede ofrecer a las empresas una herramienta más eficaz para protegerse ante intentos de acceso no autorizado, un avance particular en un contexto donde los sistemas de IA son cada vez más utilizados en diversos sectores.
Tracebit ha identificado que muchos modelos de lenguaje, incluidos los de empresas como Anthropic y Google, cuentan con tópicos prohibidos que no abordan debido a razones de seguridad. Esta debilidad se aprovecha al incluir fragmentos de texto problemáticos junto a las credenciales, lo que golpea al sistema en su núcleo de seguridad. Andy Smith, cofundador de Tracebit, señala que esta técnica provoca una reacción contundente en el contexto de la IA que dificulta su recuperación tras la exposición.
Los estudios de Tracebit abarcaron cinco modelos avanzados bajo condiciones simuladas en Amazon Web Services. Los resultados son significativos: el acceso de administrador a través de ataques cayó del 57% al 5%, y las intentos que generaban puertas traseras pasaron de un 36% a un 1%. La tasa de éxito general se redujo del 91% al 15%, siendo el modelo Opus 4.8 el que se mostró más vulnerable, pues dejó de acceder exitosamente en todos los intentos tras la implementación de context bombing.
A pesar de estos avances, la naturaleza misma de los modelos de lenguaje les hace vulnerables a esta táctica. La restricción política y regulatoria dentro del diseño de la IA es difícil de modificar, lo que ofrece a los defensores una oportunidad para implementar esta nueva técnica y resistir ante ataques. Asimismo, Tracebit ya había desarrollado previamente un sistema de “canarios”, que alerta sobre accesos a recursos falsos en la nube, aunque con limitaciones en el tiempo de reacción que esta nueva técnica busca mejorar.
No obstante, el desafío persiste: no existe una solución definitiva que elimine completamente la posibilidad de que un modelo confunda instrucciones legítimas con datos engañosos. Este contexto revela tanto el potencial como las limitaciones de la defensa mediante context bombing, subrayando la complejidad de asegurar los sistemas de inteligencia artificial en un entorno en constante evolución.
