El avance en el desarrollo de agentes de inteligencia artificial dotados de mayor autonomía genera nuevas oportunidades tecnológicas, pero a la vez suscita inquietud en la comunidad científica por sus implicaciones de seguridad. Un estudio desarrollado por especialistas de la Escuela Politécnica Federal de Lausana (EPFL) advierte que estos sistemas podrían ser manipulados con el fin de ejecutar acciones perjudiciales mediante métodos que no siempre logran ser detectados por las barreras habituales de protección.
A diferencia de los asistentes convencionales, los agentes autónomos están capacitados para gestionar tareas de superior complejidad y progresar por distintas etapas para alcanzar una meta. Dicha cualidad, útil para automatizar procesos, puede derivar en un riesgo si un usuario busca emplearla para fines ilícitos.
Expertos del Laboratorio de Procesamiento del Lenguaje Natural de la EPFL llevaron a cabo pruebas para medir el grado en que estos modelos pueden ser inducidos a evadir sus filtros de seguridad. Las conclusiones revelan que, si bien una solicitud abiertamente dañina suele ser desestimada por las herramientas, la reacción varía cuando el propósito se desglosa en una serie de directivas aparentemente desconectadas entre sí.
El director de dicho laboratorio, Antoine Bosselut, explicó que los sistemas detectan sin dificultad una demanda con intención maliciosa evidente, tal como pretender ingresar de manera ilegal a una cuenta ajena. No obstante, si el objetivo se fragmenta en fases aisladas y en apariencia inocuas, se incrementa la probabilidad de que el agente prosiga con la instrucción.
Para comprobar este punto débil, el equipo analizó 176 escenarios enfocados en conductas perjudiciales y realizó ensayos en plataformas como GPT, Gemini y Claude.
Los resultados determinaron que, en ciertos casos, los agentes llegaron a duplicar las probabilidades de consumar una acción dañina cuando las órdenes se transmitían de manera escalonada, en lugar de plantear el fin completo de entrada.
Otro de los puntos destacados por los investigadores es el impacto del cambio de idioma a lo largo de una misma sesión. De acuerdo con el reporte, modificar el idioma de los comandos entre las etapas de una tarea puede elevar considerablemente las opciones de que el modelo acabe concretando una acción que en primera instancia habría bloqueado.
Este patrón suma dificultades para los desarrolladores, ya que las medidas preventivas no solo deben analizar cada instrucción por separado, sino comprender el sentido global detrás de una secuencia prolongada de peticiones.
Los autores del trabajo remarcan que estas falencias cobran mayor relevancia conforme los agentes de IA reemplazan labores que antes demandaban supervisión humana continua. Cuanto más margen tenga un sistema para resolver situaciones, operar utilidades externas o concluir procesos sin asistencia, más severas podrían ser las repercusiones de una eventual manipulación.
Con esta investigación se pretende visibilizar la urgencia de afinar los mecanismos de control antes de que estas herramientas se adopten a escala masiva. Desde la perspectiva de los analistas, no resulta prudente esperar a que ocurra un incidente para subsanar los errores, sino incorporar defensas desde las etapas iniciales de diseño.
Bosselut apuntó que la seguridad tecnológica convencional acostumbra a reaccionar tras suscitarse un problema. No obstante, evaluó que dicha postura resulta insuficiente ante programas con capacidad de actuar con autonomía y encadenar múltiples decisiones.
El auge de la inteligencia artificial plantea desafíos inéditos para el rubro informático. Si bien los agentes autónomos agilizan procesos complejos, incrementan la productividad y expanden sus aplicaciones prácticas, su funcionamiento independiente exige crear controles aptos para identificar intenciones lesivas, aun cuando se presenten bajo instrucciones habituales o segmentadas.
Los datos obtenidos ratifican la conveniencia de seguir testeando los modelos ante diversas situaciones, lo que incluye interacciones multilingües y solicitudes progresivas, con la meta de adelantarse a probables abusos y asegurar que la evolución del sector cuente con salvaguardas idóneas. (Visión 360)

