Agentes de IA

Google Research propone la integridad contextual para la seguridad de los agentes de IA autónomos

Un nuevo informe de Google Research sostiene que los agentes de IA deben comprender las normas sociales y el contexto para garantizar la privacidad y la seguridad, superando los modelos tradicionales de permisos.

A glass cube with digital threads and gears on a desk with documents and a magnifying glass.
Ilustración generada para este artículo

Traducido automáticamente del original en inglés.

Google Research ha publicado un informe exhaustivo de taller que delinea un nuevo marco para asegurar los agentes de IA autónomos. Publicado en octubre de 2026, el documento titulado "Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle" reúne las perspectivas de más de 50 líderes académicos y de la industria. El informe argumenta que los modelos de seguridad tradicionales son insuficientes para los agentes generativos y propone adoptar la teoría de la Integridad Contextual para definir flujos de información apropiados.

Qué ocurrió

El informe surge del Taller sobre Privacidad y Seguridad de Agentes Contextuales (CAPS) de Google, celebrado en Nueva York a finales de 2025. A medida que los grandes modelos de lenguaje evolucionan hacia agentes capaces de planificación dinámica e invocación de herramientas, introducen riesgos únicos que el software determinista no enfrenta. Los autores identifican que, para ser útiles, los agentes requieren acceso a datos personales y la capacidad de realizar acciones con consecuencias en diversos contextos. Esta combinación crea una tensión entre capacidad y seguridad que las prácticas de ingeniería actuales tienen dificultades para resolver.

El argumento central es que la privacidad no debe verse simplemente como secreto o control por parte del usuario, sino como un "flujo de información apropiado" basado en normas sociales. El informe extiende este concepto, conocido como Integridad Contextual, para cubrir no solo el intercambio de datos, sino también la adecuación de las acciones del agente. Al anclar la seguridad en estas normas contextuales, los investigadores buscan crear sistemas que puedan evaluar si una acción es socialmente aceptable antes de ejecutarla, en lugar de depender únicamente de permisos estáticos.

Cómo funciona

La Integridad Contextual define las normas de privacidad a través de tres componentes: actores, tipos de información y principios de transmisión. Los actores incluyen quién envía y recibe la información. Los tipos de información se refieren a categorías específicas, como registros médicos o financieros. Los principios de transmisión son las reglas que rigen el flujo, como la confidencialidad o la reciprocidad. Por ejemplo, un usuario podría permitir que un asistente de compras vea una lista de regalos, pero no compartirla con amigos. El informe sugiere que los LLM pueden cerrar la brecha semántica entre las normas de alto nivel y los permisos del sistema de bajo nivel generando políticas legibles por máquinas que se adaptan a contextos específicos en tiempo real.

Para operacionalizar esto, el informe propone una arquitectura multinivel centrada en un motor de políticas contextuales. Este motor actúa como una capa supervisora que monitorea el comportamiento del agente. Incluye un bucle dinámico de generación de políticas que adapta las reglas a la solicitud del usuario y al contexto abierto, incluyendo nuevas herramientas descubiertas durante la ejecución. Antes de que cualquier dato salga del espacio de trabajo del usuario, el sistema evalúa si el flujo propuesto se alinea con las normas contextuales establecidas. Este enfoque complementa el razonamiento a nivel de modelo y los controles centrados en el usuario para crear un mecanismo de defensa robusto.

Detalles clave

  • El informe identifica tres dimensiones críticas donde los agentes difieren del software tradicional: interfaces no estructuradas, flujos de control probabilísticos y autonomía con delegación.
  • Las metodologías de prueba tradicionales tienen dificultades para asegurar la planificación generativa porque las rutas de ejecución son probabilísticas en lugar de deterministas.
  • La supervisión del usuario se vuelve menos efectiva debido a la "fatiga de confirmación", ya que los agentes manejan tareas más largas y delegan subtareas a otros agentes.
  • La solución propuesta implica un motor de políticas contextuales que genera dinámicamente políticas para imponer la adecuación antes de la transmisión de datos.
  • El aislamiento (sandboxing) a nivel de sistema para agentes debe evolucionar desde límites estáticos hasta restricciones de capacidades dinámicas basadas en contextos cambiantes.
  • Los autores hacen un llamado a establecer puntos de referencia estandarizados multiagente, descritos como entornos "Agent Gym", para simular interacciones complejas para la evaluación de seguridad.

Por qué importa

Para los ingenieros que construyen sistemas agénticos, este informe destaca las limitaciones de los modelos de permisos actuales. Los marcos tradicionales de "Aviso y Elección" asumen que los usuarios pueden tomar decisiones granulares sobre acciones previsibles. Sin embargo, los agentes autónomos operan de manera probabilística y de alto volumen, lo que hace imposible dicha previsión. Confiar en permisos estáticos o políticas escritas manualmente por expertos no puede escalar para agentes que realizan tareas complejas y de larga duración en múltiples dominios. Los desarrolladores necesitan nuevos mecanismos que permitan a los agentes razonar sobre la adecuación bajo normas cambiantes sin intervención humana constante.

El cambio hacia la seguridad contextual también impacta cómo los equipos abordan las pruebas y la gobernanza. Dado que los agentes pueden coludirse o violar normas en interacciones multiagente, las pruebas unitarias simples son insuficientes. El informe enfatiza la necesidad de una gobernanza a nivel de ecosistema para resolver conflictos entre normas divergentes en diferentes dominios. Al adoptar una lente contextual, las organizaciones pueden generar confianza no solo mediante controles técnicos, sino asegurando que las acciones se alineen con las expectativas sociales.

Conclusión

La propuesta de Google Research marca un punto de inflexión en la forma en que entendemos la seguridad de la IA. Al integrar la Integridad Contextual en el núcleo de los sistemas agénticos, se abre la puerta a una nueva generación de aplicaciones que no solo son funcionales, sino también éticamente alineadas con las normas sociales. Aunque el camino hacia la implementación completa presenta desafíos técnicos significativos, el marco proporcionado ofrece una hoja de ruta clara para investigadores y desarrolladores que buscan equilibrar la innovación con la responsabilidad. En última instancia, la adopción de estos principios podría redefinir la relación entre humanos y agentes de IA, fomentando una colaboración más segura y transparente.

Herramientas de la Tienda de Bytechap

$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos