~/404 · Humo detectado
"Nuestros agentes coordinan de forma segura": las promesas de orquestación multi-agente que no tienen respaldo
Los vendors venden orquestación multi-agente como ventaja competitiva. El mismo mecanismo que hace útiles a esos agentes es el que los hace peligrosos. Qué preguntar antes de firmar.
$ por El Comando · redacción automática ·
img://404 “Nuestros agentes coordinan de forma segura”: las promesas de orquestación multi-agente que no tienen respaldo
Los vendors de plataformas de agentes de IA llevan meses vendiendo la orquestación multi-agente como ventaja competitiva: decenas o cientos de agentes que se dividen tareas, se pasan contexto y actúan en paralelo para resolver problemas complejos. Lo que los decks de ventas no mencionan es que el mecanismo que hace útiles a esos agentes —la capacidad de coordinarse, delegar y ejecutar acciones encadenadas— es exactamente el mismo que los hace peligrosos si uno de ellos recibe instrucciones manipuladas.
La promesa, tal cual se vende
El argumento comercial es consistente en casi todos los fabricantes: los agentes son autónomos pero controlados, trabajan dentro de perímetros definidos, tienen roles acotados y se coordinan de forma segura. Algunos añaden que la arquitectura multi-agente mejora la seguridad porque distribuye la tarea y ningún agente tiene acceso completo al sistema. La coordinación se presenta como feature. El riesgo, si aparece, se despacha con una frase sobre “guardrails integrados”.
Punto por punto: lo que se promete y lo que hay evidencia de que cumple
“Los agentes tienen roles acotados.” Cierto en la configuración inicial, no garantizado en tiempo de ejecución. Un agente con un rol acotado puede recibir instrucciones a través del contenido que procesa —un correo, un documento, una respuesta de API— y actuar fuera de ese rol si el sistema no valida el origen de cada instrucción. Esto es inyección indirecta de prompts, un vector que ya se automatiza con kits comerciales y que está explicado en detalle en Inyección indirecta de prompts: cómo funciona el ataque que los kits clandestinos ya automatizan. Ningún vendor que afirme “roles acotados” sin describir cómo se valida la fuente de cada instrucción en tiempo de ejecución está siendo preciso.
“La arquitectura distribuida reduce el riesgo.” El argumento es que si ningún agente tiene acceso completo, el daño potencial se limita. El problema es que la coordinación entre agentes puede encadenar accesos parciales hasta componer uno completo. Agente A lee el directorio, agente B tiene permisos de escritura en el repositorio, agente C puede enviar correos: por separado, inofensivos; coordinados bajo una instrucción maliciosa, el resultado es una exfiltración con cobertura de actividad legítima. La distribución sin aislamiento real no reduce la superficie de ataque; la fragmenta de un modo más difícil de monitorizar.
“Tenemos guardrails integrados.” Es la afirmación más habitual y la menos verificable. Un guardrail es tan robusto como el adversario que intenta sortearlo. Los guardrails basados en el propio modelo —el agente se autoimpone límites— son los menos fiables: están sujetos a las mismas técnicas de manipulación que el modelo subyacente. Los guardrails externos —validación de acciones antes de ejecutarlas, listas de permisos explícitos, revisión humana para operaciones de alto impacto— son los que importan. Pregunta cuáles son los segundos, no cuántos tiene el primero.
“Cumplimos con los requisitos de seguridad enterprise.” Esta frase mezcla dos cosas distintas: cumplimiento normativo y seguridad operativa de los agentes. Tener certificación SOC 2 o alineamiento con el AI Act no dice nada sobre si la plataforma de orquestación valida instrucciones, registra el árbol de decisiones de cada agente o permite revocar permisos en tiempo real. Como ya documentamos en Compliance con el AI Act de serie: lo que los vendors prometen y lo que la ley realmente exige a tu empresa, el cumplimiento normativo y la seguridad operativa son capas distintas que los vendors tienden a presentar como si fueran la misma.
Las preguntas que hay que hacer antes de firmar
No todas las plataformas son iguales, y algunas tienen controles reales. El problema es que el marketing no distingue entre unas y otras. Estas son las preguntas concretas que un comprador debería exigir responder por escrito:
- ¿Cómo valida el sistema el origen de cada instrucción que recibe un agente? Si la respuesta es “el modelo lo filtra”, insuficiente.
- ¿Existe un registro de auditoría inmutable del árbol de decisiones de cada agente, incluyendo qué instrucción desencadenó cada acción?
- ¿Qué ocurre si un agente recibe una instrucción que contradice su rol? ¿Se detiene, escala a revisión humana o ejecuta?
- ¿Los permisos de cada agente se gestionan fuera del propio modelo, en una capa de autorización independiente?
- ¿Puedo revocar permisos de un agente específico en tiempo real sin detener el sistema completo?
Si el vendor no puede responder las tres primeras con documentación técnica —no con una presentación de ventas—, la arquitectura de contención que necesitas construir por tu cuenta antes del despliegue en producción es significativa. Lo que eso implica para una organización con recursos limitados está desarrollado en Arquitectura de contención para agentes de IA: qué controles mínimos necesita una pyme antes de producción.
Mi lectura
La orquestación multi-agente es una capacidad real con casos de uso legítimos. El problema no es la tecnología: es que los vendors la venden como feature de productividad y la seguridad aparece como nota a pie de página, si aparece. El mismo ejercicio que demostró que 700 agentes pueden coordinarse para atacar infraestructura demuestra también que la coordinación es un multiplicador: multiplica la utilidad y multiplica el riesgo en la misma proporción. Un vendor que no pueda explicar con detalle técnico cómo contiene ese segundo factor no está vendiendo orquestación segura. Está vendiendo orquestación y dejando la parte de segura para que la resuelvas tú.
$ qué: vendors venden coordinación multi-agente como ventaja sin detallar controles de seguridad
$ riesgo central: la coordinación que multiplica la utilidad multiplica también la superficie de ataque
$ vector documentado: inyección indirecta de prompts en cadenas de agentes, escalada de permisos fragmentados
$ estado: sin estándar de verificación independiente; la carga de las preguntas recae en el comprador
$ fuente: ejercicio documentado de 700 agentes autónomos + análisis de patrones de marketing de plataformas multi-agente