# Seguridad de agentes y aplicaciones de inteligencia artificial

**Categoría:** Inteligencia artificial · **Nivel:** Intermedio · **Lectura:** 15 min
**Publicada:** 2026-07-27 · **Actualizada:** 2026-07-27 · **Autoría:** Underc0de
**Versión HTML (canónica):** https://underc0de.org/guias/inteligencia-artificial/seguridad-de-agentes-y-aplicaciones-de-ia/

## Respuesta rápida

La seguridad de un **agente** es distinta de la de una aplicación que solo responde, porque el agente **actúa**: tiene credenciales, procesa contenido de terceros y puede escribir hacia afuera. OWASP publicó en diciembre de 2025 un **Top 10 para aplicaciones agénticas** —ASI01 a ASI10— encabezado por el **secuestro del objetivo** y el **uso indebido de herramientas**. El mecanismo que hay que entender es una **combinación de tres condiciones**: acceso a datos privados, procesamiento de contenido no confiable y un canal de salida. Juntas habilitan la exfiltración *sin ninguna vulnerabilidad técnica*; quitando una, la cadena se corta. Y el control que más rinde no es filtrar texto —eso se elude— sino **acotar permisos por herramienta y por ámbito**.

## De qué se trata esta guía

[Riesgos, ética y uso responsable de la IA](../riesgos-etica-y-uso-responsable-de-la-ia/index.md) cubre las familias de riesgo, los marcos de referencia, las obligaciones de transparencia y el Top 10 de OWASP para aplicaciones con modelos de lenguaje: es la mirada de **riesgo y gobernanza**.

Esta guía es la mirada de **ingeniería de seguridad**, y se ocupa solo de lo que aparece *cuando el modelo puede ejecutar acciones*: qué permisos otorgar, cómo aislar, en qué confiar y qué registrar.

## Qué cambia cuando actúa

> «Una vez que la IA empezó a tomar acciones, la naturaleza de la seguridad cambió para siempre.» — OWASP

1. **El agente tiene credenciales.** Deja de ser un usuario que pide y pasa a ser un principal con permisos.
2. **Procesa contenido de terceros.** Páginas web, correos, tickets, documentos, respuestas de APIs.
3. **Puede escribir hacia afuera.** Mandar un correo, hacer una petición HTTP, confirmar un cambio, publicar.

En un programa común el código decide y los datos son datos. En un agente, **las instrucciones y los datos llegan por el mismo canal** —el contexto— y el modelo no tiene una manera confiable de distinguir «esto me lo pidió mi usuario» de «esto lo dice un documento que estoy leyendo».

## Los diez riesgos agénticos

Publicados el **9 de diciembre de 2025** por la Iniciativa de Seguridad Agéntica de OWASP:

| Id. | Riesgo | Cómo se ve en la práctica |
|---|---|---|
| ASI01 | **Secuestro del objetivo** del agente | Instrucciones escondidas en el contenido que lee le cambian la tarea |
| ASI02 | **Uso indebido de herramientas** | Usa herramientas legítimas para un fin destructivo, con permisos válidos |
| ASI03 | Abuso de **identidad y privilegios** | Actúa con más permisos de los que la tarea necesitaba |
| ASI04 | Vulnerabilidades de la **cadena de suministro agéntica** | Un servidor de herramientas, un complemento o un modelo comprometido |
| ASI05 | **Ejecución de código inesperada** | Una herramienta termina ejecutando algo que nadie previó |
| ASI06 | **Envenenamiento de memoria y contexto** | Se planta información falsa que persiste entre sesiones |
| ASI07 | **Comunicación insegura entre agentes** | Un agente confía sin verificar en lo que le dice otro |
| ASI08 | **Fallas en cascada** | Un error se amplifica a través de una cadena de pasos automáticos |
| ASI09 | Explotación de la **confianza persona-agente** | La salida se presenta con una seguridad que no le corresponde |
| ASI10 | **Agentes descontrolados** | Un agente sigue operando fuera de su alcance previsto |

**La mayoría no son fallas del modelo**: son fallas de diseño del sistema alrededor —permisos, verificación, límites, presentación—. Se mitigan con ingeniería conocida.

## La combinación de tres

Un agente es peligroso cuando se dan **tres condiciones a la vez**:

- **Acceso a datos privados.** Documentos internos, una base, el correo, el repositorio.
- **Procesamiento de contenido no confiable.** Cualquier texto que no escribió su usuario.
- **Un canal de salida.** Cualquier forma de comunicar algo hacia afuera.

Con las tres juntas, el contenido no confiable trae una instrucción y el agente la ejecuta **con permisos legítimos**. No hay desbordamiento de búfer ni escalada de privilegios: el sistema funcionó como estaba diseñado.

> Como las tres condiciones son necesarias, **alcanza con quitar una** para cortar la cadena. La más fácil casi siempre es el **canal de salida**: restringirlo a una lista de destinos permitidos es una tarde de trabajo y elimina la clase entera.

**Filtrar el texto de entrada no es un control confiable.** Las instrucciones y los datos llegan por el mismo canal, así que cualquier lista de patrones se elude con paráfrasis, otro idioma o codificaciones. Sirve como capa que reduce ruido; no como control principal.

## Permisos: el control que rinde

Dos preguntas por herramienta: ¿qué es **lo mínimo** que necesita? y ¿qué pasa si esta acción se ejecuta **mil veces por error**?

| Tipo de acción | Cómo tratarla | Ejemplos |
|---|---|---|
| **Lectura acotada** a un ámbito | Se puede automatizar | Leer un directorio del proyecto, consultar una vista de solo lectura |
| **Escritura reversible** | Se puede automatizar, con registro | Crear una rama, escribir en un espacio de trabajo, comentar |
| **Irreversible o hacia afuera** | Requiere confirmación de una persona | Borrar, pagar, publicar, enviar correo a terceros, desplegar |

**El ámbito importa tanto como el verbo.** **Las credenciales del agente son propias y de corta vida**, no las de la persona que lo usa. Y **la confirmación tiene que ser informativa**: un cartel que dice «¿permitir la acción?» sin decir qué acción entrena a la gente a aprobar sin leer.

## Confiar en un servidor MCP

> «Las **herramientas representan ejecución de código arbitrario** y deben tratarse con la precaución apropiada.»
>
> «Las descripciones del comportamiento de una herramienta, como las anotaciones, **deben considerarse no confiables**, a menos que provengan de un servidor confiable.»
>
> «MCP **no puede hacer cumplir** estos principios de seguridad a nivel del protocolo.»

La **descripción** de una herramienta entra en el contexto del modelo: no es documentación pasiva, es texto que el modelo lee y puede seguir.

- **¿Quién lo publica y cómo se distribuye?** Un servidor local es un programa de un tercero corriendo con tus permisos.
- **¿Está fijado a una versión?** Si se actualiza solo, las herramientas y sus descripciones pueden cambiar sin aviso.
- **¿Qué herramientas expone y hacen falta todas?**
- **¿Qué credenciales le doy?** Propias del agente, ámbito mínimo, corta vida.
- **¿Puede alcanzar la red?** Un servidor con salida a internet es un canal de salida.

El tratamiento completo de la cadena de suministro está en [seguridad de la cadena de suministro de software](../../devops-cloud/seguridad-de-la-cadena-de-suministro-de-software/index.md).

## Aislamiento y contención

- **Restringir la salida de red.** Lista de destinos permitidos. Es la que corta la combinación de tres.
- **Ejecutar en un entorno separado.** Contenedor o máquina virtual. Si el agente escribe código y lo ejecuta, no es opcional.
- **Credenciales de corta vida y ámbito acotado.**
- **Secretos fuera del contexto.** Todo lo que entra en el contexto puede salir en una respuesta.

Y dos límites operativos: un **tope de pasos** por tarea y un **tope de gasto**. Sin ellos, un agente en bucle puede hacer mucho daño rápido, y esa es la forma concreta del ASI08.

## Memoria y contexto envenenado

Una inyección en una sola conversación termina con la sesión. Con **memoria persistente**, la instrucción plantada **sobrevive**: se repite en sesiones futuras, puede afectar a otras personas si la memoria es compartida y es difícil de diagnosticar porque el origen quedó semanas atrás.

Defensas: **tratar lo que el agente escribió en su memoria como entrada no confiable** al volver a leerlo, marcar cada dato con su origen, no dejar que escriba en memoria compartida sin revisión, y poder inspeccionar y borrar esa memoria.

## Registro y auditoría

1. **El pedido original.** Qué se le pidió y quién lo pidió.
2. **El contenido externo que entró.** Sin esto no se distingue un error del modelo de una instrucción inyectada.
3. **Las herramientas invocadas.** Cuáles, con qué argumentos y en qué orden.
4. **Lo que devolvió cada una.** Incluidos los errores.
5. **Las acciones aplicadas.** Qué quedó efectivamente cambiado.

El punto dos es el que casi siempre falta. Y esas trazas **contienen datos que pueden ser sensibles**: el registro de auditoría es, él mismo, un activo a proteger.

## Lista antes de dar permisos

- ¿El agente procesa contenido que escribió un tercero?
- ¿Tiene acceso a datos privados y a un canal de salida al mismo tiempo?
- ¿Los permisos están por herramienta y por ámbito?
- ¿Las credenciales son propias del agente y de corta vida?
- ¿Toda acción irreversible pide confirmación informativa?
- ¿Hay tope de pasos y de gasto?
- ¿Se ejecuta aislado del resto del sistema?
- ¿Se registra el contenido externo que entró al contexto?
- ¿La memoria persistente se puede leer y borrar?
- ¿Se mide cuántas acciones no autorizadas intentó?

## Preguntas frecuentes

**¿Qué cambia en seguridad cuando el modelo puede actuar?**
La salida deja de ser texto para revisar y pasa a ser una acción ejecutada, con credenciales propias, contenido de afuera y un canal de salida.

**¿Qué es el Top 10 de OWASP para aplicaciones agénticas?**
Una lista publicada el 9 de diciembre de 2025 con los diez riesgos principales de sistemas donde el modelo actúa, ASI01 a ASI10. Es distinta del Top 10 para aplicaciones con modelos de lenguaje.

**¿Por qué es peligrosa la combinación de datos privados, contenido ajeno y canal de salida?**
Porque las tres juntas habilitan la exfiltración sin ninguna vulnerabilidad técnica. Basta con quitar una para cortar la cadena.

**¿Se puede evitar la inyección de prompts filtrando el texto?**
No de forma confiable. El control que funciona es de arquitectura: que el paso que procesa contenido no confiable no tenga permisos para hacer daño aunque obedezca.

**¿Cómo se decide qué permisos darle a un agente?**
Por herramienta y por ámbito: lectura acotada se automatiza, escritura reversible se automatiza con registro, y lo irreversible pide confirmación.

**¿Qué hay que registrar de un agente?**
Lo suficiente para reconstruir por qué hizo lo que hizo, incluido el contenido externo que entró en su contexto.

## Fuentes

Fecha de consulta: 27 de julio de 2026. Todo el contenido se presenta con fines defensivos y educativos.

**Aportes de la comunidad Underc0de**

1. Underc0de, blog. [Extensiones maliciosas amenazan IDEs con IA basados en VS Code](https://blog.underc0de.org/extensiones-maliciosas-amenazan-ides-con-ia-basados-en-vs-code/), 7 de enero de 2026.
2. Underc0de, blog. [LangSmith: vulnerabilidad crítica permite robo de claves API y datos en LangChain](https://blog.underc0de.org/langsmith-vulnerabilidad-critica-permite-robo-de-claves-api-y-datos-en-langchain/), 19 de junio de 2025.
3. Underc0de, blog. [Malware en Hugging Face suplanta modelo de OpenAI](https://blog.underc0de.org/malware-en-hugging-face-suplanta-modelo-de-openai/), 12 de mayo de 2026.

**Documentación oficial y estándares**

4. OWASP GenAI Security Project. [OWASP Top 10 for Agentic Applications](https://genai.owasp.org/2025/12/09/owasp-top-10-for-agentic-applications-the-benchmark-for-agentic-security-in-the-age-of-autonomous-ai/), 9 de diciembre de 2025.
5. OWASP Agentic Security Initiative. [Agentic AI – Threats and Mitigations](https://genai.owasp.org/resource/agentic-ai-threats-and-mitigations/), versión 1.0, 17 de febrero de 2025.
6. OWASP. [OWASP Top 10 for LLM Applications 2025](https://genai.owasp.org/llm-top-10/).
7. Model Context Protocol. [Specification: Security and Trust & Safety](https://modelcontextprotocol.io/specification/latest), revisión 2025-11-25.

## Guías relacionadas

- [Riesgos, ética y uso responsable de la inteligencia artificial](../riesgos-etica-y-uso-responsable-de-la-ia/index.md)
- [Agentes de inteligencia artificial y Model Context Protocol](../agentes-de-ia-y-model-context-protocol/index.md)
- [Seguridad de la cadena de suministro de software](../../devops-cloud/seguridad-de-la-cadena-de-suministro-de-software/index.md)
- [Índice de Inteligencia artificial](../index.md)
