Fundamentos de la seguridad de la inteligencia artificial

Por Microsoft Learn

Jailbreak, inyección de prompts, filtros de contenido, metaprompts y red teaming: aprende a proteger sistemas de IA con la ruta de Microsoft Learn.

Los sistemas de inteligencia artificial presentan riesgos que el pentesting tradicional no cubre por sí solo: instrucciones que desactivan las reglas del modelo, órdenes maliciosas ocultas en un documento que la aplicación lee, o usuarios que actúan ciegamente sobre una respuesta falsa. La ruta de aprendizaje de Microsoft Learn Fundamentos de la seguridad de la inteligencia artificial reúne en tres módulos los conceptos básicos de esta disciplina: cómo difiere la seguridad de la IA de la ciberseguridad convencional, qué controles protegen un sistema con modelos y cómo se comprueban sus defensas. Es gratuita, está en español y se completa en unas 2 h 10 min a tu propio ritmo; la lectura no exige registro y como requisito previo pide solo familiaridad con conceptos básicos de IA y seguridad.

Tres módulos: ataque, defensa y prueba

Módulo Unidades Qué trabaja
Conceptos fundamentales de la seguridad de la IA 10 Arquitectura de tres capas y técnicas de ataque
Controles de seguridad de inteligencia artificial 10 Filtros, metaprompts, fundamentación y supervisión
Introducción a las pruebas de seguridad de la IA 6 Red teaming: categorías, planificación y herramientas

El recorrido es secuencial: el primer módulo nombra los riesgos, el segundo responde con defensas y el tercero enseña a verificarlas de forma organizada.

Ataques y riesgos específicos de los sistemas de IA

El primer módulo compara la seguridad de la IA con la ciberseguridad tradicional y presenta un modelo de arquitectura de tres capas para localizar dónde falla cada sistema. Después examina técnicas concretas: el jailbreak, que busca eludir las reglas del modelo; la inyección de prompts, que inserta órdenes maliciosas en el texto que procesa la aplicación; la manipulación del modelo; la filtración de datos, cuando una respuesta aparentemente normal revela información privada; y la dependencia excesiva, la confianza sin verificación en lo que dice la IA. Cada ataque se empareja con su mitigación, así que el módulo funciona como diccionario de consulta cuando revisas tu aplicación o lees sobre un incidente.

Controles: la defensa en capas

El segundo módulo recorre las defensas de un sistema con IA. Empieza por un punto poco tratado: la revisión de bibliotecas de código abierto y los riesgos de su cadena de suministro. Continúa con los filtros de contenido, que actúan en dos puntos: el filtro de entrada bloquea inyecciones y jailbreaks antes de que lleguen al modelo, y el de salida retiene respuestas dañinas o con material protegido. Añade los metaprompts, instrucciones del sistema que fijan límites de comportamiento, y la fundamentación, que obliga a las respuestas a apoyarse en fuentes verificables. Cierra con seguridad de aplicaciones -autenticación y control de acceso clásicos, ahora aplicados a servicios con IA- y supervisión continua para detectar amenazas específicas. Puede ser el módulo más útil si desarrollas o administras aplicaciones que consumen modelos.

Red teaming: comprobar que las defensas funcionan

El módulo final explica qué es el red teaming de IA y cómo difiere de las pruebas de seguridad tradicionales. Presenta tres categorías de pruebas con las aptitudes que exige cada una: red teaming de pila completa, aprendizaje automático adversarial e inyección de indicaciones. Recorre la planificación de un ejercicio -equipo, alcance y metodología- para modelos de lenguaje y aplicaciones con IA, y muestra cómo las herramientas automatizadas complementan el trabajo manual. Las evaluaciones piden iniciar sesión con una cuenta de Microsoft para registrar la designación de aprobado en tu perfil; la lectura no requiere cuenta.

Cómo organizar el estudio

  • Divide el tiempo en dos sesiones: los módulos 1 y 2 un día, y el 3 con su evaluación al día siguiente.
  • Tras el primer módulo, escribe cada ataque con tus palabras y piensa un ejemplo propio.
  • Con el segundo, revisa un sistema de IA que uses o construyas: qué filtro de entrada tiene, qué metaprompt lo limita y qué supervisión lo observa.
  • Cierra con un mini plan de red teaming: qué atacarías primero y con qué categoría de prueba.

Los ejemplos citan servicios de Azure, pero los conceptos son generales y no necesitas una cuenta de Azure para estudiar. La ruta no anuncia un certificado oficial; Microsoft Learn registra tu progreso con un trofeo para la ruta y badges por módulo, y las evaluaciones guardan una designación de aprobado en tu perfil tras iniciar sesión (comprobación del 17 de septiembre de 2026). Su alcance es introductorio; si quieres después práctica con modelos y prompts, puedes complementarla con Introducción a la IA generativa.

Abre el curso original de Microsoft Learn.

Abrir curso original