Guía completa
AI-901 Azure AI Fundamentals
Toca cualquier servicio para ver más detalles y documentación oficial.
Distribución del examen
40–60
Preguntas
~50
Min lectura
700
Puntaje mínimo
Identificar conceptos y capacidades de IA
40–45% del examen¿Qué es la Inteligencia Artificial?
La IA es la simulación de procesos de inteligencia humana por sistemas informáticos. En Azure, la IA se aplica a través de modelos y servicios que permiten a las aplicaciones ver, escuchar, hablar, entender, buscar y generar contenido nuevo.
Visión
Interpretar imágenes y video, y generar imágenes nuevas
Habla
Reconocer y sintetizar voz humana
Lenguaje
Comprender, extraer información y generar texto natural
Búsqueda
Indexar y buscar por significado (retrieval)
IA Generativa
Crear contenido nuevo: texto, código, imágenes
IA Agéntica
Sistemas que planifican y ejecutan tareas de forma autónoma
IA Responsable — los 6 principios de Microsoft
⚖️ Equidad
Los sistemas de IA deben tratar a todas las personas de manera justa, sin sesgo por raza, género u otras características.
🔒 Confiabilidad y seguridad
Los sistemas deben funcionar de manera confiable y segura, incluso en situaciones inesperadas.
🛡️ Privacidad y seguridad
Los sistemas deben proteger los datos y respetar la privacidad de las personas.
🌍 Inclusividad
Los sistemas deben empoderar a todos, incluyendo personas con discapacidades.
🔍 Transparencia
Los sistemas deben ser comprensibles. Las personas deben entender cómo funcionan.
✅ Responsabilidad
Las personas deben ser responsables de los sistemas de IA que diseñan y despliegan.
Los 6 principios de IA Responsable aparecen frecuentemente en el examen: Equidad, Confiabilidad y seguridad, Privacidad y seguridad, Inclusividad, Transparencia, Responsabilidad.
Cómo funcionan los modelos de IA generativa
Los modelos de IA generativa (LLMs) se entrenan con enormes cantidades de texto y aprenden a predecir la siguiente palabra (token) más probable dado el contexto anterior. Esa capacidad, escalada, produce texto coherente, código, e incluso razonamiento paso a paso.
| Concepto | Definición |
|---|---|
| LLM (Large Language Model) | Modelo entrenado con billones de tokens para entender y generar texto |
| Token | Unidad de texto que procesa el modelo (~4 caracteres o ~¾ palabra) |
| Modelo multimodal | Recibe y/o genera más de un tipo de contenido: texto, imagen, audio |
| Prompt | Instrucción o texto de entrada que se le da al modelo |
| Temperatura | Controla la creatividad de la respuesta: 0 = determinista, 1 = muy creativo |
| Grounding | Anclar las respuestas del modelo en datos reales para reducir alucinaciones |
Elegir el modelo adecuado
El model catalog de Microsoft Foundry ofrece modelos de distintos proveedores (OpenAI, Meta, Mistral, DeepSeek y más). Elegir el modelo correcto depende de la tarea, no solo de "cuál es el más nuevo".
Texto vs. multimodal
Un modelo de solo texto no puede interpretar una imagen o un audio en el prompt.
Tamaño y costo
Modelos más grandes razonan mejor pero cuestan más y responden más lento.
Razonamiento
Algunos modelos están optimizados para problemas paso a paso, no solo para conversar.
Abierto vs. propietario
Los modelos de pesos abiertos permiten más control de despliegue y ajuste fino.
Opciones y parámetros de despliegue
| Opción | Qué controla |
|---|---|
| Serverless / pago por uso | Facturas por tokens consumidos, sin capacidad reservada |
| Rendimiento aprovisionado (PTU) | Capacidad reservada para carga predecible y baja latencia |
| Región / residencia de datos | Dónde se procesan y almacenan los datos del despliegue |
| Temperatura / top-p | Cuán determinista o creativa es la respuesta generada |
| Tokens máximos | Límite de longitud de la respuesta generada |
El acceso a ciertos modelos en Foundry requiere aprobación previa — no todos los modelos están disponibles automáticamente en cualquier proyecto o región.
Workloads de IA — identificar el escenario correcto
Haz clic en cualquier servicio para ver más detalles
Análisis de texto
| Capacidad | Qué detecta/genera | Ejemplo |
|---|---|---|
| Sentiment Analysis | Positivo / Negativo / Neutro + score | "Me encantó el producto" → Positivo 0.97 |
| Key Phrase Extraction | Conceptos principales del texto | "Microsoft Foundry" en un artículo técnico |
| Entity Detection (NER) | Personas, lugares, fechas, organizaciones | Microsoft (org), Redmond (lugar), 2026 (fecha) |
| Summarization | Resumen automático de un texto largo | Resumir un reporte de 10 páginas en 3 líneas |
Reconocimiento y síntesis de voz
🎤 Speech to Text (STT)
Transcribe audio en tiempo real o por lotes. Soporta 100+ idiomas.
🔊 Text to Speech (TTS)
Convierte texto a voz natural. Voces neurales de alta calidad.
🌐 Speech Translation
Traduce voz en tiempo real entre idiomas.
🎙️ Speaker Recognition
Identifica o verifica la identidad de una persona por su voz.
Visión por computadora y generación de imágenes
| Capacidad | Descripción | Caso de uso |
|---|---|---|
| Image Analysis | Describe la imagen, detecta objetos y tags | Catalogar inventario fotográfico |
| OCR / Read API | Extrae texto de imágenes y documentos | Digitalizar facturas y formularios |
| Custom Vision | Clasifica imágenes con tus propias fotos | QA en manufactura, clasificar defectos |
| Generación de imágenes | Crea imágenes nuevas a partir de una descripción | Ilustraciones para marketing a partir de un prompt |
Extracción de información multimodal
Extraer información estructurada de contenido no estructurado (texto libre, imágenes, audio, video) es uno de los workloads clave del examen — y es la puerta de entrada al dominio 2, donde se implementa con Content Understanding.
Documentos
Campos clave, tablas y texto de formularios y contratos
Imágenes
Objetos, texto embebido y metadatos visuales
Audio
Transcripción, temas y entidades mencionadas
Video
Momentos clave, transcripción y objetos detectados
Implementar soluciones de IA con Microsoft Foundry
55–60% del examenMicrosoft Foundry — la plataforma de implementación
Haz clic en cualquier servicio para ver más detalles
Apps y agentes generativos con Foundry
Diseñar buenos prompts de sistema y de usuario es la base de cualquier solución generativa: el prompt de sistema fija el rol y las reglas del modelo, el prompt de usuario es la solicitud puntual.
Desplegar en el portal
Elige un modelo del catálogo, despliégalo y pruébalo directamente en el portal de Foundry, sin código.
Chat client con el SDK
Crea un cliente ligero de chat usando el Foundry SDK, apuntando al endpoint del proyecto.
Portal Agents
Construye un agente de un solo agente ("single-agent") directamente en el portal — sin infraestructura que mantener.
Cliente para el agente
Construye una app ligera que llame a ese agente y muestre sus respuestas.
Portal Agents = sin código, sin infraestructura propia, definidos en el portal o vía SDK/REST. Hosted Agents = tu propio código (Agent Framework, LangGraph, OpenAI Agents SDK) empaquetado y corriendo en un endpoint administrado por Foundry. El examen distingue ambos conceptos.
Texto y voz con Foundry
Haz clic en cualquier servicio para ver más detalles
App con análisis de texto
Construye una app ligera que use Foundry Tools (Language) para sentimiento, entidades o resúmenes.
Prompts hablados a un modelo multimodal
Responde a un audio directamente con un modelo desplegado — sin pasar antes por un servicio de voz separado.
App con Azure Speech en Foundry Tools
Usa Azure Speech (dentro de Foundry Tools) para transcribir o sintetizar voz en tu aplicación.
Visión y generación de imágenes con Foundry
Interpretar imágenes en el prompt
Un modelo multimodal desplegado en Foundry puede recibir una imagen junto con el texto y responder sobre su contenido.
Generar imágenes nuevas
Usa un modelo generativo de imágenes para crear contenido visual a partir de una descripción.
App con capacidades de visión
Construye una app ligera que combine ambas capacidades: interpretar y generar imágenes.
Extracción de información con Content Understanding
Haz clic en cualquier servicio para ver más detalles
| Fuente | Qué extrae Content Understanding |
|---|---|
| Documentos y formularios | Campos clave, tablas, texto — con analizadores prefabricados para facturas, contratos, recibos |
| Imágenes | Objetos, texto embebido y metadatos visuales |
| Audio | Transcripción, temas y entidades mencionadas |
| Video | Momentos clave, transcripción y objetos detectados |
Content Understanding es primera clase en el portal de Microsoft Foundry — cuando el examen pregunte por "extraer información" dentro de una solución Foundry, la respuesta casi siempre es este servicio.
Diagrama interactivo — sigue el flujo de una pregunta desde el usuario hasta la respuesta final. Pasa el cursor sobre cada nodo para entender su rol.
Grounding con RAG
RAG (Retrieval-Augmented Generation) es el patrón más común para anclar (grounding) las respuestas de un modelo en datos propios, dentro de una solución construida en Foundry.
Indexación
Los documentos se dividen en chunks y se convierten en embeddings → Azure AI Search
Recuperación
La pregunta del usuario se convierte en embedding y se busca en AI Search
Generación
Los docs relevantes + la pregunta se envían como prompt al modelo desplegado en Foundry
Respuesta
El modelo genera una respuesta fundamentada en los documentos recuperados
Las alucinaciones son cuando el modelo genera información plausible pero incorrecta. RAG con grounding reduce este problema al anclar las respuestas en documentos reales.
Tips para el día del examen
El examen tiene solo 2 dominios: "Identify AI concepts and capabilities" (40–45%) e "Implement AI solutions by using Microsoft Foundry" (55–60%). Casi el 60% es sobre Foundry.
IA Responsable tiene 6 principios: Equidad, Confiabilidad y seguridad, Privacidad y seguridad, Inclusividad, Transparencia, Responsabilidad. Memorízalos.
Portal Agents = agente sin código, sin infraestructura propia. Hosted Agents = tu código empaquetado corriendo en un endpoint administrado por Foundry. El examen distingue ambos.
Un modelo multimodal puede recibir una imagen o audio directamente en el prompt — ya no necesitas un servicio de visión o voz separado para "interpretar" el contenido.
Content Understanding extrae información de documentos, imágenes, audio y video — es la respuesta cuando el examen pregunta por "extraer información" dentro de Foundry.
Azure Speech vive dentro de Foundry Tools (antes Azure AI Services). Es el servicio correcto para "text and speech by using Foundry".
El acceso a ciertos modelos en Foundry requiere aprobación — no está disponible automáticamente para todos los proyectos.
Content filtering está habilitado por defecto en los modelos de Foundry. Se puede configurar pero no deshabilitar del todo.
RAG (Retrieval-Augmented Generation) = Azure AI Search (retrieval) + un modelo desplegado en Foundry (generación). Busca docs relevantes → los pasa al modelo como contexto.
Foundry SDK = cliente delgado con un solo endpoint de proyecto. Frameworks de más alto nivel (como Agent Framework) se construyen sobre él, no lo reemplazan.
¿Quieres más profundidad?
Esta guía es un resumen rápido. Visita la sección Deep Dive para exploración exhaustiva con casos reales, análisis de costos y decisiones arquitectónicas.
Practica AI-901 con simulaciones interactivas
Labs click-through: navega una simulación del portal paso a paso, con objetivos claros y verificación en cada acción — sin costos reales.
¿Listo para practicar?
Pon a prueba lo que aprendiste con preguntas originales del examen AI-901.
Iniciar simulacro AI-901Sin límite de simulacros con plan Pro
¿Te fue útil esta guía?
¿Aún no estás list@ para empezar?
Déjanos tu email y crea tu cuenta gratis cuando estés list@ — empieza con 15 preguntas de AI-901, sin tarjeta de crédito.
Ya tienes cuenta? Ir directo al simulacro →