Volver arriba
GuíasResumen

AI-901 Azure AI Fundamentals

Practicar ahora
MicrosoftFundamentosGratis~50 min lectura

Guía completa
AI-901 Azure AI Fundamentals

Toca cualquier servicio para ver más detalles y documentación oficial.

D1

Identificar conceptos y capacidades de IA

40–45% del examen

¿Qué es la Inteligencia Artificial?

La IA es la simulación de procesos de inteligencia humana por sistemas informáticos. En Azure, la IA se aplica a través de modelos y servicios que permiten a las aplicaciones ver, escuchar, hablar, entender, buscar y generar contenido nuevo.

👁️

Visión

Interpretar imágenes y video, y generar imágenes nuevas

🗣️

Habla

Reconocer y sintetizar voz humana

💬

Lenguaje

Comprender, extraer información y generar texto natural

🔍

Búsqueda

Indexar y buscar por significado (retrieval)

🤖

IA Generativa

Crear contenido nuevo: texto, código, imágenes

🧠

IA Agéntica

Sistemas que planifican y ejecutan tareas de forma autónoma

IA Responsable — los 6 principios de Microsoft

⚖️ Equidad

Los sistemas de IA deben tratar a todas las personas de manera justa, sin sesgo por raza, género u otras características.

🔒 Confiabilidad y seguridad

Los sistemas deben funcionar de manera confiable y segura, incluso en situaciones inesperadas.

🛡️ Privacidad y seguridad

Los sistemas deben proteger los datos y respetar la privacidad de las personas.

🌍 Inclusividad

Los sistemas deben empoderar a todos, incluyendo personas con discapacidades.

🔍 Transparencia

Los sistemas deben ser comprensibles. Las personas deben entender cómo funcionan.

Responsabilidad

Las personas deben ser responsables de los sistemas de IA que diseñan y despliegan.

Los 6 principios de IA Responsable aparecen frecuentemente en el examen: Equidad, Confiabilidad y seguridad, Privacidad y seguridad, Inclusividad, Transparencia, Responsabilidad.

Cómo funcionan los modelos de IA generativa

Los modelos de IA generativa (LLMs) se entrenan con enormes cantidades de texto y aprenden a predecir la siguiente palabra (token) más probable dado el contexto anterior. Esa capacidad, escalada, produce texto coherente, código, e incluso razonamiento paso a paso.

ConceptoDefinición
LLM (Large Language Model)Modelo entrenado con billones de tokens para entender y generar texto
TokenUnidad de texto que procesa el modelo (~4 caracteres o ~¾ palabra)
Modelo multimodalRecibe y/o genera más de un tipo de contenido: texto, imagen, audio
PromptInstrucción o texto de entrada que se le da al modelo
TemperaturaControla la creatividad de la respuesta: 0 = determinista, 1 = muy creativo
GroundingAnclar las respuestas del modelo en datos reales para reducir alucinaciones

Elegir el modelo adecuado

El model catalog de Microsoft Foundry ofrece modelos de distintos proveedores (OpenAI, Meta, Mistral, DeepSeek y más). Elegir el modelo correcto depende de la tarea, no solo de "cuál es el más nuevo".

📝

Texto vs. multimodal

Un modelo de solo texto no puede interpretar una imagen o un audio en el prompt.

Tamaño y costo

Modelos más grandes razonan mejor pero cuestan más y responden más lento.

🧮

Razonamiento

Algunos modelos están optimizados para problemas paso a paso, no solo para conversar.

🔓

Abierto vs. propietario

Los modelos de pesos abiertos permiten más control de despliegue y ajuste fino.

Opciones y parámetros de despliegue

OpciónQué controla
Serverless / pago por usoFacturas por tokens consumidos, sin capacidad reservada
Rendimiento aprovisionado (PTU)Capacidad reservada para carga predecible y baja latencia
Región / residencia de datosDónde se procesan y almacenan los datos del despliegue
Temperatura / top-pCuán determinista o creativa es la respuesta generada
Tokens máximosLímite de longitud de la respuesta generada

El acceso a ciertos modelos en Foundry requiere aprobación previa — no todos los modelos están disponibles automáticamente en cualquier proyecto o región.

Workloads de IA — identificar el escenario correcto

Haz clic en cualquier servicio para ver más detalles

Análisis de texto

CapacidadQué detecta/generaEjemplo
Sentiment AnalysisPositivo / Negativo / Neutro + score"Me encantó el producto" → Positivo 0.97
Key Phrase ExtractionConceptos principales del texto"Microsoft Foundry" en un artículo técnico
Entity Detection (NER)Personas, lugares, fechas, organizacionesMicrosoft (org), Redmond (lugar), 2026 (fecha)
SummarizationResumen automático de un texto largoResumir un reporte de 10 páginas en 3 líneas

Reconocimiento y síntesis de voz

🎤 Speech to Text (STT)

Transcribe audio en tiempo real o por lotes. Soporta 100+ idiomas.

🔊 Text to Speech (TTS)

Convierte texto a voz natural. Voces neurales de alta calidad.

🌐 Speech Translation

Traduce voz en tiempo real entre idiomas.

🎙️ Speaker Recognition

Identifica o verifica la identidad de una persona por su voz.

Visión por computadora y generación de imágenes

CapacidadDescripciónCaso de uso
Image AnalysisDescribe la imagen, detecta objetos y tagsCatalogar inventario fotográfico
OCR / Read APIExtrae texto de imágenes y documentosDigitalizar facturas y formularios
Custom VisionClasifica imágenes con tus propias fotosQA en manufactura, clasificar defectos
Generación de imágenesCrea imágenes nuevas a partir de una descripciónIlustraciones para marketing a partir de un prompt

Extracción de información multimodal

Extraer información estructurada de contenido no estructurado (texto libre, imágenes, audio, video) es uno de los workloads clave del examen — y es la puerta de entrada al dominio 2, donde se implementa con Content Understanding.

📄

Documentos

Campos clave, tablas y texto de formularios y contratos

🖼️

Imágenes

Objetos, texto embebido y metadatos visuales

🎧

Audio

Transcripción, temas y entidades mencionadas

🎬

Video

Momentos clave, transcripción y objetos detectados

D2

Implementar soluciones de IA con Microsoft Foundry

55–60% del examen

Microsoft Foundry — la plataforma de implementación

📌 Este es el dominio con más peso del examen — casi el 60%.

Haz clic en cualquier servicio para ver más detalles

Apps y agentes generativos con Foundry

Diseñar buenos prompts de sistema y de usuario es la base de cualquier solución generativa: el prompt de sistema fija el rol y las reglas del modelo, el prompt de usuario es la solicitud puntual.

🚀

Desplegar en el portal

Elige un modelo del catálogo, despliégalo y pruébalo directamente en el portal de Foundry, sin código.

💻

Chat client con el SDK

Crea un cliente ligero de chat usando el Foundry SDK, apuntando al endpoint del proyecto.

🧩

Portal Agents

Construye un agente de un solo agente ("single-agent") directamente en el portal — sin infraestructura que mantener.

📱

Cliente para el agente

Construye una app ligera que llame a ese agente y muestre sus respuestas.

Portal Agents = sin código, sin infraestructura propia, definidos en el portal o vía SDK/REST. Hosted Agents = tu propio código (Agent Framework, LangGraph, OpenAI Agents SDK) empaquetado y corriendo en un endpoint administrado por Foundry. El examen distingue ambos conceptos.

Texto y voz con Foundry

Haz clic en cualquier servicio para ver más detalles

📝

App con análisis de texto

Construye una app ligera que use Foundry Tools (Language) para sentimiento, entidades o resúmenes.

🎙️

Prompts hablados a un modelo multimodal

Responde a un audio directamente con un modelo desplegado — sin pasar antes por un servicio de voz separado.

🔊

App con Azure Speech en Foundry Tools

Usa Azure Speech (dentro de Foundry Tools) para transcribir o sintetizar voz en tu aplicación.

Visión y generación de imágenes con Foundry

👁️

Interpretar imágenes en el prompt

Un modelo multimodal desplegado en Foundry puede recibir una imagen junto con el texto y responder sobre su contenido.

🎨

Generar imágenes nuevas

Usa un modelo generativo de imágenes para crear contenido visual a partir de una descripción.

📱

App con capacidades de visión

Construye una app ligera que combine ambas capacidades: interpretar y generar imágenes.

Extracción de información con Content Understanding

Haz clic en cualquier servicio para ver más detalles

FuenteQué extrae Content Understanding
Documentos y formulariosCampos clave, tablas, texto — con analizadores prefabricados para facturas, contratos, recibos
ImágenesObjetos, texto embebido y metadatos visuales
AudioTranscripción, temas y entidades mencionadas
VideoMomentos clave, transcripción y objetos detectados

Content Understanding es primera clase en el portal de Microsoft Foundry — cuando el examen pregunte por "extraer información" dentro de una solución Foundry, la respuesta casi siempre es este servicio.

Diagrama interactivo — sigue el flujo de una pregunta desde el usuario hasta la respuesta final. Pasa el cursor sobre cada nodo para entender su rol.

Grounding con RAG

RAG (Retrieval-Augmented Generation) es el patrón más común para anclar (grounding) las respuestas de un modelo en datos propios, dentro de una solución construida en Foundry.

1

Indexación

Los documentos se dividen en chunks y se convierten en embeddings → Azure AI Search

2

Recuperación

La pregunta del usuario se convierte en embedding y se busca en AI Search

3

Generación

Los docs relevantes + la pregunta se envían como prompt al modelo desplegado en Foundry

4

Respuesta

El modelo genera una respuesta fundamentada en los documentos recuperados

Las alucinaciones son cuando el modelo genera información plausible pero incorrecta. RAG con grounding reduce este problema al anclar las respuestas en documentos reales.

Tips para el día del examen

🏭

El examen tiene solo 2 dominios: "Identify AI concepts and capabilities" (40–45%) e "Implement AI solutions by using Microsoft Foundry" (55–60%). Casi el 60% es sobre Foundry.

⚖️

IA Responsable tiene 6 principios: Equidad, Confiabilidad y seguridad, Privacidad y seguridad, Inclusividad, Transparencia, Responsabilidad. Memorízalos.

🧩

Portal Agents = agente sin código, sin infraestructura propia. Hosted Agents = tu código empaquetado corriendo en un endpoint administrado por Foundry. El examen distingue ambos.

🖼️

Un modelo multimodal puede recibir una imagen o audio directamente en el prompt — ya no necesitas un servicio de visión o voz separado para "interpretar" el contenido.

📄

Content Understanding extrae información de documentos, imágenes, audio y video — es la respuesta cuando el examen pregunta por "extraer información" dentro de Foundry.

🎙️

Azure Speech vive dentro de Foundry Tools (antes Azure AI Services). Es el servicio correcto para "text and speech by using Foundry".

🔑

El acceso a ciertos modelos en Foundry requiere aprobación — no está disponible automáticamente para todos los proyectos.

🛡️

Content filtering está habilitado por defecto en los modelos de Foundry. Se puede configurar pero no deshabilitar del todo.

🏗️

RAG (Retrieval-Augmented Generation) = Azure AI Search (retrieval) + un modelo desplegado en Foundry (generación). Busca docs relevantes → los pasa al modelo como contexto.

🎯

Foundry SDK = cliente delgado con un solo endpoint de proyecto. Frameworks de más alto nivel (como Agent Framework) se construyen sobre él, no lo reemplazan.

¿Quieres más profundidad?

Esta guía es un resumen rápido. Visita la sección Deep Dive para exploración exhaustiva con casos reales, análisis de costos y decisiones arquitectónicas.

Practica AI-901 con simulaciones interactivas

Labs click-through: navega una simulación del portal paso a paso, con objetivos claros y verificación en cada acción — sin costos reales.

Labs en demo disponibles con cuenta gratuita
Acceso completo al comprar el examen
Explorar Labs

¿Listo para practicar?

Pon a prueba lo que aprendiste con preguntas originales del examen AI-901.

Iniciar simulacro AI-901

Sin límite de simulacros con plan Pro

¿Te fue útil esta guía?

¿Aún no estás list@ para empezar?

Déjanos tu email y crea tu cuenta gratis cuando estés list@ — empieza con 15 preguntas de AI-901, sin tarjeta de crédito.

Ya tienes cuenta? Ir directo al simulacro →