AIF-C01

Deep Dive

Todas las guías
Practicar ahora
D1 · Fundamentos de IA y ML

— plataforma ML end-to-end

SageMaker es el servicio de AWS para construir, entrenar y desplegar modelos de Machine Learning propios, cubriendo todo el ciclo de vida que vimos en la sección anterior: desde el notebook hasta el endpoint en producción.

Qué es SageMaker

SageMaker es una plataforma completamente administrada que agrupa todas las herramientas necesarias para un proyecto de ML tradicional: preparación de datos, notebooks, entrenamiento distribuido, ajuste de hiperparámetros, despliegue de endpoints y monitoreo — sin tener que gestionar servidores individualmente.

Cuándo usar SageMaker

  • • Necesitas entrenar un modelo con tus propios datos y un problema muy específico de tu negocio
  • • Requieres control total sobre la arquitectura, hiperparámetros y proceso de entrenamiento
  • • Ningún foundation model pre-entrenado ni servicio de IA administrado resuelve bien tu caso de uso
  • • Quieres desplegar modelos propios (incluyendo modelos open-source o foundation models afinados) como endpoints gestionados

Dos fuentes posibles para un foundation model

Cuando el punto de partida es un foundation model (no un modelo de ML clásico entrenado desde cero), hay dos caminos: usar un modelo pre-entrenado open source (o propietario) ya publicado — como los disponibles en Amazon Bedrock o en JumpStart de SageMaker — y opcionalmente afinarlo con tus propios datos; o entrenar un modelo custom desde cero, con SageMaker, cuando ningún modelo existente se ajusta al dominio o hay requisitos de propiedad total sobre los datos y la arquitectura. La primera opción es casi siempre más rápida y barata; la segunda da control total a cambio de mucho más esfuerzo.

SageMaker Studio

Es el IDE unificado de SageMaker: un entorno visual, basado en web, que integra notebooks Jupyter, pipelines de entrenamiento, experimentos, registro de modelos y despliegue en una sola interfaz. Reemplaza el trabajo manual de gestionar instancias de notebook individuales.

Desde Studio, un data scientist puede explorar datos, escribir y ejecutar código de entrenamiento, comparar experimentos (distintos hiperparámetros o algoritmos) y desplegar el modelo ganador, todo sin salir del entorno ni aprovisionar infraestructura manualmente.

Lab relacionadoD1 · Fundamentos de IA y ML

Crear un notebook en Amazon SageMaker

Crea una instancia de notebook administrada para explorar datos y entrenar modelos de machine learning.

Entender qué es Amazon SageMaker y su rol en el ciclo de vida de ML
Crear una instancia de notebook Jupyter administrada

+1 más...

9 min6 pasos

SageMaker Autopilot — AutoML

Autopilot automatiza el proceso de construir un modelo de ML: dado un dataset tabular y una columna objetivo, prueba automáticamente distintos algoritmos, realiza ingeniería de features y ajusta hiperparámetros para encontrar el mejor modelo posible, sin que el usuario escriba código de entrenamiento.

Caso de uso típico

Un equipo sin especialistas de ML profundo necesita un modelo de predicción de abandono de clientes (churn) a partir de una tabla de datos históricos. Autopilot genera automáticamente varios modelos candidatos, muestra un ranking de desempeño y permite desplegar el mejor con unos pocos clics.

SageMaker Ground Truth — etiquetado de datos

Ground Truth ayuda a construir datasets etiquetados de alta calidad para aprendizaje supervisado, combinando anotadores humanos (tu propio equipo, una fuerza de trabajo gestionada por AWS, o Amazon Mechanical Turk) con asistencia de ML que aprende a etiquetar automáticamente los casos más sencillos, reduciendo el costo total de etiquetado.

Ejemplo: etiquetar manualmente 500,000 imágenes con bounding boxes de objetos sería extremadamente costoso. Ground Truth etiqueta manualmente un subconjunto, entrena un modelo auxiliar sobre esas etiquetas, y ese modelo auxiliar etiqueta automáticamente los casos donde tiene alta confianza — dejando solo los casos difíciles para revisión humana.

SageMaker Clarify — mención breve

Clarify detecta sesgo (bias) potencial en los datos de entrenamiento y en las predicciones del modelo, y ofrece explicabilidad mostrando qué features influyeron más en cada predicción (feature importance). Es una herramienta central en el dominio de IA responsable del examen — se profundiza en el módulo de D4.

SageMaker Model Monitor

Vigila de forma continua los modelos ya desplegados en producción, comparando las características de los datos de entrada en tiempo real contra las del conjunto de entrenamiento. Detecta automáticamente:

Data drift

Los datos que llegan al modelo en producción cambian su distribución respecto a los datos de entrenamiento (por ejemplo, nuevos patrones de comportamiento de usuarios).

Model quality drift

La precisión real del modelo se degrada con el tiempo, detectable cuando se dispone de las etiquetas reales para comparar contra las predicciones.

Este monitoreo continuo conecta directamente con la fase 6 del ciclo de vida de ML (monitoreo) que vimos antes: cuando Model Monitor detecta drift significativo, suele disparar un reentrenamiento del modelo con datos más recientes.

Lab relacionadoD1 · Fundamentos de IA y ML

Detectar drift de datos con SageMaker Model Monitor

Configura un schedule de Model Monitor y detecta cómo el drift de datos degrada silenciosamente un modelo en producción.

Entender que un modelo puede degradarse en producción sin ningún error de código
Configurar un monitor schedule con un umbral de drift

+1 más...

9 min6 pasos

SageMaker vs Bedrock — la comparación clave del examen

Esta distinción aparece constantemente en el AIF-C01: ambos son plataformas de ML/IA de AWS, pero resuelven problemas fundamentalmente distintos.

Amazon SageMaker

Construir tu propio modelo desde cero (o afinar uno existente) con tus propios datos y control total sobre la arquitectura.

Más esfuerzo, más flexibilidad, requiere conocimiento de ML.

Amazon Bedrock

Usar foundation models ya entrenados por Amazon o terceros, accesibles vía API, sin gestionar infraestructura de entrenamiento.

Menos esfuerzo, arranque inmediato, ideal para IA generativa.

Regla mnemotécnica

SageMaker = fábrica (construyes el modelo desde los datos). Bedrock = tienda (eliges un modelo ya construido y lo consumes por API).

En términos más generales de puesta en producción, esta misma decisión se resume en dos métodos:

Managed API service

Consumes un modelo a través de una API totalmente gestionada por el proveedor (ej. Amazon Bedrock). No provisionas ni escalas infraestructura — pagas por uso (tokens, requests) y AWS gestiona la disponibilidad del hardware subyacente.

Self-hosted API

Despliegas tú mismo el modelo como un endpoint propio (ej. un SageMaker endpoint), eligiendo el tipo de instancia, la configuración de auto scaling y el ciclo de actualización. Más control y potencial ahorro a gran escala, a cambio de asumir la operación de esa infraestructura.

Otros servicios de AWS en el pipeline de ML/GenAI

Además de SageMaker AI (entrenar/desplegar modelos propios) y Bedrock (consumir foundation models por API), AWS ofrece otros servicios que aparecen en distintas etapas de un pipeline de IA — desde construir la solución hasta que un usuario final la consuma.

Amazon Q

Familia de asistentes de IA generativa de AWS (Amazon Q Developer, Amazon Q Business). Etapa: consumo / producto final — un usuario interactúa con Q en lenguaje natural para escribir código, resolver dudas sobre datos corporativos o automatizar tareas, sin construir un modelo propio.

Amazon QuickSight ("Amazon Quick")

Servicio de business intelligence con capacidades de IA generativa integradas (resúmenes, preguntas en lenguaje natural sobre dashboards). Etapa: análisis y consumo de resultados por usuarios de negocio, no ML/entrenamiento.

Kiro

IDE agéntico de AWS: un entorno de desarrollo que usa IA generativa y agentes para ayudar a especificar, generar y mantener código. Etapa: construcción — se usa durante el desarrollo de la propia solución, no en producción.

SageMaker AI y Bedrock

Ya vistos en detalle: SageMaker cubre entrenamiento y despliegue de modelos propios; Bedrock cubre acceso a foundation models gestionados por API. Son el núcleo de las etapas de entrenamiento e inferencia del pipeline.

Servicios de IA gestionados de AWS

Para tareas de IA específicas y pre-entrenadas (sin construir ni entrenar nada), AWS ofrece APIs listas para usar: Amazon Transcribe (voz a texto), Amazon Polly (texto a voz), Amazon Comprehend (NLP — sentimiento, entidades), Amazon Lex (chatbots con intents) y Amazon Translate (traducción automática entre idiomas). Se profundiza en cada uno en el módulo de servicios de IA de D3.

Cuándo elegir ML tradicional vs foundation models

No todo problema de IA necesita un foundation model. El examen espera que reconozcas los criterios que inclinan la decisión hacia SageMaker (ML tradicional/custom) o hacia Bedrock (foundation models).

Requisitos regulatorios

Sectores muy regulados (banca, salud) pueden exigir modelos auditables y con procedencia de datos totalmente controlada — más fácil de garantizar con un modelo propio entrenado en SageMaker.

Necesidad de explicabilidad

Si el negocio necesita justificar cada predicción individual (ej. por qué se negó un crédito), un modelo de ML clásico interpretable suele ser preferible a un foundation model tipo "caja negra".

Restricciones operacionales

Presupuesto, latencia máxima aceptable, disponibilidad de datos de entrenamiento propios y el tiempo hasta producción también determinan si conviene construir (SageMaker) o consumir (Bedrock).

¿Entendiste este tema?

Pon a prueba lo que acabas de aprender

Una empresa de manufactura tiene un dataset propietario de sensores de sus máquinas y quiere entrenar un modelo de predicción de fallas específico para su equipo industrial, con control total sobre la arquitectura y los hiperparámetros. ¿Qué servicio de AWS es el más adecuado?

Inicia sesión para llevar tu progreso.