Los foundation models son el corazón de la IA generativa moderna y el eje central del dominio D2 del examen (24% del peso total). Entender qué los hace distintos del ML tradicional es la base para todo lo demás: Bedrock, prompting, RAG y fine-tuning.
Contenido
Un foundation model es un modelo de deep learning entrenado con cantidades masivas de datos diversos y no etiquetados, diseñado para servir como base general adaptable a muchas tareas distintas — en vez de resolver un único problema específico como hacía el ML tradicional.
El mismo foundation model de texto puede, sin reentrenarse, responder preguntas, resumir documentos, traducir, escribir código o mantener una conversación — simplemente cambiando el prompt que recibe.
ML tradicional — tarea única
Un modelo entrenado para clasificar spam solo hace eso. Un modelo entrenado para predecir precios de vivienda solo hace eso. Cada nueva tarea requiere entrenar (o al menos reentrenar significativamente) un modelo nuevo, con su propio dataset etiquetado específico para esa tarea.
Foundation model — multi-tarea
Un único modelo, entrenado una vez con datos masivos y generales, se adapta a docenas de tareas distintas simplemente mediante el prompt (instrucción en lenguaje natural), sin reentrenamiento. La generalidad viene de la escala del pre-entrenamiento, no de entrenar para cada tarea individualmente.
Para el examen
Si un escenario describe "un solo modelo que responde preguntas, resume texto Y genera código sin reentrenarse para cada tarea", está describiendo un foundation model. Si describe "un modelo entrenado específicamente para detectar fraude con datos históricos etiquetados de fraude", es ML tradicional.
Los foundation models se entrenan inicialmente ("pre-entrenan") con volúmenes enormes de datos no etiquetados — texto de internet, libros, código, imágenes — usando tareas de aprendizaje auto-supervisado, como predecir la siguiente palabra de una oración dado el contexto anterior. No requiere que un humano etiquete cada ejemplo: la propia estructura del texto sirve como señal de entrenamiento.
Este pre-entrenamiento es extremadamente costoso en cómputo (semanas de entrenamiento en clusters masivos de GPUs) y solo lo hacen unas pocas organizaciones. El resultado es un modelo base con un entendimiento amplio del lenguaje, que luego se puede adaptar a tareas específicas con mucho menos esfuerzo mediante prompt engineering, RAG o fine-tuning.
El transfer learning es la técnica que permite reutilizar el conocimiento general adquirido durante el pre-entrenamiento de un foundation model para tareas específicas, sin tener que entrenar desde cero. Es la razón económica por la que los foundation models son viables: entrenar desde cero cuesta millones de dólares; adaptar un modelo pre-entrenado cuesta una fracción de eso.
Ejemplo
Un foundation model pre-entrenado con texto general de internet ya "sabe" gramática, hechos generales y razonamiento básico. Fine-tunearlo con un pequeño dataset de tickets de soporte técnico de una empresa transfiere ese conocimiento general al dominio específico, requiriendo muchísimos menos datos y cómputo que entrenar un modelo de lenguaje desde cero.
Texto (LLMs)
Generan, resumen, traducen y razonan sobre lenguaje natural. Ejemplos: Claude, Titan Text, Llama.
Imagen
Generan imágenes a partir de descripciones en texto (text-to-image) o transforman imágenes existentes. Ejemplo: Titan Image Generator, Stable Diffusion.
Multimodal
Procesan y/o generan combinaciones de texto, imagen, audio o video en una sola interacción. Ejemplo: Claude con capacidad de visión.
Código
Especializados en generar, explicar y completar código fuente en múltiples lenguajes de programación. Ejemplo: modelos detrás de Amazon Q Developer.
Envía una imagen y un prompt de texto a un modelo multimodal de Bedrock para describir y evaluar un daño.
+1 más...
Desde que se decide construir o adaptar un foundation model hasta que está en producción, el proceso sigue un ciclo con etapas bien diferenciadas — y termina en un bucle continuo de retroalimentación, no en un paso final único.
1. Selección de datos: Se identifican y preparan las fuentes de datos de entrenamiento — texto, código, imágenes — evaluando su calidad, diversidad y posibles sesgos.
2. Selección de modelo: Se elige la arquitectura y el tamaño de modelo adecuados al presupuesto de cómputo y al objetivo (o se elige un foundation model existente como base en vez de entrenar desde cero).
3. Pre-entrenamiento: El modelo aprende patrones generales de lenguaje/datos con aprendizaje auto-supervisado sobre el dataset masivo, en un proceso extremadamente costoso en cómputo.
4. Fine-tuning: El modelo base se adapta a tareas o dominios específicos con datasets más pequeños y (normalmente) etiquetados, aprovechando transfer learning.
5. Evaluación: Se mide el desempeño del modelo con métricas y benchmarks relevantes antes de desplegarlo, verificando precisión, sesgo y comportamiento en casos límite.
6. Despliegue: El modelo se pone en producción, expuesto mediante una API (por ejemplo, a través de Amazon Bedrock) para que las aplicaciones lo consuman.
7. Feedback (loop continuo): El comportamiento del modelo en producción se monitorea y se recopila feedback real de uso, que alimenta nuevas rondas de fine-tuning, ajuste de datos o incluso re-entrenamiento — el ciclo no termina en el despliegue, se retroalimenta continuamente.
Para el examen
El punto clave es que el ciclo es iterativo, no lineal de un solo paso: el feedback de producción retroalimenta etapas anteriores (más datos, más fine-tuning), en vez de terminar el proceso una vez desplegado el modelo.
¿Entendiste este tema?
Pon a prueba lo que acabas de aprender
¿Cuál es la principal diferencia entre un foundation model y un modelo de ML tradicional entrenado para una tarea específica?
Inicia sesión para llevar tu progreso.