Este es, según los patrones históricos de exámenes AWS, el tema individual más preguntado del AIF-C01: identificar cuál de las tres técnicas de personalización usar según el escenario que te plantean.
Contenido
Las tres personalizan cómo responde un foundation model, pero actúan en momentos y con esfuerzos muy distintos.
Prompt engineering
Cambiar cómo formulas la instrucción al modelo. No toca el modelo ni añade datos externos. El esfuerzo más bajo y el resultado más inmediato.
RAG
Inyectar información externa relevante en el prompt en tiempo real, recuperada de una base de conocimiento. No reentrena el modelo, pero requiere una infraestructura de recuperación.
Fine-tuning
Continuar el entrenamiento del modelo con un dataset propio, ajustando sus pesos internos. Cambia el comportamiento del modelo de forma permanente. El esfuerzo y costo más altos.
| Criterio | Prompt engineering | RAG | Fine-tuning |
|---|---|---|---|
| Esfuerzo | Bajo — inmediato | Medio — requiere pipeline de datos | Alto — requiere dataset etiquetado y cómputo |
| Costo | Mínimo (solo tokens de inferencia) | Medio (almacenamiento vectorial + inferencia) | Alto (entrenamiento + almacenamiento del modelo ajustado) |
| Qué problema resuelve | El modelo sabe la respuesta pero hay que guiarlo mejor a formularla | El modelo no tiene acceso a información privada o actualizada | El modelo necesita cambiar su comportamiento, tono o dominio de forma consistente |
| Requiere reentrenar | No | No | Sí |
| Actualización de datos | No aplica | Instantánea (solo actualizar la base de conocimiento) | Requiere reentrenar de nuevo |
| Ejemplo típico | Pedir al modelo que responda en formato JSON o con ejemplos (few-shot) | Chatbot que responde con el manual interno de la empresa | Modelo que debe hablar siempre con el tono de marca y terminología legal específica |
Regla mnemotécnica para el examen
Si el escenario habla de "no sabe algo" → RAG. Si habla de "cómo lo dice / en qué formato / con qué tono" → prompt engineering. Si habla de "debe comportarse de forma distinta de manera consistente y repetible" → fine-tuning.
Fine-tuning completo
Se actualizan todos los parámetros (pesos) del modelo durante el reentrenamiento. Requiere mucha capacidad de cómputo, mucho tiempo, y produce una copia completa del modelo por cada versión ajustada.
Más caro de entrenar y de almacenar, pero puede lograr el ajuste más profundo posible.
PEFT (Parameter-Efficient Fine-Tuning)
Solo se entrena un pequeño subconjunto de parámetros adicionales (o capas ligeras insertadas), manteniendo congelados los pesos originales del modelo base.
Mucho más barato y rápido de entrenar, requiere menos datos, y produce artefactos pequeños que se pueden combinar con el modelo base en tiempo de inferencia. Es el enfoque preferido en la mayoría de casos prácticos con Bedrock.
A nivel conceptual, no necesitas saber los detalles matemáticos de técnicas PEFT específicas para el examen — basta con entender que PEFT logra resultados similares al fine-tuning completo con una fracción del costo y el cómputo, al no reentrenar el modelo entero.
Ajusta un foundation model con tus propios ejemplos usando fine-tuning en Amazon Bedrock.
+1 más...
"Fine-tuning" es el término general; el examen también nombra estos dos enfoques concretos dentro de esa categoría.
Instruction tuning
Ajusta el modelo con ejemplos formateados como pares de instrucción → respuesta deseada (ej. "resume este texto" → resumen correcto), para que el modelo aprenda a seguir instrucciones de forma más precisa y consistente en general, no solo en una tarea muy estrecha.
Transfer learning
Reutiliza el conocimiento que un modelo ya aprendió en una tarea o dominio para adaptarlo a otra tarea relacionada, en lugar de entrenar desde cero. El fine-tuning de un foundation model es, en esencia, una aplicación de transfer learning: partes de un modelo ya entrenado y lo especializas con menos datos y menos cómputo.
Es distinto del fine-tuning específico de una tarea: aquí se sigue pre-entrenando el modelo base con un gran volumen de datos nuevos y sin etiquetar de un dominio concreto (por ejemplo, todos los documentos técnicos internos de una empresa, o literatura médica), antes de aplicarle fine-tuning para una tarea específica.
El objetivo es que el modelo adquiera vocabulario, estilo y conocimiento general del dominio, de forma similar a como se pre-entrenó originalmente pero enfocado en ese dominio — un paso previo y complementario al fine-tuning, no un sustituto.
Diferencia clave con fine-tuning
Continuous pre-training usa datos no etiquetados y busca que el modelo "aprenda el dominio" en general. Fine-tuning usa datos etiquetados para una tarea concreta y busca que el modelo se comporte de una forma específica en esa tarea.
La calidad del fine-tuning depende directamente de la calidad de los datos de entrenamiento usados.
Curación
Seleccionar y limpiar los ejemplos relevantes para la tarea, eliminando datos irrelevantes, duplicados o de baja calidad.
Gobernanza
Controlar el origen, los permisos de uso y la trazabilidad de los datos usados para entrenar, especialmente si incluyen información sensible o de clientes.
Tamaño del dataset
Suficientes ejemplos para que el modelo generalice el patrón deseado, sin ser tan grande que el entrenamiento se vuelva innecesariamente costoso.
Etiquetado
Los ejemplos deben tener las respuestas o etiquetas correctas claramente definidas, ya que el modelo aprende directamente de esas etiquetas.
Representatividad
El dataset debe cubrir la variedad real de casos que el modelo encontrará en producción, para evitar sesgos o puntos ciegos.
RLHF (Reinforcement Learning from Human Feedback)
En lugar de solo usar ejemplos etiquetados de forma estática, se recolectan comparaciones y calificaciones humanas sobre las respuestas del modelo, y se usa aprendizaje por refuerzo para ajustar el modelo hacia las respuestas que las personas prefieren — clave para alinear el modelo con preferencias humanas (utilidad, tono, seguridad).
Qué es
Cuando haces fine-tuning (sobre todo fine-tuning completo) con un dataset muy especializado y estrecho, el modelo puede "olvidar" capacidades generales que tenía antes del ajuste — porque sus pesos se reajustaron fuertemente hacia la nueva tarea, degradando su desempeño en tareas para las que no se le siguió entrenando.
Ejemplo: un modelo ajustado intensivamente solo con tickets de soporte técnico puede volverse peor respondiendo preguntas generales de conocimiento que antes respondía bien.
Cómo se mitiga
Usar técnicas PEFT (que dejan intactos los pesos originales), incluir en el dataset de ajuste ejemplos variados que preserven las capacidades generales, y evaluar el modelo ajustado tanto en la nueva tarea como en tareas generales antes de desplegarlo a producción.
Un banco quiere que su asistente responda siempre citando las tasas de interés vigentes, que cambian cada semana.
Los datos cambian con frecuencia y necesitan estar siempre actualizados sin reentrenar el modelo.
Una aseguradora necesita que el modelo entienda y use correctamente la terminología legal específica de sus pólizas, de forma consistente en miles de interacciones.
Se necesita un cambio de comportamiento profundo y consistente en el dominio, no solo información puntual.
Un equipo quiere que las respuestas del modelo sigan siempre un formato de tabla Markdown con encabezados específicos.
Es un ajuste de formato/estilo de salida — se resuelve dando instrucciones claras y ejemplos en el prompt, sin tocar el modelo ni datos externos.
¿Entendiste este tema?
Pon a prueba lo que acabas de aprender
Una empresa de e-commerce ajustó un foundation model con miles de ejemplos de descripciones de productos de moda. Después del ajuste, notan que el modelo responde peor preguntas generales que antes manejaba correctamente. ¿Qué fenómeno describe esto?
Inicia sesión para llevar tu progreso.