La técnica más importante para conectar un foundation model con información privada o actualizada sin tener que reentrenarlo. Domina esto y resolverás la mayoría de escenarios de "el modelo no sabe X" del examen.
Contenido
Un foundation model se entrena una vez, en un momento concreto, sobre un corpus de datos públicos. Después de ese entrenamiento, el modelo no sabe nada nuevo: no conoce eventos posteriores a su fecha de corte, ni tiene acceso a los documentos internos de tu empresa, ni a tus bases de datos privadas.
Reentrenar el modelo cada vez que cambian tus datos es lento y costoso. RAG resuelve esto sin tocar los pesos del modelo: en el momento de responder, se le "inyecta" la información relevante como contexto adicional del prompt.
Sin RAG
El modelo responde solo con lo que "recuerda" de su entrenamiento. Si le preguntas por la política de vacaciones de tu empresa o por un producto lanzado la semana pasada, o inventa una respuesta plausible (alucinación) o admite que no lo sabe.
Con RAG
Antes de responder, el sistema busca en tus documentos los fragmentos más relevantes para la pregunta y se los añade al prompt. El modelo responde basándose en esa información concreta, actualizada y verificable.
Cuatro pasos, dos fases: una de preparación (offline) y otra en el momento de la consulta (online).
Ingesta y trocear documentos (chunking)
Preparación (offline)Tus documentos (PDFs, páginas web, tickets de soporte, wikis internas) se dividen en fragmentos más pequeños ("chunks") — párrafos o secciones manejables.
Generar embeddings y almacenarlos
Preparación (offline)Cada fragmento se convierte en un vector numérico (embedding) que captura su significado semántico, y se guarda en una base de datos vectorial.
Búsqueda por similitud semántica
Consulta (online)Cuando el usuario hace una pregunta, esta también se convierte en un embedding, y se buscan en la base vectorial los fragmentos más "cercanos" (similares en significado) a la pregunta.
Inyección de contexto en el prompt
Consulta (online)Los fragmentos recuperados se insertan en el prompt junto con la pregunta original, y ese prompt "enriquecido" se envía al foundation model para generar la respuesta final.
Compara chunks pequeños contra chunks grandes y observa el tradeoff de precisión vs. contexto en una consulta RAG.
+1 más...
Embeddings
Representaciones numéricas (vectores de cientos o miles de dimensiones) del significado de un texto. Textos con significados similares producen vectores "cercanos" entre sí en ese espacio matemático, aunque usen palabras completamente distintas. Es lo que permite buscar por significado y no solo por coincidencia de palabras.
Base de datos vectorial
Almacena los embeddings y permite búsquedas de similitud muy rápidas incluso sobre millones de fragmentos, comparando vectores en lugar de comparar texto literal.
Servicios de AWS que puedes usar como base vectorial
El examen espera que reconozcas cuáles servicios de AWS son capaces de almacenar embeddings y ejecutar búsquedas por similitud — son la pieza de "almacenamiento vectorial" del pipeline de RAG.
Amazon OpenSearch Service
Motor de búsqueda y analítica con soporte nativo de vectores (k-NN). La opción más usada como base vectorial para RAG, incluida la que aprovisiona Bedrock Knowledge Bases por defecto.
Amazon Aurora (con pgvector)
Base de datos relacional compatible con PostgreSQL a la que se le añade la extensión pgvector para guardar embeddings junto a tus datos transaccionales.
Amazon Neptune
Base de datos de grafos que también soporta almacenamiento y búsqueda de vectores, útil cuando además necesitas modelar relaciones entre entidades.
Amazon RDS for PostgreSQL (con pgvector)
Igual que Aurora, pero sobre RDS estándar para PostgreSQL: añade la extensión pgvector para habilitar búsqueda por similitud.
Idea clave para el examen
Búsqueda vectorial ≠ búsqueda de palabras clave. Una búsqueda tradicional busca coincidencias exactas de texto; una búsqueda vectorial busca cercanía de significado, así que "cómo cancelo mi suscripción" puede encontrar un fragmento titulado "dar de baja el plan" aunque no compartan ninguna palabra.
La implementación totalmente administrada de RAG en AWS: automatiza todo el pipeline que acabas de ver.
Qué automatiza
Por qué importa para el examen
Cuando el escenario dice "queremos que nuestro chatbot responda con base en nuestros manuales internos, sin gestionar infraestructura de búsqueda vectorial", la respuesta casi siempre es Bedrock Knowledge Bases — no montar tu propia base vectorial desde cero.
Crea una Knowledge Base en Bedrock para implementar RAG sobre documentos de empresa.
+1 más...
| Situación | RAG | Fine-tuning |
|---|---|---|
| Los datos cambian con frecuencia (precios, inventario, políticas) | ✓ | — |
| Necesitas que el modelo cite o base sus respuestas en documentos fuente verificables | ✓ | — |
| Quieres reducir alucinaciones dando contexto factual concreto | ✓ | — |
| Necesitas cambiar el tono, estilo o formato de respuesta de forma consistente | — | ✓ |
| Necesitas que el modelo aprenda un lenguaje o dominio muy especializado (jerga legal, médica) | — | ✓ |
| Quieres evitar el costo y complejidad de reentrenar | ✓ | — |
La calidad depende de los documentos fuente
"Garbage in, garbage out": si tus documentos están desactualizados, mal organizados o son contradictorios, el modelo recuperará y usará esa información incorrecta con total confianza. RAG no corrige la calidad de tus datos.
No cambia el comportamiento del modelo
RAG le da al modelo información nueva, pero no le enseña nuevos patrones de razonamiento, tono ni formato de forma permanente — para eso necesitarías fine-tuning. El modelo base sigue siendo el mismo entre consulta y consulta.
Recuperación imperfecta
Si la búsqueda semántica no encuentra los fragmentos correctos (documentos mal fragmentados, preguntas ambiguas), el modelo responderá con contexto irrelevante o insuficiente.
Límite del context window
Solo se puede inyectar una cantidad limitada de contexto por consulta (según la ventana de contexto del modelo), así que hay que elegir cuidadosamente cuántos fragmentos recuperar.
Un chatbot RAG sigue citando precios antiguos aunque el PDF en S3 ya se actualizó. Encuentra y corrige la causa — sin pasos guiados.
+1 más...
RAG y fine-tuning no son las únicas formas de adaptar un foundation model. El examen también espera que reconozcas estas dos técnicas relacionadas:
In-context learning
Enseñar al modelo a resolver una tarea incluyendo ejemplos directamente en el prompt (few-shot prompting), sin modificar sus pesos ni añadir infraestructura de recuperación. Es la técnica más ligera de las cuatro.
Model distillation
Entrenar un modelo más pequeño ("student") para imitar el comportamiento de un modelo grande ya entrenado ("teacher"), usando las respuestas del modelo grande como datos de entrenamiento. El resultado es un modelo más barato y con menor latencia, que conserva buena parte de la calidad del modelo original para la tarea concreta que se destiló.
Idea clave para el examen
Si el escenario dice "queremos reducir costo y latencia manteniendo un desempeño similar al de un modelo grande", piensa en model distillation — es distinto de fine-tuning (que ajusta el mismo modelo con datos nuevos) y de RAG (que no cambia el modelo en absoluto).
¿Entendiste este tema?
Pon a prueba lo que acabas de aprender
Una empresa quiere que su asistente de IA generativa responda preguntas de empleados usando el manual interno de políticas, que se actualiza semanalmente. La empresa no quiere gestionar infraestructura de búsqueda vectorial. ¿Qué solución de AWS es la más adecuada?
Inicia sesión para llevar tu progreso.