AIF-C01

Deep Dive

Todas las guías
Practicar ahora
D3 · Aplicaciones de foundation models

Icon-Architecture/48/Arch_Amazon-Bedrock_48 RAG — Retrieval-Augmented Generation

La técnica más importante para conectar un foundation model con información privada o actualizada sin tener que reentrenarlo. Domina esto y resolverás la mayoría de escenarios de "el modelo no sabe X" del examen.

El problema que resuelve

Un foundation model se entrena una vez, en un momento concreto, sobre un corpus de datos públicos. Después de ese entrenamiento, el modelo no sabe nada nuevo: no conoce eventos posteriores a su fecha de corte, ni tiene acceso a los documentos internos de tu empresa, ni a tus bases de datos privadas.

Reentrenar el modelo cada vez que cambian tus datos es lento y costoso. RAG resuelve esto sin tocar los pesos del modelo: en el momento de responder, se le "inyecta" la información relevante como contexto adicional del prompt.

Sin RAG

El modelo responde solo con lo que "recuerda" de su entrenamiento. Si le preguntas por la política de vacaciones de tu empresa o por un producto lanzado la semana pasada, o inventa una respuesta plausible (alucinación) o admite que no lo sabe.

Con RAG

Antes de responder, el sistema busca en tus documentos los fragmentos más relevantes para la pregunta y se los añade al prompt. El modelo responde basándose en esa información concreta, actualizada y verificable.

Cómo funciona el pipeline de RAG

Cuatro pasos, dos fases: una de preparación (offline) y otra en el momento de la consulta (online).

1

Ingesta y trocear documentos (chunking)

Preparación (offline)

Tus documentos (PDFs, páginas web, tickets de soporte, wikis internas) se dividen en fragmentos más pequeños ("chunks") — párrafos o secciones manejables.

2

Generar embeddings y almacenarlos

Preparación (offline)

Cada fragmento se convierte en un vector numérico (embedding) que captura su significado semántico, y se guarda en una base de datos vectorial.

3

Búsqueda por similitud semántica

Consulta (online)

Cuando el usuario hace una pregunta, esta también se convierte en un embedding, y se buscan en la base vectorial los fragmentos más "cercanos" (similares en significado) a la pregunta.

4

Inyección de contexto en el prompt

Consulta (online)

Los fragmentos recuperados se insertan en el prompt junto con la pregunta original, y ese prompt "enriquecido" se envía al foundation model para generar la respuesta final.

Lab relacionadoD2 · Fundamentos de IA generativa

Comparar estrategias de chunking para RAG

Compara chunks pequeños contra chunks grandes y observa el tradeoff de precisión vs. contexto en una consulta RAG.

Entender que el tamaño de chunk es una decisión de diseño clave en RAG
Comparar la recuperación con chunks pequeños vs. chunks grandes

+1 más...

8 min2 pasos

Embeddings y bases de datos vectoriales

Representaciones numéricas (vectores de cientos o miles de dimensiones) del significado de un texto. Textos con significados similares producen vectores "cercanos" entre sí en ese espacio matemático, aunque usen palabras completamente distintas. Es lo que permite buscar por significado y no solo por coincidencia de palabras.

Almacena los embeddings y permite búsquedas de similitud muy rápidas incluso sobre millones de fragmentos, comparando vectores en lugar de comparar texto literal.

Servicios de AWS que puedes usar como base vectorial

El examen espera que reconozcas cuáles servicios de AWS son capaces de almacenar embeddings y ejecutar búsquedas por similitud — son la pieza de "almacenamiento vectorial" del pipeline de RAG.

Icon-Architecture/48/Arch_Amazon-OpenSearch-Service_48

Amazon OpenSearch Service

Motor de búsqueda y analítica con soporte nativo de vectores (k-NN). La opción más usada como base vectorial para RAG, incluida la que aprovisiona Bedrock Knowledge Bases por defecto.

Icon-Architecture/48/Arch_Amazon-Aurora_48

Amazon Aurora (con pgvector)

Base de datos relacional compatible con PostgreSQL a la que se le añade la extensión pgvector para guardar embeddings junto a tus datos transaccionales.

Icon-Architecture/48/Arch_Amazon-Neptune_48

Amazon Neptune

Base de datos de grafos que también soporta almacenamiento y búsqueda de vectores, útil cuando además necesitas modelar relaciones entre entidades.

Icon-Architecture/48/Arch_Amazon-RDS_48

Amazon RDS for PostgreSQL (con pgvector)

Igual que Aurora, pero sobre RDS estándar para PostgreSQL: añade la extensión pgvector para habilitar búsqueda por similitud.

Idea clave para el examen

Búsqueda vectorial ≠ búsqueda de palabras clave. Una búsqueda tradicional busca coincidencias exactas de texto; una búsqueda vectorial busca cercanía de significado, así que "cómo cancelo mi suscripción" puede encontrar un fragmento titulado "dar de baja el plan" aunque no compartan ninguna palabra.

La implementación totalmente administrada de RAG en AWS: automatiza todo el pipeline que acabas de ver.

Icon-Architecture/48/Arch_Amazon-Bedrock_48

Qué automatiza

  • Ingesta: Conecta directamente con fuentes de datos como S3, Confluence, Salesforce o SharePoint y las mantiene sincronizadas.
  • Chunking y embeddings: Divide tus documentos y genera los embeddings usando un modelo de embeddings de Bedrock, sin que tengas que gestionarlo tú.
  • Almacenamiento vectorial: Aprovisiona y gestiona la base de datos vectorial subyacente (por ejemplo OpenSearch Serverless) por ti.
  • Recuperación y generación: En tiempo de consulta, ejecuta la búsqueda semántica y construye el prompt con el contexto recuperado antes de llamar al foundation model.

Por qué importa para el examen

Cuando el escenario dice "queremos que nuestro chatbot responda con base en nuestros manuales internos, sin gestionar infraestructura de búsqueda vectorial", la respuesta casi siempre es Bedrock Knowledge Bases — no montar tu propia base vectorial desde cero.

Lab relacionadoD3 · Aplicaciones de foundation models

Crear una Knowledge Base (RAG) en Bedrock

Crea una Knowledge Base en Bedrock para implementar RAG sobre documentos de empresa.

Entender cómo Knowledge Bases implementa RAG de forma administrada
Configurar una fuente de datos S3 para la ingesta de documentos

+1 más...

10 min7 pasos

Cuándo RAG es la opción correcta (vs fine-tuning)

SituaciónRAGFine-tuning
Los datos cambian con frecuencia (precios, inventario, políticas)
Necesitas que el modelo cite o base sus respuestas en documentos fuente verificables
Quieres reducir alucinaciones dando contexto factual concreto
Necesitas cambiar el tono, estilo o formato de respuesta de forma consistente
Necesitas que el modelo aprenda un lenguaje o dominio muy especializado (jerga legal, médica)
Quieres evitar el costo y complejidad de reentrenar

Limitaciones de RAG

La calidad depende de los documentos fuente

"Garbage in, garbage out": si tus documentos están desactualizados, mal organizados o son contradictorios, el modelo recuperará y usará esa información incorrecta con total confianza. RAG no corrige la calidad de tus datos.

No cambia el comportamiento del modelo

RAG le da al modelo información nueva, pero no le enseña nuevos patrones de razonamiento, tono ni formato de forma permanente — para eso necesitarías fine-tuning. El modelo base sigue siendo el mismo entre consulta y consulta.

Recuperación imperfecta

Si la búsqueda semántica no encuentra los fragmentos correctos (documentos mal fragmentados, preguntas ambiguas), el modelo responderá con contexto irrelevante o insuficiente.

Límite del context window

Solo se puede inyectar una cantidad limitada de contexto por consulta (según la ventana de contexto del modelo), así que hay que elegir cuidadosamente cuántos fragmentos recuperar.

Lab relacionadoD3 · Aplicaciones de foundation models

Examina el error: RAG devuelve respuestas desactualizadas

Un chatbot RAG sigue citando precios antiguos aunque el PDF en S3 ya se actualizó. Encuentra y corrige la causa — sin pasos guiados.

Entender que las Knowledge Bases ingieren datos en el momento de la sincronización, no de forma continua
Diagnosticar por qué una actualización en S3 no se refleja en las respuestas del chatbot

+1 más...

6 min2 pasos

Otras técnicas de customización de FMs

RAG y fine-tuning no son las únicas formas de adaptar un foundation model. El examen también espera que reconozcas estas dos técnicas relacionadas:

In-context learning

Enseñar al modelo a resolver una tarea incluyendo ejemplos directamente en el prompt (few-shot prompting), sin modificar sus pesos ni añadir infraestructura de recuperación. Es la técnica más ligera de las cuatro.

Entrenar un modelo más pequeño ("student") para imitar el comportamiento de un modelo grande ya entrenado ("teacher"), usando las respuestas del modelo grande como datos de entrenamiento. El resultado es un modelo más barato y con menor latencia, que conserva buena parte de la calidad del modelo original para la tarea concreta que se destiló.

Idea clave para el examen

Si el escenario dice "queremos reducir costo y latencia manteniendo un desempeño similar al de un modelo grande", piensa en model distillation — es distinto de fine-tuning (que ajusta el mismo modelo con datos nuevos) y de RAG (que no cambia el modelo en absoluto).

¿Entendiste este tema?

Pon a prueba lo que acabas de aprender

Una empresa quiere que su asistente de IA generativa responda preguntas de empleados usando el manual interno de políticas, que se actualiza semanalmente. La empresa no quiere gestionar infraestructura de búsqueda vectorial. ¿Qué solución de AWS es la más adecuada?

Inicia sesión para llevar tu progreso.