AIF-C01

Deep Dive

Todas las guías
Practicar ahora
D2 · Fundamentos de IA generativa

Conceptos clave: tokens, embeddings, context window

Cinco conceptos que aparecen en casi cualquier pregunta de IA generativa del AIF-C01. Son el vocabulario técnico mínimo para entender cómo "piensa" y cómo se configura un foundation model.

Tokens y tokenización

Un modelo de lenguaje no procesa texto como caracteres ni como palabras completas — lo divide en tokens: fragmentos que pueden ser una palabra completa, parte de una palabra, o incluso un solo carácter o signo de puntuación, según el vocabulario del tokenizador.

Ejemplo práctico

La palabra "tokenización" podría dividirse en varios tokens como token, iza, ción, mientras que palabras muy comunes como "el" o "de" suelen ser un único token. En promedio, en textos en inglés, un token equivale aproximadamente a ¾ de una palabra.

El costo de usar un foundation model (y el uso del context window) se mide en tokens — tanto los que envías en el prompt como los que el modelo genera en la respuesta.

Chunking y modelos multi-modales / diffusion

El chunking consiste en dividir documentos largos en fragmentos ("chunks") más pequeños y manejables antes de generar sus embeddings. Es un paso previo esencial en RAG: en vez de convertir un documento entero de 200 páginas en un único embedding poco preciso, se divide en fragmentos de tamaño razonable (por párrafo, sección o número fijo de tokens), cada uno con su propio embedding, lo que permite recuperar justo la parte relevante del documento en vez de todo el documento completo.

Por qué importa el tamaño del chunk

Chunks muy pequeños pierden contexto (una frase aislada puede ser ambigua); chunks muy grandes diluyen la precisión de la búsqueda semántica y consumen más context window al recuperarse. El tamaño de chunk es un parámetro de diseño que se ajusta según el tipo de documento y el caso de uso.

Modelos multi-modales

pueden procesar y/o generar combinaciones de texto, imagen, audio o video en una misma interacción, en vez de estar limitados a una única modalidad de entrada o salida.

Diffusion models

Los son un tipo de modelo usado principalmente para generación de imágenes: aprenden a revertir gradualmente un proceso de "ruido" agregado a una imagen, hasta producir una imagen nueva y coherente a partir de ruido aleatorio guiado por un prompt.

Embeddings y similitud semántica

Un es una representación numérica (un vector de cientos o miles de dimensiones) del significado de un texto, imagen u otro dato. Dos textos con significado similar producen vectores matemáticamente cercanos entre sí, aunque usen palabras completamente distintas.

Ejemplo

Los embeddings de "el coche está averiado" y "el auto se dañó" quedan muy cerca en el espacio vectorial, aunque no comparten ninguna palabra literal — porque su significado es prácticamente el mismo. Esta cercanía se mide con métricas como la similitud coseno.

Los embeddings son la base técnica de la búsqueda semántica y de RAG (Retrieval-Augmented Generation): en vez de buscar por coincidencia exacta de palabras, se buscan los documentos cuyo embedding está más cerca del embedding de la pregunta del usuario.

Lab relacionadoD2 · Fundamentos de IA generativa

Visualizar similitud semántica con embeddings de Bedrock

Genera embeddings de tres frases en Bedrock y compara su similitud semántica, sin que compartan ni una palabra.

Entender qué es un embedding: una representación numérica del significado
Comparar embeddings con similitud coseno

+1 más...

6 min2 pasos

Context window

El es la cantidad máxima de tokens (contando el prompt de entrada más la respuesta generada) que un modelo puede considerar en una sola interacción. Todo lo que exceda ese límite simplemente no es visible para el modelo.

Implicaciones prácticas

  • • Una conversación muy larga puede hacer que el modelo "olvide" el inicio si excede el context window
  • • Documentos muy extensos deben resumirse, dividirse en fragmentos (chunking) o recuperarse selectivamente con RAG en vez de pegarse enteros en el prompt
  • • Un context window más grande permite dar más contexto de una vez, pero generalmente incrementa el costo y la latencia por solicitud

Context engineering

El context window es solo el límite físico de cuánto puede procesar el modelo. El context engineering es la práctica activa de diseñar qué información específica va dentro de ese límite — qué documentos incluir, qué parte del historial de conversación mantener, qué instrucciones anteponer — para maximizar la calidad de la respuesta sin desperdiciar espacio en información irrelevante.

Context window vs. context engineering

El context window es una propiedad fija del modelo (cuántos tokens caben). El context engineering es una decisión de diseño de la aplicación: incluso con un context window enorme, meter documentos irrelevantes o un historial de conversación innecesario diluye la atención del modelo y aumenta el costo — la meta es seleccionar cuidadosamente qué entra, no simplemente llenar todo el espacio disponible.

Temperature, top-p y top-k

En cada paso, un modelo generativo calcula una distribución de probabilidad sobre el siguiente token posible. Los controlan cómo se elige el token final de esa distribución.

Temperature

Controla la aleatoriedad general de la elección. Con temperature = 0 el modelo siempre elige el token más probable (respuestas deterministas y repetibles). Con temperature = 1 o más, aumenta la probabilidad de elegir tokens menos obvios (respuestas más creativas y variadas, pero menos predecibles).

Top-p (nucleus sampling)

Limita la elección al conjunto más pequeño de tokens cuya probabilidad acumulada alcanza p. Con top-p = 0.9, el modelo solo considera los tokens más probables que en conjunto suman el 90% de la probabilidad, descartando la "cola larga" de opciones improbables.

Top-k

Limita la elección a los k tokens más probables, sin importar su probabilidad acumulada. Con top-k = 10, el modelo elige entre los 10 tokens con mayor probabilidad en ese paso, descartando el resto por completo.

Ejemplo numérico combinado

Para generar un chatbot de atención al cliente que debe dar respuestas consistentes y factuales, se usatemperature baja (0.1-0.3). Para generar ideas creativas de marketing, se usa temperature alta (0.7-1.0) combinada con un top-p amplio, para permitir más variedad en las respuestas.

Token-based pricing

La mayoría de los foundation models (incluidos los de Amazon Bedrock) se cobran por tokens: un precio por cada mil o millón de tokens de entrada (el prompt) y otro precio, normalmente más alto, por cada tokens de salida (la respuesta generada).

Cómo afecta esto al diseño de aplicaciones

  • • Prompts largos (mucho contexto, muchos ejemplos de few-shot) incrementan el costo de cada solicitud, incluso antes de que el modelo genere una sola palabra de respuesta
  • • Pedir respuestas más cortas o estructuradas reduce el costo de los tokens de salida, que suelen ser más caros que los de entrada
  • • Técnicas como RAG y chunking bien diseñadas ayudan a incluir solo el contexto relevante en vez de documentos completos, controlando el costo por solicitud
  • • Conversaciones largas con mucho historial acumulado incrementan progresivamente el costo de cada turno, si el historial completo se reenvía en cada solicitud

Alucinaciones y no determinismo

Una alucinación ocurre cuando un modelo genera información que suena convincente y coherente, pero es objetivamente falsa o no está respaldada por ninguna fuente real.

Por qué ocurren

Un foundation model no "sabe" hechos de forma explícita — genera texto prediciendo estadísticamente el siguiente token más plausible dado el contexto y sus patrones de entrenamiento. Si el modelo no tiene suficiente información confiable sobre un tema, igual generará una respuesta gramaticalmente coherente y con apariencia de certeza, aunque el contenido factual sea inventado.

No determinismo — otra desventaja distinta

A diferencia del software tradicional, el mismo prompt enviado dos veces al mismo modelo puede producir respuestas distintas — esto es el no determinismo de la IA generativa. Ocurre porque la generación de texto es un proceso de muestreo probabilístico (afectado por parámetros como temperature y top-p), no un cálculo exacto y repetible. Es una limitación distinta de la alucinación: una respuesta puede ser factualmente correcta y aun así variar en su redacción exacta cada vez.

Cómo se mitigan (no se eliminan)

  • • RAG: fundamentar las respuestas en documentos reales recuperados, en vez de depender solo del conocimiento paramétrico del modelo
  • • Temperature baja: reduce la aleatoriedad, favoreciendo respuestas más conservadoras y menos "inventivas"
  • • Prompts que piden citar fuentes o admitir incertidumbre cuando no se tiene información suficiente
  • • Revisión humana en casos de alto riesgo (legal, médico, financiero)

¿Entendiste este tema?

Pon a prueba lo que acabas de aprender

Un equipo configura un asistente legal con Amazon Bedrock y necesita que las respuestas sean lo más consistentes y predecibles posible, minimizando la variabilidad entre ejecuciones del mismo prompt. ¿Qué ajuste de parámetros de inferencia es más adecuado?

Inicia sesión para llevar tu progreso.