AIF-C01

Deep Dive

D1 · Fundamentos de IA y ML

Deep Learning y redes neuronales

El deep learning es la técnica detrás de los foundation models modernos. Entender su arquitectura básica — sin entrar en las matemáticas — te da el contexto necesario para razonar sobre IA generativa en el resto del examen.

Qué es una red neuronal

Una red neuronal artificial es un modelo computacional organizado en capas de "neuronas" interconectadas, inspirado de forma laxa en el cerebro biológico. No hace falta entender el cálculo subyacente para el examen — sí entender su estructura conceptual.

Capa de entrada

Recibe los datos crudos: los píxeles de una imagen, los valores numéricos de una fila de datos, los tokens de un texto. Cada neurona de entrada representa una característica (feature) del input.

Capas ocultas

Cada neurona combina las salidas de la capa anterior usando pesos (qué tanto importa cada entrada) y una función de activación que introduce no linealidad. "Deep" learning se refiere precisamente a tener muchas capas ocultas apiladas.

Capa de salida

Produce el resultado final: una probabilidad de clase, un valor numérico, o —en un modelo de lenguaje— una distribución de probabilidad sobre el siguiente token posible.

Entrenamiento, en una frase

Entrenar una red neuronal significa ajustar iterativamente los pesos entre neuronas para que las predicciones se acerquen cada vez más a la respuesta correcta, comparando el error y propagándolo hacia atrás por la red (backpropagation) para corregir los pesos capa por capa.

Lab relacionadoD1 · Fundamentos de IA y ML

Entrenar un modelo y observar la curva de pérdida (loss)

Lanza un training job en SageMaker y observa cómo la función de pérdida (loss) disminuye época tras época.

Entender qué mide la función de pérdida (loss) durante el entrenamiento
Configurar un training job con un algoritmo y un número de epochs

+1 más...

9 min6 pasos

ML clásico vs Deep Learning

AspectoML clásicoDeep Learning
Extracción de característicasManual — un experto define qué features usar (ingeniería de features)Automática — la red aprende sus propias representaciones internas de las capas ocultas
Volumen de datos necesarioFunciona razonablemente bien con datasets pequeños o medianosRequiere datasets grandes para generalizar bien
Poder de cómputoPuede entrenarse en CPU en minutos u horasGeneralmente requiere GPUs y puede tomar horas, días o semanas
Ejemplos de algoritmosRegresión lineal/logística, árboles de decisión, random forest, SVMRedes neuronales profundas: CNN, RNN, Transformers
InterpretabilidadMás fácil de explicar por qué se tomó una decisiónMás difícil de interpretar ("caja negra")

Deep Learning es un subconjunto de Machine Learning, que a su vez es un subconjunto de Inteligencia Artificial. Todos los foundation models de IA generativa modernos (GPT, Claude, Llama, Titan) están construidos con arquitecturas de deep learning, específicamente Transformers.

IA, ML, Deep Learning, GenAI y Agentic AI

El examen exige distinguir estos cinco términos con precisión. La forma más fácil de recordarlos es como círculos concéntricos: cada uno es un subconjunto más específico del anterior.

1

Inteligencia Artificial (IA)

El campo más amplio: cualquier técnica que permite a una máquina simular comportamiento inteligente — desde reglas "si-entonces" escritas a mano hasta los modelos más avanzados de hoy.

2

Machine Learning (ML)

Subconjunto de IA donde el sistema aprende patrones a partir de datos, en vez de seguir reglas programadas explícitamente.

3

Deep Learning

Subconjunto de ML que usa redes neuronales con muchas capas para aprender representaciones automáticamente, sin ingeniería manual de features.

4

IA generativa (GenAI)

Subconjunto de deep learning enfocado en generar contenido nuevo (texto, imágenes, audio, código) usando foundation models entrenados sobre volúmenes masivos de datos.

5

Agentic AI (IA agéntica)

El nivel más específico: sistemas que combinan un foundation model de GenAI con memoria, planificación y acceso a herramientas externas para actuar de forma autónoma persiguiendo un objetivo — tomando decisiones y ejecutando acciones sin supervisión humana en cada paso.

Agentic AI en la práctica

Un chatbot que responde una pregunta es GenAI. Un sistema al que le das el objetivo "reserva el vuelo más barato para estas fechas", que busca opciones, compara precios, verifica políticas de la empresa y completa la reserva sin que un humano apruebe cada paso intermedio, es Agentic AI. En AWS, es el servicio que habilita este tipo de comportamiento autónomo.

Piensa en ello como círculos concéntricos: IA ⊃ ML ⊃ Deep Learning ⊃ GenAI. Agentic AI no es un círculo aún más pequeño dentro de GenAI, sino una capa de comportamiento construida sobre GenAI, que le añade memoria, planificación y herramientas para actuar de forma autónoma.

CNN — redes convolucionales para visión

Las Convolutional Neural Networks (CNN) son la arquitectura clásica para tareas de visión por computadora: clasificación de imágenes, detección de objetos, segmentación.

Idea central

En vez de conectar cada píxel con cada neurona (inviable computacionalmente para imágenes grandes), una CNN aplica pequeños filtros (kernels) que se deslizan sobre la imagen detectando patrones locales: bordes, texturas, formas. Las capas iniciales detectan patrones simples (bordes, colores); las capas más profundas combinan esos patrones en conceptos cada vez más abstractos (ojos, caras, objetos completos).

Servicios de AWS como usan modelos de visión basados en este tipo de arquitectura, ya entrenados y expuestos como API.

RNN y Transformers — redes para secuencias y lenguaje

RNN (Recurrent Neural Networks)

Diseñadas para datos secuenciales (texto, audio, series temporales). Procesan la secuencia elemento por elemento, manteniendo un "estado" o memoria interna que se actualiza en cada paso, permitiendo que el contexto previo influya en el procesamiento del siguiente elemento.

Limitación clave: procesan secuencialmente (lento de entrenar en paralelo) y pierden contexto de elementos muy lejanos en la secuencia ("memoria corta").

Transformers

Arquitectura introducida en 2017 que reemplazó a las RNN como estándar para lenguaje. Usa un mecanismo llamado attention (atención): en vez de procesar palabra por palabra secuencialmente, evalúa las relaciones entre todas las palabras de la secuencia simultáneamente, "prestando más atención" a las partes más relevantes del contexto para cada predicción.

Esto permite entrenar en paralelo masivamente (aprovechando GPUs) y capturar dependencias de largo alcance en el texto — la base de todos los LLMs modernos (GPT, Claude, Titan, Llama).

Para el examen

No necesitas saber implementar attention matemáticamente. Necesitas reconocer que los foundation models de texto (los que hay detrás de Amazon Bedrock) están basados en la arquitectura Transformer, y que esta es la razón por la que pueden procesar contexto largo y generar texto coherente.

GPUs vs CPUs para entrenamiento

El entrenamiento de deep learning consiste, en esencia, en enormes cantidades de operaciones matriciales que se pueden ejecutar en paralelo. Esto determina qué tipo de hardware es más eficiente para cada tarea.

CPU (Central Processing Unit)

Pocos núcleos, muy potentes, optimizados para tareas secuenciales y de propósito general. Adecuada para ML clásico, preprocesamiento de datos e inferencia de modelos pequeños, pero ineficiente para entrenar redes neuronales grandes.

GPU (Graphics Processing Unit)

Miles de núcleos más simples diseñados para ejecutar muchas operaciones en paralelo simultáneamente — exactamente lo que requiere el álgebra matricial de una red neuronal. Es el hardware estándar para entrenar e inferir con foundation models a escala.

En AWS, servicios como permiten seleccionar instancias con GPU (familias P y G de EC2) para entrenamiento e inferencia de deep learning. Amazon Bedrock abstrae completamente esta decisión: AWS gestiona el hardware subyacente para servir los foundation models, tú solo consumes la API.

¿Entendiste este tema?

Pon a prueba lo que acabas de aprender

¿Qué característica principal distingue a la arquitectura Transformer de las RNN tradicionales para procesar lenguaje?

Inicia sesión para llevar tu progreso.