Introduction to LLMs (Large Language Models)

¿Alguna vez te has preguntado cómo es posible que ChatGPT o Claude respondan casi cualquier pregunta que les hagas, como si "entendieran" lo que dices? Eso es exactamente lo que hace un LLM. En este post te explico qué son estos modelos, cómo aprenden a partir de texto y por qué se volvieron el corazón de la IA generativa. Sin necesitar un doctorado para entenderlo ;).
¿Qué son los modelos fundacionales grandes (foundation models) y los LLMs?

Un LLM es un modelo de deep learning con muchísimos parámetros. Desde miles de millones hasta más de un billón, entrenado sobre grandes volúmenes de texto sin etiquetar, usando self-supervised learning: el modelo predice la siguiente palabra de una oración a partir del contexto anterior, y el propio texto le sirve de "respuesta correcta", sin que un humano tenga que etiquetar nada. Repetido billones de veces, así es como el modelo termina "aprendiendo" gramática, hechos del mundo y patrones de razonamiento.

Deep learning, es una extensión del machine learning basada en redes neuronales con múltiples capas (de ahí "deep"). Cada capa aprende representaciones de los datos cada vez más abstractas —de patrones simples a conceptos complejos— sin que un experto tenga que diseñar manualmente las features, como exigía el machine learning clásico.
El término más amplio es foundation model (o LFM, Large Foundation Model): un modelo entrenado con datos masivos y diseñado sobre transfer learning Se preentrena una sola vez a gran escala y luego se adapta (fine-tuning o prompting) a tareas específicas, en vez de entrenar un modelo distinto para cada una (Stanford CRFM, 2021). Su arquitectura profunda y con millones o incluso billones de parámetros es justamente lo que le permite generalizar tan bien.

Cambio de paradigma en IA
Antes, resolver un problema de IA significaba entrenar una red desde cero para cada tarea: una para clasificar sentimiento, otra para reconocer entidades, otra para traducir. Cada una con su propio dataset y su propio proceso de entrenamiento completo.

Los foundation models cambiaron esa lógica. Ahora se entrena un solo modelo, una sola vez, sobre una cantidad masiva de datos generales, y ese mismo modelo se reutiliza en tareas muy distintas: ajustándolo con fine-tuning o simplemente dándole el prompt correcto.

Lo que hace posible ese salto es, en el fondo, bastante simple. El modelo se pre-entrena sobre patrones generales del lenguaje (o imagen, o audio) sin saber todavía para qué se va a usar. Ese conocimiento después se transfiere a tareas nuevas en lugar de aprenderlas desde cero, eso es transfer learning. Si hace falta especializarlo más, se ajusta con fine-tuning, usando muchísimos menos datos que en un entrenamiento completo. Y nada de esto funcionaría si la arquitectura no fuera gigante: hablamos de millones o billones de parámetros, que es lo que le permite al modelo capturar relaciones complejas en los datos y, de paso, generalizar bien incluso frente a cosas que nunca vio en el entrenamiento.
Un LLM es exactamente esta misma idea, pero aplicada solo a texto. GPT-4, Claude, BERT o Megatron todos son foundation models, nada más que enfocados en lenguaje.
En pocas palabras, un LLM está construido sobre una idea que se inspira en cómo están conectadas nuestras neuronas. Cada capa de una red neuronal imita, de forma muy simplificada, las conexiones sinápticas del cerebro.
Arquitectura de un LLM
Un LLM es un tipo de red neuronal, y como ya vimos, las redes neuronales tienen una arquitectura grande. Entendamos un poquito cómo está dividida esa arquitectura, desde lo más simple hasta lo más complejo.

Tokenización
Es el proceso de dividir el texto en unidades más pequeñas palabras, subpalabras o caracteres para que el modelo pueda procesarlas. Los LLMs actuales usan tokenización por subpalabras (BPE), que reduce el vocabulario a unos 30-50 mil tokens y le permite manejar palabras que nunca vio, descomponiéndolas en piezas conocidas. El objetivo de la tokenización es crear estructuras de texto que puedan ser fácilmente procesables por modelos de machinelearning.


La plataforma https://platform.openai.com/tokenizer permite validar, cuántos tokens y caracteres se procesan en una oración.
Embeddings
Cuando se tokeniza el texto, es momento de convertir esta información en vectores númericos llamados embeddings. En términos más teóricos, es la representación numérica de cada token como un vector en un espacio de muchas dimensiones. Esta representación permite que los modelos puedan aplicar operaciones matemáticas y algebráicas en los tokens para entender el contexto que los relaciona. Por ejemplo: Saber qué tan relacionados están sus significados. "Gato" y "Perro" quedan cerca; "feliz" y "triste" apuntan en direcciones distintas.


Esta plataforma, permite generar embeddings de forma gratuita https://taubyte.com/tools/embedder util para probar, a través de diferentes modelos.

En resumen, la tokenización convierte el texto a una estructura más pequeña y procesable, y los embeddings convierten estos tokens en vectores númericos. Este es el primer para para que un LLM pueda procesar y entender información textual y su contexto, para posteriormente aplicar técnicas de procesamiento natural (NPL).
Redes Neuronales Multicapa (multi-layered neuronal network)
Aquí es donde comienza el procesamiento e inferencia de los LLMS. Luego de tener vectorizada la entrada, es momento de pasar esta información a las redes neuronales multicapa. Las cuales se conforman por tres tipos de capas.
input layer: Capa de entrada, recibe los datos crudos. Cada neurona corresponde a un atributo o característica de la entrada de datos, en este caso, los embeddings de cada token.
hidden layer: Capas ocultas, son las que realizan el trabajo duro. Pueden haber una o más capas ocultas, todo depende de que tanto esfuerzo necesito el modelo, más capas ocultas no es sinónimo de eficiencia, por el contrario una mala optimización de muchas capas anidadas puede brindar peor desempeño, que una capa optimizada. Aquí se procesan los datos de la capa de entrada a través de una serie de operaciones matemáticas y se extraen los patrones y representaciones relevantes de la data.
output layer: Capa de salida, convierte el resultado en la predicción o clasificación del modelo. En un LLM, lo convierte a una distribución de probabilidad sobre todas las palabras posibles del vocabulario.

Backpropagation
Es el proceso en el cual se calcula cuánto contribuyó cada peso de la red al error de una predicción. El ajuste de esos pesos lo hace despúes el algoritmo de optimización (gradient descent), usando esos cálculos como guía.

El algoritmo de backpropagation es muy utilizado en el deep learning para entrenar redes neuronales. Normalmente tiene dos momentos:
- Forward pass: Los datos pasan a través de la red para computar la salida. (forwardpass).
- Backward pass: El error se propaga hacia atrás, capa por capa, para calcular cuánto contribuyó cada peso a ese error.
La lógica de la backpropagation es que las capas de neuronas en las ANN son esencialmente una serie de funciones matemáticas anidadas. Durante el entrenamiento, esas ecuaciones interconectadas se anidan en otra función: una "función de pérdida" que mide la diferencia (o "pérdida") entre la salida deseada (o "verdad fundamental") para una entrada dada y la salida real de Neural Networks
Es importante destacar, que los sistemas de AI, y LLMs, generan texto, seleccionando en cada paso la palabra más probable dado el contexto. Esto funciona gracias al concepto estadístico de probabilidad condicional formalizado en el teorema de Bayers
¿Cómo elige un LLM la siguiente palabra? Probabilidad Condicional
La probabilidad condicional mide que tan probable es un resultado (A), dado que ya ocurrió otro evento (B).
Se lee como "La probabilidad de A dado B". No es lo mismo que sola: condicionar sobre B casi siempre cambia esa probabilidad, porque estamos alimentando con información nueva.
Ahora saber no da gratis. Veamos el siguiente ejemplo:
Un exámen médico para detectar una enfermedad poco común lo deja claro: Si tiene la enfermedad sale positivo el 99% de las veces. Eso se mide fácil en un laboratorio. Pero al paciente le importa la pregunta contraria: si el exámen dió positivo, ¿qué tan probable es que realmente esté enfermo? No es la misma probabilidad, y a veces es mucho más baja de lo que uno pensaría.
Aquí entra el teorema de Bayes, que describe cómo actualizar la probabilidad de una hipótesis a partir de nueva evidencia. Este teorema permite calcular a partir de , y ya vamos a desmenuzar esto con más calma. Pero primero entendamos las fórmula
Donde:
- — probabilidad a priori (prior): qué tan probable es A por sí sola, antes de tener en cuenta la evidencia B.
- — verosimilitud (likelihood): qué tan probable es observar la evidencia B, si asumimos que A es cierto.
- — probabilidad a posteriori (posterior): la probabilidad actualizada de A, ahora que ya sabemos que B ocurrió — es lo que realmente queremos calcular.
- — evidencia (probabilidad marginal): qué tan probable es observar B en general, sin importar si A es cierto o no; funciona como factor de normalización.
Aplicado a un LLM: "A" es una palabra candidata para completar una oración, y "B" es el contexto que ya se escribió. El modelo usa exactamente esta lógica cada vez que genera una palabra: calcula P(palabra | contexto) para cada candidata posible y elige la más alta.
Entendamos esto con un ejemplo, el prompt es: "Me gusta leer mucho, próximamente compraré un..." y el modelo elige entre "kindle", "carro" y "libro". Entonces identifiquemos contexto y candidatos.
Candidatas: "Libro", "Kindle", "Carro".
Contexto: "Me gusta leer mucho, próximamente compraré un ..."
Calculemos ahora:
- Probabilidad a priori : Qué tan frecuente es cada palabra en general, sin mirar el contexto todavía: P("Libro"), P("Kindle"), P("Carro").
- Verosimilitud : Qué tan probable es ver justo este contexto, si asumimos que la palabra es cada candidata. En otras palabras la probabilidad de A dado B.
- P("Me gusta leer mucho, próximamente compraré un..." | "libro")
- P("Me gusta leer mucho, próximamente compraré un..." | "kindle")
- P("Me gusta leer mucho, próximamente compraré un..." | "carro")
- Probabilidad a posteriori : Combinando ambas con el teorema de bayes.

Selección de la palabra más probable: El modelo compara las tres posteriores y elige la más alta. "Libro" tiene prior fuerte y verosimilitud alta para este contexto (aparece muchísimos en textos sobre lectura), así que gana por mucho.

Image by the author.
Todo este cálculo no ocurre aislado. Es, de hecho, el último paso de la arquitectura de la sección 3: los tokens se convierten en embeddings, pasan por las capas ocultas de la red, y el resultado final se transforma en un vector de probabilidades mediante una función llamada softmax.

¿Cómo entiende un LLM lo que preguntas? Arquitectura Transformer
La mayoria de modelos que se utilizan a diario, como chatGPT llevan siglas GPT( Generative Pre-trained Transformer). Entendamos que significa cada palabra:
Generative: Significa que no solo clasifica o etiqueta algo que ya existe, sino que genera contenido nuevo. Esto puede ser, palabra por palabra, pixel por pixel o muestra de audio por muestra de audio.

Pretrained: Los modelos tienen una base de entrenamiento original. Sin embargo, para tareas específicas, buscan adaptarse, en vez de entrenarse de nuevo.

Transformer: Es el uso del mecanismo de atención, desarrollado por el equipo de investigación de google en el 2017 (Vaswani et al.) y publicado en el paper "Attention Is All You Need". Como esta es la arquitectura que hace posible todo lo anterior vamos a desglosar un poco su funcionamiento.
1. Transformers - Problema que resolvió
Antes de los Transformers, los modelos de lenguaje se apoyaban en RNNs (redes neuronales recurrentes) y su variante LSTM. Para entender su problema, imagina que le pides a alguien que lea un libro en voz alta, pero solo puede decir una palabra a la vez, y no puede pasar a la palabra 50 sin haber leído antes, en orden, las 49 anteriores. Así procesa el texto una RNN: palabra por palabra, de forma estrictamente secuencial, cargando en su memoria lo que ya leyó.

Problemas de este diseño
- Procesamiento secuencial: Cada palabra depende de que la anterior ya se haya procesado, es imposible repartir el trabajo. En ese orden de ideas, es como tener una sola persona leyendo, en vez de diez personas leyendo diez páginas distintas al mismo tiempo. Esta limitación hace que no se puede paralelizar.
- Mala memoria de largo plazo: Es como jugar el teléfono roto, el mensaje se va distorsionando cada vez que pasa de una persona a la siguiente, así que cuando llegue a la persona 50, ya el mensaje se tergiversó demasiado. Este problema se conoce como vanishing/exploding gradient
2. Transformers - Mecanismo de atención.
El paper de "Attention Is All You Need" resolvió los dos problemas anteriores. Introduciendo el mecanismo de atención, el cual permite que el modelo se enfoque solo en partes relevantes del texto, mientras va generando la salida. Visto de otro modo, en vez de procesar el texto en orden, el transformer mira todo los tokens de la secuencia a la vez, y usa la atención para decicidir qué tan relevante es cada palabra respecto a las demás.

Funcionamiento: para cada palabra de la oración, el modelo calcula un "puntaje de atención" contra todas las demás palabras no solo contra las que tiene al lado, sino contra la oración completa, sin importar qué tan lejos estén. Por ejemplo, en "El banco estaba cerrado porque no tenían dinero", el mecanismo de atención conecta "banco" con "dinero" y no con, digamos, "río" y así el modelo entiende que se refiere a una entidad financiera y no a un banco de parque. Todo eso se calcula en paralelo para cada palabra de la oración, no en secuencia como haría una RNN.
3. Transformers - Arquitectura
Veamos un ejemplo, para entender sus componentes. Tenemos la siguiente frase "La medicina salva" en inglés "Medicine salves ...?". Con este flujo de entrada, el comportamiento de la arquitectura es
- Embedding de entrada: Cada token se convierte en un valor númerico.
- Positional encoding: El transformer procesa de forma paralela. Por eso necesita saber en qué posición va cada palabra. Para atacar eso, a cada embedding se le suma un vector de codificación posicional.

- Multi-head self attention: Es la aplicación de la formula del mecanismo de atención. Softmax.



- Add & Norm (conexión residual + normalización): Despúes de cada capa de atención y de cada capa feed-forward, el modelo suma la entrada original a la salida de esa capa (conexión residual) y normaliza el resultado, lo que ayuda a que el gradiente fluya mejor durante el entrenamiento.
- Feed-forward: Una red neuronal multicapa "normal" como las de la sección 3. Que se aplica de forma independiente a cada posición.


- Encoder y decoder: El Transformer original se divide en dos bloques. El encoder lee toda la secuencia de entrada y construye una representación de contexto para cada token, repitiendo el ciclo atención.

Probabilities: Antes de dar una probabilidad, el modelo primero calcula un "puntaje crudo" para cada una de las más de 50,000 palabras del vocabulario a eso se le llama logit. Imaginemos los logits como una tabla de calificaciones sin ajustar: pueden salir números negativos, positivos, muy grandes o muy pequeños, y no tienen ningún límite solo indican qué tanto "le gusta" cada palabra candidata al modelo, antes de convertirla en algo comparable. La función softmax, la misma que conectamos con Bayes en la sección 4, es la que toma esos puntajes crudos y los convierte en una probabilidad de verdad: todos los valores quedan entre 0 y 1, y la suma de todas las palabras da exactamente 1 (Telnyx).

Entrenamiento de un LLM
Entendiendo la importancia de los LLMS, y su funcionamiento bajo su arquitectura, nos vamos acercando al final de este blog. Y uno de los temas principales que como profesionales en Inteligencia Artificial e IA Generativa debemos entender, es como se entrenan.
Ya vimos que un LLM es "grande" en dos sentidos:
- La cantidad de parámetros que tiene
- El volumen de texto con el que se entrena.
Para dimensionar esto último, un ejemplo real ayuda más que cualquier definición: así se veía el conjunto de datos con el que OpenAI entrenó GPT-3.
Dataset | Cantidad (tokens) | Peso en el entrenamiento |
|---|---|---|
Common Crawl (filtrado) | 410 mil millones | 60% |
WebText2 | 19 mil millones | 22% |
Books1 | 12 mil millones | 8% |
Books2 | 55 mil millones | 8% |
Wikipedia | 3 mil millones | 3% |
Tengamos en cuenta que:
1 token ~= 4 caracteres en inglés
1 token ~= palabras
Por lo tanto GPT-3 fue entrenado con alrededor de 374 Billones de palabras.
Common Crawl es un archivo público y masivo de texto extraído de internet; WebText2 y Books1/Books2 son colecciones de artículos web y libros; y Wikipedia, pues, Wikipedia. En total, más de 300 mil millones de tokens , imaginense como cientos de miles de millones de palabras (Brown et al., "Language Models are Few-Shot Learners", arXiv, 2020).

El peso de un solo mes de common crawl, es de ~5.84 TiB comprimidos (WET), o sea aprox 2.14 mil millones de páginas. Esto quiere decir, que se necesian una arquitectura de cómputo distribuido para poder procesarlo. Ni una computadora ni una sola GPU pueden cargar esta cantidad de información de una sola vez. Por eso el entrenamiento de un LLM frontera no corre en una sola máquina, sino en un clúster de cientos o miles de GPUs o TPUs, conectadas por redes de alta velocidad y trabajando en paralelo.
Etapas de Entrenamiento
Entrenar un LLM no es un solo paso, es un proceso de varias etapas, cada una construida sobre la anterior:

Evaluación del modelo
Evaluar un modelo de IA "tradicional" es bastante intuitivo: si entrenas un clasificador para distinguir fotos de perros y gatos, lo pruebas con imágenes que nunca vio, y la métrica es simplemente el porcentaje que acertó.
Con un LLM esa lógica no aplica igual. No es un modelo especializado en una sola tarea, sino uno de propósito general que responde a lo que le pidas: hoy traduce, mañana resume, pasado mañana escribe código. Evaluarlo implica medir cosas más difíciles de reducir a un solo número: qué tan fluido es, qué tan coherente, qué tanto sabe, y qué tan bien se adapta a estilos distintos según lo que se le pida.
Por eso surgió un conjunto de benchmarks, pruebas estandarizadas diseñadas específicamente para LLMs:
- GLUE y SuperGLUE. Miden qué tan bien entiende el lenguaje un modelo a través de varias tareas (gramática, similitud entre textos, inferencia, preguntas y respuestas), no solo una. SuperGLUE nació después como una versión más difícil, con tareas que exigen más razonamiento (GLUE — Wang et al., arXiv, 2018; SuperGLUE — Wang et al., arXiv, 2019).
- MMLU (Massive Multitask Language Understanding). Mide cuánto "sabe" el modelo con 14,000 preguntas de opción múltiple repartidas en 57 áreas, desde matemáticas e historia hasta derecho y ética. Se evalúa en zero-shot: sin darle al modelo ningún ejemplo previo ni ajustarlo para la tarea, solo viendo qué tan bien responde con lo que ya aprendió (Hendrycks et al., arXiv, 2020).
- HellaSwag. Evalúa sentido común. Le da al modelo el inicio de una situación y cuatro posibles finales (uno correcto, tres absurdos pero verosímiles) y mide si distingue cuál continuación tiene sentido real (Zellers et al., arXiv, 2019).
- TruthfulQA. Mide qué tan propenso es un modelo a repetir creencias falsas o mitos comunes, en vez de responder con precisión (Lin et al., arXiv, 2021).
- ARC (AI2 Reasoning Challenge). Preguntas científicas de opción múltiple, divididas en un set fácil y uno difícil que exige razonamiento real y no solo memorización (Clark et al., arXiv, 2018).
Encontré el video — es de 3Blue1Brown: "Transformers, the tech behind LLMs | Deep Learning Chapter 5" (canal @3blue1brown). Es la explicación visual del mecanismo de atención/Transformer más citada que hay — encaja perfecto como recomendación para quien quiera profundizar después de leer el post.
Aquí va la sección de cierre completa:
Referencias
Buena parte de la estructura de este post se inspiró en:
Valentina Alto, Building LLM Powered Applications: Create intelligent apps and agents with large language models, Capítulo 1: "Introduction to Large Language Models" (Packt Publishing, 2024).
Todo el contenido, ejemplos y redacción de este post son propios, el libro se usó solo como guía de estructura y temas a cubrir.
Fuentes citadas
Sección 1 — Foundation models y LLMs:
- On the Opportunities and Risks of Foundation Models — Stanford CRFM
- What Are Large Language Models (LLMs)? — IBM
- What are Large Language Models? — NVIDIA
- What is LLM? — AWS
- Foundation Model vs LLM: Key Differences — Label Your Data
- Large Language Models vs. Foundation Models — Teradata
Sección 2 — Cambio de paradigma:
- What Is Deep Learning? — IBM
- Deep Learning — LeCun, Bengio & Hinton, Nature (2015)
- Foundation Models: A New Paradigm for AI — Springer (2024)
Sección 3 — Por dentro de un LLM:
- What Are Word Embeddings? — IBM
- What is backpropagation? — IBM
- Subword Tokenization in NLP — GeeksforGeeks
- What Is a Neural Network? — IBM
Sección 4 — Probabilidad y teorema de Bayes:
- Conditional Probability — Yale Statistics
- Conditional Probability — GeeksforGeeks
- Bayes' theorem — Wikipedia
- Bayes' Rule – Explained For Beginners — freeCodeCamp
- Posterior probability — Wikipedia
Sección 5 — Arquitectura Transformer:
- Generative pre-trained transformer — Wikipedia
- Attention Is All You Need — Vaswani et al. (arXiv, 2017)
- LLM 6: Limitations of RNNs and the Rise of Transformers — Medium
- An Image is Worth 16x16 Words — Dosovitskiy et al. (arXiv, 2020)
- Transformer architectures for audio — Hugging Face Audio Course
- What is a Transformer Model? — IBM
- What Are Logits in AI? — Telnyx
Sección 6 — Entrenamiento de un LLM:
- Language Models are Few-Shot Learners — Brown et al. (arXiv, 2020)
- Training language models to follow instructions with human feedback — Ouyang et al. (arXiv, 2022)
- What is RLHF? — IBM
- What Is Distributed Machine Learning? — IBM
- Data Parallelism — DigitalOcean
Sección 7 — Evaluación de modelos:
- GLUE — Wang et al. (arXiv, 2018)
- SuperGLUE — Wang et al. (arXiv, 2019)
- Measuring Massive Multitask Language Understanding (MMLU) — Hendrycks et al. (arXiv, 2020)
- HellaSwag — Zellers et al. (arXiv, 2019)
- TruthfulQA — Lin et al. (arXiv, 2021)
- ARC — Clark et al. (arXiv, 2018)
Recomendaciones
Les recomiendo mucho con demasiado, mirar este video. Les resume lo que ya leyeron y les da claridad visual para interpretar lo que aquí se escribe.
Si leyó hasta aquí, gracias — de verdad.
Escribir esto tomó tiempo y saber que alguien lo lee hasta el final lo hace valer la pena. Si algo no quedó claro, tiene dudas, o simplemente quiere debatir algún punto, queda la cajita de los comentarios. Leo todo (casi siempre jajaja).
Si quiere estar al tanto, de cuando salen artículos como este — suscríbase. Sin spam, solo contenido valioso cuando haya algo que valga la pena compartir.
Nos vemos en la próxima, espero que haya sido de mucha utilidad.
— Alejo🥭
Comments (0)
Sign in to comment