Qué es un modelo de lenguaje — LLMs explicados para tu tía
Empieza con tu celular
Tenés un teléfono con autocomplete. Escribís "Hola, ¿cómo" y te sugiere "estás". No te asombra. Es una herramienta básica.
Un modelo de lenguaje es eso. Pero turbinado mil veces.
Cómo funciona en realidad
Durante el entrenamiento, el modelo lee. Lee mucho. Novelas, artículos, código, conversaciones, prácticamente todo lo que existe en internet. GPT-3, el primero que dio el salto al público, se entrenó con unos 300 mil millones de tokens (Brown et al., 2020). Eso es más texto del que vos podrías leer en mil vidas.
Mientras lee, aprende patrones. Después de "buenos" generalmente viene "días". Después de "la lluvia" probablemente viene "cae".
Cuando vos le escribís un prompt a Claude, el modelo adivina cuál es la palabra que viene siguiente. Después la siguiente. Y la siguiente. Palabra por palabra, hasta que decide parar.
No entiende. Predice. Pero sus predicciones son tan buenas que parece que entiende.
Por qué puede escribir, traducir, programar
Porque todas esas tareas son, en el fondo, predicción de palabras.
Escribir una historia es predecir qué palabra viene después dada una trama. Traducir es predecir cuál es la secuencia en otro idioma que corresponde a este patrón. Programar es predecir cuál es la línea de código probable después de esta estructura.
Claude no sabe programar como sabe un humano. Sabe qué patrones de código son probables. Y como millones de programadores escriben código de forma consistente, los patrones son muy buenos.
Lo sorprendente: las capacidades emergentes
Nadie programó a Claude para escribir un poema sobre la muerte. Nadie le enseñó matemáticas con una clase formal.
Pero puede hacer ambas cosas.
¿Por qué? Porque el modelo aprendió patrones tan ricos que, en cierto punto, empieza a hacer cosas que nadie había anticipado. Es como si los patrones se combinaran de formas que crean habilidades nuevas. Lo llamamos capacidades emergentes.
Las limitaciones
Un LLM nunca vivió un día. Leyó todo libro que existe, pero nunca comió, nunca lloró, nunca fue traicionado. Eso importa cuando necesitás contexto emocional profundo o experiencia sensorial real. Puede imitar. No puede comprender.
Además, alucina. A veces inventa datos. No por maldad. Porque predice cuál es la palabra probable y a veces esa palabra es un hecho falso. Sin experiencia real, no se da cuenta.
Y tiene un knowledge cutoff: fue entrenado hasta cierta fecha y no sabe qué pasó después. No por incapacidad. Porque esos datos no estaban cuando se entrenó.
Tres ideas para llevar
Primero, un LLM predice. Punto. No piensa, no entiende. Pero predice tan bien que con eso alcanza para cambiarte el trabajo.
Segundo, sus puntos fuertes son crear, sintetizar y explorar variaciones. Sus puntos débiles son los hechos críticos sin verificar y las decisiones de alto riesgo donde se necesita comprensión genuina.
Tercero, las alucinaciones y el cutoff de conocimiento no son bugs. Son consecuencias estructurales de cómo funciona el modelo. Saberlo te ahorra sorpresas.
Qué es un modelo de lenguaje — LLMs explicados para tu tía
Hay una confusión gigante
Hay una confusión gigante sobre qué hace exactamente un modelo de lenguaje. "Predice la siguiente palabra" suena demasiado simple. "Entiende el contexto" suena demasiado impresionante.
La realidad es más interesante que cualquiera de las dos. Y entenderla cambia cómo lo usás.
El autocomplete de hace diez años
Te acordás del predictive text de los teclados de hace una década. Escribías tres palabras y te sugería "mañana", "después", "hoy". Funcionaba porque las máquinas aprendían qué palabras tienden a seguir a otras. "Buenos" → "días" es probable. No porque la máquina entendiera. Porque estadísticamente eso es lo que pasa.
Un LLM (Large Language Model) es exactamente lo mismo. Pero con escala y sofisticación bestiales.
Cómo se entrena
El modelo lee texto. No lee bien, no entiende bien. Solo lee. Mete los ojos. Mientras lo hace, aprende probabilidades.
Cuando aparece "Reino Unido", las próximas palabras probables son "es", "tiene", "está". Cuando aparece "El arte de la", lo probable es "guerra". Cuando aparece "import numpy as", la próxima es "np" con altísima probabilidad.
GPT-3 se entrenó con unos 300 mil millones de tokens, según el paper original (Brown et al., 2020). Modelos posteriores usaron aún más. No hay cifra pública para los últimos Claude o GPT-4o, pero están en el mismo orden de magnitud o por encima.
Cómo predice cuando vos le escribís
Cuando vos le mandás un mensaje a Claude pasa esto. Lee tu prompt. Calcula probabilidades para cada palabra posible. Elige la más probable, o muestrea con cierta variación. Escribe esa palabra. Repite.
Palabra. Tras. Palabra.
Lo que vos leés como una respuesta fluida son técnicamente miles de decisiones de predicción tomadas en milisegundos.
Por qué puede hacer tareas tan distintas
Porque casi cualquier tarea de oficina es, en el fondo, predicción de secuencias.
Escribir un email es predecir qué palabra viene en una narrativa lógica. Resumir es predecir qué palabras son las esenciales en un texto. Traducir es predecir la secuencia en idioma B que corresponde a la del idioma A. Programar es predecir qué línea sigue en este programa.
El modelo no sabe que está resumiendo. No tiene un concepto de "resumen". Lo que hace es: en este contexto donde la instrucción dice "resumí", qué palabras son probables. Aprendió eso de millones de ejemplos.
Nunca nadie programó esas capacidades. Emergieron del pattern matching.
Las capacidades emergentes
Acá la cosa se pone rara.
Nadie programó a Claude para escribir poesía. Nadie la entrenó específicamente en métrica ni rima. Pero puede hacerlo.
¿Cómo? Porque leyó tanta poesía durante el entrenamiento que los patrones de palabras en un poema son consistentes. No porque sepa poesía. Porque aprendió las correlaciones estadísticas de palabras en contextos poéticos.
Wei y otros investigadores documentaron en 2022 que cuando los modelos crecen en escala, de repente aparecen habilidades que en versiones más pequeñas no estaban. Lo llamaron capacidades emergentes.
Vale aclarar algo importante. Schaeffer y otros publicaron en 2023 una crítica a esa idea, mostrando que algunas de las "emergencias" eran artefactos de cómo se medía el rendimiento, no saltos genuinos. La discusión sigue abierta. Pero está claro que pasar de un modelo de mil millones de parámetros a uno de cien mil millones desbloquea cosas que antes no se podían.
El sesgo más importante: predicción vs comprensión
Esto es lo que la mayoría subestima.
Claude no entiende un poema. Predice qué palabra es probable en un contexto poético. ¿Importa la diferencia?
Un poeta entiende qué emoción está transmitiendo. Claude muestra patrones de palabras que correlacionan con esa emoción según lo que aprendió.
Si le preguntás a un poeta "¿por qué escribiste sobre la muerte así?", responde "porque sentía esto". Si le preguntás lo mismo a Claude, lo más honesto que puede decir es "porque esa secuencia de palabras tiene alta probabilidad en este contexto".
Importa cuando necesitás comprensión real. Si le pedís que entienda matices éticos de una decisión compleja en un escenario que nunca vio en su entrenamiento, problema. Puede sonar creíble pero estar prediciendo mal. Si le pedís que escriba algo que suene como vos, casi nunca falla. Tu voz es un patrón. Y los patrones son su juego.
Las limitaciones que explican muchas sorpresas
Alucinaciones. A veces Claude inventa datos con tono de seguridad total. Predice la palabra probable. Si el patrón dice "después de 'Einstein descubrió' viene una teoría", puede generar una teoría que no existe pero suena plausible. Sin acceso a verificación externa, no se da cuenta.
Knowledge cutoff. Cada modelo tiene una fecha de corte de entrenamiento. Lo que pasó después no está en sus parámetros. No es que no pueda saber. Es que esos datos no estaban cuando se entrenó. La fecha varía por modelo (Claude Sonnet 4.6, por ejemplo, tiene un cutoff distinto al de GPT-4o).
Sesgos. Los patrones que aprendió reflejan los sesgos de internet. Si los textos de entrenamiento decían "programador" más veces en masculino, el modelo aprendió esa correlación. Está en los pesos. Las empresas hacen post-entrenamiento para mitigarlo, pero el sesgo subyacente persiste.
Memoria limitada. Una vez entrenado, los pesos del modelo están fijos. No aprende de la conversación con vos en tiempo real. Las funciones de "memoria" que algunas plataformas ofrecen son trucos externos: guardan información sobre vos en una base aparte y la inyectan al contexto. El modelo en sí no recuerda.
Qué significa todo esto en la práctica
Claude es excelente para crear, sintetizar, brainstormear, generar variaciones, resumir, explicar, traducir y explorar. Es menos confiable para hechos críticos sin verificación, decisiones de riesgo alto que requieren comprensión genuina, y situaciones que no se parecen a nada que haya visto en el entrenamiento.
Los modelos que existen
Claude (Anthropic), entrenamiento enfocado en seguridad, calibración de incertidumbre y utilidad. La línea actual es Opus, Sonnet y Haiku.
GPT-4o y la familia GPT (OpenAI), multimodal nativo, agresivo en intentar resolver, dominante en código.
Gemini (Google), multimodal con énfasis en integración con el ecosistema Google.
Llama (Meta), de código abierto, ideal para correr local o adaptar a un dominio específico.
Mixtral (Mistral) y Phi (Microsoft), también de código abierto, eficientes y útiles para deploys locales.
Todos comparten la misma arquitectura base de transformers (Vaswani et al., 2017). Las diferencias están en la escala, los datos de entrenamiento y los ajustes post-entrenamiento.
Una pregunta para cerrar
Si cada respuesta de Claude es predicción palabra por palabra, ¿qué le podrías cambiar a tu próximo prompt para mejorar la calidad de esas predicciones? Probablemente más contexto, ejemplos de cómo querés que suene la respuesta y restricciones explícitas de formato.
En "Cómo 'piensa' una IA", otro artículo de la serie, profundizo en la mecánica. Mientras tanto, la próxima vez que algo te sorprenda (positivamente o negativamente) en una respuesta de Claude, preguntate qué patrón estadístico lo explicaría. Casi siempre la respuesta está ahí.
Qué es un modelo de lenguaje — LLMs explicados para tu tía
Una definición precisa para empezar
Un modelo de lenguaje grande (LLM) es un sistema neuronal que aprendió a estimar la distribución de probabilidad sobre tokens posibles dada una secuencia de entrada, mediante entrenamiento sobre grandes corpus de texto.
No es una definición accesible. Pero es precisa. Y la precisión importa cuando vas a basar decisiones reales en lo que el sistema produce.
La arquitectura de fondo: transformers
Todo LLM moderno (Claude, GPT, Gemini, Llama, Mixtral) está construido sobre la arquitectura transformer, presentada en el paper "Attention Is All You Need" de Vaswani et al. (2017).
La idea central es el mecanismo de atención. Para cada token, el modelo asigna pesos a todos los demás tokens del contexto, decidiendo matemáticamente cuáles son relevantes para predecir el siguiente.
Esto es radicalmente distinto de las arquitecturas anteriores. Las RNN y LSTM procesaban secuencialmente token por token, lo que producía vanishing gradients en secuencias largas y entrenamiento lento. Las redes feedforward procesaban en paralelo pero perdían relaciones de largo alcance. Los transformers procesan todo el contexto en paralelo (escalable de forma masiva) y a la vez preservan relaciones a cualquier distancia gracias al multi-head attention.
El resultado práctico es que el modelo puede aprender, por ejemplo, que la palabra "gato" en la primera oración es relevante para predecir un pronombre en la quinta oración, aunque estén separadas por 200 tokens. Eso es lo que permite manejar contextos largos.
Parámetros y leyes de escala
Cuando leés "Claude tiene X mil millones de parámetros", esos parámetros son los pesos numéricos en la red neuronal. Cada conexión entre operaciones tiene un número asociado que se ajusta durante el entrenamiento mediante backpropagation para minimizar el error de predicción.
Algunas cifras verificables. GPT-3 tiene 175 mil millones de parámetros (Brown et al., 2020, NeurIPS). GPT-4 se estima en aproximadamente 1.8 billones de parámetros en una arquitectura mixture-of-experts, según reportes de la prensa especializada y filtraciones, aunque OpenAI nunca lo confirmó oficialmente. Anthropic no publica el tamaño exacto de Claude. Cuando alguien te dé un número de parámetros para Claude, pedile la fuente. Casi nunca existe.
Las scaling laws (Kaplan et al., 2020 en OpenAI; Hoffmann et al., 2022 en DeepMind, conocidas como Chinchilla) muestran que la capacidad mejora de forma predecible con más parámetros, más datos y más cómputo de entrenamiento (medido en FLOP).
Pero los parámetros sin datos suficientes son inútiles. Un modelo de un billón de parámetros entrenado con poco texto va a rendir peor que un modelo de 175 mil millones bien entrenado. Chinchilla específicamente sugiere que para un presupuesto computacional fijo conviene balancear el tamaño del modelo y el del dataset, no maximizar uno solo.
El fenómeno de las capacidades emergentes y su crítica
Las capacidades emergentes son habilidades que no aparecen en modelos pequeños y emergen abruptamente al aumentar la escala. El término lo acuñaron Wei et al. en 2022.
Ejemplos del paper original. Aprendizaje en contexto (in-context learning), donde el modelo aprende de ejemplos dentro del prompt sin actualizar parámetros. Razonamiento en cadena (chain-of-thought), donde modelos pequeños no resuelven problemas multi-paso pero modelos grandes empiezan a hacerlo cuando se los induce a "pensar paso a paso". Razonamiento aritmético y simbólico que aparece en escalas particulares.
Pero hay que mencionar la contracrítica. Schaeffer, Miranda y Koyejo publicaron en 2023 "Are Emergent Abilities of Large Language Models a Mirage?" (NeurIPS 2023). Argumentaron que muchas de esas "emergencias" son artefactos de las métricas no lineales que se usaron para evaluar. Si cambiabas a métricas continuas, la mejora se veía gradual, no abrupta.
¿Cuál es la lectura honesta hoy? Que hay mejoras reales con escala, pero que la narrativa de "habilidades que aparecen de la nada" probablemente sobrestimó el fenómeno. Las mejoras existen y son medibles, pero son menos misteriosas de lo que sugería el paper de 2022.
Predicción versus comprensión: el límite epistemológico
Acá está el sesgo más importante que la mayoría subestima.
Una predicción muy buena de "cuál es la próxima palabra probable" parece comprensión. Pero epistemológicamente no lo es.
Caso concreto. Le das a Claude un artículo de Nature sobre física cuántica (durante el entrenamiento leyó miles de papers similares). Le preguntás "¿qué significa superposición?". Claude da una respuesta coherente, técnicamente precisa, con uso correcto de la terminología.
¿Comprende superposición? No. Predice qué palabras correlacionan con "explicación de superposición" en contextos similares observados durante el entrenamiento.
¿Cómo lo sabés? Porque si le das un concepto que nunca vio con correlación clara (una paradoja nueva, un escenario contrafáctico genuinamente novedoso), genera una respuesta plausible pero a veces demostrablemente falsa.
Un físico comprende. Puede visualizar el fenómeno, ver las implicaciones en dominios donde no fue entrenado, identificar predicciones experimentales nuevas. Claude predice. Genera palabras estadísticamente asociadas a contextos de física cuántica.
¿Importa la diferencia? Importa mucho cuando el sistema enfrenta casos verdaderamente novedosos. Ahí la predicción falla de forma característica. Cuando la tarea está dentro de la distribución del entrenamiento, la predicción brilla.
Alucinaciones: no son bugs, son consecuencia estructural
Cuando Claude inventa un hecho o cita un paper que no existe, no es un glitch.
Es que el modelo, dada la secuencia de entrada, predice que cierta secuencia de salida es probable en la distribución aprendida. Esa salida suena creíble porque los patrones de la forma "X es una teoría científica" o "Y es un paper de Z" tienen muy alta probabilidad en el training. Pero X puede ser falso e Y puede no existir.
Sin acceso a una base de datos verificable en tiempo real, sin experiencia sensoriomotora, sin una noción interna de "verdad" separada de "probabilidad", el modelo predice palabras probables que pueden ser falsas.
Esto es estructural. No se "arregla" con prompting más cuidadoso. Se mitiga. Pedir citas con localizaciones específicas fuerza al modelo a anclar afirmaciones a su entrenamiento. Usar RAG (Retrieval-Augmented Generation), donde le proporcionás documentos verificados externos, baja drásticamente las alucinaciones. Pedir incertidumbre cuantificada ayuda. Implementar verificación externa con una segunda llamada al modelo o a una fuente autoritativa es lo más efectivo.
Pero el fenómeno subyacente sigue. Predicción sin acceso a verificación es siempre vulnerable a error sistemático.
Knowledge cutoff y la ilusión de actualidad
Cada modelo tiene una fecha de corte de entrenamiento. Para Claude Sonnet 4.6 está documentada en la página oficial de Anthropic. Para GPT-4o, en la documentación de OpenAI. Verificá siempre el dato concreto en la fuente del proveedor.
El usuario tiende a asumir que si el modelo no sabe algo, lo va a decir explícitamente. Pero a veces, si la pregunta cae justo cerca del cutoff, el modelo puede generar una respuesta que parece actual pero es extrapolación de patrones, no hecho verificado.
Por eso los chatbots con búsqueda web habilitada (como Claude conectado a Brave Search, ChatGPT con Bing, Gemini con Google Search) dan resultados sustancialmente más confiables para información reciente. La búsqueda inyecta información post-cutoff al contexto. La predicción sigue siendo predicción, pero ahora con datos frescos disponibles.
Multimodalidad: misma idea, entrada más rica
Claude, GPT-4o y Gemini son multimodales. Pueden procesar texto, imágenes y, en versiones recientes, audio y video.
¿Cómo funciona técnicamente con imágenes? La imagen pasa por un encoder visual (típicamente un Vision Transformer, ViT) que la convierte en una secuencia de tokens visuales. Esos tokens entran al LLM como contexto adicional. El LLM predice texto que es probable dada esa entrada combinada.
Es el mismo mecanismo de fondo. Predicción de secuencia. La entrada es más rica, pero el core sigue siendo "qué viene después según las correlaciones aprendidas".
Implicaciones para arquitectura de prompts
Si entendiste todo lo anterior, hay cinco cosas que cambian inmediatamente en cómo armás tus prompts.
Más contexto da mejor predicción. Por eso el Método CAFÉ (Contexto, Acción, Formato, Estilo) funciona. No es magia. Es darle al modelo más señal sobre la distribución desde la cual debe predecir.
Los ejemplos en el prompt activan pattern matching intenso. El few-shot learning consiste en dar tres a cinco ejemplos del estilo que querés. El modelo predice respuestas que se parecen estadísticamente a esos ejemplos.
Pedir que piense paso a paso (chain-of-thought) fuerza al modelo a generar tokens intermedios que exploran el espacio de predicción de forma más cuidadosa. Para problemas de razonamiento, esto suele subir la tasa de acierto significativamente.
La temperatura controla cuánto se aparta el muestreo de la palabra más probable. Temperatura cero te da la palabra de máxima probabilidad determinísticamente (consistente, repetible, a veces aburrido). Temperatura uno introduce variación (más creativo, menos predecible). Temperatura dos suele producir caos.
El orden de las instrucciones importa. El modelo presta más atención al inicio y al final del contexto que al medio (efecto "lost in the middle" documentado en literatura reciente). Pone tus instrucciones críticas al principio o al final.
Ajuste post-entrenamiento: RLHF y Constitutional AI
Después del pretraining (predecir siguiente palabra mediante cross-entropy loss), los modelos pasan por ajuste adicional.
RLHF (Reinforcement Learning from Human Feedback), formalizado por OpenAI en Ouyang et al. (2022). Humanos califican pares de respuestas. El modelo aprende mediante PPO (Proximal Policy Optimization) a maximizar la probabilidad de respuestas bien calificadas, mientras se mantiene cerca del modelo base para no degradarse.
Constitutional AI, de Anthropic (Bai et al., 2022). Además de RLHF, el modelo se entrena contra un conjunto de "principios constitucionales". El modelo critica sus propias respuestas contra esos principios y se autocorrige.
Esto no cambia los parámetros fundamentales del transformer. Pero recalibra la distribución desde la cual el modelo muestrea. Hacia respuestas más útiles, más seguras, menos sesgadas.
Por eso Claude se siente distinto a un modelo base sin ajuste. Fue ajustado explícitamente para reconocer límites, calibrar incertidumbre y rechazar tareas que violan principios.
Trayectoria a corto, mediano y largo plazo
A corto plazo, multiplicación de modelos especializados. LLMs ajustados a verticales específicos (medicina, derecho, código, soporte). El mercado se diferencia por dominio.
A mediano plazo, sistemas agénticos. LLMs como orquestadores que predicen no solo palabras sino también acciones (llamar APIs, usar herramientas, ejecutar código, integrar con bases de datos externas). RAG se vuelve default. El protocolo MCP de Anthropic es la pieza estándar de esa capa.
A largo plazo, la pregunta abierta es epistemológica. ¿Convergen LLMs mejorados (con memoria persistente, multimodalidad completa, razonamiento en tiempo de inferencia, retroalimentación continua) hacia algo cercano a AGI? ¿O el techo es predicción muy sofisticada pero no comprensión genuina en el sentido filosófico fuerte (qualia, intencionalidad, consciencia)?
Mi postura. Es predicción de secuencias extremadamente potente. Hasta hoy no hemos visto evidencia de comprensión genuina en sentido filosófico fuerte. Pero el problema está abierto y la honestidad intelectual exige no clausurarlo.
La tesis del blog
Cuando usás Claude estás usando un sistema que en su núcleo predice la siguiente palabra en una distribución de probabilidades. Que esa predicción sea sofisticada al punto de parecer razonamiento, creatividad y comprensión emocional es real conductualmente. La ejecución subyacente, sin embargo, es matemáticamente predicción de secuencia.
Esto no la hace menos útil. La hace distinta a la inteligencia humana. Y comprender esa diferencia, que el sistema funciona muy bien sin entender lo que hace, es el inicio de usarlo bien.
Los que mejor aprovechan los LLMs son los que internalizaron este marco. Saben dónde la predicción brilla. Saben dónde falla de forma característica. Verifican donde la verdad importa. No esperan que el modelo "se vuelva consciente" en la próxima versión, porque saben que eso no es lo que está cambiando.
Lo que está cambiando es la calidad de la predicción. Y eso, palabra por palabra, alcanza para transformar industrias enteras.