Análisis · Historia y Fundamentos · Edición #0007

Qué es un modelo de lenguaje — LLMs explicados para tu tía

Un LLM es autocomplete potenciado. Aprende patrones de texto. Por eso puede escribir, resumir, traducir y programar — y por eso a veces inventa cosas.

G
Germán Falcioni 12 April 2026
✦ Lectura: 8 min
Predicción de la siguiente palabra: una visualización de probabilidades en cascada
TL;DR

Un LLM predice la siguiente palabra a partir de patrones que aprendió. No entiende de verdad, pero los patrones son tan ricos que parece que sí. Claude, GPT y Gemini son LLMs. Saber cómo funcionan evita sorpresas.

✦ Resumido con Claude al publicar
Reescritura con IA
Leelo como…

Qué es un modelo de lenguaje — LLMs explicados para tu tía

Hay una confusión gigante

Hay una confusión gigante sobre qué hace exactamente un modelo de lenguaje. "Predice la siguiente palabra" suena demasiado simple. "Entiende el contexto" suena demasiado impresionante.

La realidad es más interesante que cualquiera de las dos. Y entenderla cambia cómo lo usás.

El autocomplete de hace diez años

Te acordás del predictive text de los teclados de hace una década. Escribías tres palabras y te sugería "mañana", "después", "hoy". Funcionaba porque las máquinas aprendían qué palabras tienden a seguir a otras. "Buenos" → "días" es probable. No porque la máquina entendiera. Porque estadísticamente eso es lo que pasa.

Un LLM (Large Language Model) es exactamente lo mismo. Pero con escala y sofisticación bestiales.

Cómo se entrena

El modelo lee texto. No lee bien, no entiende bien. Solo lee. Mete los ojos. Mientras lo hace, aprende probabilidades.

Cuando aparece "Reino Unido", las próximas palabras probables son "es", "tiene", "está". Cuando aparece "El arte de la", lo probable es "guerra". Cuando aparece "import numpy as", la próxima es "np" con altísima probabilidad.

GPT-3 se entrenó con unos 300 mil millones de tokens, según el paper original (Brown et al., 2020). Modelos posteriores usaron aún más. No hay cifra pública para los últimos Claude o GPT-4o, pero están en el mismo orden de magnitud o por encima.

Cómo predice cuando vos le escribís

Cuando vos le mandás un mensaje a Claude pasa esto. Lee tu prompt. Calcula probabilidades para cada palabra posible. Elige la más probable, o muestrea con cierta variación. Escribe esa palabra. Repite.

Palabra. Tras. Palabra.

Lo que vos leés como una respuesta fluida son técnicamente miles de decisiones de predicción tomadas en milisegundos.

Por qué puede hacer tareas tan distintas

Porque casi cualquier tarea de oficina es, en el fondo, predicción de secuencias.

Escribir un email es predecir qué palabra viene en una narrativa lógica. Resumir es predecir qué palabras son las esenciales en un texto. Traducir es predecir la secuencia en idioma B que corresponde a la del idioma A. Programar es predecir qué línea sigue en este programa.

El modelo no sabe que está resumiendo. No tiene un concepto de "resumen". Lo que hace es: en este contexto donde la instrucción dice "resumí", qué palabras son probables. Aprendió eso de millones de ejemplos.

Nunca nadie programó esas capacidades. Emergieron del pattern matching.

Las capacidades emergentes

Acá la cosa se pone rara.

Nadie programó a Claude para escribir poesía. Nadie la entrenó específicamente en métrica ni rima. Pero puede hacerlo.

¿Cómo? Porque leyó tanta poesía durante el entrenamiento que los patrones de palabras en un poema son consistentes. No porque sepa poesía. Porque aprendió las correlaciones estadísticas de palabras en contextos poéticos.

Wei y otros investigadores documentaron en 2022 que cuando los modelos crecen en escala, de repente aparecen habilidades que en versiones más pequeñas no estaban. Lo llamaron capacidades emergentes.

Vale aclarar algo importante. Schaeffer y otros publicaron en 2023 una crítica a esa idea, mostrando que algunas de las "emergencias" eran artefactos de cómo se medía el rendimiento, no saltos genuinos. La discusión sigue abierta. Pero está claro que pasar de un modelo de mil millones de parámetros a uno de cien mil millones desbloquea cosas que antes no se podían.

El sesgo más importante: predicción vs comprensión

Esto es lo que la mayoría subestima.

Claude no entiende un poema. Predice qué palabra es probable en un contexto poético. ¿Importa la diferencia?

Un poeta entiende qué emoción está transmitiendo. Claude muestra patrones de palabras que correlacionan con esa emoción según lo que aprendió.

Si le preguntás a un poeta "¿por qué escribiste sobre la muerte así?", responde "porque sentía esto". Si le preguntás lo mismo a Claude, lo más honesto que puede decir es "porque esa secuencia de palabras tiene alta probabilidad en este contexto".

Importa cuando necesitás comprensión real. Si le pedís que entienda matices éticos de una decisión compleja en un escenario que nunca vio en su entrenamiento, problema. Puede sonar creíble pero estar prediciendo mal. Si le pedís que escriba algo que suene como vos, casi nunca falla. Tu voz es un patrón. Y los patrones son su juego.

Las limitaciones que explican muchas sorpresas

Alucinaciones. A veces Claude inventa datos con tono de seguridad total. Predice la palabra probable. Si el patrón dice "después de 'Einstein descubrió' viene una teoría", puede generar una teoría que no existe pero suena plausible. Sin acceso a verificación externa, no se da cuenta.

Knowledge cutoff. Cada modelo tiene una fecha de corte de entrenamiento. Lo que pasó después no está en sus parámetros. No es que no pueda saber. Es que esos datos no estaban cuando se entrenó. La fecha varía por modelo (Claude Sonnet 4.6, por ejemplo, tiene un cutoff distinto al de GPT-4o).

Sesgos. Los patrones que aprendió reflejan los sesgos de internet. Si los textos de entrenamiento decían "programador" más veces en masculino, el modelo aprendió esa correlación. Está en los pesos. Las empresas hacen post-entrenamiento para mitigarlo, pero el sesgo subyacente persiste.

Memoria limitada. Una vez entrenado, los pesos del modelo están fijos. No aprende de la conversación con vos en tiempo real. Las funciones de "memoria" que algunas plataformas ofrecen son trucos externos: guardan información sobre vos en una base aparte y la inyectan al contexto. El modelo en sí no recuerda.

Qué significa todo esto en la práctica

Claude es excelente para crear, sintetizar, brainstormear, generar variaciones, resumir, explicar, traducir y explorar. Es menos confiable para hechos críticos sin verificación, decisiones de riesgo alto que requieren comprensión genuina, y situaciones que no se parecen a nada que haya visto en el entrenamiento.

Los modelos que existen

Claude (Anthropic), entrenamiento enfocado en seguridad, calibración de incertidumbre y utilidad. La línea actual es Opus, Sonnet y Haiku.

GPT-4o y la familia GPT (OpenAI), multimodal nativo, agresivo en intentar resolver, dominante en código.

Gemini (Google), multimodal con énfasis en integración con el ecosistema Google.

Llama (Meta), de código abierto, ideal para correr local o adaptar a un dominio específico.

Mixtral (Mistral) y Phi (Microsoft), también de código abierto, eficientes y útiles para deploys locales.

Todos comparten la misma arquitectura base de transformers (Vaswani et al., 2017). Las diferencias están en la escala, los datos de entrenamiento y los ajustes post-entrenamiento.

Una pregunta para cerrar

Si cada respuesta de Claude es predicción palabra por palabra, ¿qué le podrías cambiar a tu próximo prompt para mejorar la calidad de esas predicciones? Probablemente más contexto, ejemplos de cómo querés que suene la respuesta y restricciones explícitas de formato.

En "Cómo 'piensa' una IA", otro artículo de la serie, profundizo en la mecánica. Mientras tanto, la próxima vez que algo te sorprenda (positivamente o negativamente) en una respuesta de Claude, preguntate qué patrón estadístico lo explicaría. Casi siempre la respuesta está ahí.

Siguiente artículo
IA generativa — qué es y por qué cambió el trabajo intelectual