Un ingeniero latinoamericano, laptop con 32 GB de RAM y sin GPU dedicada, abre Ollama en su máquina y descarga Qwen-2.5-Coder de 14B parámetros. Lo prueba pidiéndole que le escriba una función de Python, después que le refactorice una clase vieja, después que le explique un bug. Anda. No como Claude, no como GPT-4, pero decente. Corre local, sin conexión, sin mandar nada a ningún servidor.
Esto, a fines de 2024 y durante 2025, fue el cambio que pocos notaron en la prensa pero muchos en la comunidad de desarrollo: los modelos chinos open-source se volvieron viables para correr en hardware de usuario serio, con resultados buenos. La IA potente dejó de ser sinónimo de "conectarse a la API de una big tech".
Mapa rápido de los jugadores chinos que importan
DeepSeek (subsidiaria de High-Flyer, fondo quant): el que rompió el silencio en enero 2025. Modelos principales — V3 (general), R1 (razonamiento), R1-Distill (versiones más chicas destiladas). Todas con pesos abiertos y paper técnico. Es el laboratorio más disruptivo del año 2025.
Qwen / Alibaba Cloud: la familia más grande y más usada en Hugging Face. Qwen-2.5 (general), Qwen-2.5-Coder (coding), Qwen-2.5-Max (frontier), Qwen-VL (visión), Qwen-Audio (audio). Estrategia: competir con open-source de punta y monetizar con Alibaba Cloud.
Moonshot AI — modelo Kimi, chatbot muy popular en China, con ventana de contexto grande. Con interfaz en inglés también accesible.
MiniMax — productos de video (Hailuo) y modelos de texto. Fuerte en generación de video.
Zhipu AI — modelos GLM, spin-off de la Universidad de Tsinghua. Usados sobre todo en el ecosistema empresarial chino.
Baidu — Ernie, el chatbot de Baidu, más dirigido al mercado chino interno.
El tablero no es uno solo. Son seis o siete laboratorios compitiendo, y dos de ellos (DeepSeek y Qwen) ya pisan la frontera técnica global.
Cómo los usás, práctico
En la nube oficial (gratis en la mayoría de casos): chat.deepseek.com, chat.qwen.ai. App móvil. Bueno para probar.
Vía API: deepseek.com para desarrolladores, dashscope.aliyun.com para Qwen. Precios por token marcadamente más bajos que OpenAI o Anthropic. Para escenarios de alto volumen donde el costo importa.
Local con pesos abiertos: descargás desde Hugging Face, corrés con Ollama (más fácil) o LM Studio. DeepSeek-R1-Distill-Qwen-14B o Qwen-2.5-14B corren en una laptop con 32 GB de RAM aceptablemente. Versiones más chicas (7B, 3B) corren hasta en teléfonos.
En proveedores cloud alternativos (Together, Fireworks, Groq): alojan los modelos chinos en hardware americano con latencia buena. Solución para empresas que quieren los modelos pero no enviar datos a China.
Comparación honesta de capacidades
Coding: Qwen-2.5-Coder y DeepSeek-R1 competitivos con Claude 3.5 Sonnet en benchmarks como HumanEval y MBPP (fuente: LMArena, Hugging Face model cards). En tareas agenticas multi-archivo Claude todavía suele ganar.
Matemáticas y razonamiento: DeepSeek-R1 compite con o1 de OpenAI en AIME y MATH. Uno de los dominios donde las IAs chinas están al nivel frontier.
Escritura larga: Claude y ChatGPT siguen arriba. DeepSeek y Qwen producen texto competente pero menos cohesión en pieces largos.
Español: Claude, ChatGPT y Gemini sacan ventaja clara. Las IAs chinas priorizan inglés y chino — el español funciona pero con errores de idiomaticidad.
Multimodal: Qwen-VL compite razonablemente en visión. Gemini sigue adelante en integración multimodal pareja.
El tema geopolítico y los chips
Este es el capítulo que da contexto a todo. Desde 2022, sanciones de Biden y después Trump restringieron la exportación a China de chips NVIDIA H100 y A100 de última generación. La idea era frenar el avance chino en IA. El resultado parcial es el opuesto: DeepSeek y otros entrenaron modelos competitivos con hardware menor (H800, chips domésticos), forzados a innovar en eficiencia de entrenamiento. DeepSeek-R1 declaró costos ~10x menores a los estimados para GPT-o1. La industria debate si esas cifras son enteramente verificables, pero el orden de magnitud nadie lo discute.
Una pregunta abierta
Si los modelos open-source chinos siguen mejorando al ritmo de 2024-2025, ¿qué parte del valor que hoy pagás vía Claude/ChatGPT/Gemini podría venir gratis y local en 18 meses? Si el tema te interesa, seguí con Las IA chinas — DeepSeek, Qwen y el otro lado de la carrera y con Modelos abiertos vs cerrados.
El lunes 27 de enero de 2025 amaneció raro en Wall Street. Una app que el viernes anterior nadie conocía estaba número uno en la App Store de Estados Unidos, arriba de ChatGPT. Se llamaba DeepSeek. Era china. Gratis. Y al abrirla contestaba, en un estilo muy parecido a o1 de OpenAI, preguntas que hasta ese día sólo se suponía que contestaban bien los modelos americanos.
A las 9:30 de la mañana abrió el mercado. Nvidia cayó. Cayó fuerte. Para el cierre del día había perdido alrededor de 600 mil millones de dólares de valor bursátil (fuente: Bloomberg, 27 enero 2025), la mayor caída diaria en valor absoluto de una sola empresa en la historia del mercado estadounidense. El shock no era sólo que una IA china funcionara bien. Era que la había construido un laboratorio chico, con chips restringidos, y por un costo declarado mucho menor al que la industria asumía necesario.
Así entró la IA china en la conversación global masiva.
Las dos que podés usar hoy sin instalar nada
DeepSeek — chat.deepseek.com. Gratis, registro con email. Tiene dos modelos principales: V3 (general, tipo ChatGPT) y R1 (razonamiento, muestra los pasos mentales como o1). Especialmente bueno en matemáticas, lógica y coding.
Qwen — chat.qwen.ai. Es de Alibaba, el Amazon chino. También gratis, también con varios modelos: Qwen general, Qwen-Coder para programación, Qwen-VL para analizar imágenes. Tiene el ecosistema open-source más grande del mundo en Hugging Face.
Ambas tienen app móvil en App Store y Play Store.
Lo que hay que saber antes de confiar
- Censura: preguntas sobre Tiananmen, Taiwán, Xi Jinping o críticas al gobierno chino reciben respuestas evasivas o directamente no se responden. No es bug — es política de producto.
- Idioma: funcionan bien en inglés y en chino. En español andan, pero notablemente por debajo de Claude, ChatGPT o Gemini. Si tu trabajo es en español, mejor aplicalas como herramienta secundaria, no como default.
- Privacidad: los datos que mandás al chat oficial pueden quedar bajo jurisdicción china. Para trabajo con información sensible (clientes, finanzas, documentos internos), no son la elección prudente.
Tres ideas para llevarte
- DeepSeek y Qwen son hoy el primer caso en que IAs no americanas entran en la foto grupal del top técnico. Vale la pena probarlas para saber.
- Para trabajo profesional en español con datos sensibles, Claude, ChatGPT o Gemini siguen siendo mejores apuestas. Las chinas son complemento, no default.
- Si te interesa razonamiento o coding y no te importa el inglés, DeepSeek-R1 es la prueba gratuita más barata de lo que hasta hace un año costaba pagar $20 por ChatGPT Plus.
Un ingeniero latinoamericano, laptop con 32 GB de RAM y sin GPU dedicada, abre Ollama en su máquina y descarga Qwen-2.5-Coder de 14B parámetros. Lo prueba pidiéndole que le escriba una función de Python, después que le refactorice una clase vieja, después que le explique un bug. Anda. No como Claude, no como GPT-4, pero decente. Corre local, sin conexión, sin mandar nada a ningún servidor.
Esto, a fines de 2024 y durante 2025, fue el cambio que pocos notaron en la prensa pero muchos en la comunidad de desarrollo: los modelos chinos open-source se volvieron viables para correr en hardware de usuario serio, con resultados buenos. La IA potente dejó de ser sinónimo de "conectarse a la API de una big tech".
Mapa rápido de los jugadores chinos que importan
DeepSeek (subsidiaria de High-Flyer, fondo quant): el que rompió el silencio en enero 2025. Modelos principales — V3 (general), R1 (razonamiento), R1-Distill (versiones más chicas destiladas). Todas con pesos abiertos y paper técnico. Es el laboratorio más disruptivo del año 2025.
Qwen / Alibaba Cloud: la familia más grande y más usada en Hugging Face. Qwen-2.5 (general), Qwen-2.5-Coder (coding), Qwen-2.5-Max (frontier), Qwen-VL (visión), Qwen-Audio (audio). Estrategia: competir con open-source de punta y monetizar con Alibaba Cloud.
Moonshot AI — modelo Kimi, chatbot muy popular en China, con ventana de contexto grande. Con interfaz en inglés también accesible.
MiniMax — productos de video (Hailuo) y modelos de texto. Fuerte en generación de video.
Zhipu AI — modelos GLM, spin-off de la Universidad de Tsinghua. Usados sobre todo en el ecosistema empresarial chino.
Baidu — Ernie, el chatbot de Baidu, más dirigido al mercado chino interno.
El tablero no es uno solo. Son seis o siete laboratorios compitiendo, y dos de ellos (DeepSeek y Qwen) ya pisan la frontera técnica global.
Cómo los usás, práctico
En la nube oficial (gratis en la mayoría de casos): chat.deepseek.com, chat.qwen.ai. App móvil. Bueno para probar.
Vía API: deepseek.com para desarrolladores, dashscope.aliyun.com para Qwen. Precios por token marcadamente más bajos que OpenAI o Anthropic. Para escenarios de alto volumen donde el costo importa.
Local con pesos abiertos: descargás desde Hugging Face, corrés con Ollama (más fácil) o LM Studio. DeepSeek-R1-Distill-Qwen-14B o Qwen-2.5-14B corren en una laptop con 32 GB de RAM aceptablemente. Versiones más chicas (7B, 3B) corren hasta en teléfonos.
En proveedores cloud alternativos (Together, Fireworks, Groq): alojan los modelos chinos en hardware americano con latencia buena. Solución para empresas que quieren los modelos pero no enviar datos a China.
Comparación honesta de capacidades
Coding: Qwen-2.5-Coder y DeepSeek-R1 competitivos con Claude 3.5 Sonnet en benchmarks como HumanEval y MBPP (fuente: LMArena, Hugging Face model cards). En tareas agenticas multi-archivo Claude todavía suele ganar.
Matemáticas y razonamiento: DeepSeek-R1 compite con o1 de OpenAI en AIME y MATH. Uno de los dominios donde las IAs chinas están al nivel frontier.
Escritura larga: Claude y ChatGPT siguen arriba. DeepSeek y Qwen producen texto competente pero menos cohesión en pieces largos.
Español: Claude, ChatGPT y Gemini sacan ventaja clara. Las IAs chinas priorizan inglés y chino — el español funciona pero con errores de idiomaticidad.
Multimodal: Qwen-VL compite razonablemente en visión. Gemini sigue adelante en integración multimodal pareja.
El tema geopolítico y los chips
Este es el capítulo que da contexto a todo. Desde 2022, sanciones de Biden y después Trump restringieron la exportación a China de chips NVIDIA H100 y A100 de última generación. La idea era frenar el avance chino en IA. El resultado parcial es el opuesto: DeepSeek y otros entrenaron modelos competitivos con hardware menor (H800, chips domésticos), forzados a innovar en eficiencia de entrenamiento. DeepSeek-R1 declaró costos ~10x menores a los estimados para GPT-o1. La industria debate si esas cifras son enteramente verificables, pero el orden de magnitud nadie lo discute.
Una pregunta abierta
Si los modelos open-source chinos siguen mejorando al ritmo de 2024-2025, ¿qué parte del valor que hoy pagás vía Claude/ChatGPT/Gemini podría venir gratis y local en 18 meses? Si el tema te interesa, seguí con Las IA chinas — DeepSeek, Qwen y el otro lado de la carrera y con Modelos abiertos vs cerrados.
El 20 de enero de 2025, DeepSeek publicó el paper de DeepSeek-R1 junto con los pesos abiertos del modelo. El documento describía una receta sorprendentemente directa: partir de DeepSeek-V3 (modelo base mixture-of-experts de 671B parámetros totales, ~37B activados por token), aplicar pura reinforcement learning con recompensa basada en outputs verificables (matemáticas, código), y después destilar los comportamientos a modelos más chicos. El costo total de entrenamiento declarado fue USD 5.576 millones para la fase final. Cifra que, si es verídica, está un orden de magnitud por debajo de las estimaciones para GPT-o1 (reportadas como superiores a $100M por analistas como The Information y Epoch AI).
La comunidad técnica miró con sospecha sana. Las auditorías independientes no pueden verificar el costo declarado — DeepSeek no publicó logs de entrenamiento detallados. Analistas como SemiAnalysis estimaron el costo real incluyendo infraestructura, personal y experimentos previos en $1B+ — muy por debajo de los competidores americanos pero muy por encima del número puntual que circuló en prensa.
Aun con ese caveat, la lección técnica es genuina: la frontera de razonamiento se alcanza con menos compute del que se pensaba, si se elige bien la arquitectura (MoE + multi-head latent attention) y el método de entrenamiento (pure RL con GRPO en lugar de PPO, eliminando el critic model).
Arquitectura técnica que importa
Multi-head Latent Attention (MLA): innovación de DeepSeek que comprime las keys y values proyectándolas a un espacio latente más chico, reduciendo drásticamente el uso de memoria durante inferencia. Permite sostener contextos largos con menor hardware.
Mixture-of-Experts profundo (256 expertos en V3): sólo activa una fracción (~37B de 671B) por token, manteniendo el compute de inferencia manejable mientras el capacity total del modelo es enorme.
GRPO (Group Relative Policy Optimization): variante de PPO sin critic model, diseñada específicamente para tareas con recompensas verificables. Ahorra compute y memoria en RL.
Razonamiento con R1-Zero → R1: primero entrenaron con pura RL sin supervised fine-tuning (R1-Zero), descubrieron que emergieron cadenas de pensamiento largas espontáneamente, y después agregaron una capa corta de SFT para mejorar la legibilidad (R1).
Estos pedazos no son revelaciones inéditas — MoE es viejo, RL con recompensa verificable es viejo, LLMs con razonamiento es el paradigma o1 — pero la combinación específica y la ejecución en chips restringidos es lo que hizo el momento.
Qwen: la estrategia de volumen open source
Mientras DeepSeek ganó el ciclo de prensa, Qwen de Alibaba ganó el ciclo de adopción silenciosa. En Hugging Face, la familia Qwen consistentemente está entre los modelos open-weight más descargados. Qwen-2.5, Qwen-2.5-Coder, Qwen-2.5-VL, Qwen-Audio — cubren texto, código, visión, audio con pesos publicados.
La estrategia de Alibaba es clara: competir en la frontera open-source, generar ecosistema (fine-tunes, cuantizaciones, integraciones), y monetizar arriba con Alibaba Cloud Model Studio y Alibaba Cloud. Es el mismo playbook de Microsoft con Linux — no evitar el open, abrazarlo y vender la infraestructura.
Qwen-2.5-Max (finales de 2024) compitió cabeza a cabeza con GPT-4o y Claude 3.5 Sonnet en varios benchmarks. Qwen-2.5-Coder-32B se volvió el modelo open de referencia para coding, fine-tuneado por la comunidad para cientos de casos verticales.
Contexto geopolítico: las restricciones aceleraron la eficiencia
La tesis más interesante de 2025 es que las sanciones tecnológicas produjeron el efecto contrario al buscado. Prohibir H100 y A100 para exportación a China en 2022-2024 forzó a los labs chinos a entrenar con H800 (variantes recortadas en ancho de banda de interconexión) y con chips domésticos (Huawei Ascend). El resultado fue un foco sistémico en eficiencia: arquitecturas como MLA y MoE profundo emergieron porque eran las formas de sacarle más jugo a menos compute.
Paralelamente, OpenAI, Anthropic y Google operaban sin restricciones de chips y podían asumir "escalar resuelve casi todo". Esa comodidad fue una desventaja competitiva cuando el techo técnico se alcanzó con menos.
Dario Amodei (Anthropic) respondió al momento DeepSeek con un ensayo argumentando que el paper no invalida la curva de scaling — R1 sigue ganando con más compute, como todos los modelos. Lo que cambió no es que "ya no importe el compute": es que el compute necesario para entrar en la frontera bajó. Eso es una noticia distinta, menos dramática que los titulares pero más relevante estratégicamente.
Limitaciones reales para el usuario profesional latinoamericano
- Censura política: no es evasiva, es categórica en temas del gobierno chino. Si tu trabajo roza geopolítica, periodismo, análisis de mercado asiático, es una limitación de producto.
- Calidad en español: aceptable pero con errores idiomáticos y culturales más frecuentes que en Claude/GPT/Gemini. El training data está dominado por inglés y chino.
- Seguridad de outputs: menos trabajada que en modelos alineados con constitutional AI o RLHF enterprise-grade. Más propenso a producir outputs inapropiados en edge cases.
- Privacidad y jurisdicción: datos enviados a APIs chinas oficiales quedan potencialmente bajo jurisdicción china. Para empresas reguladas, compliance es una pregunta abierta que los departamentos legales corporativos están recién empezando a responder.
- Latencia: para usuarios latinoamericanos, la latencia desde chat.deepseek.com o chat.qwen.ai puede ser mayor que Claude/ChatGPT (que tienen edge presence global). Mitigable usando Together, Fireworks, Groq u otros proveedores que alojen los modelos chinos en infra americana.
Tesis editorial: el fin del moat por compute
La historia oficial de 2022-2024 fue: "el moat de los frontier labs es el compute — nadie más tiene los H100 ni el capital". La historia real de 2025 es: el compute ayuda, pero no es foso suficiente. DeepSeek demostró que un equipo relativamente chico, con restricciones de hardware, alcanza la frontera con mejor receta. Esa es una noticia estratégica que la industria todavía está digiriendo.
¿Qué significa para un profesional en Buenos Aires, São Paulo o Ciudad de México? Tres cosas concretas:
Una, que el costo por token va a seguir cayendo. Las APIs chinas compiten por precio, las americanas tienen que responder. Para casos de uso de alto volumen (customer service, análisis masivo, generación de contenido a escala), el costo de la IA deja de ser restricción.
Dos, que los modelos locales se vuelven una opción real. Para tareas de privacidad o desconexión, poder correr un modelo decente en una laptop propia cambia el cálculo. No reemplaza a Claude para tareas críticas, pero cubre el 70% del uso cotidiano gratis.
Tres, que la dependencia de un solo laboratorio disminuye. El stack profesional del próximo año no es "Claude o ChatGPT" — es "Claude o ChatGPT como default, DeepSeek/Qwen como alternativa de alto volumen, local como opción de privacidad". Esa arquitectura de tres capas es más robusta y más barata que la dependencia del 2023.
Para el hispanohablante que produce trabajo profesional serio, la recomendación de 2026 sigue siendo Claude, ChatGPT o Gemini como caballos principales. Pero saber que existe, funciona, y es gratis una versión open-weight de razonamiento técnico al nivel o1 cambia la conversación sobre qué tan grande era el foso de los labs americanos. No era tan grande. 2025 lo demostró.