Análisis · IA en el panorama · Edición #0016

Las IAs chinas — DeepSeek, Qwen y el otro lado de la carrera

DeepSeek llegó al #1 de la App Store de EEUU un lunes de enero de 2025. Ese mismo día Nvidia perdió 589 mil millones de capitalización. El ángulo técnico es interesante; el ángulo político es más.

G
Germán Falcioni 20 April 2026
✦ Lectura: 10 min
Las sanciones buscaban frenar; terminaron forzando eficiencia y publicación abierta. Ese es el otro lado de la carrera.
TL;DR

DeepSeek, Qwen, Kimi y otros laboratorios chinos compiten hoy con Claude y ChatGPT en benchmarks y, a veces, en precio. La historia interesante no es que "China alcanzó a EEUU" — es que las restricciones de exportación de GPUs de NVIDIA impuestas por Washington en 2022-2023 forzaron a esos laboratorios a optimizar agresivamente sobre hardware limitado, y publicaron las técnicas. DeepSeek-R1 (enero 2025) demostró que el razonamiento estilo o1 se podía reproducir open-source por una fracción del costo percibido. Para uso profesional con datos sensibles, Claude sigue siendo la elección sólida. Para startups que necesitan self-host con licencia permisiva, Qwen2.5-72B en infra propia es una opción legítima. Los filtros de contenido alineados a normativa china son reales — no son un detalle menor.

✦ Resumido con Claude al publicar
Reescritura con IA
Leelo como…

El 26 de diciembre de 2024, DeepSeek publicó en GitHub un documento técnico de 53 páginas titulado DeepSeek-V3 Technical Report. No fue un blog post de marketing: fue un paper detallado, con arquitectura, decisiones de entrenamiento, curvas de pérdida, y una cifra que paralizó a Silicon Valley cuando los analistas la leyeron con atención. La corrida final de entrenamiento habría costado unos 5,6 millones de dólares.

El mercado tardó cuatro semanas en procesar lo que ese número implicaba. El lunes 27 de enero de 2025, con la app de DeepSeek liderando el App Store de EEUU por delante de ChatGPT, Wall Street reaccionó. Nvidia cerró ese día con una pérdida de capitalización de 589 mil millones de dólares — la caída más grande en un solo día para cualquier empresa en la historia de la bolsa estadounidense. El Nasdaq perdió 3,1 por ciento. El índice de semiconductores SOX cayó 9,2.

Lo que se rompió ese lunes no fue DeepSeek. Se rompió una creencia: que entrenar IA de frontera requería capex de escala EEUU y era, por lo tanto, un juego de pocos jugadores.

¿De dónde salió DeepSeek?

DeepSeek se fundó en mayo de 2023 en Hangzhou. Su creador, Liang Wenfeng, venía de dirigir High-Flyer, un fondo cuantitativo chino que había acumulado un cluster importante de GPUs Nvidia — inicialmente para trading de alta frecuencia, no para IA. Cuando Liang pivoteó hacia modelos de lenguaje, tenía dos cosas raras para el ecosistema chino: capacidad de compute propia sin depender de una big tech, y cultura de optimización heredada de finanzas cuantitativas.

La trayectoria de productos hasta hoy:

  • DeepSeek-V2 (mayo 2024) — primer modelo que llamó la atención en benchmarks técnicos, con la arquitectura Mixture-of-Experts que después explotarían en V3.
  • DeepSeek-V3 (diciembre 2024) — 671 mil millones de parámetros totales, 37 mil millones activos por token. El paper que incluye la cifra de 5,6 millones.
  • DeepSeek-R1 (enero 2025) — modelo de razonamiento tipo o1. Open-weights bajo licencia MIT.

La licencia MIT de R1 es importante. Es la licencia más permisiva que existe. Podés descargar los pesos, fine-tunearlos, correrlos en producción comercial, sin pedirle permiso a nadie.

La cifra de 5,6 millones está en disputa (y no importa tanto)

Hay que ser honesto con los números. Los 5,6 millones corresponden solo al costo de compute de la corrida final — no incluyen las GPUs (el capex de hardware que ya tenían), ni salarios de investigadores, ni las docenas de experimentos fallidos previos, ni el data labeling. SemiAnalysis y otros analistas independientes estimaron el costo total real en el orden de los 500 millones cuando se incluye todo.

Pero ese debate se queda corto del punto. Aun si DeepSeek gastó 500 millones, entrenar el equivalente a GPT-4 por medio billón de dólares sigue siendo un orden de magnitud menos que los 5 a 10 mil millones que analistas venían calculando para el próximo ciclo de escalado de OpenAI o Anthropic.

La eficiencia por dólar de cómputo no es marketing chino. Está documentada en el paper, es reproducible por equipos técnicos, y sus técnicas centrales — multi-head latent attention, auxiliary-loss-free load balancing, FP8 mixed precision training — ya fueron adoptadas por laboratorios occidentales.

Qwen, Kimi y el resto del pelotón

DeepSeek es la cara visible, pero no es el único jugador serio del lado chino.

Qwen (Alibaba). La serie más consistente. Qwen2 (mediados de 2024), Qwen2.5 (fines de 2024), Qwen3 (2025). Modelos de distintos tamaños — 7B, 32B, 72B — todos con pesos abiertos bajo licencia Apache 2.0 (también permisiva). Qwen2.5-72B es el modelo de facto para muchas startups que necesitan self-host. Alibaba lo empuja porque quiere vender infraestructura de Alibaba Cloud; los modelos abiertos son el anzuelo.

Kimi (Moonshot). Especialidad: contexto largo. Fue el primero en ofrecer comercialmente ventanas de un millón de tokens en chino, antes que los occidentales tuvieran equivalentes. Fuerte en el mercado chino, menos conocido afuera.

Baichuan, Zhipu GLM, 01.AI (Yi). Tres laboratorios con modelos competentes. 01.AI está fundada por Kai-Fu Lee, figura conocida en el ecosistema occidental. Zhipu tiene vínculos académicos con Tsinghua.

Ernie Bot (Baidu). Es la respuesta corporativa más directa a ChatGPT. Más cerrada, menos técnicamente innovadora, pero con distribución enorme dentro de China vía productos de Baidu.

El ecosistema es más diverso de lo que sugiere el foco mediático en DeepSeek.

El contexto que no sale en los titulares

Para entender por qué laboratorios chinos innovaron tan agresivamente en eficiencia, hay que mirar qué estaba haciendo Washington.

En octubre de 2022 la Administración Biden, a través del Bureau of Industry and Security del Departamento de Comercio, impuso restricciones sobre la exportación de GPUs avanzadas a China. Las H100 y A100 de Nvidia — los chips de referencia para entrenar modelos de frontera — quedaron prohibidas. Nvidia respondió creando variantes levemente degradadas (la H800, después la H20) que cumplían los umbrales de la regulación. Washington endureció las restricciones en octubre de 2023 para tapar esas brechas.

El objetivo declarado era frenar a China. El efecto real fue distinto: los laboratorios chinos, con menos cómputo por investigador y hardware inferior, tuvieron que optimizar agresivamente. Y publicaron las técnicas.

Eso es lo que hace único a DeepSeek-V3 como documento: no es un producto cerrado con una caja negra adentro, es un manual de operaciones. Cualquier laboratorio con los recursos puede leer el paper y aplicar las mismas técnicas.

¿Qué hago yo, profesionalmente, con todo esto?

Acá es donde vale separar casos de uso.

Si tu trabajo es con clientes reales, con contratos, con datos sensibles, con reputación en juego — Claude sigue siendo la apuesta que hago todos los días. No porque DeepSeek-R1 sea malo en capacidad bruta (no lo es), sino porque la combinación de jurisdicción, trayectoria de confianza, garantías contractuales y soporte multilingüe consistente no existe en los modelos chinos accesibles al público. Para el trabajo delegable con datos que no pueden salir de mi control, Anthropic en Estados Unidos sigue siendo el proveedor que entiendo y al que puedo señalar responsabilidad.

Si tu trabajo es una startup técnica con presupuesto limitado y necesitás self-host — ahí Qwen2.5-72B o DeepSeek-V3 corriendo en tu propia infraestructura son opciones legítimas. Licencia permisiva, capacidad alta, sin tercero mirando tus prompts. Esta es una puerta real que hace dos años no existía para nadie fuera de las big tech.

Si estás aprendiendo — probá todos. DeepSeek tiene una web pública. Qwen tiene demo en Hugging Face. ChatGPT y Claude los conocés. Ver cómo piensa cada uno te da intuición que ningún blog te da.

Si tu tema es periodismo, investigación política, derechos humanos o cualquier cosa que toque geopolítica asiática — los modelos chinos accesibles al público no son la herramienta. No por maldad, por regulación de origen.

Para cerrar y para seguir

El surgimiento de DeepSeek y la consolidación de Qwen cambiaron la conversación sobre qué significa "caro" entrenar un modelo de frontera. Rompieron un supuesto de costo, democratizaron técnicas a través de papers públicos, y forzaron a los laboratorios occidentales a reaccionar en eficiencia.

Pero no son intercambiables con Claude o ChatGPT para uso profesional occidental. Los filtros de contenido son reales. La jurisdicción es real. El soporte multilingüe desigual es real. Son herramientas distintas para casos distintos.

¿En qué parte de tu flujo de trabajo te serviría tener una opción open-weights con licencia permisiva corriendo en tu propia infraestructura? Si querés contexto más amplio del panorama competitivo, La carrera de las IAs es el siguiente eslabón. Si querés entender cómo se compara la capacidad de estos modelos, Cómo se miden las IAs te arma el marco.

Seguí explorando

¿Querés profundizar en algo del artículo?

01 ¿Puedo usar DeepSeek o Qwen desde Argentina o América Latina para mi trabajo?

Técnicamente sí, con matices. DeepSeek tiene una web públicany una API pagas; Qwen está disponible vía Alibaba Cloud yntambién como pesos descargables desde Hugging Face. El temanno es el acceso — es qué pasa con tu data. Si usás la APInoficial, tus prompts y respuestas quedan bajo jurisdicciónnchina. Para probar capacidades, aprender, hacer un sidenproject: ningún drama. Para trabajo con clientes reales,ncontratos, documentos internos: no la vas a querer ahí. Lanopción intermedia interesante es descargar los pesos denQwen2.5 (licencia Apache 2.0) y correrlo en infraestructuranpropia — ahí la data no sale de tu control.n

02 ¿DeepSeek-R1 es realmente tan barato de entrenar como dicen?

La cifra de 5.6 millones de dólares que circuló en enero den2025 viene del paper de DeepSeek-V3, y corresponde al costonde compute de la corrida final — no incluye salarios,nexperimentos fallidos, data labeling ni el costo de las GPUs.nAnalistas independientes estiman el costo total real en elnorden de los 500 millones de dólares cuando se incluyenhardware y ecosistema. Pero incluso 500 millones es un ordennde magnitud menos que lo que se suponía que costaba entrenarnun modelo de frontera. La cifra exacta está en disputa; elnefecto sobre las expectativas del mercado no lo está.n

03 ¿Qué pasa con la censura y los filtros de contenido en modelos chinos?

Son reales y son específicos. La Cyberspace Administration ofnChina (CAC) exige que los modelos accesibles al público ennChina registren sus datos de entrenamiento y apliquen filtrosnsobre temas sensibles: Tiananmen, Taiwán, el Dalai Lama,ncrítica directa al Partido. Si usás DeepSeek oficial o Qwennvía Alibaba Cloud vas a encontrarte con rechazos suaves ondesvíos de tema en esas áreas. Si corrés los pesos abiertosnen infra propia, gran parte de esos filtros son post-trainingny se pueden mitigar con fine-tuning, pero el sesgo del datanmix inicial queda. Para trabajo profesional occidental enntemas neutros (código, análisis, matemática) la censura raranvez te toca. Para periodismo, investigación política oncualquier cosa que roce geopolítica, es un deal-breaker.n

Siguiente artículo
La carrera de las IAs — Claude vs ChatGPT vs Gemini vs el resto