MUNDO: INTELIGENCIA ARTIFICIAL Y TECNOPOLITICA

DeepSeek y Huawei atacan el foso de Nvidia: el kit de código abierto para Ascend que pone a prueba los controles de exportación

DeepSeek liberó seis componentes de software optimizados para los chips Ascend 950 de Huawei y para configuraciones de hasta 128 aceleradores. El objetivo no es el silicio sino CUDA...

Miércoles, 30 de Septiembre de 2026
China, Competencia tecnológica, Estados Unidos, DeepSeek, Inteligencia Artificial


DeepSeek liberó seis componentes de software optimizados para los chips Ascend 950 de Huawei y para configuraciones de hasta 128 aceleradores. El objetivo no es el silicio sino CUDA, la ventaja más duradera de Nvidia. Si el ecosistema prospera, la eficacia de los controles de exportación estadounidenses dependerá cada vez más de la capacidad de fabricación china y cada vez menos del software.


En el concierto de la competencia tecnológica entre los Estados Unidos y la República Popular China, la discusión pública suele concentrarse en el hardware: nanómetros, litografía ultravioleta extrema, memorias de alto ancho de banda. Sin embargo, la supremacía de Nvidia en la computación para inteligencia artificial nunca descansó exclusivamente en sus procesadores. Descansa en CUDA, la plataforma de programación que la compañía desarrolla desde mediados de la década de 2000 y sobre la cual se escribió, durante casi veinte años, la práctica totalidad del software de aprendizaje profundo del mundo.

Entre el 29 y el 30 de septiembre, DeepSeek —el laboratorio de Hangzhou que en enero de 2025 sacudió a Wall Street con un modelo de alto rendimiento entrenado a bajo costo— publicó como código abierto un conjunto de herramientas desarrolladas junto con Huawei para sus aceleradores Ascend. Según informó Reuters, el propósito declarado es reducir la dependencia del ecosistema de Nvidia. El movimiento apunta al componente del dominio estadounidense que los controles de exportación nunca alcanzaron a regular: el hábito de millones de desarrolladores.


Qué liberaron DeepSeek y Huawei

El paquete incluye seis componentes, cada uno dirigido a una capa distinta de la pila de software:

  • TileLang-Ascend: lenguaje de dominio específico para escribir kernels de alto rendimiento, que DeepSeek presenta como un modelo de programación más simple que CUDA.
  • DeepGEMM: biblioteca de multiplicación de matrices, la operación que concentra la mayor parte del cómputo en el entrenamiento y la inferencia de modelos.
  • DeepEP: comunicación entre dispositivos para arquitecturas de mezcla de expertos distribuidas en múltiples aceleradores.
  • TileKernels: operaciones vectoriales y de acceso a memoria, que exponen la misma interfaz en Python tanto para Nvidia como para Ascend.
  • FlashMLA: kernels para la atención latente multicabezal (MLA), la arquitectura propia de los modelos de DeepSeek, clave para contextos largos.
  • DeepSelect: filtrado de datos y operaciones de selección TopK empleadas en la atención dispersa.

El conjunto está optimizado para el Ascend 950 y para un diseño de supernodo de 128 aceleradores definido en conjunto con Huawei, con optimizaciones que abarcan tanto el cómputo como la comunicación entre chips. Los resultados publicados por el proyecto sitúan el rendimiento de TileLang-Ascend en torno a 0,98 veces el de un código escrito a mano en Ascend C para multiplicación de matrices, 0,96 para operadores vectoriales y 0,95 para cargas combinadas como Flash Attention. Son mediciones propias, aún sin verificación independiente.

El anuncio consolida un proceso previo. DeepSeek ya había publicado en abril kernels de su modelo V4 para Ascend y desarrolló una variante, V4-Flash, pensada para esos procesadores. Según reportes de la prensa tecnológica china, el laboratorio planea desplegar al menos 160.000 aceleradores Ascend 950DT en un centro de datos en Ulanqab, Mongolia Interior, con una inversión estimada en US$ 2.560 millones.


El verdadero foso de Nvidia: por qué el software pesa más que el silicio

La expresión ‘foso’ describe una ventaja competitiva difícil de replicar. En el caso de Nvidia, el foso no es un chip determinado —los competidores pueden igualar o superar ciertas métricas de hardware— sino el costo de abandonar su ecosistema. CUDA reúne un compilador, bibliotecas optimizadas como cuBLAS para álgebra lineal y NCCL para comunicación entre procesadores, herramientas de depuración y perfilado, y una base instalada de código que los grandes marcos de trabajo, como PyTorch, dan por supuesta. Migrar a otra arquitectura exige reescribir o adaptar cada una de esas piezas.

Los costos de transición son concretos. Cada llamada a cuBLAS o a NCCL debe reemplazarse por su equivalente en Ascend C o en HCCL, la biblioteca de comunicación de Huawei, y los errores de compatibilidad en la comunicación colectiva pueden hacer que un entrenamiento falle sin señales evidentes. Huawei cuenta desde hace años con CANN, su arquitectura de cómputo equivalente, pero su adopción fuera de proyectos impulsados por el Estado chino ha sido limitada precisamente por la escasez de herramientas maduras y de desarrolladores entrenados.

La estrategia de DeepSeek ataca ese problema en dos frentes. El primero es elevar el nivel de abstracción: TileLang permite escribir kernels en un lenguaje de alto nivel que el compilador traduce a cada arquitectura, del mismo modo en que Triton, impulsado por OpenAI, simplificó la programación sobre GPU. El segundo es la portabilidad deliberada: TileKernels y DeepGEMM mantienen interfaces idénticas en ambas plataformas, de modo que un equipo puede desarrollar sobre Nvidia y desplegar sobre Ascend con cambios mínimos. El objetivo estratégico es gradual: reducir el costo de salida de CUDA hasta que deje de ser disuasorio.

Que el impulso provenga de DeepSeek no es casual. El laboratorio construyó su reputación sobre la optimización de bajo nivel: su modelo V3 recurrió a programación en PTX, lenguaje intermedio de Nvidia, para exprimir hardware restringido. Esa competencia técnica, sumada a su comunidad de código abierto, es exactamente lo que el ecosistema de Huawei no tenía. Gregory Allen, del Center for Strategic and International Studies (CSIS), reconoce que esa combinación puede mejorar CANN, aunque advierte que desplazar cargas de trabajo desde CUDA llevará, probablemente, años.
 

El silicio chino y sus límites: Ascend 950, SMIC y la memoria

El software resuelve un cuello de botella, no todos. En la conferencia Huawei Connect del 17 de septiembre en Shanghái, el presidente rotativo Eric Xu admitió que la compañía no tiene capacidad suficiente para satisfacer siquiera la demanda china, razón por la cual no planea una expansión internacional significativa. Huawei adelantó el Ascend 960DT al primer trimestre de 2027 y mantiene una hoja de ruta anual hasta el Ascend 980 en 2029, con la meta de duplicar el cómputo en cada generación. En opinión de la prensa especializada, también elevó en torno a 60% el precio del 950DT por la estrechez de componentes.

Las estimaciones de Epoch AI dimensionan la brecha: alrededor de 1,5 millones de unidades Ascend en 2026, frente a unos 5,9 millones de aceleradores de Nvidia. La restricción más severa es la memoria de alto ancho de banda (HBM), cuyo acceso está limitado por los controles estadounidenses: sólo una fracción minoritaria de las unidades Ascend de este año incorpora HBM de fabricación nacional. A ello se suma la fabricación: los chips se producen en SMIC con un proceso de clase N+3, sin acceso a litografía ultravioleta extrema, lo que limita la densidad de transistores y el rendimiento por chip.

La respuesta de Huawei a esa limitación es arquitectónica: compensar la menor potencia individual con escala, interconectando cientos o miles de aceleradores en supernodos. El diseño de 128 chips acordado con DeepSeek se inscribe en esa lógica, que traslada el desafío al ancho de banda de la interconexión y al consumo energético. Es una solución viable en un país con abundante generación eléctrica y un Estado dispuesto a subsidiar la infraestructura, aunque menos eficiente por unidad de cómputo que la alternativa estadounidense.
 

Controles de exportación: qué erosiona el kit y qué no

La secuencia regulatoria explica el contexto. Desde octubre de 2022, la Oficina de Industria y Seguridad (BIS) del Departamento de Comercio restringió la venta de aceleradores avanzados a China; en octubre de 2023 amplió los criterios, y en abril de 2025 exigió licencia para el H20, el chip diseñado por Nvidia para cumplir con las reglas. En diciembre de 2025, la Administración Trump habilitó ventas del H200 a clientes aprobados con una participación del 25% de los ingresos para el gobierno federal, y en enero de 2026 BIS pasó a una revisión caso por caso. Pekín respondió en sentido contrario: sus aduanas bloquearon el ingreso del H200, las autoridades instruyeron a las empresas a no comprarlo salvo necesidad y, desde noviembre de 2025, los centros de datos con financiamiento estatal deben utilizar chips nacionales. El resultado es que la cuota de Nvidia en el mercado chino de aceleradores para IA pasó de alrededor de 95% a prácticamente cero, y sus envíos de la familia Hopper a China representaron menos del 1% de sus ingresos de centros de datos en el último trimestre.

Esa trayectoria contiene una paradoja que el kit de DeepSeek vuelve explícita. Los controles negaron a China el mejor hardware, pero la combinación con la política de sustitución de importaciones de Pekín le entregó a Huawei un mercado cautivo. La única ventaja estadounidense que seguía operando dentro de ese mercado era el software: aun sin chips de Nvidia, los desarrolladores chinos pensaban, escribían y probaban en CUDA. Un ecosistema abierto y portable sobre Ascend ataca, precisamente, esa última dependencia.

Sería lícito -y hasta aconsejable-, sin embargo, delimitar el alcance. El kit erosiona la eficacia de los controles sobre chips terminados, conforme reduce la penalización de usar el hardware disponible en China. No erosiona los controles sobre equipos de fabricación de semiconductores ni sobre HBM, que siguen fijando el techo de volumen y rendimiento de Huawei. La conclusión de esta redacción es que el centro de gravedad de la competencia se desplaza: con el software dejando de ser una barrera, la eficacia de la política estadounidense dependerá casi por completo de las restricciones sobre litografía, memoria y herramientas de fabricación, y de la coordinación con los Países Bajos, Japón y Corea del Sur.

Existe una lectura opuesta que merece consideración. Parte de la industria estadounidense sostiene que las restricciones aceleraron el desarrollo del ecosistema chino que pretendían contener, y que vender chips de Nvidia a China habría preservado la dependencia de CUDA. El argumento tiene un fundamento empírico en la evolución de 2026, aunque omite que la decisión de bloquear el H200 fue de Pekín, no de Washington: la voluntad china de autonomía tecnológica precede a los controles, y difícilmente se hubiera revertido con acceso comercial.
 

La bifurcación del stack: dos ecosistemas de IA

El lanzamiento acelera la formación de dos pilas tecnológicas paralelas: una estadounidense —Nvidia, CUDA, modelos cerrados de frontera y nubes norteamericanas— y otra china —Ascend, CANN, TileLang, modelos de pesos abiertos como los de DeepSeek y Qwen, y nubes de Huawei, Alibaba y Tencent—. La elección del código abierto no es sólo técnica: funciona como mecanismo de difusión geopolítica, porque permite que universidades, gobiernos y empresas de terceros países adopten las herramientas sin firmar contratos con proveedores chinos.

El límite de esa difusión, en el corto plazo, es industrial. Si Huawei no puede abastecer a su propio mercado, la pila china tendrá una proyección internacional acotada —ventas puntuales a Malasia o Egipto— hasta que su capacidad de fabricación aumente. El software, en cambio, se exporta sin restricciones de volumen: un desarrollador en São Paulo o en Santiago puede aprender TileLang hoy, aunque su centro de datos siga funcionando con Nvidia.

 

Conclusiones accionables

El kit de DeepSeek y Huawei no destrona a Nvidia, pero modifica la naturaleza de la competencia: el software deja de ser el ancla que mantenía a los desarrolladores chinos dentro del ecosistema estadounidense, y la contienda se reduce a la capacidad de fabricar chips y memoria. De ello se derivan pautas concretas:

  • Para los responsables de política tecnológica: la eficacia de los controles deberá medirse en equipos de fabricación, HBM y coordinación con aliados, no en ventas de chips terminados.
  • Para operadores de centros de datos latinoamericanos: evaluar la exposición a las reglas de BIS antes de considerar infraestructura Ascend, y priorizar arquitecturas de software portables que permitan cambiar de proveedor.
  • Para universidades y equipos de desarrollo: familiarizarse con lenguajes de abstracción como TileLang y Triton, que reducen la dependencia de una sola plataforma.
  • Para inversores: distinguir entre el riesgo de corto plazo para Nvidia, acotado dado que China ya no representa ingresos significativos, y el riesgo de largo plazo sobre su margen si la portabilidad se generaliza fuera de China.
  • Indicadores a seguir: verificación independiente del rendimiento de TileLang-Ascend, adopción por parte de otros laboratorios chinos, el ritmo de producción de HBM nacional, el cumplimiento del calendario del Ascend 960DT y nuevas acciones de BIS sobre equipos de fabricación.

Durante dos décadas, Nvidia ganó la competencia por la computación de IA antes de que comenzara, porque definió el lenguaje en que se escribía. Lo que DeepSeek y Huawei proponen es otro idioma. Su éxito no se medirá en semanas ni en cotizaciones bursátiles, sino en cuántos ingenieros, dentro y fuera de China, dejen de considerar a CUDA como el punto de partida obligado.


 

Redacción, El Ojo Digital