Le 30 septembre, DeepSeek a annoncé travailler avec Huawei sur des outils pour les accélérateurs Ascend et a ouvert des composants logiciels associés. C’est une étape vers le développement d’une plateforme matérielle alternative, mais pas la preuve qu’elle est prête à remplacer CUDA et Nvidia dans des systèmes de production. L’annonce ne remonte pas aux dernières 24 heures à la date de cette analyse, le 2 octobre 2026 ; il est donc plus juste de la qualifier de nouvelle récente.
Le compte rendu de Reuters porte sur l’infrastructure destinée à Huawei Ascend : TileLang et des bibliothèques de calcul et de communication entre puces. Reuters rapporte également l’annonce d’un développement conjoint d’un supernœud doté de 128 puces Ascend 950. Il s’agit d’une déclaration des participants au projet ; les sources examinées ne proposent aucune comparaison indépendante des performances de ce système avec une configuration Nvidia équivalente.
Ce qui a été publié
Le dépôt DeepGEMM-Ascend annonce la prise en charge d’Ascend 950 et des opérations BF16, FP8 et FP4. Le projet présente cette bibliothèque comme compatible au niveau de l’API avec DeepGEMM, tout en signalant certaines différences : par exemple, le format de stockage des facteurs d’échelle sur Ascend diffère de celui de Nvidia. La documentation indique que l’environnement nécessite CANN, torch_npu et le compilateur Bisheng. La compatibilité des interfaces ne signifie donc pas que le code peut être transféré d’une plateforme à l’autre sans tenir compte de leurs spécificités.
Le même dépôt publie des mesures réalisées par le projet sur Ascend 950DT. Ce sont des résultats du projet, et non une vérification indépendante des performances sur des charges de production réelles.
La bibliothèque DeepEP-Ascend est destinée aux échanges de données lors de l’entraînement et de l’inférence, notamment dans les modèles Mixture-of-Experts. Sa documentation précise que les mesures ont été effectuées sur une version de test du matériel et des logiciels fournie par DeepSeek — le PoC HDK — avec des réglages manuels supplémentaires. Cette configuration n’a pas été distribuée publiquement. Huawei prévoyait de commercialiser le HDK vers la mi-octobre 2026 ; il s’agit d’un calendrier indiqué dans la documentation, et non d’une date de sortie confirmée.
TileLang n’a pas non plus été lancé avec l’annonce actuelle : l’historique de TileLang-Ascend indique que le projet est devenu public le 29 septembre 2025. La nouvelle porte sur une nouvelle étape de la collaboration et sur les bibliothèques associées, et non sur le lancement de TileLang à partir de zéro.
Ce qui n’est pas encore démontré
Un langage de programmation peut simplifier la création de noyaux de calcul, mais remplacer une plateforme en pratique exige aussi des compilateurs, des bibliothèques, des outils de débogage, la prise en charge des frameworks et du matériel accessible. Les dépôts ouverts permettent d’étudier le code et les interfaces annoncées, mais ne montrent pas dans quelle mesure il est facile ou peu coûteux de transférer des charges de production vers Ascend.
Pour DeepEP-Ascend, la réserve sur les conditions de test est particulièrement importante : les mesures publiées ont été obtenues sur une configuration de test non publique. Et les mesures portant sur des opérations isolées, même reproductibles, ne répondent pas à elles seules aux questions de stabilité et de performances globales d’un système complet.
La publication du code, la documentation et les exigences d’environnement indiquées sont confirmées. En revanche, les performances des nouvelles bibliothèques, la large disponibilité de la configuration annoncée et la facilité d’intégration dans les flux de travail existants n’ont pas encore été confirmées par des tests indépendants.
Il est donc plus juste de considérer cette annonce comme une tentative de renforcer l’écosystème logiciel autour d’Ascend. La valeur pratique de ces outils se précisera lorsque seront disponibles un environnement commercial accessible, des tests indépendants et reproductibles, ainsi que des rapports détaillés sur le transfert de charges de travail réelles. Il s’agit aujourd’hui d’une étape concrète dans la bataille pour la couche logicielle, et non d’une preuve que CUDA a été remplacé.