TL;DR

  • Rattrapage de cinq semaines : le dernier rapport de cette veille datait du 2 septembre. Ce numéro couvre donc la fenêtre du 2 septembre au 10 octobre, en privilégiant les faits les plus récents (début octobre) et en datant chaque élément.
  • Zhipu dévoile sa feuille de route (8 octobre) : GLM-5.4/5.5 passera de ~740 Md à au moins 1 000 Md de paramètres, avec deux axes revendiqués comme inédits — le RSI (auto-amélioration récursive) et les agents à horizon long. Le « fully self-training » intégral reste réservé à GLM-6.
  • 23ᵉ semaine consécutive devant les États-Unis (données du 28 sept. au 4 oct.) : 57,46 T de tokens/semaine pour les modèles chinois contre 16,2 T pour les américains sur OpenRouter — et un modèle anonyme, « Space Bunny Alpha », rafle la première place mondiale avec 38,7 T de tokens (+179 %), soupçonné d’être un MiniMax.
  • Huawei HC 2026 (Shanghai, début octobre) : nouvelle architecture Peerium + bus UnifiedBus (灵衢), cluster Atlas 950 à 256 000 cartes en déploiement de test, et Xu Zhijun affirmant que la part de marché d’Ascend en Chine dépasse désormais celle de Nvidia — chiffre maison, à prendre comme tel.
  • Gartner publie son premier Magic Quadrant « fournisseurs de modèles GenAI » (septembre, relayé le 9 octobre) : 5 chinois sur 15 évalués, Alibaba Cloud seul chinois en « Leader », Moonshot et Zhipu en « Visionnaires », DeepSeek et MiniMax en « Niche Players ».
  • Moonshot boucle son dernier tour pré-IPO (6 octobre) : valorisation ~50 Md $, introduction visée à Hong Kong au T1 2027, après six tours de table en six mois.
  • IQuest-Q1 open source (28–29 septembre) : un entrant peu connu, 至知创新 (IQuest Research), publie un MoE 320 Md paramètres / 15 Md activés, contexte 524 K, taillé pour le code agentique.

Actualités du jour

Zhipu cadre GLM-5.4/5.5 : le trillion de paramètres, puis l’auto-amélioration

Acteur : 智谱 Zhipu AI / Z.ai Apport clé : passage de ~740 Md à ≥ 1 000 Md de paramètres, données de pré-entraînement portées à « plusieurs T », renforcement du post-training (SFT, RLHF, RLVR), et deux chantiers présentés comme les vraies frontières : le RSI (recursive self-improvement) et les agents à horizon long Type de source : propos publics du fondateur Tang Jie (唐杰) lors d’une conférence à Singapour, rapportés par 快科技 et relayés par 新浪科技 Benchmark vérifié : N/A — annonce de feuille de route, aucun modèle ni score

C’est l’information la plus structurante de la fenêtre, et elle ne porte sur aucun modèle existant. Tang Jie décrit trois leviers pour la prochaine génération GLM : élargir le pré-entraînement, durcir le RL post-entraînement — domaine où Zhipu s’est taillé une réputation de « maître du post-training » dans la communauté chinoise — et pousser le raisonnement long et l’agentivité, avec des environnements plus complexes et des tâches à cycle plus long.

Le plus intéressant est le cadrage stratégique : selon lui, l’IA n’a plus grand-chose à gagner à « se battre sur la conversation et le code ». Les deux routes encore vierges seraient l’itération autonome du modèle sur lui-même (RSI) et l’agent réellement long et autonome. La définition qu’il avait donnée fin août en conférence de résultats — un modèle capable de s’entraîner lui-même du pré-entraînement au post-entraînement, le « fully self-training » — était alors attribuée à GLM-6 ; GLM-5.4/5.5 n’en porterait que des résultats partiels. Tang Jie identifie d’ailleurs lui-même le verrou : non pas grossir le modèle, mais lui apprendre à juger « quand s’arrêter et quand se corriger ».

À retenir comme intention déclarée, pas comme réalisation. Aucune date, aucun chiffre vérifiable, et l’écart entre un discours de conférence et une model card peut être large.

新浪科技 / 快科技 — 智谱暗示新一代GLM-5.4/5.5大模型:参数量万亿以上、技术要走2条新路 — 新浪科技 (reprise 快科技), 8 octobre 2026


23ᵉ semaine en tête : 57,46 T de tokens chinois, et un modèle fantôme en pole position

Acteur : écosystème chinois dans son ensemble (mesure OpenRouter) Apport clé : semaine du 28 septembre au 4 octobre — 166 T de tokens appelés dans le monde (+13,69 %), dont 57,46 T pour les modèles chinois contre 16,2 T pour les américains ; quatre des cinq premiers modèles mondiaux sont chinois ; un modèle anonyme, Space Bunny Alpha (« 太空兔 »), prend la 1ʳᵉ place avec 38,7 T (+179 %) Type de source : calculs de presse chinoise à partir des données publiques OpenRouter Benchmark vérifié : données tierces (OpenRouter), mais mesure d’usage sur une seule plateforme — pas une part de marché globale

Le détail du classement est plus instructif que le total. DeepSeek V4.1 Flash est 2ᵉ avec 25,6 T (+31 %) — cohérent avec sa place de nouveau n°1 des classements code chez DataLearner. GLM-5.3 Flash tombe à 9,73 T (−40 %), MiMo-V2.6-Flash de Xiaomi monte à 9,63 T (+75 %), et Hy4 preview de Tencent recule à 6,51 T (−32 %). Autrement dit : la demande se concentre sur la catégorie « Flash » — rapide, bon marché, bon en code — et les positions y changent de main en quelques semaines.

Le cas Space Bunny Alpha mérite l’attention. Mis en ligne sur OpenRouter le 23 septembre, ce modèle anonyme revendique inférence rapide, programmation, contexte 1 M tokens, entrées texte/image/vidéo, intensité de raisonnement réglable et appel d’outils. Un test d’empreinte de tokenizer sur 50 chaînes donne un comptage identique à celui de la série MiniMax, d’où l’hypothèse — non confirmée officiellement — d’un MiniMax en pré-lancement. À rapprocher du MiniMax M3.1 Flash preview apparu le 27 septembre dans les bases de suivi.

Deux réserves. D’abord, OpenRouter est un routeur pour développeurs : il échantillonne mal les usages grand public et les déploiements d’entreprise directs. Ensuite, un modèle furtif et gratuit ou subventionné peut gonfler un classement sans signifier grand-chose sur l’adoption durable.

搜狐 / 93913 — 中国AI大模型调用量连续二十三周领跑:匿名模型”太空兔”冲上榜首,环比增长179% — 搜狐, 6 octobre 2026 DataLearner — AI大模型最新动态 — DataLearner, consulté le 10 octobre 2026


Huawei HC 2026 : l’architecture Peerium, le bus UnifiedBus, et un cluster à 256 000 cartes

Acteur : 华为 Huawei (Xu Zhijun 徐直军, président tournant ; Liao Heng 廖恒, scientifique en chef HiSilicon) Apport clé : architecture de calcul Peerium (parallélisme imbriqué, adressage mémoire unifié, interconnexion « entre égaux » pour passer à l’échelle du million de processeurs, modèle Nested BSP) ; bus UnifiedBus / 灵衢 unifiant scale-up et scale-out sous un seul protocole (≈ 150 ns de traversée, jusqu’à 800 Go/s inter-baies) ; super-nœud Atlas 950 et cluster 256 000 cartes en déploiement et test ; module optique Hi-ONE NPO à 7,2 T avec source lumineuse embarquée Type de source : conférence de presse officielle post-keynote, transcrite par 界面新闻 et relayée par 新浪科技 Benchmark vérifié : non — part de marché, bandes passantes et calendriers sont des chiffres Huawei, sans validation tierce

Le fond technique est le point saillant : Huawei assume ne pas pouvoir rivaliser au niveau de la puce unique (limite de procédé domestique) et déplace entièrement le combat sur l’interconnexion et l’architecture système. L’argument chiffré contre Nvidia est précis : un NVL72 offre 1,8 To/s dans la baie mais chute à 0,2 To/s dès qu’on en sort, alors qu’UnifiedBus viserait 800 Go/s entre baies avec un protocole unique — évitant les conversions NVLink↔InfiniBand que Liao Heng estime coûteuses de l’ordre de la microseconde. Huawei dit aussi avoir livré plus de mille super-nœuds 910C à 384 cartes.

Côté calendrier et capacité : le 950PR, orienté inférence, est sorti en premier mais en volumes modestes ; le super-nœud 950DT, destiné à l’entraînement, est encore en test, avec livraison en volume annoncée pour fin 2026 ou début 2027. Xu Zhijun est explicite sur le goulot : ce n’est plus la demande, c’est la capacité de production — et il situe l’équilibre offre/demande mondial autour de 2029, plus tard encore pour la Chine.

Deux déclarations méritent d’être isolées. D’une part, la part de marché : « si l’on s’en tient aux données que nous pouvons mesurer, Ascend aurait dépassé Nvidia » en Chine — formulation prudente, qui circule ensuite dans la presse sous la forme beaucoup plus affirmative d’un 50 % contre 8 %. Mieux vaut traiter ce chiffre comme une revendication interne non auditée. D’autre part, la projection de Liao Heng sur le dimensionnement : il justifie les ~200 000 à 256 000 cartes par l’attente de 6 à 7 laboratoires frontières chinois dans les deux ans, visant des modèles de 10 000 à 40 000 milliards de paramètres — et par les limites d’alimentation électrique d’un parc de data centers raccordé au réseau national. C’est, en creux, la prévision de compute la plus concrète qu’un industriel chinois ait livrée récemment.

Enfin, l’aveu le plus intéressant vient du logiciel : Liao Heng reconnaît qu’il y a deux ans le vrai obstacle d’Ascend n’était pas le matériel mais l’écosystème face à CUDA, et considère que les 18 derniers mois ont rééquilibré la situation — les laboratoires de pointe écrivant désormais des noyaux à très grande échelle plutôt que du PyTorch standard, ce qui érode l’avantage historique de CUDA. Affirmation de partie intéressée, mais elle rejoint ce qu’on observe sur l’outillage.

新浪科技 / 界面新闻 — 华为徐直军:昇腾中国市场份额已超英伟达,中国芯片自主化是必然之路 — 新浪科技 (reprise 界面新闻), 6 octobre 2026


Gartner classe les labos chinois : Alibaba Cloud seul « Leader », DeepSeek relégué en « Niche »

Acteur : Alibaba Cloud 阿里云, Moonshot 月之暗面, Zhipu 智谱, DeepSeek 深度求索, MiniMax Apport clé : premier Magic Quadrant des fournisseurs de modèles GenAI (publié en septembre, analysé par la presse chinoise le 9 octobre) : 5 chinois sur 15 évalués ; Alibaba Cloud en « Leader », Moonshot et Zhipu en « Visionnaires », DeepSeek et MiniMax en « Niche Players » Type de source : rapport d’analyste occidental, lecture et contextualisation par TechWeb / 新浪科技 (l’étude source n’est pas chinoise ; l’analyse citée l’est) Benchmark vérifié : N/A — évaluation d’analyste, pas un benchmark technique

L’intérêt n’est pas le palmarès mais les critères, qui expliquent des positions contre-intuitives. Alibaba Cloud est crédité d’un portefeuille complet à toutes les tailles, majoritairement en poids ouverts sous licence permissive, et surtout d’une intégration verticale modèle–puce–cloud financée par les activités rentables du groupe. Zhipu est salué pour sa cadence de sorties et sa couverture de toutes les gammes en open weights, mais pénalisé pour une infrastructure et un support concentrés en Asie-Pacifique. Moonshot est reconnu comme moteur de l’innovation en poids ouverts avec Kimi K3, mais critiqué sur le tarif de son API phare et sur l’imprévisibilité des coûts quand le raisonnement avancé consomme de très longs contextes.

Le cas DeepSeek est le plus frappant : Gartner loue la transparence architecturale et le prix de l’API, mais juge les modèles « en retard sur les meilleures alternatives en poids ouverts » dans leurs catégories respectives, avec une cadence de publication lente. MiniMax est reconnu pour son multimodal large (texte, voix, image, vidéo, musique) mais pénalisé par une gamme de tailles étroite.

Ce qui ressort : la ligne de partage n’est plus la performance brute mais la capacité à mobiliser une infrastructure à grande échelle et à offrir conformité et opérations mondiales. À noter, pour les deux « visionnaires », un modèle commun de sortie à l’international en actif léger — Kimi K3 et la série GLM sont disponibles sur Amazon Bedrock en partage de revenus, ce qui limite les besoins en capital mais dépend entièrement de la tolérance des clouds occidentaux aux modèles chinois.

新浪科技 / TechWeb — Gartner首份AI模型魔力象限:阿里云主桌,中国五强各显神通 — 新浪科技 (reprise TechWeb), 9 octobre 2026


Moonshot termine son dernier tour privé : ~50 Md $ de valorisation, IPO visée au T1 2027 à Hong Kong

Acteur : 月之暗面 Moonshot AI (Yang Zhilin 杨植麟) Apport clé : dernier tour pré-IPO bouclé à une valorisation d’environ 50 Md $ ; préparation d’une introduction à Hong Kong au premier trimestre 2027, premières rencontres investisseurs possibles dès octobre ; transformation statutaire en société par actions (股份有限公司), signal classique de préparation de cotation Type de source : sources proches du dossier, rapportées par 红星资本局 et relayées par 新浪科技 Benchmark vérifié : N/A — information de marché non confirmée par l’entreprise

La trajectoire de valorisation sur l’année est vertigineuse et vaut d’être posée telle quelle : ~10 Md $ en janvier-février (trois tours consécutifs) → 18 Md $ → 20 Md $ en mai (série D) → 31,5 Md $ pré-money en juin (série E) → 35 Md $ en juillet (série F) → ~50 Md $ aujourd’hui. Six tours en six mois.

Le moteur affiché est Kimi K3 (2 800 Md de paramètres, couvert dans le rapport du 18 juillet) : saturation du service deux jours après la mise en ligne, première place du classement tendances de Hugging Face en trente minutes, et selon la présidente Zhang Yutong, une croissance de l’ARR entreprise « multipliée » après la sortie — l’ARR ayant franchi 300 M $ à la mi-juin.

Mise en perspective utile : DeepSeek prépare de son côté une IPO sur le STAR Market (voir le rapport du 2 septembre), avec des revenus de ~475 M¥ sur sept mois. Deux dossiers, deux places de cotation, et un même constat — la phase « financée par le capital-risque » du secteur chinois arrive à son terme, ce qui va forcer les labos à exposer des chiffres.

新浪科技 / 红星资本局 — 月之暗面已完成IPO前最后一轮融资,正推进明年第一季度赴港上市 — 新浪科技 (reprise 红星资本局), 6 octobre 2026


IQuest-Q1 : un inconnu ouvre un MoE 320 Md avec seulement 15 Md de paramètres activés

Acteur : 至知创新研究院 IQuest Research (équipe peu connue jusqu’ici) Apport clé : modèle open weights IQuest-Q1 — Transformer decoder-only + MoE creux, ~320 Md de paramètres totaux pour ~15 Md activés par token (ratio de parcimonie ≈ 20:1), 88 couches, 256 experts dont 8 actifs, attention hybride (3 couches à fenêtre glissante pour 1 couche d’attention complète), contexte 524 288 tokens ; poids sur Hugging Face, code d’inférence sur GitHub ; intégration annoncée avec Claude Code et Codex CLI Type de source : blog technique et dépôts officiels de l’équipe + analyses de presse chinoise (钛媒体, 凤凰网) Benchmark vérifié : non — scores auto-déclarés, pas encore d’évaluation OpenCompass / SuperCLUE / FlagEval indépendante

Les poids sont apparus sur Hugging Face le 28 septembre, l’annonce formelle le 29, et une campagne de communication internationale a suivi le 9 octobre — d’où le sentiment trompeur d’une sortie d’octobre.

Le pari technique est clair et mérite d’être noté pour lui-même : l’équipe n’a pas cherché à empiler du paramètre total mais à écraser le paramètre activé. La logique est celle du coût d’un agent : un modèle ne devient pas cher parce qu’il répond à une question, il devient cher quand il relit des fichiers, appelle des outils et révise sa sortie en boucle jusqu’à terminer la tâche. Un budget de 15 Md activés place l’inférence dans une zone soutenable pour un poste de développeur, un petit cluster ou un déploiement interne — ce qui est précisément le créneau visé.

Côté méthode, le point distinctif est la Multi-Teacher On-Policy Distillation (MOPD) : compresser les forces de plusieurs modèles enseignants dans un modèle à faible activation, au terme d’un pipeline en trois temps (pré-entraînement → entraînement intermédiaire → post-entraînement avec SFT et RL ciblés sur l’ingénierie logicielle, les tâches longues et le raisonnement général).

Scores annoncés (tous auto-déclarés) : 64,6 sur DeepSWE v1.1, 63,0 sur NL2Repo, 84,5 sur CyberGym, 83,2 sur Terminal-Bench 2.1, 55,7 sur JobBench et 29,6 sur Agents’ Last Exam. À confirmer par un tiers avant d’en tirer quoi que ce soit.

Détail peut-être plus durable que le modèle : l’équipe a aussi publié son processus de R&D, dans lequel le modèle participe au diagnostic de ses propres capacités, à la conception de plans d’entraînement et à l’exécution d’une partie des expériences, les chercheurs humains gardant la décision sur l’orientation, les expériences coûteuses et l’adoption des versions. Qualifié d’« étape précoce » par ses auteurs — mais c’est le même thème que le RSI évoqué par Zhipu plus haut, vu depuis l’atelier.

IQuest Research — IQuest-Q1: Advancing Foundation Capabilities for Agentic CLI Systems — blog officiel (en anglais), septembre 2026 钛媒体 — IQuest-Q1 开源:「小激活」撬动「大任务」 — 钛媒体, 29 septembre 2026 凤凰网 — 刚刚,320B中国开源黑马杀出!模型自己抓Bug,凶手是一个空格 — 凤凰网, septembre 2026


En bref

  • Vidu Q4 Preview : la vidéo générée passe à la facturation « en centimes » (8 octobre). 生数科技 (Shengshu) sort la première préversion de son nouveau modèle vidéo phare : jusqu’à 15 images de référence et 3 segments audio, sorties 540P à 4K, 16 s maximum par génération, à partir de 0,09 ¥/s en tarif de lancement. L’entreprise revendique environ 5× plus de vidéo à budget constant à spécifications comparables — chiffre maison. À rapprocher d’Agent Teams côté Alibaba (rapport du 2 septembre) : l’offensive chinoise sur la vidéo générative se joue désormais autant sur le prix que sur la qualité. (IT之家, 新浪财经)

  • CAC : 1 112 services d’IA générative enregistrés au 31 août (annonce du 14 septembre). Le 国家网信办 publie son avis périodique : +124 services enregistrés (备案) sur juillet-août, dont 7 services d’IA générative embarqués sur mobile (Apple Intelligence, Xiaoyi de Huawei, AndesGPT d’OPPO, BlueLM de vivo, Xiaomi HyperAI, Galaxy AI de Samsung, Doubao sur nubia), plus 133 applications enregistrées au niveau local. Cumul : 1 112 services et 731 applications ou fonctions. Le franchissement du millier est symbolique mais le rythme reste stable — l’enregistrement est devenu une formalité industrielle plutôt qu’un filtre. (新浪财经, CAC)

  • Rappel de contexte : la fenêtre de septembre a été dense côté modèles. Pour mémoire, et sans détailler faute de place : Qwen3.8-Max-0902 (2 400 Md param., 2 sept.), MiniCPM5-2B (OpenBMB, 7 sept.), Intern-S2-397B (Shanghai AI Lab, 9 sept.), DeepSeek-V4.1-Flash (552 Md, 10 sept.), Kimi K2.8 Preview (11 sept.), la série audio/image Qwen (18–22 sept.), Step 5 Preview (StepFun, 600 Md, 20 sept.), MiMo-V2.6 Pro/Flash/Pro-UltraSpeed (Xiaomi, 22 sept.) et MiniMax M3.1 Flash preview (27 sept.). Ces sorties feront l’objet d’un traitement individuel si elles produisent des résultats indépendants vérifiables. (DataLearner)


Tableau récapitulatif

Modèle / ActuLaboApport cléLicence / ScoreSource (datée)
Feuille de route GLM-5.4/5.5Zhipu 智谱≥ 1 000 Md param., RSI partiel, agents longsAnnonce de roadmap, aucun score新浪科技, 8 oct.
Classement OpenRouter S40Écosystème CN57,46 T tokens/sem. vs 16,2 T US ; 4 modèles CN dans le top 5Données tierces (une plateforme)搜狐, 6 oct.
Space Bunny AlphaMiniMax ? (non confirmé)38,7 T tokens/sem. (+179 %), contexte 1 M, multimodalIdentité non confirmée搜狐, 6 oct.
Peerium + UnifiedBusHuawei 华为Million de processeurs vus comme une machine ; 800 Go/s inter-baiesChiffres maison, non audités新浪科技, 6 oct.
Magic Quadrant GenAI5 labos chinoisAlibaba Cloud seul « Leader » chinois ; DeepSeek en « Niche »Évaluation analyste (source non chinoise)新浪科技, 9 oct.
Tour pré-IPOMoonshot 月之暗面~50 Md $ de valorisation ; IPO HK visée T1 2027Non confirmé par l’entreprise新浪科技, 6 oct.
IQuest-Q1IQuest Research 至知MoE 320 Md / 15 Md actifs, contexte 524 K, code agentiqueOpen weights ; scores auto-déclarés钛媒体, 29 sept.
Vidu Q4 PreviewShengshu 生数科技Vidéo 4K, 15 images de réf., dès 0,09 ¥/sProduit fermé ; gains auto-déclarésIT之家, 8 oct.
1 112 备案 cumulésCAC 国家网信办+124 services (juil.–août), +133 applicationsDonnée officielle新浪财经, 14 sept.

Sources