TL;DR

  • Kimi K2.5 hors service depuis le 31 août : le premier modèle multimodal à mille milliards de paramètres de Moonshot est retiré après seulement 7 mois — un cycle de vie éclair qui illustre la vitesse d’itération des labos chinois. Kimi K3 prend intégralement le relais.
  • Les finances de DeepSeek dévoilées (26 août) : ~475 M¥ de revenus sur les 7 premiers mois de 2026 (10× l’année 2025 entière), perte nette de ~715 M¥, mais ~11 Md¥ investis dans le compute — et des banques mandatées pour l’IPO STAR Market.
  • 千问创作 passe en mode studio (31 août) : la fonctionnalité Agent Teams orchestre des agents spécialisés (scénariste, réalisateur, directeur artistique…) pour produire des vidéos complètes sur Wan3.0, à partir d’une simple idée.
  • 寒序科技 (Hanxu) dévoile uHBM/uLPU (31 août) : architecture d’inférence à mémoire magnétique MRAM, 24 To/s de bande passante sur puce, objectif 2 000 tokens/s en decode — les poids ne « déménagent » plus.
  • Fenêtre globalement calme après la rafale d’annonces d’août (GLM-5.3 Flash, Hy4, Qwen3.8-Flash-Next) : pas de nouveau modèle majeur sur la période.

Actualités du jour

Kimi K2.5 retiré du service : 7 mois de vie pour un modèle à mille milliards de paramètres

Acteur : 月之暗面 Moonshot AI Apport clé : l’API kimi-k2.5 (et la série moonshot-v1) est hors ligne depuis le 31 août — les appels renvoient désormais une erreur 404 ; Kimi K3 (2,8T, attention linéaire hybride KDA, contexte 1M, couvert le 18 juillet) reprend l’intégralité du trafic, épaulé par kimi-2.6 et les modèles code kimi-k2.7-code Type de source : annonce officielle Moonshot (Weibo du 24 août + notification développeurs du 4 août) + reprises presse Benchmark vérifié : N/A — actualité de cycle de vie, pas de performance

Annoncée le 24 août, la « retraite » de K2.5 est effective depuis le 31 août. Le symbole est fort : le premier modèle multimodal à mille milliards de paramètres de Moonshot, sorti et open-sourcé en janvier 2026, n’aura servi que sept mois avant d’être remplacé. Ce cycle de vie éclair — à comparer aux 18–24 mois de service des générations occidentales équivalentes — traduit à la fois la vitesse d’itération des labos chinois et la pression économique : maintenir en production plusieurs générations coûte cher en compute, et la migration forcée vers K3 concentre les ressources sur la flotte la plus rentable. Pour les développeurs, la transition avait été préparée dès le 4 août avec un préavis d’un mois — court, mais dans les normes du marché chinois.

网易 — 月之暗面宣布Kimi K2.5月底“退役” 服役仅7个月网易, 24 août 2026 CNMO — 月之暗面Kimi K2.5今日正式下线 第一代万亿参数模型谢幕CNMO, 31 août 2026


Les comptes de DeepSeek mis à nu : hypercroissance, pertes maîtrisées, compute pharaonique

Acteur : 深度求索 DeepSeek Apport clé : revenus de ~475 M¥ sur janvier–juillet 2026 (≈ 10× le total 2025), perte nette de ~715 M¥, marge brute globale de 44,6 % (82,9 % sur l’API), mais ~11 Md¥ investis en infrastructure de calcul sur la période (23× les revenus) ; banques d’investissement mandatées pour préparer l’IPO Type de source : fuite via The Information (source non chinoise à l’origine), massivement relayée et recoupée par la presse chinoise (网易科技, 新浪科技, IT之家) Benchmark vérifié : N/A — données financières non auditées, à prendre avec prudence

Complément direct au feuilleton de la levée de fonds suivi dans le rapport du 29 août : au moment où la 2ᵉ levée (~50 Md¥, valorisation pré-money ~500 Md¥) se boucle, les chiffres d’exploitation de DeepSeek fuitent pour la première fois. La lecture est double. Côté commercial, la traction est réelle : 10× les revenus de 2025 en sept mois, portés par la montée de V4 et la hausse de tarifs d’août, avec une marge API de 82,9 % qui valide le modèle économique de l’inférence à bas coût. Côté structurel, les ~11 Md¥ de compute rappellent que la course reste une affaire de capital — et expliquent à la fois la levée en cours et la préparation de l’IPO sur le 科创板 (dépôt possible fin 2026, cotation visée 2027). Prudence toutefois : ces chiffres proviennent d’une fuite non auditée, DeepSeek n’a rien confirmé.

网易科技 — DeepSeek被曝前七个月收入4.75亿元,算力投入110亿元网易科技, août 2026 新浪科技 — 消息称 DeepSeek 今年前 7 个月营收近 4.75 亿元,达去年全年水平 10 倍新浪科技, 26 août 2026


Agent Teams : 千问创作 devient un studio de production vidéo multi-agents

Acteur : 阿里巴巴 / 通义千问 (Alibaba, Qwen) Apport clé : orchestration multi-agents (scénariste, réalisateur, directeur artistique, générateur vidéo…) au-dessus de Wan3.0 : l’utilisateur décrit une idée, les agents planifient, se répartissent les rôles et livrent la vidéo complète (script, personnages, storyboard, images, voix, musique, montage) ; jusqu’à 30 s en 720P, coût annoncé dès 0,26 ¥/s ; disponible sur 千问创作 PC et l’app 千问 Type de source : annonce officielle Alibaba + reprises (界面新闻, IT之家, 凤凰网) Benchmark vérifié : N/A — lancement produit ; coût par seconde auto-déclaré

Lancée le 31 août, Agent Teams déplace la frontière de la création vidéo : on ne rédige plus des prompts, on recrute une équipe. La mécanique illustre la stratégie d’agentification à marche forcée de l’écosystème 千问 (plateforme ouverte le 10 août, partenaires « fulfillment » type KFC/Luckin début juin) : chaque brique modèle (Wan3.0 pour la vidéo, couverte fin août pour son lancement du 24) est désormais enrobée dans une couche d’orchestration d’agents visant les usages professionnels — courts métrages, mini-drames animés (漫剧), clips musicaux, publicité. C’est aussi une réponse frontale aux plateformes de création américaines : le pari est que le multi-agents, plus que le modèle seul, fera la différence sur les flux de production complets.

界面新闻 — 千问创作上线Agent Teams功能界面新闻, 31 août 2026 IT之家 — 阿里千问创作上线 Agent Teams 功能:用户提出创意,Agent 规划任务完成视频制作IT之家, 31 août 2026


寒序科技 : l’inférence sans « déménagement » des poids, sur mémoire magnétique MRAM

Acteur : 寒序科技 Hanxu (startup issue de 北京大学, spécialiste du calcul magnétique) Apport clé : architecture d’inférence uHBM + uLPU : les poids du modèle résident en permanence dans des matrices Persistent MRAM, la multiplication matrice-vecteur s’effectue dans le même die Compute-Memory, seules les activations basse dimension circulent ; bande passante de lecture des poids sur puce annoncée à 24 To/s, objectif > 2 000 tokens/s en decode pour un backbone multimodal 4B ; gamme prévue du die au rack (uLPU Edge pour la robotique, uLPU Cloud extensible via UCIe) Type de source : annonce officielle + reprises (快科技, 雷锋网) ; produit en phase de convergence pré-tapeout Benchmark vérifié : non — valeurs de design auto-déclarées, aucun silicium fonctionnel public

L’annonce du 31 août ouvre un front original dans la course au compute domestique : plutôt que d’empiler de la HBM autour de GPU (l’approche 昇腾/Nvidia), Hanxu supprime le goulot d’étranglement en fusionnant stockage des poids et calcul dans la même puce, grâce à la MRAM — mémoire non volatile dont l’entreprise avait réalisé en mai le premier tape-out asiatique en eMRAM 8 nm. Si les valeurs de design se confirment sur silicium, l’approche viserait d’abord l’edge (robots, IA physique — thème consacré à la WRC 2026) avec des modèles compacts, avant le cloud. À ce stade, tout reste sur le papier : première puce complète attendue au tape-out, aucune évaluation indépendante. À suivre comme un signal de la diversification des architectures d’inférence chinoises au-delà du GPU, aux côtés des LPU et NPU.

快科技 — 2000 Tokens/s!寒序科技推出国产LPU推理芯片:让权重不再“搬家”快科技, 31 août 2026 雷锋网 — 独家丨直指2000 Tokens/s,北大系「流式推理芯片」公司完成数千万元融资雷锋网, août 2026


En bref

  • Hy4 preview : essai gratuit de deux semaines (1ᵉʳ septembre). Suite de la sortie couverte le 29 août : Tencent ouvre un essai gratuit de Hy4 preview sur la plateforme WorkBuddy pour pousser l’adoption, en réutilisant son blind test interne (2,99/4 vs 2,94 pour Kimi K3 et 2,92 pour GLM-5.3 — toujours auto-déclaré). (AI探索舰 / 心流社区, 1ᵉʳ septembre)

  • Rétrospective d’août : « la triple bascule ». Une synthèse de la communauté Aliyun résume le mois écoulé comme une triple bascule : architectures hybrides linéaire + sparse (GLM-5.3 Flash, Qwen3.8-Flash-Next), service sur puces domestiques à grande échelle, et ouverture des modèles de gamme Max. Une bonne lecture de consolidation avant la rentrée. (阿里云开发者社区)


Tableau récapitulatif

Modèle / ActuLaboApport cléLicence / ScoreSource (datée)
Kimi K2.5 hors serviceMoonshot 月之暗面Retrait après 7 mois ; K3 reprend tout le traficN/ACNMO, 31 août
Finances DeepSeekDeepSeek 深度求索475 M¥ / 7 mois (10× 2025), perte 715 M¥, 11 Md¥ computeNon audité (fuite The Information)新浪科技, 26 août
Agent Teams (千问创作)Alibaba 通义千问Studio vidéo multi-agents sur Wan3.0, 30 s / 720P, 0,26 ¥/sProduit fermé ; coût auto-déclaré界面新闻, 31 août
uHBM / uLPUHanxu 寒序科技Inférence MRAM in-memory, 24 To/s, cible 2 000 tok/s (4B)Pré-tapeout ; design auto-déclaré快科技, 31 août
Essai gratuit Hy4 previewTencent 混元2 semaines gratuites sur WorkBuddyOpen source (déjà couvert)心流社区, 1ᵉʳ sept.

Sources