TL;DR
- Kimi K2.5 hors service depuis le 31 août : le premier modèle multimodal à mille milliards de paramètres de Moonshot est retiré après seulement 7 mois — un cycle de vie éclair qui illustre la vitesse d’itération des labos chinois. Kimi K3 prend intégralement le relais.
- Les finances de DeepSeek dévoilées (26 août) : ~475 M¥ de revenus sur les 7 premiers mois de 2026 (10× l’année 2025 entière), perte nette de ~715 M¥, mais ~11 Md¥ investis dans le compute — et des banques mandatées pour l’IPO STAR Market.
- 千问创作 passe en mode studio (31 août) : la fonctionnalité Agent Teams orchestre des agents spécialisés (scénariste, réalisateur, directeur artistique…) pour produire des vidéos complètes sur Wan3.0, à partir d’une simple idée.
- 寒序科技 (Hanxu) dévoile uHBM/uLPU (31 août) : architecture d’inférence à mémoire magnétique MRAM, 24 To/s de bande passante sur puce, objectif 2 000 tokens/s en decode — les poids ne « déménagent » plus.
- Fenêtre globalement calme après la rafale d’annonces d’août (GLM-5.3 Flash, Hy4, Qwen3.8-Flash-Next) : pas de nouveau modèle majeur sur la période.
Actualités du jour
Kimi K2.5 retiré du service : 7 mois de vie pour un modèle à mille milliards de paramètres
Acteur : 月之暗面 Moonshot AI Apport clé : l’API kimi-k2.5 (et la série moonshot-v1) est hors ligne depuis le 31 août — les appels renvoient désormais une erreur 404 ; Kimi K3 (2,8T, attention linéaire hybride KDA, contexte 1M, couvert le 18 juillet) reprend l’intégralité du trafic, épaulé par kimi-2.6 et les modèles code kimi-k2.7-code Type de source : annonce officielle Moonshot (Weibo du 24 août + notification développeurs du 4 août) + reprises presse Benchmark vérifié : N/A — actualité de cycle de vie, pas de performance
Annoncée le 24 août, la « retraite » de K2.5 est effective depuis le 31 août. Le symbole est fort : le premier modèle multimodal à mille milliards de paramètres de Moonshot, sorti et open-sourcé en janvier 2026, n’aura servi que sept mois avant d’être remplacé. Ce cycle de vie éclair — à comparer aux 18–24 mois de service des générations occidentales équivalentes — traduit à la fois la vitesse d’itération des labos chinois et la pression économique : maintenir en production plusieurs générations coûte cher en compute, et la migration forcée vers K3 concentre les ressources sur la flotte la plus rentable. Pour les développeurs, la transition avait été préparée dès le 4 août avec un préavis d’un mois — court, mais dans les normes du marché chinois.
网易 — 月之暗面宣布Kimi K2.5月底“退役” 服役仅7个月 — 网易, 24 août 2026 CNMO — 月之暗面Kimi K2.5今日正式下线 第一代万亿参数模型谢幕 — CNMO, 31 août 2026
Les comptes de DeepSeek mis à nu : hypercroissance, pertes maîtrisées, compute pharaonique
Acteur : 深度求索 DeepSeek Apport clé : revenus de ~475 M¥ sur janvier–juillet 2026 (≈ 10× le total 2025), perte nette de ~715 M¥, marge brute globale de 44,6 % (82,9 % sur l’API), mais ~11 Md¥ investis en infrastructure de calcul sur la période (23× les revenus) ; banques d’investissement mandatées pour préparer l’IPO Type de source : fuite via The Information (source non chinoise à l’origine), massivement relayée et recoupée par la presse chinoise (网易科技, 新浪科技, IT之家) Benchmark vérifié : N/A — données financières non auditées, à prendre avec prudence
Complément direct au feuilleton de la levée de fonds suivi dans le rapport du 29 août : au moment où la 2ᵉ levée (~50 Md¥, valorisation pré-money ~500 Md¥) se boucle, les chiffres d’exploitation de DeepSeek fuitent pour la première fois. La lecture est double. Côté commercial, la traction est réelle : 10× les revenus de 2025 en sept mois, portés par la montée de V4 et la hausse de tarifs d’août, avec une marge API de 82,9 % qui valide le modèle économique de l’inférence à bas coût. Côté structurel, les ~11 Md¥ de compute rappellent que la course reste une affaire de capital — et expliquent à la fois la levée en cours et la préparation de l’IPO sur le 科创板 (dépôt possible fin 2026, cotation visée 2027). Prudence toutefois : ces chiffres proviennent d’une fuite non auditée, DeepSeek n’a rien confirmé.
网易科技 — DeepSeek被曝前七个月收入4.75亿元,算力投入110亿元 — 网易科技, août 2026 新浪科技 — 消息称 DeepSeek 今年前 7 个月营收近 4.75 亿元,达去年全年水平 10 倍 — 新浪科技, 26 août 2026
Agent Teams : 千问创作 devient un studio de production vidéo multi-agents
Acteur : 阿里巴巴 / 通义千问 (Alibaba, Qwen) Apport clé : orchestration multi-agents (scénariste, réalisateur, directeur artistique, générateur vidéo…) au-dessus de Wan3.0 : l’utilisateur décrit une idée, les agents planifient, se répartissent les rôles et livrent la vidéo complète (script, personnages, storyboard, images, voix, musique, montage) ; jusqu’à 30 s en 720P, coût annoncé dès 0,26 ¥/s ; disponible sur 千问创作 PC et l’app 千问 Type de source : annonce officielle Alibaba + reprises (界面新闻, IT之家, 凤凰网) Benchmark vérifié : N/A — lancement produit ; coût par seconde auto-déclaré
Lancée le 31 août, Agent Teams déplace la frontière de la création vidéo : on ne rédige plus des prompts, on recrute une équipe. La mécanique illustre la stratégie d’agentification à marche forcée de l’écosystème 千问 (plateforme ouverte le 10 août, partenaires « fulfillment » type KFC/Luckin début juin) : chaque brique modèle (Wan3.0 pour la vidéo, couverte fin août pour son lancement du 24) est désormais enrobée dans une couche d’orchestration d’agents visant les usages professionnels — courts métrages, mini-drames animés (漫剧), clips musicaux, publicité. C’est aussi une réponse frontale aux plateformes de création américaines : le pari est que le multi-agents, plus que le modèle seul, fera la différence sur les flux de production complets.
界面新闻 — 千问创作上线Agent Teams功能 — 界面新闻, 31 août 2026 IT之家 — 阿里千问创作上线 Agent Teams 功能:用户提出创意,Agent 规划任务完成视频制作 — IT之家, 31 août 2026
寒序科技 : l’inférence sans « déménagement » des poids, sur mémoire magnétique MRAM
Acteur : 寒序科技 Hanxu (startup issue de 北京大学, spécialiste du calcul magnétique) Apport clé : architecture d’inférence uHBM + uLPU : les poids du modèle résident en permanence dans des matrices Persistent MRAM, la multiplication matrice-vecteur s’effectue dans le même die Compute-Memory, seules les activations basse dimension circulent ; bande passante de lecture des poids sur puce annoncée à 24 To/s, objectif > 2 000 tokens/s en decode pour un backbone multimodal 4B ; gamme prévue du die au rack (uLPU Edge pour la robotique, uLPU Cloud extensible via UCIe) Type de source : annonce officielle + reprises (快科技, 雷锋网) ; produit en phase de convergence pré-tapeout Benchmark vérifié : non — valeurs de design auto-déclarées, aucun silicium fonctionnel public
L’annonce du 31 août ouvre un front original dans la course au compute domestique : plutôt que d’empiler de la HBM autour de GPU (l’approche 昇腾/Nvidia), Hanxu supprime le goulot d’étranglement en fusionnant stockage des poids et calcul dans la même puce, grâce à la MRAM — mémoire non volatile dont l’entreprise avait réalisé en mai le premier tape-out asiatique en eMRAM 8 nm. Si les valeurs de design se confirment sur silicium, l’approche viserait d’abord l’edge (robots, IA physique — thème consacré à la WRC 2026) avec des modèles compacts, avant le cloud. À ce stade, tout reste sur le papier : première puce complète attendue au tape-out, aucune évaluation indépendante. À suivre comme un signal de la diversification des architectures d’inférence chinoises au-delà du GPU, aux côtés des LPU et NPU.
快科技 — 2000 Tokens/s!寒序科技推出国产LPU推理芯片:让权重不再“搬家” — 快科技, 31 août 2026 雷锋网 — 独家丨直指2000 Tokens/s,北大系「流式推理芯片」公司完成数千万元融资 — 雷锋网, août 2026
En bref
-
Hy4 preview : essai gratuit de deux semaines (1ᵉʳ septembre). Suite de la sortie couverte le 29 août : Tencent ouvre un essai gratuit de Hy4 preview sur la plateforme WorkBuddy pour pousser l’adoption, en réutilisant son blind test interne (2,99/4 vs 2,94 pour Kimi K3 et 2,92 pour GLM-5.3 — toujours auto-déclaré). (AI探索舰 / 心流社区, 1ᵉʳ septembre)
-
Rétrospective d’août : « la triple bascule ». Une synthèse de la communauté Aliyun résume le mois écoulé comme une triple bascule : architectures hybrides linéaire + sparse (GLM-5.3 Flash, Qwen3.8-Flash-Next), service sur puces domestiques à grande échelle, et ouverture des modèles de gamme Max. Une bonne lecture de consolidation avant la rentrée. (阿里云开发者社区)
Tableau récapitulatif
| Modèle / Actu | Labo | Apport clé | Licence / Score | Source (datée) |
|---|---|---|---|---|
| Kimi K2.5 hors service | Moonshot 月之暗面 | Retrait après 7 mois ; K3 reprend tout le trafic | N/A | CNMO, 31 août |
| Finances DeepSeek | DeepSeek 深度求索 | 475 M¥ / 7 mois (10× 2025), perte 715 M¥, 11 Md¥ compute | Non audité (fuite The Information) | 新浪科技, 26 août |
| Agent Teams (千问创作) | Alibaba 通义千问 | Studio vidéo multi-agents sur Wan3.0, 30 s / 720P, 0,26 ¥/s | Produit fermé ; coût auto-déclaré | 界面新闻, 31 août |
| uHBM / uLPU | Hanxu 寒序科技 | Inférence MRAM in-memory, 24 To/s, cible 2 000 tok/s (4B) | Pré-tapeout ; design auto-déclaré | 快科技, 31 août |
| Essai gratuit Hy4 preview | Tencent 混元 | 2 semaines gratuites sur WorkBuddy | Open source (déjà couvert) | 心流社区, 1ᵉʳ sept. |
Sources
- 网易 — 月之暗面宣布Kimi K2.5月底“退役” 服役仅7个月 — 网易 — 24 août 2026
- CNMO — 月之暗面Kimi K2.5今日正式下线 第一代万亿参数模型谢幕 — CNMO — 31 août 2026
- 观点网 — 月之暗面Kimi部分模型API将于8月31日下线 — 观点网 — août 2026
- 网易科技 — DeepSeek被曝前七个月收入4.75亿元,算力投入110亿元 — 网易科技 — août 2026
- 新浪科技 — 消息称 DeepSeek 今年前 7 个月营收近 4.75 亿元,达去年全年水平 10 倍 — 新浪科技 — 26 août 2026
- IT之家 — 消息称 DeepSeek 今年前 7 个月营收近 4.75 亿元 — IT之家 — août 2026
- 界面新闻 — 千问创作上线Agent Teams功能 — 界面新闻 — 31 août 2026
- IT之家 — 阿里千问创作上线 Agent Teams 功能 — IT之家 — 31 août 2026
- 凤凰网 — 千问创作推出Agent Teams功能,覆盖AI短剧、漫剧等专业创作场景 — 凤凰网 — 31 août 2026
- 快科技 — 2000 Tokens/s!寒序科技推出国产LPU推理芯片:让权重不再“搬家” — 快科技 — 31 août 2026
- 雷锋网 — 独家丨直指2000 Tokens/s,北大系「流式推理芯片」公司完成数千万元融资 — 雷锋网 — août 2026
- AI探索舰 / 心流社区 — 海外AI资讯简报 2026年9月1日 — 心流社区 — 1ᵉʳ septembre 2026
- 阿里云开发者社区 — 2026 年 8 月大模型的三重跃迁 — 阿里云开发者社区 — septembre 2026