TL;DR

  • GLM-5.3 Flash démasqué (26 août) : le mystérieux modèle « 牛来 » (Ox Alpha), n°1 sur OpenRouter dès son premier jour anonyme (20 août), est le premier GLM nativement multimodal de Zhipu — 320B (18B activés), score 57 sur Artificial Analysis (parité Claude Opus 4.8, à 1/40 du prix), open source, et servi intégralement sur puces chinoises.
  • Tencent ouvre Hy4 preview (28 août) : nouveau vaisseau amiral Hunyuan, 770B (49B activés), contexte 1M, open source, positionné premier peloton des modèles ouverts.
  • Qwen3.8-Flash-Next (26 août) : preview open weights de l’architecture Qwen4 (GDN + attention parcimonieuse QSA), 125B + 51B d’embeddings N-gram, 6B activés, coût d’entraînement annoncé à 1/9 du prédécesseur.
  • DeepSeek V4-Pro enfin publié — en silence (12–13 août) : le build 0813 remplace la preview sur l’API sans annonce ; bonds spectaculaires en agentique (DeepSWE 12,8 → 62,7). Suite du feuilleton du rapport précédent.
  • Promesses tenues chez Qwen : poids de Qwen3.8-Max ouverts le 12 août (2,4T, ~4,9 To en BF16), Qwen3.8-27B le 14 août sous Apache 2.0 — première ouverture d’un modèle Max.
  • GLM-5.3 (14 août) : post-entraînement massif sur GLM-5.2, +50 % en programmation (évaluation interne), revendiqué meilleur modèle open source en coding.
  • Business : la 2ᵉ levée de DeepSeek (~50 Md ¥, valorisation pré-money ~500 Md ¥) en cours de signature fin août, avec préparation d’une IPO STAR Market visée 2027.

Actualités du jour

« Ox Alpha » démasqué : GLM-5.3 Flash, premier GLM natif multimodal — sur puces chinoises

Acteur : 智谱 Zhipu / Z.ai Apport clé : modèle 320B (18B activés, 45 couches), premier de la série 5 nativement multimodal (vidéo/image en entrée, Visual Coding), attention hybride linéaire + parcimonieuse (-3× de calcul d’attention, KV cache -4,4×), contexte 1M ; open source (Hugging Face), prix à 1/40 de Claude Opus 4.8 Type de source : annonce officielle Zhipu + reprise 量子位 Benchmark vérifié : oui (partiel) — 57 sur l’indice Artificial Analysis (parité Opus 4.8) ; n°1 OpenRouter dès le premier jour en anonyme (record de tokens/jour)

Le modèle anonyme « 牛来 » (Ox Alpha), apparu le 20 août sur OpenRouter, a affolé les développeurs occidentaux pendant une semaine : record historique de tokens consommés en une journée, et fin de la série de 56 jours de DeepSeek en tête d’OpenCode. Le 26 août, Zhipu a levé le voile : il s’agit de GLM-5.3 Flash, premier modèle nativement multimodal de la série 5, immédiatement open-sourcé.

Deux points marquants. D’abord l’efficacité architecturale : avec 320B de paramètres totaux (18B activés), il dépasse GLM-5.2 (753B) sur l’ensemble des capacités, grâce à une attention hybride linéaire + parcimonieuse avec indexeur léger (IndexPool) et 30T de tokens multimodaux de pré-entraînement. Ensuite — et c’est le symbole fort mis en avant par la presse chinoise — l’intégralité des 62T de tokens servis pendant la phase anonyme a tourné sur des puces d’accélération chinoises, via une architecture de service désagrégée Encode-Prefill-Decode, avec un coût par token annoncé comparable aux GPU Nvidia. Un modèle chinois, open source, en tête des classements mondiaux d’usage, servi sur du matériel domestique : la boucle revendiquée par l’écosystème est bouclée. À noter le 29 août : Zhipu a corrigé une dégradation de performance signalée après le lancement.

量子位 — 神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡量子位, 27 août 2026 量子位 — 匿名牛来大模型被扒出智谱血缘量子位, 23 août 2026


Tencent ouvre Hy4 preview : 770B, contexte 1M, premier peloton open source

Acteur : 腾讯 Tencent / 混元 Hunyuan Apport clé : nouveau modèle phare de la lignée Hunyuan, 770B de paramètres (49B activés), contexte 1M, open source dès la sortie ; tarifs 6 ¥/M en entrée, 18 ¥/M en sortie (0,3 ¥/M en cache hit) Type de source : annonce officielle Tencent + reprises (新浪财经, 搜狐, 系统极客) Benchmark vérifié : non — le test en aveugle interne (163 experts, 203 tâches d’ingénierie : Hy4 preview 2,99/4 vs GLM-5.3 2,92 et Kimi K3 2,94) est auto-organisé par Tencent

Le 28 août, Tencent a publié et open-sourcé Hy4 preview, présenté comme une extension simultanée de la taille du modèle, du contexte et des données d’entraînement, avec un accent sur les tâches de productivité (code, bureautique, applications scientifiques). Le modèle est déployé d’emblée dans les produits maison (CodeBuddy, 元宝 Yuanbao, ima) et accessible via Tencent Cloud et OpenRouter. Après le Hy3 d’avril, Tencent confirme sa stratégie d’ouverture systématique de ses modèles de tête — le test en aveugle interne le plaçant devant GLM-5.3 et Kimi K3 reste toutefois à confirmer par des évaluations tierces.

新浪财经 — 腾讯混元 Hy4 preview 发布并开源新浪财经, 28 août 2026 AI工具宝箱 — 腾讯混元 Hy4 preview 开源:770B参数1M上下文大模型AI工具宝箱, août 2026


Qwen3.8-Flash-Next : la preview de l’architecture Qwen4, à 1/9 du coût d’entraînement

Acteur : 阿里巴巴 / 通义千问 (Alibaba, Qwen) Apport clé : modèle MoE open weights de 125B (+ 51B d’embeddings N-gram, 6B activés/token), architecture hybride GDN (Gated DeltaNet) + QSA (Qwen Sparse Attention), contexte natif 262K (1M via YaRN), accélérations ×7,6 en prefill et ×4,9 en decode à 1M tokens ; coût d’entraînement annoncé à 1/9 de la génération précédente Type de source : annonce officielle Qwen (Hugging Face + ModelScope + rapport technique GitHub) + reprises (IT之家, 知乎) Benchmark vérifié : non — chiffres d’efficacité auto-déclarés du rapport technique

Publié le 26 août, Qwen3.8-Flash-Next n’est pas une mise à jour de routine : l’équipe Qwen le positionne explicitement comme une preview expérimentale de l’architecture de la génération Qwen4. La recette rejoint la tendance de fond du mois (voir GLM-5.3 Flash) : combiner un mécanisme linéaire qui compresse l’historique (GDN) et une attention parcimonieuse à indexeur léger (QSA) pour faire s’effondrer le coût des longs contextes. La convergence de Zhipu et d’Alibaba vers ce même schéma hybride linéaire + sparse, chacun avec sa variante, dessine la direction probable des architectures chinoises de 2027.

IT之家 — 阿里通义 Qwen3.8-Flash(Next)发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9IT之家, 26 août 2026 DataLearner — Qwen3.8-Flash-Next:Qwen4 架构预览版的规格、评测与许可DataLearner, août 2026


DeepSeek V4-Pro : sortie fantôme du build 0813, bonds spectaculaires en agentique

Acteur : 深度求索 DeepSeek Apport clé : version stable (GA) de V4-Pro mise en ligne les 12–13 août en remplacement de la preview d’avril sur l’endpoint API, sans aucune annonce (ni blog, ni réseaux sociaux) ; progression massive en agentique : DeepSWE 12,8 → 62,7, CyberGym 52,7 → 83,3, Terminal Bench 2.1 72,1 → 87,9 ; tarifs inchangés (0,435 $/M en entrée, 0,87 $/M en sortie) Type de source : constat communautaire (changement de version sur la page tarifs) + reprises (知乎, 新浪财经, 博客园) Benchmark vérifié : non — scores issus de la communication DeepSeek, pas encore consolidés par des évaluations tierces

Mise à jour du feuilleton suivi depuis le rapport du 16 juillet : V4-Pro, annoncé « très bientôt » puis repoussé, est finalement sorti dans la nuit du 12 au 13 août — à la manière DeepSeek, c’est-à-dire sans communication : seul le numéro de version de la page de tarification a trahi le passage de la preview au build 0813. La presse spécialisée chinoise retient surtout le rattrapage agentique (le point faible de la preview) et le positionnement prix : des performances revendiquées au niveau des modèles de tête pour ~2 % de leur coût. Quelques jours auparavant, DeepSeek avait annoncé une hausse de tarifs, interprétée par le marché comme le signal de l’arrivée imminente de la version stable.

知乎 — Deepseek V4 Pro深夜上线,性能追平Fable 5,但价格只有它的2%知乎, août 2026 新浪财经 — 刚刚,DeepSeek V4 Pro正式版发布!新浪财经, 13 août 2026 新华报业 — DeepSeek宣布大幅涨价,业内人士预计V4 Pro正式版即将发布新华报业, août 2026


Qwen3.8-Max : promesse d’ouverture tenue — 2,4 billions de paramètres sur Hugging Face

Acteur : 阿里巴巴 / 通义千问 (Alibaba, Qwen) Apport clé : poids de base de Qwen3.8-Max ouverts le 12 août (Qwen3.8-2.4T-A95B, BF16 ≈ 4,89 To en 213 shards + version FP8) sous licence « Qwen3.8-Max License » ; Qwen3.8-27B ouvert le 14 août sous Apache 2.0 (262K de contexte, déployable sur une carte) Type de source : publication officielle Hugging Face + reprises (DataLearner, EOGEE, CSDN) Benchmark vérifié : N/A — il s’agit de la publication des poids du modèle couvert le 8 août

Suite directe du rapport précédent : l’ouverture promise « sous une semaine » a bien eu lieu, avec deux jours de décalage pour le 27B. C’est la première fois qu’Alibaba ouvre un modèle de gamme Max (>2 000 Md de paramètres). Nuance importante relevée par la communauté : la version ouverte est texte seul, mode raisonnement, contexte natif 262K — l’entrée visuelle, le mode non-thinking et le contexte 1M restent l’apanage de l’API. La licence spécifique du 2.4T (non standard, contrairement à l’Apache 2.0 du 27B) mérite lecture attentive avant tout usage commercial.

DataLearner — Qwen3.8-Max:2.4 万亿参数千问旗舰,开源权重、价格与评测DataLearner, août 2026 EOGEE — Qwen3.8-Max 权重正式开源:2.4T 参数旗舰首次开放EOGEE, août 2026


GLM-5.3 : le pari du post-entraînement scaling

Acteur : 智谱 Zhipu / Z.ai Apport clé : nouvelle génération publiée le 14 août ; base inchangée par rapport à GLM-5.2 mais post-entraînement massivement étendu (environnements long-horizon ×10, durée de post-entraînement très allongée) ; +50 % en programmation vs GLM-5.2 (évaluation interne), premier des modèles open source sur Terminal Bench 3.0 et Agents’ Last Exam (CLI) ; CyberGym 84,5 % (vs 77,2 %) Type de source : annonce officielle Zhipu + reprises (科技日报, 财新, 新浪科技) Benchmark vérifié : partiel — les scores sur benchmarks publics (Terminal Bench 3.0…) sont vérifiables, le « +50 % » est une évaluation interne

Deux semaines avant le coup d’éclat de son petit frère Flash, GLM-5.3 illustrait déjà la thèse de Zhipu : à base identique, c’est le scaling du post-entraînement (RL sur environnements agentiques longs et variés) qui repousse le plafond d’intelligence. L’accent mis sur la cybersécurité (CyberGym) rejoint la trajectoire observée chez DeepSeek V4-Pro — les capacités de raisonnement sur vulnérabilités deviennent un axe de différenciation assumé des labos chinois. Le GLM Coding Plan (abonnement à partir de 118 ¥/mois) a basculé sur GLM-5.3 dans la foulée.

科技日报 — 智谱发布新一代基座模型GLM-5.3科技日报, 14 août 2026 新浪科技 — 智谱正式发布 GLM-5.3:编程能力最强开源模型,较 GLM-5.2 提升 50%新浪科技, 14 août 2026


En bref

  • DeepSeek : 2ᵉ levée en signature, cap sur la STAR Market. Selon la presse du 26 août, la deuxième levée de fonds (≈ 50 Md ¥ recherchés, valorisation pré-money ≈ 500 Md ¥, soit ~74 Md $) doit être bouclée avant fin août, après une pause surprise fin juillet. L’entreprise aurait parallèlement engagé la préparation d’une IPO sur le 科创板 (STAR Market) : dépôt possible fin 2026, cotation visée 2027. (搜狐, 26 août ; 网易)

  • Moonshot (月之暗面) : dernière levée pré-IPO en août. Kimi K3 (2,8T, couvert le 18 juillet) porte la dynamique : la société viserait une levée pré-IPO à ~50 Md $ de valorisation, débattue sur Zhihu quant à sa soutenabilité. (知乎)

  • MiniMax intègre le 港股通 (6 août). Sept mois après son IPO à Hong Kong (janvier), MiniMax entre dans le Stock Connect, avec un pic intraday à +22,8 % et un retour au-dessus de 100 Md HK$ de capitalisation. (财新, 6 août)

  • L’open source chinois comme « socle » des produits américains. 观察者网 (17 août) prolonge l’enquête « huit semaines, cinq modèles » du rapport précédent : les modèles ouverts chinois deviennent l’infrastructure par défaut d’une part croissante des produits d’IA américains, l’usage open source dépassant pour la première fois le closed source sur certaines plateformes de développement fin août. (观察者网, 17 août)

  • WRC 2026 (19–23 août, Pékin) : l’année des « world models ». Le forum Physical AI de la World Robot Conference a consacré les modèles du monde nativement omnimodaux comme prochain front, dans le sillage des LLM — avec les acteurs LLM chinois (Zhipu, ByteDance, Alibaba) en première ligne. (量子位, 19 août)


Tableau récapitulatif

Modèle / ActuLaboApport cléLicence / ScoreSource (datée)
GLM-5.3 Flash (« Ox Alpha »)Zhipu 智谱320B (18B act.), natif multimodal, servi 100 % sur puces chinoisesOpen source ; AA 57 (= Opus 4.8), n°1 OpenRouter量子位, 27 août
Hy4 previewTencent 混元770B (49B act.), 1M ctx, produits maison + OpenRouterOpen source ; blind test interne (auto-déclaré)新浪财经, 28 août
Qwen3.8-Flash-NextAlibaba 通义千问Preview archi Qwen4 (GDN+QSA), 125B, coût ÷9Open weights ; auto-déclaréIT之家, 26 août
DeepSeek V4-Pro 0813DeepSeek 深度求索GA silencieuse ; DeepSWE 12,8→62,7 ; 0,435 $/MFermé (API) ; auto-déclaré新浪财经, 13 août
Qwen3.8-Max poids ouvertsAlibaba 通义千问2,4T sur HF (4,89 To BF16) ; 27B en Apache 2.0Qwen3.8-Max License / Apache 2.0DataLearner, août
GLM-5.3Zhipu 智谱Post-training scaling ; 1ᵉʳ open source Terminal Bench 3.0Open source ; partiel (benchs publics)科技日报, 14 août
Levée DeepSeekDeepSeek~50 Md ¥, pré-money ~500 Md ¥, IPO STAR 2027 visée搜狐, 26 août

Sources