
DeepSeek a publié le 17 septembre 2026 le rapport technique de V4.1-Flash, modèle multimodal à mélange d'experts de 552 milliards de paramètres servi depuis le 10 septembre, avec un contexte d'un million de jetons. Son architecture à encodeur-décodeur causal active 16 milliards de paramètres au décodage mais 8 milliards au préremplissage, phase dominante des charges agentiques. La réutilisation du cache clés-valeurs entre couches et un stockage en FP4 ramènent l'empreinte globale de ce cache à 890 octets par jeton, le quart de celle du modèle précédent ; le cache persistant sur SSD tombe à un huitième. L'enjeu est la densité de service, donc le coût par requête, plus que le score.
Espace publicitaire · 300×250







