Articles sur Qwen Team
1 articles liés
Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture
AI InsightL'équipe Qwen d'Alibaba a présenté le modèle Qwen3.8-Flash-Next, doté de plus de 125 milliards de modèles MoE multimodaux et de 6 milliards de paramètres actifs. Le modèle est une version préliminaire de l'architecture Qwen4, qui adopte une architecture hybride Gated DeltaNet et Qwen Sparse Attention, Gated Residual, N-gram Embedding et l'optimiseur Muon. Le coût d'entraînement du modèle est 9 fois inférieur à celui du Qwen3.7-Plus et nécessite un point de contrôle FP8 de 172,78 GiB.