Noticias sobre Qwen Team
1 artículos relacionados
Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture
AI InsightEl equipo Qwen de Alibaba lanzó el modelo Qwen3.8-Flash-Next, con más de 125 mil millones de parámetros modales MoE y 6 mil millones de parámetros activos. El modelo es una versión previa de la arquitectura Qwen4 y utiliza tecnologías como Gated DeltaNet y Qwen Sparse Attention, Gated Residual, N-gram Embedding y el optimizador Muon. El costo de entrenamiento del modelo es 9 veces menor que el de Qwen3.7-Plus y requiere un punto de control FP8 de 172,78 GiB.