Noticias sobre Qwen3.8-Flash-Next
4 artículos relacionados
Experiment with Qwen3.8-Flash-Next 176B Model on NVIDIA GB300 NVL72 for Agentic Coding
AI InsightAlibaba lanzó los pesos del modelo Qwen3.8-Flash-Next como un adelanto de la arquitectura Qwen4, que se lanzará próximamente, para que los desarrolladores puedan experimentar y evaluar. El modelo utiliza una arquitectura de expertos multimodales mixtos (MoE), con un total de 176 mil millones de parámetros, que incluyen 51 mil millones de parámetros de incrustación de N-gramas, con 6 mil millones de parámetros activados por cada token. Su ventana de contexto nativa es de 262,144 tokens, que se puede ampliar a 1M de tokens mediante YaRN.Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
AI InsightAlibaba ha lanzado los pesos del modelo Qwen3.8-Flash-Next como una vista previa de la próxima arquitectura Qwen4, lo que permite a los desarrolladores experimentar y evaluar. El modelo utiliza una arquitectura MoE multimodal, con 12.5 mil millones de parámetros principales, complementados con 5.1 mil millones de incrustaciones de N-gram, y 600 millones de parámetros de activación por token. Soporta una ventana de contexto de 262.144 tokens, ampliable hasta 1 millón de tokens.Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture
AI InsightEl equipo Qwen de Alibaba lanzó el modelo Qwen3.8-Flash-Next, con más de 125 mil millones de parámetros modales MoE y 6 mil millones de parámetros activos. El modelo es una versión previa de la arquitectura Qwen4 y utiliza tecnologías como Gated DeltaNet y Qwen Sparse Attention, Gated Residual, N-gram Embedding y el optimizador Muon. El costo de entrenamiento del modelo es 9 veces menor que el de Qwen3.7-Plus y requiere un punto de control FP8 de 172,78 GiB.Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"
AI InsightEl equipo de Qwen de Alibaba lanzó el modelo Qwen3.8-Flash-Next, un modelo de expertos híbrido que activa solo 6 de 125 mil millones de parámetros a la vez. Con un costo de entrenamiento de solo 1/9, superó a competidores más grandes como DeepSeek-V4-Flash y Claude Opus 4.6 en benchmarks de codificación y oficina. Este logro aumenta la presión sobre empresas como OpenAI y Anthropic en términos de precio.