← Volver a la línea de tiempo
Resumen del evento84Primera vez · Última actualización

阿里巴巴发布Qwen3.8-Flash-Next,瞄准“终极成本效率”

Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"

Síntesis del evento
阿里巴巴Qwen团队发布了Qwen3.8-Flash-Next模型,采用混合专家模型架构和Muon优化器,训练成本比Qwen3.7-Plus降低9倍。该模型在编码和办公benchmarks上超越了更大的竞争对手,如DeepSeek-V4-Flash和Claude Opus 4.6。该成就对OpenAI和Anthropic等公司带来了更大的价格压力。
Fuentes · 2
  1. MarkTechPost84

    阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next:一个125亿多模态MoE,具有6亿活跃参数,预览Qwen4架构

    El equipo Qwen de Alibaba lanzó el modelo Qwen3.8-Flash-Next, con más de 125 mil millones de parámetros modales MoE y 6 mil millones de parámetros activos. El modelo es una versión previa de la arquitectura Qwen4 y utiliza tecnologías como Gated DeltaNet y Qwen Sparse Attention, Gated Residual, N-gram Embedding y el optimizador Muon. El costo de entrenamiento del modelo es 9 veces menor que el de Qwen3.7-Plus y requiere un punto de control FP8 de 172,78 GiB.

    Verificar fuente
  2. The Decoder76

    阿里巴巴发布Qwen3.8-Flash-Next,瞄准“终极成本效率”

    El equipo de Qwen de Alibaba lanzó el modelo Qwen3.8-Flash-Next, un modelo de expertos híbrido que activa solo 6 de 125 mil millones de parámetros a la vez. Con un costo de entrenamiento de solo 1/9, superó a competidores más grandes como DeepSeek-V4-Flash y Claude Opus 4.6 en benchmarks de codificación y oficina. Este logro aumenta la presión sobre empresas como OpenAI y Anthropic en términos de precio.

    Verificar fuente
阿里巴巴发布Qwen3.8-Flash-Next,瞄准“终极成本效率” · AI Noticias