← Retour à la chronologie
Aperçu de l'événement84Première apparition · Dernière mise à jour

阿里巴巴发布Qwen3.8-Flash-Next,瞄准“终极成本效率”

Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"

Synthèse de l'événement
阿里巴巴Qwen团队发布了Qwen3.8-Flash-Next模型,采用混合专家模型架构和Muon优化器,训练成本比Qwen3.7-Plus降低9倍。该模型在编码和办公benchmarks上超越了更大的竞争对手,如DeepSeek-V4-Flash和Claude Opus 4.6。该成就对OpenAI和Anthropic等公司带来了更大的价格压力。
Sources · 2
  1. MarkTechPost84

    阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next:一个125亿多模态MoE,具有6亿活跃参数,预览Qwen4架构

    L'équipe Qwen d'Alibaba a présenté le modèle Qwen3.8-Flash-Next, doté de plus de 125 milliards de modèles MoE multimodaux et de 6 milliards de paramètres actifs. Le modèle est une version préliminaire de l'architecture Qwen4, qui adopte une architecture hybride Gated DeltaNet et Qwen Sparse Attention, Gated Residual, N-gram Embedding et l'optimiseur Muon. Le coût d'entraînement du modèle est 9 fois inférieur à celui du Qwen3.7-Plus et nécessite un point de contrôle FP8 de 172,78 GiB.

    Vérifier la source
  2. The Decoder76

    阿里巴巴发布Qwen3.8-Flash-Next,瞄准“终极成本效率”

    L'équipe Qwen d'Alibaba a publié Qwen3.8-Flash-Next, un modèle d'expert hybride qui n'active que 6 des 125 milliards de paramètres à la fois. Avec un coût de formation neuf fois inférieur, il a surpassé des concurrents plus grands comme DeepSeek-V4-Flash et Claude Opus 4.6 sur les benchmarks d'encodage et de bureautique. Cette réalisation exerce une pression accrue sur les prix sur des entreprises comme OpenAI et Anthropic.

    Vérifier la source
阿里巴巴发布Qwen3.8-Flash-Next,瞄准“终极成本效率” · AI Actualités