阿里巴巴发布Qwen3.8-Flash-Next,瞄准“终极成本效率”
Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"
事件综合
阿里巴巴Qwen团队发布了Qwen3.8-Flash-Next模型,采用混合专家模型架构和Muon优化器,训练成本比Qwen3.7-Plus降低9倍。该模型在编码和办公benchmarks上超越了更大的竞争对手,如DeepSeek-V4-Flash和Claude Opus 4.6。该成就对OpenAI和Anthropic等公司带来了更大的价格压力。
信息来源 · 2
阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next:一个125亿多模态MoE,具有6亿活跃参数,预览Qwen4架构
阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next模型,具有125亿多模态MoE和6亿活跃参数。该模型是Qwen4架构的预览版,采用了Gated DeltaNet和Qwen Sparse Attention混合架构、Gated Residual、N-gram Embedding和Muon优化器等技术。该模型的训练成本比Qwen3.7-Plus低9倍,需要172.78 GiB FP8 checkpoint。
查证原文 →阿里巴巴发布Qwen3.8-Flash-Next,瞄准“终极成本效率”
阿里巴巴Qwen团队发布了Qwen3.8-Flash-Next模型,这是一种混合专家模型,每次只激活125亿参数中的6个。在训练成本仅为1/9的情况下,它在编码和办公benchmarks上超越了更大的竞争对手,如DeepSeek-V4-Flash和Claude Opus 4.6。这一成就为OpenAI和Anthropic等公司带来了更大的价格压力。
查证原文 →