关于 Qwen Team 的报道
共 1 篇相关报道
阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next:一个125亿多模态MoE,具有6亿活跃参数,预览Qwen4架构
Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture
AI 洞察阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next模型,具有125亿多模态MoE和6亿活跃参数。该模型是Qwen4架构的预览版,采用了Gated DeltaNet和Qwen Sparse Attention混合架构、Gated Residual、N-gram Embedding和Muon优化器等技术。该模型的训练成本比Qwen3.7-Plus低9倍,需要172.78 GiB FP8 checkpoint。