关于 Alibaba 的报道
共 6 篇相关报道
在NVIDIA GB300 NVL72上实验Qwen3.8-Flash-Next 176B模型的代理式编码
Experiment with Qwen3.8-Flash-Next 176B Model on NVIDIA GB300 NVL72 for Agentic Coding
AI 洞察阿里巴巴发布了 Qwen3.8-Flash-Next 模型权重,作为即将推出的 Qwen4 架构的预览,供开发者实验和评估。该模型采用多模态混合专家(MoE)架构,总参数量达 176B,包括 51B N-gram 嵌入参数,每个 token 激活 6B 参数。其原生上下文窗口大小为 262,144 个 token,通过 YaRN 可扩展至 1M 个 token。在NVIDIA GB300 NVL72上实验Qwen3.8-Flash-Next,用于代理编码
Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
AI 洞察阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 体系结构的预览,让开发者进行实验和评估。该模型采用多模态 MoE 架构,主模型参数达 125 亿,辅以 51 亿 N-gram 嵌入,激活参数每个 token 6 亿。它支持 262,144 个 token 的上下文窗口,最大可扩展到 100 万 token。阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next:一个125亿多模态MoE,具有6亿活跃参数,预览Qwen4架构
Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture
AI 洞察阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next模型,具有125亿多模态MoE和6亿活跃参数。该模型是Qwen4架构的预览版,采用了Gated DeltaNet和Qwen Sparse Attention混合架构、Gated Residual、N-gram Embedding和Muon优化器等技术。该模型的训练成本比Qwen3.7-Plus低9倍,需要172.78 GiB FP8 checkpoint。阿里巴巴发布Qwen3.8-Flash-Next,瞄准“终极成本效率”
Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"
AI 洞察阿里巴巴Qwen团队发布了Qwen3.8-Flash-Next模型,这是一种混合专家模型,每次只激活125亿参数中的6个。在训练成本仅为1/9的情况下,它在编码和办公benchmarks上超越了更大的竞争对手,如DeepSeek-V4-Flash和Claude Opus 4.6。这一成就为OpenAI和Anthropic等公司带来了更大的价格压力。阿里巴巴的Wan3.0可根据文本、图像和文档生成长达30秒的AI视频
Alibaba's Wan3.0 generates AI videos up to 30 seconds long from text, images, and documents
汤森路透押宝4亿美元拥有自己的AI,而不是从OpenAI或Anthropic租借
Thomson Reuters bets $40M on owning its AI instead of renting from OpenAI or Anthropic
AI 洞察汤森路透斥资4000万美元开发自有语言模型Thomson,基于阿里巴巴的Qwen,该模型在公司内容(如Westlaw)支持下表现良好。行业影响有限