Articles sur Qwen3.8-Flash-Next
4 articles liés
Experiment with Qwen3.8-Flash-Next 176B Model on NVIDIA GB300 NVL72 for Agentic Coding
AI InsightAlibaba a publié les poids du modèle Qwen3.8-Flash-Next, en guise d'avant-goût de l'architecture Qwen4 à venir, pour que les développeurs puissent l'expérimenter et l'évaluer. Ce modèle utilise une architecture multi-modale à experts mixtes (MoE), avec un total de 176 milliards de paramètres, dont 51 milliards de paramètres d'incorporation de N-grammes, avec 6 milliards de paramètres activés pour chaque jeton. Sa taille native de fenêtre de contexte est de 262 144 jetons, et peut être étendue à 1 million de jetons via YaRN.Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
AI InsightAlibaba a publié les poids du modèle Qwen3.8-Flash-Next en tant qu'aperçu de la prochaine architecture Qwen4, permettant aux développeurs d'expérimenter et d'évaluer. Le modèle utilise une architecture MoE multimodale, avec 12,5 milliards de paramètres principaux, complétés par 5,1 milliards de N-gram embeddings, et 600 millions de paramètres d'activation par jeton. Il prend en charge une fenêtre de contexte de 262 144 jetons, pouvant être étendue jusqu'à 1 million de jetons.Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture
AI InsightL'équipe Qwen d'Alibaba a présenté le modèle Qwen3.8-Flash-Next, doté de plus de 125 milliards de modèles MoE multimodaux et de 6 milliards de paramètres actifs. Le modèle est une version préliminaire de l'architecture Qwen4, qui adopte une architecture hybride Gated DeltaNet et Qwen Sparse Attention, Gated Residual, N-gram Embedding et l'optimiseur Muon. Le coût d'entraînement du modèle est 9 fois inférieur à celui du Qwen3.7-Plus et nécessite un point de contrôle FP8 de 172,78 GiB.Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"
AI InsightL'équipe Qwen d'Alibaba a publié Qwen3.8-Flash-Next, un modèle d'expert hybride qui n'active que 6 des 125 milliards de paramètres à la fois. Avec un coût de formation neuf fois inférieur, il a surpassé des concurrents plus grands comme DeepSeek-V4-Flash et Claude Opus 4.6 sur les benchmarks d'encodage et de bureautique. Cette réalisation exerce une pression accrue sur les prix sur des entreprises comme OpenAI et Anthropic.