Noticias sobre Alibaba
6 artículos relacionados
Experiment with Qwen3.8-Flash-Next 176B Model on NVIDIA GB300 NVL72 for Agentic Coding
AI InsightAlibaba lanzó los pesos del modelo Qwen3.8-Flash-Next como un adelanto de la arquitectura Qwen4, que se lanzará próximamente, para que los desarrolladores puedan experimentar y evaluar. El modelo utiliza una arquitectura de expertos multimodales mixtos (MoE), con un total de 176 mil millones de parámetros, que incluyen 51 mil millones de parámetros de incrustación de N-gramas, con 6 mil millones de parámetros activados por cada token. Su ventana de contexto nativa es de 262,144 tokens, que se puede ampliar a 1M de tokens mediante YaRN.Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
AI InsightAlibaba ha lanzado los pesos del modelo Qwen3.8-Flash-Next como una vista previa de la próxima arquitectura Qwen4, lo que permite a los desarrolladores experimentar y evaluar. El modelo utiliza una arquitectura MoE multimodal, con 12.5 mil millones de parámetros principales, complementados con 5.1 mil millones de incrustaciones de N-gram, y 600 millones de parámetros de activación por token. Soporta una ventana de contexto de 262.144 tokens, ampliable hasta 1 millón de tokens.Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture
AI InsightEl equipo Qwen de Alibaba lanzó el modelo Qwen3.8-Flash-Next, con más de 125 mil millones de parámetros modales MoE y 6 mil millones de parámetros activos. El modelo es una versión previa de la arquitectura Qwen4 y utiliza tecnologías como Gated DeltaNet y Qwen Sparse Attention, Gated Residual, N-gram Embedding y el optimizador Muon. El costo de entrenamiento del modelo es 9 veces menor que el de Qwen3.7-Plus y requiere un punto de control FP8 de 172,78 GiB.Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"
AI InsightEl equipo de Qwen de Alibaba lanzó el modelo Qwen3.8-Flash-Next, un modelo de expertos híbrido que activa solo 6 de 125 mil millones de parámetros a la vez. Con un costo de entrenamiento de solo 1/9, superó a competidores más grandes como DeepSeek-V4-Flash y Claude Opus 4.6 en benchmarks de codificación y oficina. Este logro aumenta la presión sobre empresas como OpenAI y Anthropic en términos de precio.Alibaba's Wan3.0 generates AI videos up to 30 seconds long from text, images, and documents
Thomson Reuters bets $40M on owning its AI instead of renting from OpenAI or Anthropic
AI InsightThomson Reuters invirtió 40 millones de dólares en el desarrollo de su propio modelo de lenguaje, Thomson, basado en Qwen de Alibaba, que se ha desempeñado bien con el respaldo del contenido de la empresa (como Westlaw).行业影响有限