阿里巴巴将于本周三正式发布Qwen 3.8-Flash-Next模型,这是一款拥有1250亿参数的大模型,但每个token仅激活60亿参数。Qwen团队将其定位为下一代Qwen 4架构的预览版,而非最终旗舰产品。
截至目前,官方尚未公布该模型的详细信息,但根据外界传闻,它很可能采用混合专家系统(Mixture-of-Experts, MoE)。这一设计将网络拆分为多个专门化的子模型,每次任务仅激活相关子模型,从而使一个1250亿参数的模型在运行时仅消耗相当于60亿参数模型的计算资源。
参数本质上是模型可以调整的所有“旋钮”,参数越多,模型能力越强,所需算力也越大。混合专家系统使得一个极其强大的模型能够只激活必要的部分,从而在输出最佳结果的同时避免资源浪费。
阿里巴巴Qwen团队确认该模型为多模态,并基于即将推出的Qwen 4架构构建。团队表示,提前发布早期版本是为了让开发者能够为完整系列做好准备。为何命名“3.8”?阿里巴巴已发布预告,但团队称这只是预览。计划是在Qwen 4完整推出之前,先行交付架构改进。Qwen 3.8 Flash Next is releasing Tomorrow. 125B paramters +51B N-gram and 6B active. Its based on the next generation Qwen 4 architecture.
Qwen 4 is coming https://t.co/xduZNdKnKU pic.twitter.com/rAcBZlNwKs
— AiBattle (@AiBattle_) August 25, 2026
模型权重也已上传至Hugging Face,平台上同样将其描述为“Qwen 4架构的预览”。
严格的基准测试尚未公布。Qwen尚未发布与自家Qwen 3系列或西方竞品的对比分数,因此1250亿和60亿参数的具体数字尚未得到验证,其性能只能推测。中国开源模型的发布节奏从未停歇。一款神秘的免费模型Ox Alpha近期在部分编程基准测试中击败了Anthropic的Fable,且其背后建造者不明。阿里巴巴、DeepSeek和Moonshot均已推出可下载、微调并运行的权重。开源权重让开发者无需将数据发送至封闭API即可构建应用,并降低了托管模型的成本。
这就是为什么一款拥有1250亿参数、仅激活60亿参数的开源模型意义重大:它让接近前沿的能力运行在普通硬件上。但我们仍需等待具体数据。截至本文撰写时,Qwen尚未发布该版本的基准测试分数。
