千问开源Qwen3.8-Flash-Next架构,轻量化多模态大模型实现效能突破
2026年8月27日 09:57·AIBase
近日,阿里千问团队正式发布多模态MoE模型Qwen3.8-Flash,并同步开源下一代底层架构Qwen3.8-Flash-Next,该架构也是全新一代Qwen4系列模型的雏形。
Qwen3.8-Flash总参数量125B,额外搭载51B N-gram Embedding,但每token仅激活6B参数。模型原生支持26万token上下文,借助YaRN技术可扩展至100万token。在成本上优势显著,训练开销仅为前代Qwen3.7-Plus的九分之一,API定价每百万Tokens输入1元、输出3元,目前已上线千问AI平台,同步推出“千问办公”功能。

架构层面,团队完成四大核心升级。注意力模块采用GDN+QSA混合架构,GDN负责压缩历史信息,QSA筛选关键上下文,百万token场景下Prefill、Decode最高分别加速7.6倍、4.9倍;Gated Residual机制将残差流拓展为4条并行分支,依靠动态门控优化跨层信息传递,提升训练稳定性;N-gram Embedding利用局部上下文查表扩充模型容量,新增51B参数几乎不增加计算负担;训练环节采用Muon与AdamW混合优化策略,重新拟合Scaling Law,省去批次预热流程。
多项基准测试显示,依靠6B激活参数,基础模型在14项评测中斩获8项最优成绩。微调版本在代码、智能体、多模态任务上表现亮眼,SWE-bench Pro达到62.5分,CoWorkBench、Toolathlon等智能体榜单大幅领先同类模型。
目前Qwen3.8-Flash-Next权重已在Hugging Face、ModelScope开源,完整技术报告同步公开。千问团队提前开放架构,希望借助社区力量验证创新方案,持续迭代技术,稳步推进Qwen4系列模型研发。

