数码

阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9

来源:IT之家 · 2026-08-26 21:00
阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9

IT之家 8 月 26 日消息,阿里通义千问团队今晚正式发布了 Qwen3.8-Flash。通义团队同时发布了 Qwen3.8-Flash-Next 的开源权重,Next 新架构将是全新一代 Qwen4 系列模型的雏形。这是一个多模态 MoE 模型,主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。它原生支持 262,144 tokens 上下文,并可通过 YaRN 扩展至 1M tokens。据介绍,Qwen3.8-Flash 围绕四个方向进行了系统升级:在 Attention 方面,采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN 负责高效压缩历史信息,QSA 则通过轻量级 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列

原文:IT之家

← 返回首页