
阿里巴巴云(Alibaba Cloud)发布了多模态MoE模型「Qwen3.8-Flash-Next」,该模型不仅作为即将发布的「Qwen4」架构的早期预览,同时已在Hugging Face和ModelScope平台上线。产品版以Qwen3.8-Flash的形式在QwenCloud提供,默认支持100万个上下文长度,并内置官方工具,价格为每输入100万个Token 0.16美元,输出100万个Token 0.47美元。
Qwen3.8-Flash-Next通过系统性升级模型,提升能力的同时优化了计算效率、模型容量和训练稳定性。其采用了名为「Gated DeltaNet(GDN)」的架构,兼顾了长文本上下文的高效检索与计算效率,能够有效压缩历史信息。Qwen Sparse Attention(QSA)机制利用压缩后的推理所需相关信息,按微块单位选择重要上下文,显著降低了处理长序列的成本。
此外,模型引入了门控残差机制,将深度学习模型中层间信息通路扩展为四条,并通过动态门控控制读写,增强了层间信息流和训练稳定性。
模型还采用了N-gram嵌入技术,将文本切分为Token序列,利用分布式表示和记忆表保持及引用表层排列模式。该方法通过局部上下文检索记忆表,带来极少的额外计算开销却能扩展模型容量。

Qwen3.8-Flash-Next主模型拥有1250亿参数,辅以510亿参数的N-gram嵌入,使得每个Token激活约60亿参数。与前代Qwen3.7-Plus相比,训练和推理成本大幅降低,训练时间缩短至原来的约九分之一。该模型原生支持最大262,144个Token的记忆与处理,借助YaRN技术可扩展至100万个Token。



