共 1 篇文章
提前预览Qwen4代架构,125B参数MoE模型训练成本降至前代九分之一
阿里巴巴通义千问正式开源新一代多模态MoE模型Qwen3.8-Flash-Next,作为Qwen4架构的早期预览版,采用125B参数与混合注意力机制,每Token仅激活6B参数,原生支持26万Token上下文。该模型训练成本仅为前代的九分之一,在代码生成、多模态理解及Agent任务中表现卓越,同步上线商业API版本Qw......