阿里旗下千问团队近日推出全新大模型Qwen3.8-Flash,并同步开源模型权重。该模型采用多模态混合专家(MoE)架构,通过激活1250亿参数中的60亿(6B)实现性能突破,在多项基准测试中超越Claude Opus4.6,部分场景表现接近Opus4.8。相较于前代Qwen3.7-Plus,新模型训练成本降低90%,推理成本降至每百万Tokens输入1元、输出3元,价格仅为DeepSeek-V4-Flash忙时价格的1/3,重新定义了全球大模型的性价比标准。
技术架构层面,Qwen3.8-Flash引入四大创新机制:在注意力计算上,通过QSA(Qwen Sparse Attention)与GDN融合的混合架构,使1M Tokens长上下文处理速度提升8倍;信息传递方面,自研Gated Residual方法将传统Transformer的单通道拆分为四条动态路径,显著提升训练稳定性;参数扩展通过51B规模的N-gram Embedding实现"外挂式记忆指南",避免计算资源浪费;模型优化则采用结构与训练协同设计,使收敛效率提升3倍。这些革新使未经过微调的基座模型在通用能力、数学推理和编程任务上即超越3倍体量的Qwen3.7-Plus。
在专业场景评测中,Qwen3.8-Flash展现显著优势:智能体编程任务SWE-bench Pro得分领先Opus4.6达9.1分,长程协作任务CoWorkBench和工具调用任务Toolathlon Verified均超越DeepSeek-V4-Flash,办公任务JobBench评测超出Opus4.6近20分。多模态能力方面,移动端操作AndroidWorld评测领先22.5分,视觉数学推理MathVision超出25.1分,具身智能ERQA任务领先31.5分。这些性能突破得益于模型架构与训练方案的协同优化,特别是混合注意力机制和动态信息通道设计,使复杂任务处理效率大幅提升。
应用落地层面,Qwen3.8-Flash已率先集成至"千问办公"标准模式,可自动完成95%的日常办公任务,包括文档处理、数据分析、跨系统操作等。开发者和企业可通过千问AI平台调用模型API,享受低至行业1/3的推理成本。技术团队透露,该模型采用的Next架构将成为Qwen4的基础框架,目前已在Hugging Face和魔搭社区开源Qwen3.8-Flash-Next权重,供全球开发者参与验证。截至发布时,Qwen系列模型全球下载量已突破30亿次,衍生模型超30万个,形成覆盖2.4T参数量、全尺寸全模态的开源生态,持续推动中国大模型技术全球化发展。















