阿里巴巴近日正式推出其旗舰大模型Qwen3.8-Max,这一举动在人工智能领域引发了广泛关注。该模型不仅拥有2.4万亿总参数,推理激活参数达950亿,更成为千问系列中规模最大的模型。尤为引人注目的是,千问首次计划开放Max旗舰级模型的权重,为全球开发者提供了前所未有的机会。
在性能表现上,Qwen3.8-Max在国际权威Arena榜单上大放异彩,多个赛道均跻身全球前列。文本任务榜单位列实验室榜第二,视觉赛道紧随ClaudeFable5之后获得第二名,前端编程榜单则位列全球第四。在多项专业基准测试中,该模型也屡创佳绩,如论文复现评测PaperBench获得93.0分,超越了GPT-5.6Sol和ClaudeFable5;在模拟电脑操作的OSWorld-Verified榜单上,以86.1分的高分荣登榜首。
然而,Qwen3.8-Max并非毫无短板。在终端命令测试、软件工程基准SWE-benchPro以及长视频理解任务中,它与海外顶尖闭源模型仍存在一定差距。尽管如此,千问团队对其定位清醒,认为这款模型有望成为除Fable5之外实力顶尖的模型,避免了单纯追求跑分的浮躁风气。
在商用定价方面,Qwen3.8-Max同样展现出竞争力。国内接口输入每百万Tokens仅需12元,输出为36元;海外输入为2美元,输出为6美元,且缓存命中价格大幅降低。这一价格策略有助于降低企业和开发者落地复杂智能体应用的门槛。
Qwen3.8-Max的最大亮点在于其长程自主执行能力。千问团队进行了一项长期实验,让模型从零开始搭建命令行工具项目,构建了一套可以自我迭代的开发系统。在无人干预的16天内,模型完成了265次代码提交和上百次功能迭代,展现了其持续保存项目状态、处理报错、吸收新需求以及长期维护工程的能力。
在多行业应用方面,Qwen3.8-Max也表现出色。它覆盖了编程、科研、办公、多模态和长程智能体五大方向,大量测试瞄准真实行业工作场景。例如,在量化研究案例中,模型仅依靠六条因子描述,就自动拆分数百个研究方向,调度330个子Agent完成6000次策略回测,并自主筛选有效交易因子。在芯片设计测试中,模型更是从算法设计、代码编写、仿真测试到布局布线全程自主完成,将RSA硬件加速器的逻辑门数量从8298个压缩至678个,芯片面积缩减81%。
多模态能力是旗舰模型的标配,而Qwen3.8-Max在这一方面也进一步补齐了短板。它能够一次性解析上百页财报和复杂PDF文档,自动提取图表和文字信息并输出结构化报告。同时,它还支持处理最长100小时的连续视频素材,梳理人物关系、时间线与事件脉络。模型还具备视觉驱动智能体的能力,能够观察软件界面和网页画面,仅凭屏幕画面复刻各类操作系统App。
为了方便开发者搭建应用,千问团队还同步推出了扩展工具库,为各类智能体框架补充了图像、视频、3D建模和CAD等专业工具支持,进一步降低了多模态智能体的开发门槛。而阿里宣布下周将在HuggingFace和ModelScope开放Qwen3.8-Max完整权重的决定,更是打破了行业潜规则,为中小企业和科研团队提供了本地私有化部署和自主微调的机会。












