
8月26日晚间,阿里千问带来重磅新作——Qwen3.8‑Flash,模型同步对外开源。依托下一代全新模型架构,千亿总参数只需激活60亿,就跑出了比肩行业顶尖模型的实力,刷新了大模型效率的全球标杆。
这一次千问把性能与成本的平衡推到了新高度:对比前代Qwen3.7‑Plus,Qwen3.8‑Flash训练成本直接降低近90%,推理开销也大幅下探。API定价做到每百万Tokens输入仅1元、输出3元,价格仅为Claude Opus4.6的3%,最低可到DeepSeek V4 Flash的1/3,把大模型的性价比“斩杀线”再度拉低。该模型现已登陆千问办公,企业与开发者也可以通过千问AI平台调用它的API服务。
Qwen3.8‑Flash属于多模态MoE混合专家模型,采用Next下一代架构,总Transformer参数125B,实际激活仅6B,综合性能超越Claude Opus4.6,逼近Opus4.8。
仅仅是预训练基座版本,它在SuperGPQA通用能力、GSM8K数学推理、SWEBench‑Pretrain编程等多项基准测试里,就已经超过参数规模是它3倍的Qwen3.7‑Plus基座。
经过后训练调优之后,能力更是再上一个台阶:
• 智能体编程SWE‑bench Pro评测,领先Opus4.6达9.1分;
• CoWorkBench长程专业任务、Toolathlon Verified工具调用等智能体场景,表现优于DeepSeek‑V4‑Flash;
• JobBench专业工作任务评测,高出Opus4.6接近20分;
• 多模态领域亮点突出:移动端智能体AndroidWorld高出Opus4.6 22.5分,MathVision视觉数学推理领先25.1分,具身智能ERQA任务领先31.5分,多模态综合实力十分亮眼。
强悍表现的背后,是整套架构与训练方案的全方位革新,和过往千问模型的设计思路有着明显区别:
❶ QSA稀疏注意力机制:搭配GDN组成混合注意力架构,显著削减计算成本。面对1M Tokens超长上下文真实业务场景,缓存命中率高的情况下速度最高提升8倍,兼顾速度与效果;
❷ 自研Gated Residual门控残差:把传统Transformer单条信息通道拓展为4条,模型按需读写处理信息,信息流转效率更高,训练过程也更加稳定;
❸ 51B N‑gram Embedding:相当于给模型外挂一份轻量化的“记忆手册”,只做查表寻址,不参与每一步Token运算,用很小的算力代价实现参数高效扩容;
❹ 结构与训练联合优化,进一步拉高模型收敛速度与训练吞吐。
架构上的突破,直接转化为看得见的成本优势。
性能看齐Qwen3.7‑Plus,但训练资源仅需原来的1/9,训练成本直降90%。推理侧,输入百万Token仅1元、输出百万Token仅3元,对比Opus4.6成本仅其3%;相较DeepSeek‑V4‑Flash,忙时价格仅1/3,闲时也只有2/3。
模型尤其擅长Agent智能体编程、复杂专业办公、超长上下文任务。千问团队还针对模型和Harness框架深度协同调优,强化智能体能力。现在千问办公的标准模式已经接入Qwen3.8‑Flash,绝大多数日常办公需求,它都可以轻松搞定。
值得一提的是,这套Next新架构,就是下一代千问Qwen4的技术雏形。目前Qwen3.8‑Flash‑Next完整权重,已经在魔搭社区、Hugging Face开源,交给全球开发者社区共同打磨迭代,为Qwen4铺路。
至此Qwen3.8系列已经完成Qwen3.8‑Max(2.4T参数量)、Qwen3.8‑27B、Qwen3.8‑Flash三款模型开源。截至现在,千问模型全球下载量突破30亿次,社区衍生模型超30万个。全尺寸、全模态的持续开源输出,正在让来自中国的大模型,在全球AI生态持续释放影响力。
节点声明:本内容为作者独立观点,不代表节点财经立场。未经允许不得转载,文中内容仅供参考,不作为实际操作建议,交易风险自担。