# 同期开放的 27B 与 Flash-Next

> Qwen3.8 这一代放出了三份开放权重——2.4T 的 Max、27B 稠密模型与 Qwen4 结构预览 Flash-Next，三种许可各不相同；Flash-Next 还带来了这一代唯一的技术报告。

- 作者：David（道雾轩）
- 专栏：Qwen3.8-Max 深度解析（https://daiw.org/manual/qwen3-8-max.md）
- 最后更新：2026-09-19
- 原文：https://daiw.org/manual/qwen3-8-max/qwen38-family
- 转载与引用：请注明出处并附原文链接（https://daiw.org/about/copyright）

# 同期开放的 27B 与 Flash-Next

8 月 3 日的承诺里只有两个名字：Max 和 27B。到 8 月底，Qwen3.8 这一代实际放出了三份开放权重。放在一起看，能看清三件单看 Max 看不到的事：**这套架构从哪来、往哪去；“开放”在同一代里有几种松紧；这一代唯一的技术报告讲了什么、没讲什么。**

## 三份开放权重

| | Qwen3.8-2.4T-A95B | Qwen3.8-27B | Qwen3.8-Flash-Next |
| --- | --- | --- | --- |
| 公开日期 | 8 月 12 日 | 8 月 14 日 | 8 月 26 日 |
| 规模 | 2.4T 总参数 / 95B 激活 | 27B 稠密 | 主干 125B / 6B 激活，另有 51B N-gram 嵌入与 4B MTP |
| 结构 | Qwen3.5 结构（`qwen3_5_moe_text`）：92 层，Gated DeltaNet 与门控注意力 3:1，512 个专家 | Qwen3.5 结构（`qwen3_5`）：64 层，同样 3:1 混排，每层接稠密 FFN | 新结构（`qwen4_exp`）：48 层，Gated DeltaNet 与 QSA 稀疏注意力 3:1，512 个小专家，加 Gated Residual 与 N-gram 嵌入 |
| 模态 | 仅文本 | 文本、图像、视频 | 文本、图像、视频 |
| 能否关闭思考 | 不能 | 能 | 能 |
| 许可 | Qwen3.8-Max License | Apache 2.0 | Qwen Community License 1.0 |
| 对应的 API | `qwen3.8-max`（多了视觉等能力，9 月起为 0902） | `qwen3.8-27b` | `qwen3.8-flash`（默认 1M 上下文与内置工具） |

表里的数字都出自各自的模型卡与 `config.json`。Hugging Face 统计 Flash-Next 约有 1800 亿个参数，是因为把 N-gram 嵌入表和 MTP 模块也算了进去（125B + 51B + 4B）。

## 架构：Max 从哪来，Qwen4 往哪去

27B 与 Max 用的是同一套结构，区别在规模和前馈层：27B 是 16 组“3 层 Gated DeltaNet + 1 层门控注意力”，每层接稠密 FFN；Max 是 23 组同样的排布，每层接 512 选 10 的 MoE。

Flash-Next 的官方博客交代了这套结构的来历：**Qwen3-Next 引入的 Gated DeltaNet 加门控注意力混合结构，此后被用在 Qwen3.5、3.6、3.7 与 3.8 系列上**；Flash-Next 则扮演当年 Qwen3-Next 的角色——它是 **Qwen4 所用模型结构的先导预览**，先放出来让社区检验。它在四处动了刀：

| 改动 | 做法（官方描述） |
| --- | --- |
| 注意力 | 每 4 层中的那 1 层全注意力换成 **Qwen Sparse Attention（QSA）**：用压缩过的轻量索引器，以微块为单位挑出重要的上下文，只在这些位置上算注意力 |
| 残差 | **Gated Residual**：残差流加宽成 4 路，读的时候按元素、按数据动态加门控，写的时候每个分支一个标量 |
| 嵌入 | **N-gram 嵌入**：在第 2 层按二元、三元组查表，用很少的计算扩充参数；嵌入表可以放在主机内存里、异步预取 |
| 优化 | **Muon 与 AdamW 分工**：Muon 负责起线性映射作用的二维权重，嵌入、输出头、路由器等留给 AdamW；按新结构重新拟合缩放律，取消 batch 大小的热身 |

对理解 Max 来说，这张表的意义在于：**Max 仍属于 Qwen3.5 这一路结构；下一代的方向已经公布，但它不在 Max 身上。**

## 这一代唯一的技术报告

Flash-Next 附了一份 28 页的技术报告，题为《On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability》，署期 2026 年 8 月 26 日。这是 Qwen3.8 这一代**唯一**的一份技术报告。它的主要结论（均为官方口径，待独立验证）：

- **更省**：Flash-Next 的基座模型在 14 项预训练基准中有 8 项超过上一代 397B-A17B 的旗舰基座（报告表中为 Qwen3.7-Plus），其余 6 项最多落后 2.6 分；而激活参数约为后者的 1/3，训练 token 约 1/3，训练算力约 1/9。
- **更快**：在 1M 上下文下，QSA 在算子层面比稠密注意力快 7.6 倍（prefill）和 4.9 倍（decode）。
- **更稳**：全规模训练“没有出现一次 loss 尖峰”，也没有依赖 qk-clip 这类截断技巧。在一个 28 层 MoE 上把学习率固定在最优值的 4 倍做压力测试，“Qwen3.5 结构 + AdamW”每一万步出现 183 次尖峰，两种 Muon 配置从未触及梯度裁剪阈值，加了 Gated Residual 的那一种一次尖峰都没有。
- **一个方法论提醒**：loss 和下游准确率并不总是同向——比如 N-gram 词表越大 loss 越低，下游分数却早早饱和。

但它**没有**回答本专栏最关心的问题：报告里没有一处提到 Qwen3.8-Max，给的也是相对比例而不是绝对的 token 数。报告把“Qwen3.5 结构 + AdamW”称为“已经成功扩展过规模”的上一代配方，并以它作稳定性的比较基准；Max 正是 Qwen3.5 结构，但报告没有点名 Max 用了什么优化器，本专栏不据此下结论。**Max 的预训练规模、数据与优化器，仍然是空白。**

## 同一代，三种“开放”

[开源那一章](https://daiw.org/manual/qwen3-8-max/open-weights)逐条读过 Max 的许可。放到同一代里比较，差别一目了然：

- **27B：Apache 2.0。** 标准的宽松许可，商用、托管、做竞品都不设卡。
- **2.4T-A95B：Qwen3.8-Max License。** 主体接近 MIT，外加两条：大体量产品要署名；合计营收超过 5000 万美元、又在做“模型即服务”或“AI 工作助手”业务的，商用前另行授权。
- **Flash-Next：Qwen Community License 1.0。** 条文与 Max 的许可几乎逐字相同，**唯一的区别是删掉了营收门槛**：只要在做这两类业务，不论公司大小，商用前都要另行授权。

也就是说，一家小型推理服务商可以直接托管 27B 和 Max，却不能不打招呼就托管 Flash-Next。许可的松紧没有跟着参数量走——**最大的 Max 居中，最新的 Flash-Next 最紧**。一个可能的解释是：Flash-Next 以约 1/3 的激活参数追平上一代旗舰，生产版每百万输出 token 只卖 2.7 元，恰恰是推理服务商最想拿来卖的那种模型。**这只是本专栏的解读，官方没有解释过许可的差异。**

## 27B：最宽松的那一个

27B 是 8 月 3 日就承诺过的模型，8 月 14 日与 2.4T 权重一起官宣。模型卡的定位是“部署友好的稠密模型”：原生支持图像与视频理解，思考默认开启、可以按请求关闭，上下文原生 262,144、可外推到约 1M。官方帖子说它“整体超过 Qwen3.7-Plus”（官方口径）。

它也是这一代最受欢迎的一个：截至 9 月 19 日，Hugging Face 上 27B 仓库的点赞超过 1.5 万，近一个月下载约 736 万次；2.4T 仓库分别是 1,200 多个和约 5.6 万次。原因不难理解——27B 的 BF16 权重约 56 GB，一张 80 GB 显存的卡就放得下；2.4T 的 BF16 权重约 4.9 TB。

## Flash-Next：发布会上没提的那一个

Flash-Next 8 月 26 日发布，官方博客的标题是“全新架构，迈向极致性价比”。它的生产版本在 API 上叫 **Qwen3.8-Flash**，默认 1M 上下文、带内置工具，国内每百万 token 输入 0.8 元、输出 2.7 元（国际 0.15 美元、0.47 美元）。官方给的对比是：训练开销约为 Qwen3.7-Plus 的 1/9，编程与办公任务上却更强（官方口径）。

第三方数据点目前只有一个：Arena 9 月 2 日公布的 Code Arena：WebDev 榜上，Flash-Next 1,620 分、排第 9，27B 1,599 分、排第 13（众包投票，第三方口径）。

## 这一章对理解 Max 有什么用

1. **架构的来龙去脉有了官方说法**：Max 属于 Qwen3-Next 开创、3.5 至 3.8 一脉相承的那套结构；Qwen4 会换成 Flash-Next 这套。
2. **“开放”要逐个模型看许可**：同一代里从 Apache 2.0 到不设门槛的“另行授权”都有，Max 居中。
3. **技术报告的空白没有被填上**：这一代唯一的报告讲的是 Flash-Next，Max 的训练侧仍然只能靠发布博客里的几段话和一张图。

最后一章收束。👉 [回顾：在证据不足时怎么判断一个模型](https://daiw.org/manual/qwen3-8-max/recap)

## 参考文献

- [1] Qwen Team. [Qwen3.8-27B 模型卡](https://huggingface.co/Qwen/Qwen3.8-27B)、同仓库 `config.json` 与 LICENSE（Apache 2.0），2026-08。
- [2] Qwen Team. [Qwen3.8-Flash-Next 模型卡](https://huggingface.co/Qwen/Qwen3.8-Flash-Next)、同仓库 `config.json` 与 LICENSE（Qwen Community License 1.0），2026-08。
- [3] Qwen Team. “[Qwen3.8-Flash-Next：全新架构，迈向极致性价比](https://qwen.ai/blog?id=qwen3.8-flash-next).” 2026-08-26 —— 结构来历、Qwen4 预览的定位、Qwen3.8-Flash 的定价。
- [4] Qwen Team. “[On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability](https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf).” 技术报告，2026-08-26 —— 预训练对比、QSA 加速、Muon 与稳定性压力测试。
- [5] Qwen Team. [Qwen3.8-2.4T-A95B 模型卡](https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B) 与 LICENSE（Qwen3.8-Max License）。
- [6] Qwen 官方 X 帖子. [27B 与 2.4T 权重的公告](https://x.com/Alibaba_Qwen/status/2088280182356611304)，2026-08-14。
- [7] Qwen Cloud 模型页：[Qwen3.8-Flash](https://www.qwencloud.com/models/qwen3.8-flash)、[Qwen3.8-27B](https://www.qwencloud.com/models/qwen3.8-27b)；阿里云百炼[模型调用价格](https://help.aliyun.com/zh/model-studio/model-pricing)。
- [8] Arena. [Code Arena：WebDev 榜单帖子](https://x.com/arena/status/2094974637704913198)，2026-09-02。
- [9] Hugging Face 模型元数据（点赞、近 30 天下载量、safetensors 参数统计），2026-09-19 查阅。
