Appearance
Qwen / 通义千问
最后核对:
2026-07-24
Qwen 最大的特点不是某一个单点最强,而是 模型谱系极完整。从小模型、Dense、大型 MoE、Coder、Max,到云上 API 计费,它都铺得很开。
1. 2025 以来的关键节点
| 时间 | 模型 / 事件 | 关键变化 |
|---|---|---|
2025-01-28 | Qwen2.5-Max | 官方强调大规模 MoE 路线和强推理 / 长文本能力 |
2025-04-29 | Qwen3 | 同时推出 Dense 与 MoE 多尺寸谱系 |
2025-07-23 | Qwen3-Coder | 明确把 coding 单独拉成一条大模型路线 |
2. Qwen 的架构路线怎么看
2.1 它是这组厂商里最像“完整模型产品线”的一条路线
Qwen 官方资料最大的信号是:
- 同时维护
Dense与MoE - 同时覆盖
0.6B到235B-A22B - 再叠加
Coder与云上 API SKU
这意味着 Qwen 的优势,不只是某个旗舰模型,而是:
- 你很容易在同一家体系内做不同层级的部署和路由
2.2 官方参数公开度很高
Qwen 官方博客已经明确给出:
Qwen3Dense:0.6B / 1.7B / 4B / 8B / 14B / 32BQwen3MoE:30B-A3B、235B-A22BQwen3-Coder:480B total parameters、35B active parameters
这对做本地部署、私有化、成本模型与能力分层的人非常友好。
3. 公开参数与上下文
| 模型 | 总参数 | 激活参数 | 上下文 | 备注 |
|---|---|---|---|---|
Qwen2.5-Max | 官方博客强调 large-scale MoE | 未在摘要页单独列出 | 长文本能力为主线 | 2025 年初重要过渡代 |
Qwen3-30B-A3B | 30B | 3B active | 云上与开源线路并行 | 适合轻量 MoE 层 |
Qwen3-235B-A22B | 235B | 22B active | 当前主力大型 MoE 之一 | API 与开源心智都很强 |
Qwen3-32B | 32B | Dense | 多部署层适配好 | 适合更稳的 Dense 中层 |
Qwen3-Coder | 480B | 35B active | 256K,可借助 YaRN 扩展到 1M | 明确是 coding 专线 |
4. 当前官方价格观察
以下价格来自阿里云百炼官方价格页,单位为 CNY / 1M tokens。
| 模型 | 输入 | 输出(非思考) | 输出(思考 / 总输出) | 备注 |
|---|---|---|---|---|
qwen3.7-max | ¥12 | ¥36 | 与思考 / 非思考模式同页定义 | 当前高端 Max 档 |
qwen3-235b-a22b | ¥2 | ¥8 | ¥20 | 大型 MoE 主力 |
qwen3-32b | ¥1.174 | ¥4.697 | ¥4.697 | Dense 中层 |
qwen3-30b-a3b | ¥0.75 | ¥3 | ¥7.5 | 轻量 MoE |
qwen3-14b | ¥1 | ¥4 | ¥10 | 更小的通用层 |
qwen3-8b | ¥0.5 | ¥2 | ¥5 | 高性价比执行层 |
4.1 怎么理解这套价格
Qwen 的价值不只是旗舰单价,而是:
- 同一体系下可以很自然地做
多层路由 - 云上 API、开源模型、不同参数规模之间的迁移更顺
这对于真正做平台的人非常重要,因为你很少只需要一个模型。
5. 为什么 Qwen 值得作为“平台型模型体系”来看
5.1 优势
- 模型谱系非常完整
- 参数口径公开度高
- Dense 与 MoE 双线并行,适合不同部署策略
- Qwen3-Coder 把 coding 明确独立出来
- 云上价格和落地路径都比较清楚
5.2 边界
- 体系大也意味着选型更复杂
- 不同模型的思考模式 / 非思考模式、云区与价格规则需要认真分辨
- 如果团队没有路由能力,Qwen 的谱系优势会被浪费
6. 一个关键判断:Qwen 更像“模型操作系统”,不只是单模型
如果你要做的是:
- 多模型协同
- 本地 + 云混合部署
- 按任务大小分层路由
- coding / reasoning / execution 拆层
Qwen 会非常好用。
因为它的强项不是只有一个超级旗舰,而是 整条模型带。
7. 选型建议
优先考虑 Qwen 的情况:
- 你想用同一家体系完成从小到大的路由
- 你想兼顾开源、私有化和云 API
- 你要做 coding / reasoning / cost-aware routing
如果你更想直接选择一个“高端即插即用”的闭源前沿能力层,就继续看 GPT 与 Claude。