Skip to content

模型专题

最后核对:2026-07-24

本专题聚焦 2025 年以来主流大模型厂商的公开路线,统一从 发布时间线架构路线公开参数上下文窗口API 价格Agent 适配度 六个角度做对比。

这个专题不是为了做一张“谁第一名”的排行榜,而是为了回答更实际的工程问题:

  1. 同样叫“大模型”,不同厂商到底在押注什么架构方向。
  2. 为什么有些模型适合 高频在线推理,有些更适合 长链路 Agent
  3. 为什么有的厂商强调 总参数,有的更强调 激活参数上下文长度缓存折扣工具生态
  4. 当你真的要做系统选型时,应该先看什么,再看什么。

1. 建议怎么读

1.1 你想先建立整体地图

推荐顺序:

  1. GPT / OpenAI
  2. Claude / Anthropic
  3. GLM / Z.AI
  4. DeepSeek
  5. Kimi / Moonshot AI
  6. Qwen / 阿里云通义千问

这条顺序更适合先建立闭源前沿模型与开源 / 半开源 Agent 模型两条路线的差异。

1.2 你想直接看国产模型路线

推荐顺序:

  1. GLM / Z.AI
  2. DeepSeek
  3. Kimi / Moonshot AI
  4. Qwen / 阿里云通义千问

这条顺序更容易看清 MoE长上下文Agent 工程推理成本 在国内厂商里的不同取舍。

1.3 你想直接为了系统选型

推荐顺序:

  1. 本页的“快速对比”
  2. GPT / OpenAI
  3. Claude / Anthropic
  4. GLM / Z.AI
  5. DeepSeek

先看闭源产品化能力,再看开源 / 可私有化路线,通常更贴近真实采购和落地节奏。

2. 看模型时到底该看什么

很多团队做模型选型时,第一反应是先找“参数最大”或者“榜单最高”的模型。但如果目标是落地而不是围观,真正该看的通常是下面六层。

2.1 架构路线

先看厂商是在走:

  • Dense / 闭源产品路线
  • MoE 稀疏专家路线
  • 长上下文优化路线
  • Agent-first 工程路线

这会直接影响成本结构、吞吐、延迟、部署方式和训练延展性。

2.2 参数口径

参数不能只看一个数字。至少要分清:

  • 总参数(Total Params)
  • 激活参数(Active Params)
  • 是否是专家混合(MoE)
  • 官方是否公开披露

总参数更像“规模上限”,激活参数更接近“单 token 实际算力成本”。

2.3 上下文与注意力机制

看上下文不能只看 1M200K 这种数字,还要看:

  • 长上下文是不是 标准价格
  • 是否需要缓存配合才划算
  • 厂商有没有单独优化长上下文注意力
  • 在长链路 Agent 场景下是否容易出现 目标漂移

2.4 工具与 Agent 适配度

如果你做的是问答机器人,工具支持不一定是第一优先级;但如果你做的是 Agent / Workflow / Coding Agent,就要非常在意:

  • JSON / Structured Output
  • Tool calling
  • Prompt / Context cache
  • 长任务稳定性
  • 多步执行与回放

2.5 价格口径

不要只看“输入输出单价”,还要看:

  • 是否区分 缓存命中非缓存输入
  • 是否有 Batch / Flex / Priority
  • 是否有 长上下文溢价
  • 是否区分 全球路由区域推理
  • 价格单位是 USD 还是 CNY

2.6 披露方式

这也是很容易被忽略的一层:

  • OpenAI、Anthropic 这类闭源厂商通常不披露总参数与激活参数。
  • DeepSeek、Kimi、Qwen、GLM 的部分路线会公开更多架构细节。
  • “披露更多”不等于一定更强,但会显著影响你做私有化评估、算力预算、推理优化时的可判断性。

3. 2025 年以来的快速对比

厂商2025 以来关键节点公开架构信号公开参数口径当前价格观察点
GPT / OpenAIGPT-4.1GPT-5强调长上下文、工具、推理层与产品化能力官方通常不公开总参数价格体系最细,含 cached inputbatchflexpriority
Claude / AnthropicClaude 3.7 SonnetClaude 4 系列强调 agentic coding、长上下文、稳定输出官方通常不公开总参数Prompt caching 与长上下文规则清晰,企业化很强
GLM / Z.AIGLM-4.54.64.755.15.2明确走 native agentic 与长任务执行官方披露较多版本能力与上下文美元计价,价格相对激进,1M context 已进入主线
DeepSeekR1V3 系、V4 Preview强调稀疏注意力、开源推理路线、超高性价比多个版本公开 总参数 / 激活参数API 价格极低,但要结合产品支持面理解
Kimi / Moonshot AIK2K2.6K3强调 Agent、知识工作、长链路执行K2 / K3 公开了较多 MoE 信号人民币计价,缓存价与非缓存价差距明显
Qwen / 通义千问Qwen2.5-MaxQwen3Qwen3-CoderDense 与 MoE 双线并行,模型谱系最丰富公开模型尺寸丰富,适合不同部署层级百炼价格覆盖面最广,云上选项多

4. 架构路线怎么理解

4.1 闭源前沿模型更像“产品系统”

以 OpenAI、Anthropic 为代表的路线,近两年越来越少把重心放在“公开总参数”,而是更强调:

  • 能否稳定使用工具
  • 能否处理长上下文
  • 能否支撑 coding / agent / enterprise workflow
  • 是否提供一整套价格、缓存、批处理、区域路由、平台接入能力

工程上这意味着:

  • 这些模型通常更适合作为 现成生产能力层
  • 但对底层训练与推理细节的可见性较低

4.2 开源 / 可见性更强的厂商更适合做算力和私有化判断

以 DeepSeek、Qwen、Kimi、GLM 为代表的路线,官方更频繁公开:

  • MoE 结构
  • 总参数 / 激活参数
  • 上下文长度
  • 长上下文优化方法

这会让你更容易回答:

  • 这条路线为什么便宜
  • 这个模型为什么擅长长任务
  • 私有化时大概会吃多少显存和带宽

4.3 2025 之后最重要的变化,不只是更大,而是更会“做事”

过去做模型对比,很容易只看知识和推理分数;但从 2025 开始,更关键的变化是:

  • 模型开始围绕 Agent 重构能力表达
  • 工具调用、状态延续、长链路任务、代码执行、知识工作都成了主战场
  • “会不会回答”逐渐变成“能不能持续把任务做完”

所以本专题会反复强调:

  • 不要只把模型看成聊天接口
  • 也不要把 Agent 看成 prompt 技巧

模型架构、价格、缓存、上下文和工具协议,正在一起决定系统上限。

5. 选型时先问自己的五个问题

  1. 你是要 问答 / 摘要,还是要 Agent / Coding / Workflow
  2. 你最敏感的是 价格延迟稳定性 还是 长上下文
  3. 你是否需要 私有化开源可审查多云部署
  4. 你是否需要模型长期处理 200K+ 以上上下文?
  5. 你团队是否已经有完善的 缓存 / 回放 / tracing / eval 体系?

如果这五个问题没先想清楚,后面的参数和价格表非常容易被看成“热闹”,却无法变成决策。

6. 厂商目录

7. 阅读说明

7.1 关于日期

本专题按 2026-07-24 可访问的官方页面核对信息。

  • 2025 年以前的旧模型,除非与当前路线强相关,否则不作为本专题重点。
  • 2026-07-24 之后的未来发布日期,不计入本页结论。

7.2 关于参数

如果官方没有明确公开:

  • 总参数
  • 激活参数
  • 专家数

本专题不会把二手传闻直接写成确定事实,而会明确标成:

  • 官方未披露
  • 根据官方架构描述做的工程推断

7.3 关于价格

价格以官方页面当前标注为准,但以下因素会让真实账单不同:

  • 缓存命中
  • Batch / Flex / Priority
  • 区域路由
  • 长上下文倍率
  • 平台侧活动折扣

所以本专题的价格部分更适合做 横向比较,不是最终采购报价。

8. 主要来源

  • OpenAI Models / Pricing
  • Anthropic Models overview / Pricing
  • Z.AI Overview / Pricing / Release notes
  • DeepSeek News / Pricing
  • Kimi Platform Pricing / Moonshot Research Blog
  • 阿里云百炼模型价格 / Qwen 官方博客