Appearance
模型专题
最后核对:
2026-07-24本专题聚焦
2025年以来主流大模型厂商的公开路线,统一从发布时间线、架构路线、公开参数、上下文窗口、API 价格、Agent 适配度六个角度做对比。
这个专题不是为了做一张“谁第一名”的排行榜,而是为了回答更实际的工程问题:
- 同样叫“大模型”,不同厂商到底在押注什么架构方向。
- 为什么有些模型适合
高频在线推理,有些更适合长链路 Agent。 - 为什么有的厂商强调
总参数,有的更强调激活参数、上下文长度、缓存折扣或工具生态。 - 当你真的要做系统选型时,应该先看什么,再看什么。
1. 建议怎么读
1.1 你想先建立整体地图
推荐顺序:
这条顺序更适合先建立闭源前沿模型与开源 / 半开源 Agent 模型两条路线的差异。
1.2 你想直接看国产模型路线
推荐顺序:
这条顺序更容易看清 MoE、长上下文、Agent 工程、推理成本 在国内厂商里的不同取舍。
1.3 你想直接为了系统选型
推荐顺序:
先看闭源产品化能力,再看开源 / 可私有化路线,通常更贴近真实采购和落地节奏。
2. 看模型时到底该看什么
很多团队做模型选型时,第一反应是先找“参数最大”或者“榜单最高”的模型。但如果目标是落地而不是围观,真正该看的通常是下面六层。
2.1 架构路线
先看厂商是在走:
Dense / 闭源产品路线MoE 稀疏专家路线长上下文优化路线Agent-first 工程路线
这会直接影响成本结构、吞吐、延迟、部署方式和训练延展性。
2.2 参数口径
参数不能只看一个数字。至少要分清:
总参数(Total Params)激活参数(Active Params)是否是专家混合(MoE)官方是否公开披露
总参数更像“规模上限”,激活参数更接近“单 token 实际算力成本”。
2.3 上下文与注意力机制
看上下文不能只看 1M 或 200K 这种数字,还要看:
- 长上下文是不是
标准价格 - 是否需要缓存配合才划算
- 厂商有没有单独优化长上下文注意力
- 在长链路 Agent 场景下是否容易出现
目标漂移
2.4 工具与 Agent 适配度
如果你做的是问答机器人,工具支持不一定是第一优先级;但如果你做的是 Agent / Workflow / Coding Agent,就要非常在意:
JSON / Structured OutputTool callingPrompt / Context cache长任务稳定性多步执行与回放
2.5 价格口径
不要只看“输入输出单价”,还要看:
- 是否区分
缓存命中与非缓存输入 - 是否有
Batch / Flex / Priority - 是否有
长上下文溢价 - 是否区分
全球路由与区域推理 - 价格单位是
USD还是CNY
2.6 披露方式
这也是很容易被忽略的一层:
- OpenAI、Anthropic 这类闭源厂商通常不披露总参数与激活参数。
- DeepSeek、Kimi、Qwen、GLM 的部分路线会公开更多架构细节。
- “披露更多”不等于一定更强,但会显著影响你做私有化评估、算力预算、推理优化时的可判断性。
3. 2025 年以来的快速对比
| 厂商 | 2025 以来关键节点 | 公开架构信号 | 公开参数口径 | 当前价格观察点 |
|---|---|---|---|---|
| GPT / OpenAI | GPT-4.1、GPT-5 | 强调长上下文、工具、推理层与产品化能力 | 官方通常不公开总参数 | 价格体系最细,含 cached input、batch、flex、priority |
| Claude / Anthropic | Claude 3.7 Sonnet、Claude 4 系列 | 强调 agentic coding、长上下文、稳定输出 | 官方通常不公开总参数 | Prompt caching 与长上下文规则清晰,企业化很强 |
| GLM / Z.AI | GLM-4.5、4.6、4.7、5、5.1、5.2 | 明确走 native agentic 与长任务执行 | 官方披露较多版本能力与上下文 | 美元计价,价格相对激进,1M context 已进入主线 |
| DeepSeek | R1、V3 系、V4 Preview | 强调稀疏注意力、开源推理路线、超高性价比 | 多个版本公开 总参数 / 激活参数 | API 价格极低,但要结合产品支持面理解 |
| Kimi / Moonshot AI | K2、K2.6、K3 | 强调 Agent、知识工作、长链路执行 | K2 / K3 公开了较多 MoE 信号 | 人民币计价,缓存价与非缓存价差距明显 |
| Qwen / 通义千问 | Qwen2.5-Max、Qwen3、Qwen3-Coder | Dense 与 MoE 双线并行,模型谱系最丰富 | 公开模型尺寸丰富,适合不同部署层级 | 百炼价格覆盖面最广,云上选项多 |
4. 架构路线怎么理解
4.1 闭源前沿模型更像“产品系统”
以 OpenAI、Anthropic 为代表的路线,近两年越来越少把重心放在“公开总参数”,而是更强调:
- 能否稳定使用工具
- 能否处理长上下文
- 能否支撑 coding / agent / enterprise workflow
- 是否提供一整套价格、缓存、批处理、区域路由、平台接入能力
工程上这意味着:
- 这些模型通常更适合作为
现成生产能力层 - 但对底层训练与推理细节的可见性较低
4.2 开源 / 可见性更强的厂商更适合做算力和私有化判断
以 DeepSeek、Qwen、Kimi、GLM 为代表的路线,官方更频繁公开:
MoE结构总参数 / 激活参数上下文长度长上下文优化方法
这会让你更容易回答:
- 这条路线为什么便宜
- 这个模型为什么擅长长任务
- 私有化时大概会吃多少显存和带宽
4.3 2025 之后最重要的变化,不只是更大,而是更会“做事”
过去做模型对比,很容易只看知识和推理分数;但从 2025 开始,更关键的变化是:
- 模型开始围绕
Agent重构能力表达 - 工具调用、状态延续、长链路任务、代码执行、知识工作都成了主战场
- “会不会回答”逐渐变成“能不能持续把任务做完”
所以本专题会反复强调:
- 不要只把模型看成聊天接口
- 也不要把 Agent 看成 prompt 技巧
模型架构、价格、缓存、上下文和工具协议,正在一起决定系统上限。
5. 选型时先问自己的五个问题
- 你是要
问答 / 摘要,还是要Agent / Coding / Workflow? - 你最敏感的是
价格、延迟、稳定性还是长上下文? - 你是否需要
私有化、开源可审查或多云部署? - 你是否需要模型长期处理
200K+以上上下文? - 你团队是否已经有完善的
缓存 / 回放 / tracing / eval体系?
如果这五个问题没先想清楚,后面的参数和价格表非常容易被看成“热闹”,却无法变成决策。
6. 厂商目录
7. 阅读说明
7.1 关于日期
本专题按 2026-07-24 可访问的官方页面核对信息。
2025年以前的旧模型,除非与当前路线强相关,否则不作为本专题重点。2026-07-24之后的未来发布日期,不计入本页结论。
7.2 关于参数
如果官方没有明确公开:
总参数激活参数专家数
本专题不会把二手传闻直接写成确定事实,而会明确标成:
官方未披露根据官方架构描述做的工程推断
7.3 关于价格
价格以官方页面当前标注为准,但以下因素会让真实账单不同:
- 缓存命中
- Batch / Flex / Priority
- 区域路由
- 长上下文倍率
- 平台侧活动折扣
所以本专题的价格部分更适合做 横向比较,不是最终采购报价。
8. 主要来源
- OpenAI Models / Pricing
- Anthropic Models overview / Pricing
- Z.AI Overview / Pricing / Release notes
- DeepSeek News / Pricing
- Kimi Platform Pricing / Moonshot Research Blog
- 阿里云百炼模型价格 / Qwen 官方博客