Appearance
2025-至今:推理模型与 Agent 化
本页按 2026-07-24 可访问的公开资料整理。2025 年之后的 AI 仍在快速变化,具体模型名和能力边界应以官方发布页为准。
这一段的关键词是推理、工具、长上下文、低延迟、多模态、工作流和治理。模型不再只被看作一个回答器,而是逐渐成为能接任务、查资料、调用工具、执行步骤、接受审批、写入系统并留下 trace 的工作流组件。
核心变化
| 变化 | 说明 |
|---|---|
| 推理模型成为明确方向 | 模型在复杂数学、代码、规划和多步骤任务上投入更多计算时间 |
| Agent 基础设施产品化 | 工具调用、状态管理、文件检索、浏览器、代码执行和连接器成为平台能力 |
| 长上下文成为常规能力 | 模型可以一次处理更长文档、代码库、音视频和多轮任务历史 |
| 多模态从“能看图”走向实时交互 | 语音、视觉和文本的统一交互开始影响客服、教育、会议和助理产品 |
| 企业治理成为主线 | 评测、trace、审批、权限、数据边界、成本控制和事故响应成为上线门槛 |
代表作品与节点
| 年份 | 代表作品 / 模型 | 价值 |
|---|---|---|
| 2025 | GPT-4.1 | 强调编码、指令遵循和长上下文能力,适合复杂工程任务 |
| 2025 | OpenAI o3 / o4-mini | 推理模型进一步产品化,面向复杂问题求解和工具使用 |
| 2025 | Claude 4 | 继续强化编码、Agent 任务和长时间运行工作流 |
| 2025 | Gemini 2.5 | 强化 thinking、长上下文和多模态任务能力 |
| 2025-2026 | Agent 平台与连接器 | 模型能力开始围绕业务系统接入、工具执行和可治理工作流组织 |
这一段和前面阶段的差别
前几个阶段的代表问题是模型能否识别、生成、翻译、问答、下棋。现在的问题更像工程系统问题:
- 模型是否能把复杂任务拆成步骤。
- 模型是否能正确选择工具并检查工具结果。
- 工具执行是否有权限、审批和回滚。
- 任务过程是否可观测、可暂停、可恢复。
- 成本、延迟和质量是否能被持续治理。
这意味着 AI 应用正在从 Prompt 工程进入系统工程。模型能力仍然重要,但真正上线时,检索、工具、状态、评测、权限和运维会共同决定系统质量。
对学习路径的建议
- 先补 Transformer、LLM 协议和函数调用,不要直接跳到“万能 Agent”。
- 再补 RAG、知识权限、引用设计和检索评测。
- 接着学习工作流状态机、审批、人机协同、trace 和事故响应。
- 最后再做多 Agent 或长期任务,否则很容易把不可控复杂度提前引入系统。