Skip to content

2025-至今:推理模型与 Agent 化

本页按 2026-07-24 可访问的公开资料整理。2025 年之后的 AI 仍在快速变化,具体模型名和能力边界应以官方发布页为准。

这一段的关键词是推理、工具、长上下文、低延迟、多模态、工作流和治理。模型不再只被看作一个回答器,而是逐渐成为能接任务、查资料、调用工具、执行步骤、接受审批、写入系统并留下 trace 的工作流组件。

核心变化

变化说明
推理模型成为明确方向模型在复杂数学、代码、规划和多步骤任务上投入更多计算时间
Agent 基础设施产品化工具调用、状态管理、文件检索、浏览器、代码执行和连接器成为平台能力
长上下文成为常规能力模型可以一次处理更长文档、代码库、音视频和多轮任务历史
多模态从“能看图”走向实时交互语音、视觉和文本的统一交互开始影响客服、教育、会议和助理产品
企业治理成为主线评测、trace、审批、权限、数据边界、成本控制和事故响应成为上线门槛

代表作品与节点

年份代表作品 / 模型价值
2025GPT-4.1强调编码、指令遵循和长上下文能力,适合复杂工程任务
2025OpenAI o3 / o4-mini推理模型进一步产品化,面向复杂问题求解和工具使用
2025Claude 4继续强化编码、Agent 任务和长时间运行工作流
2025Gemini 2.5强化 thinking、长上下文和多模态任务能力
2025-2026Agent 平台与连接器模型能力开始围绕业务系统接入、工具执行和可治理工作流组织

这一段和前面阶段的差别

前几个阶段的代表问题是模型能否识别、生成、翻译、问答、下棋。现在的问题更像工程系统问题:

  1. 模型是否能把复杂任务拆成步骤。
  2. 模型是否能正确选择工具并检查工具结果。
  3. 工具执行是否有权限、审批和回滚。
  4. 任务过程是否可观测、可暂停、可恢复。
  5. 成本、延迟和质量是否能被持续治理。

这意味着 AI 应用正在从 Prompt 工程进入系统工程。模型能力仍然重要,但真正上线时,检索、工具、状态、评测、权限和运维会共同决定系统质量。

对学习路径的建议

  • 先补 Transformer、LLM 协议和函数调用,不要直接跳到“万能 Agent”。
  • 再补 RAG、知识权限、引用设计和检索评测。
  • 接着学习工作流状态机、审批、人机协同、trace 和事故响应。
  • 最后再做多 Agent 或长期任务,否则很容易把不可控复杂度提前引入系统。

参考资料