Skip to content

基础入门

版本:v1.1

最后更新:2026-07-08

适用对象:刚接触 AI / LLM 应用、已经会简单调接口但知识体系还不稳、准备继续进入 RAG / Agent / 平台化的读者

很多人学 AI 会卡在一个很奇怪的阶段:

  • 名词看了很多,但脑子里没有稳定结构。
  • Demo 能跑起来,但不知道为什么一上线就变脆。
  • 看了 RAG、Agent、协议、工作流、评测、安全,但边界还是混在一起。

这通常不是因为资料太少,而是因为学习顺序错了。

基础阶段真正要建立的,不是“模型技巧清单”,而是一条能支撑后续工程化的主线:

  1. 先理解一次模型调用究竟由哪些层组成。
  2. 再分清 Prompt、上下文、结构化输出、工具调用分别解决什么问题。
  3. 再开始建立 token、上下文窗口、状态管理、评测与安全意识。
  4. 最后再进入 RAG、Agent、协议和平台工程。

如果这一层没有打稳,后面看得越多,越容易把问题错归因。

1. 这组资料到底在解决什么

基础入门不是“扫盲区”,而是整个 AI Wiki 的底座。

它主要解决 6 个最常见的问题:

1.1 不知道问题到底出在模型、Prompt 还是工程链路

很多人看到效果不好,第一反应就是:

  • 模型不行
  • Prompt 不够强
  • 需要上更复杂的 Agent

但真实情况往往是:

  • 输入结构没分层
  • 上下文污染了任务
  • 输出格式没约束
  • 工具调用条件没定义
  • 检索或状态管理出问题

基础阶段就是要先学会按“层”看问题。

1.2 把一次调用误以为只是“问模型一个问题”

工程里的一次调用,至少包含:

  • 稳定规则
  • 当前任务
  • 用户输入
  • 外部上下文
  • 工具定义
  • 结果消费方式

你真正设计的不是一句 Prompt,而是一份任务执行协议。

1.3 不知道什么时候该继续调 Prompt,什么时候该换方案

基础阶段要能开始区分:

  • 只改 Prompt 就能解决的问题
  • 需要结构化输出的问题
  • 需要检索的问题
  • 需要工具调用的问题
  • 需要工作流或 Agent 的问题

1.4 忽略 token、上下文、状态这类“看不见的成本”

新手最容易低估的不是模型能力,而是这些约束:

  • 上下文窗口不是无限的
  • token 不只是字数
  • 历史消息会污染当前轮
  • 工具定义、schema、图片、文件也会消耗上下文预算

这些约束直接决定方案是否能稳定落地。

1.5 一开始就看复杂专题,反而失去主线

你当然可以直接看:

  • Agent 与工作流
  • MCP / A2A / AG-UI
  • RAG / 向量数据库
  • LLMOps / 安全治理 / 评测运营

但如果没有基础主线,后面就会变成“知道很多词,不知道怎么连起来”。

1.6 缺少“上线意识”

基础阶段不是只学“答出来”。

还要开始建立这些意识:

  • 输出要能被系统消费
  • 失败样例要能回放
  • 高风险动作要能被拦截
  • 方案要能评测、回归、观察和迭代

2. 基础阶段真正要建立的 8 个核心能力

如果你把下面这 8 个能力建立起来,后面进入 LLM 专题、Agent 专题、平台工程和安全治理就会顺很多。

2.1 任务表达能力

你要能把“我想做个 AI 功能”翻译成:

  • 输入是什么
  • 输出是什么
  • 成功标准是什么
  • 失败长什么样

2.2 消息分层能力

你要能分清:

  • 哪些是稳定规则
  • 哪些是用户输入
  • 哪些是检索证据
  • 哪些是工具结果
  • 哪些是历史状态

2.3 输出约束能力

你要知道什么时候:

  • 自然语言回答就够了
  • 需要结构化输出
  • 需要 function/tool calling
  • 需要程序端二次校验

2.4 上下文预算意识

你要知道上下文不是“聊天记录越多越好”,而是预算分配问题。

核心问题包括:

  • 哪些内容必须长期保留
  • 哪些内容需要摘要
  • 哪些内容要按轮丢弃
  • 哪些内容应当缓存、复用或检索拉取

2.5 方案选型能力

看到一个需求,至少要能先判断:

  • 纯 Prompt 就够不够
  • 要不要接结构化输出
  • 要不要接外部工具
  • 要不要接知识库
  • 要不要上 Agent / 工作流

2.6 失败归因能力

效果差时,不是“继续玄学调 Prompt”,而是能按层排查:

  • 输入层
  • 指令层
  • 检索层
  • 输出层
  • 状态层
  • 工具层

2.7 评测意识

基础阶段就要开始做最小闭环:

  • 留样本
  • 留失败样例
  • 留改动前后对比
  • 用固定数据回放

2.8 安全边界意识

即使还没进入安全治理目录,也应该先建立这些最低共识:

  • 模型输出不能默认可信
  • 工具调用不能默认放行
  • 外部输入可能污染上下文
  • 结构化结果也要做程序校验

3. 推荐学习顺序

3.1 从零开始的推荐顺序

  1. AI学习计划
  2. 模型调用与消息结构入门
  3. Transformer架构详解
  4. 提示词工程详解
  5. LLM 与生产化总目录
  6. AI Agents学习文档
  7. AI Agents详细学习资料
  8. AI面试题专题

这个顺序的核心逻辑是:

先建立单次调用心智模型,再理解模型工作原理,再去做复杂系统。

3.2 如果你已经会调模型 API

更适合按这个顺序补短板:

  1. 模型调用与消息结构入门
  2. 提示词工程详解
  3. LLM 与生产化总目录
  4. 平台工程
  5. 安全治理

3.3 如果你要进入 Agent / 协议 / 工作流

建议顺序是:

  1. 先补消息结构、结构化输出、工具调用边界。
  2. 再补状态管理、多步任务拆解和失败回放。
  3. 再进入 AI Agents专题
  4. 最后再看协议生态与互操作。

这样更容易理解为什么会有:

  • MCP
  • A2A
  • AG-UI
  • Structured Outputs
  • Function Calling
  • Agent 编排层

4. 先建立一个最小概念图

基础阶段最重要的是脑子里先有一张图。

4.1 单次调用视角

一次最小调用可以先理解成下面这条链:

  1. 定义任务目标。
  2. 明确规则和边界。
  3. 组织用户输入。
  4. 决定是否带上历史、知识、工具结果。
  5. 发给模型生成输出。
  6. 在应用侧校验、解析、消费结果。

4.2 工程视角

更完整地看,一次调用通常有 8 层:

  • 任务规格:这次到底要解决什么问题。
  • 指令层:角色、规则、禁区、输出要求。
  • 动态输入层:用户这次真正输入的内容。
  • 上下文层:历史、检索证据、状态摘要、工具结果。
  • 模型层:模型本身的推理与生成。
  • 执行层:工具调用、检索系统、工作流节点。
  • 校验层:schema 校验、风险检查、人工审批。
  • 消费层:UI 展示、数据库写入、业务动作触发。

4.3 为什么这张图重要

因为它能帮你回答很多后续问题:

  • 为什么同一句 Prompt 在两个场景效果不同。
  • 为什么 JSON 看似格式正确,但系统还是不能用。
  • 为什么历史消息越多,效果反而越差。
  • 为什么“只是查个数据”不一定需要 Agent。

5. 你在基础阶段最该跑通的 3 个最小闭环

5.1 文本摘要

目标:

  • 练任务目标表达
  • 练输出长度约束
  • 练失败样例收集

5.2 信息抽取

目标:

  • 练字段设计
  • 练结构化输出
  • 练程序校验

5.3 分类与路由

目标:

  • 练边界定义
  • 练不确定时的处理策略
  • 练简单评测集构建

这 3 类任务已经足够让你建立最关键的工程意识,而不需要一开始就去碰复杂系统。

6. 不同角色怎么读这组资料

6.1 应用开发同学

优先关注:

  • 模型调用
  • 输出结构
  • 工具调用
  • 失败回放

建议顺序:

  1. 模型调用与消息结构入门
  2. 提示词工程详解
  3. LLM 与生产化总目录

6.2 平台工程同学

优先关注:

  • token / 上下文
  • 多轮状态
  • schema 与工具定义
  • 可观测、评测、成本、回放

建议顺序:

  1. 模型调用与消息结构入门
  2. LLM 与生产化总目录
  3. 平台工程
  4. 安全治理

6.3 产品 / 方案 / 交付同学

优先关注:

  • 任务边界
  • 输入输出定义
  • 什么时候该用 AI
  • 什么时候不能只靠 AI

建议顺序:

  1. AI学习计划
  2. 模型调用与消息结构入门
  3. AI面试题专题

6.4 准备面试或培训的读者

优先关注:

  • 基础概念能否讲清
  • 是否能从 Demo 讲到工程化
  • 是否能解释选型和权衡

建议顺序:

  1. Transformer架构详解
  2. 模型调用与消息结构入门
  3. 提示词工程详解
  4. AI面试题专题

7. 一张“什么时候该升级方案”的判断表

现象先做什么不要急着做什么
模型偶尔答偏先补任务说明和输入结构不要先上 Agent
输出不能稳定进系统先做结构化输出和程序校验不要只靠“返回 JSON”
明明资料里有却答不出来先排查检索与证据装配不要先微调
需要查实时数据先接工具调用不要把静态知识硬塞进 Prompt
需要跨系统多步决策先定义状态与失败恢复不要一开始就多智能体
历史越多效果越差先做状态压缩与裁剪不要机械保留全部对话

8. 14 天基础入门建议

8.1 第 1 到 3 天

8.2 第 4 到 6 天

  • Transformer架构详解
  • 用自己的话解释 token、上下文窗口和生成机制。
  • 不追求公式,先追求“能讲明白”。

8.3 第 7 到 10 天

  • 提示词工程详解
  • 至少练 3 类任务:摘要、抽取、分类。
  • 每类任务都留成功和失败样例。

8.4 第 11 到 12 天

8.5 第 13 到 14 天

  • AI Agents学习文档
  • 只做一个最小工具调用例子。
  • 分清“单次调用”和“多步 Agent”的边界。

9. 学完基础阶段,至少要能讲清楚这些问题

  1. 一次模型调用里,哪些内容是规则,哪些是动态输入,哪些是上下文。
  2. 为什么结构化输出比自由文本更适合进入工程系统。
  3. token、上下文窗口和成本之间是什么关系。
  4. 为什么历史消息不能无脑一直追加。
  5. 什么时候只改 Prompt 就够了,什么时候该接检索、工具或工作流。
  6. 为什么高风险动作不能只靠模型自己决定。
  7. 为什么要在基础阶段就开始做失败样例和评测集。

10. 最容易踩的坑

  • 还没看懂消息结构,就直接学复杂 Agent 框架。
  • 还没分清输出协议和自然语言回答,就把结果直接写回业务系统。
  • 还没做失败样例沉淀,就不断重写 Prompt。
  • 还没建立 token 和上下文预算意识,就盲目堆历史和资料。
  • 还没搞清工具调用边界,就把所有事都做成“智能体”。

11. 看完本目录后,下一步怎么走

如果你现在最缺的是:

12. 建议同时对照的官方资料

以下入口在 2026-07-08 检查时可访问,适合作为本目录的“外部一手资料地图”。

12.1 OpenAI

12.2 Anthropic

12.3 Google Gemini

13. 这组基础资料和官方文档怎么搭配读

一个比较稳的方式是:

  1. 先用本目录建立中文主线和工程边界。
  2. 再去官方文档确认当前 API 形态、参数、限制和最佳实践。
  3. 不把官方文档当“教程合集”,而是当规范和一手行为说明。

换句话说:

  • 本目录负责帮你“连起来看”。
  • 官方文档负责帮你“按当前版本看准”。

如果你能把这两层结合起来,后面进入更复杂的 RAG、Agent、协议和平台治理,就不会只是看热闹。