Appearance
基础入门
版本:
v1.1最后更新:
2026-07-08适用对象:刚接触 AI / LLM 应用、已经会简单调接口但知识体系还不稳、准备继续进入 RAG / Agent / 平台化的读者
很多人学 AI 会卡在一个很奇怪的阶段:
- 名词看了很多,但脑子里没有稳定结构。
- Demo 能跑起来,但不知道为什么一上线就变脆。
- 看了 RAG、Agent、协议、工作流、评测、安全,但边界还是混在一起。
这通常不是因为资料太少,而是因为学习顺序错了。
基础阶段真正要建立的,不是“模型技巧清单”,而是一条能支撑后续工程化的主线:
- 先理解一次模型调用究竟由哪些层组成。
- 再分清 Prompt、上下文、结构化输出、工具调用分别解决什么问题。
- 再开始建立 token、上下文窗口、状态管理、评测与安全意识。
- 最后再进入 RAG、Agent、协议和平台工程。
如果这一层没有打稳,后面看得越多,越容易把问题错归因。
1. 这组资料到底在解决什么
基础入门不是“扫盲区”,而是整个 AI Wiki 的底座。
它主要解决 6 个最常见的问题:
1.1 不知道问题到底出在模型、Prompt 还是工程链路
很多人看到效果不好,第一反应就是:
- 模型不行
- Prompt 不够强
- 需要上更复杂的 Agent
但真实情况往往是:
- 输入结构没分层
- 上下文污染了任务
- 输出格式没约束
- 工具调用条件没定义
- 检索或状态管理出问题
基础阶段就是要先学会按“层”看问题。
1.2 把一次调用误以为只是“问模型一个问题”
工程里的一次调用,至少包含:
- 稳定规则
- 当前任务
- 用户输入
- 外部上下文
- 工具定义
- 结果消费方式
你真正设计的不是一句 Prompt,而是一份任务执行协议。
1.3 不知道什么时候该继续调 Prompt,什么时候该换方案
基础阶段要能开始区分:
- 只改 Prompt 就能解决的问题
- 需要结构化输出的问题
- 需要检索的问题
- 需要工具调用的问题
- 需要工作流或 Agent 的问题
1.4 忽略 token、上下文、状态这类“看不见的成本”
新手最容易低估的不是模型能力,而是这些约束:
- 上下文窗口不是无限的
- token 不只是字数
- 历史消息会污染当前轮
- 工具定义、schema、图片、文件也会消耗上下文预算
这些约束直接决定方案是否能稳定落地。
1.5 一开始就看复杂专题,反而失去主线
你当然可以直接看:
- Agent 与工作流
- MCP / A2A / AG-UI
- RAG / 向量数据库
- LLMOps / 安全治理 / 评测运营
但如果没有基础主线,后面就会变成“知道很多词,不知道怎么连起来”。
1.6 缺少“上线意识”
基础阶段不是只学“答出来”。
还要开始建立这些意识:
- 输出要能被系统消费
- 失败样例要能回放
- 高风险动作要能被拦截
- 方案要能评测、回归、观察和迭代
2. 基础阶段真正要建立的 8 个核心能力
如果你把下面这 8 个能力建立起来,后面进入 LLM 专题、Agent 专题、平台工程和安全治理就会顺很多。
2.1 任务表达能力
你要能把“我想做个 AI 功能”翻译成:
- 输入是什么
- 输出是什么
- 成功标准是什么
- 失败长什么样
2.2 消息分层能力
你要能分清:
- 哪些是稳定规则
- 哪些是用户输入
- 哪些是检索证据
- 哪些是工具结果
- 哪些是历史状态
2.3 输出约束能力
你要知道什么时候:
- 自然语言回答就够了
- 需要结构化输出
- 需要 function/tool calling
- 需要程序端二次校验
2.4 上下文预算意识
你要知道上下文不是“聊天记录越多越好”,而是预算分配问题。
核心问题包括:
- 哪些内容必须长期保留
- 哪些内容需要摘要
- 哪些内容要按轮丢弃
- 哪些内容应当缓存、复用或检索拉取
2.5 方案选型能力
看到一个需求,至少要能先判断:
- 纯 Prompt 就够不够
- 要不要接结构化输出
- 要不要接外部工具
- 要不要接知识库
- 要不要上 Agent / 工作流
2.6 失败归因能力
效果差时,不是“继续玄学调 Prompt”,而是能按层排查:
- 输入层
- 指令层
- 检索层
- 输出层
- 状态层
- 工具层
2.7 评测意识
基础阶段就要开始做最小闭环:
- 留样本
- 留失败样例
- 留改动前后对比
- 用固定数据回放
2.8 安全边界意识
即使还没进入安全治理目录,也应该先建立这些最低共识:
- 模型输出不能默认可信
- 工具调用不能默认放行
- 外部输入可能污染上下文
- 结构化结果也要做程序校验
3. 推荐学习顺序
3.1 从零开始的推荐顺序
这个顺序的核心逻辑是:
先建立单次调用心智模型,再理解模型工作原理,再去做复杂系统。
3.2 如果你已经会调模型 API
更适合按这个顺序补短板:
3.3 如果你要进入 Agent / 协议 / 工作流
建议顺序是:
- 先补消息结构、结构化输出、工具调用边界。
- 再补状态管理、多步任务拆解和失败回放。
- 再进入 AI Agents专题。
- 最后再看协议生态与互操作。
这样更容易理解为什么会有:
- MCP
- A2A
- AG-UI
- Structured Outputs
- Function Calling
- Agent 编排层
4. 先建立一个最小概念图
基础阶段最重要的是脑子里先有一张图。
4.1 单次调用视角
一次最小调用可以先理解成下面这条链:
- 定义任务目标。
- 明确规则和边界。
- 组织用户输入。
- 决定是否带上历史、知识、工具结果。
- 发给模型生成输出。
- 在应用侧校验、解析、消费结果。
4.2 工程视角
更完整地看,一次调用通常有 8 层:
任务规格:这次到底要解决什么问题。指令层:角色、规则、禁区、输出要求。动态输入层:用户这次真正输入的内容。上下文层:历史、检索证据、状态摘要、工具结果。模型层:模型本身的推理与生成。执行层:工具调用、检索系统、工作流节点。校验层:schema 校验、风险检查、人工审批。消费层:UI 展示、数据库写入、业务动作触发。
4.3 为什么这张图重要
因为它能帮你回答很多后续问题:
- 为什么同一句 Prompt 在两个场景效果不同。
- 为什么 JSON 看似格式正确,但系统还是不能用。
- 为什么历史消息越多,效果反而越差。
- 为什么“只是查个数据”不一定需要 Agent。
5. 你在基础阶段最该跑通的 3 个最小闭环
5.1 文本摘要
目标:
- 练任务目标表达
- 练输出长度约束
- 练失败样例收集
5.2 信息抽取
目标:
- 练字段设计
- 练结构化输出
- 练程序校验
5.3 分类与路由
目标:
- 练边界定义
- 练不确定时的处理策略
- 练简单评测集构建
这 3 类任务已经足够让你建立最关键的工程意识,而不需要一开始就去碰复杂系统。
6. 不同角色怎么读这组资料
6.1 应用开发同学
优先关注:
- 模型调用
- 输出结构
- 工具调用
- 失败回放
建议顺序:
6.2 平台工程同学
优先关注:
- token / 上下文
- 多轮状态
- schema 与工具定义
- 可观测、评测、成本、回放
建议顺序:
6.3 产品 / 方案 / 交付同学
优先关注:
- 任务边界
- 输入输出定义
- 什么时候该用 AI
- 什么时候不能只靠 AI
建议顺序:
6.4 准备面试或培训的读者
优先关注:
- 基础概念能否讲清
- 是否能从 Demo 讲到工程化
- 是否能解释选型和权衡
建议顺序:
7. 一张“什么时候该升级方案”的判断表
| 现象 | 先做什么 | 不要急着做什么 |
|---|---|---|
| 模型偶尔答偏 | 先补任务说明和输入结构 | 不要先上 Agent |
| 输出不能稳定进系统 | 先做结构化输出和程序校验 | 不要只靠“返回 JSON” |
| 明明资料里有却答不出来 | 先排查检索与证据装配 | 不要先微调 |
| 需要查实时数据 | 先接工具调用 | 不要把静态知识硬塞进 Prompt |
| 需要跨系统多步决策 | 先定义状态与失败恢复 | 不要一开始就多智能体 |
| 历史越多效果越差 | 先做状态压缩与裁剪 | 不要机械保留全部对话 |
8. 14 天基础入门建议
8.1 第 1 到 3 天
- 看完 AI学习计划。
- 读 模型调用与消息结构入门。
- 自己写清楚一个任务的输入、输出和失败样例。
8.2 第 4 到 6 天
- 读 Transformer架构详解。
- 用自己的话解释 token、上下文窗口和生成机制。
- 不追求公式,先追求“能讲明白”。
8.3 第 7 到 10 天
- 读 提示词工程详解。
- 至少练 3 类任务:摘要、抽取、分类。
- 每类任务都留成功和失败样例。
8.4 第 11 到 12 天
- 进入 LLM 与生产化总目录。
- 开始理解评测、回放、成本、延迟和结构化输出。
8.5 第 13 到 14 天
- 读 AI Agents学习文档。
- 只做一个最小工具调用例子。
- 分清“单次调用”和“多步 Agent”的边界。
9. 学完基础阶段,至少要能讲清楚这些问题
- 一次模型调用里,哪些内容是规则,哪些是动态输入,哪些是上下文。
- 为什么结构化输出比自由文本更适合进入工程系统。
- token、上下文窗口和成本之间是什么关系。
- 为什么历史消息不能无脑一直追加。
- 什么时候只改 Prompt 就够了,什么时候该接检索、工具或工作流。
- 为什么高风险动作不能只靠模型自己决定。
- 为什么要在基础阶段就开始做失败样例和评测集。
10. 最容易踩的坑
- 还没看懂消息结构,就直接学复杂 Agent 框架。
- 还没分清输出协议和自然语言回答,就把结果直接写回业务系统。
- 还没做失败样例沉淀,就不断重写 Prompt。
- 还没建立 token 和上下文预算意识,就盲目堆历史和资料。
- 还没搞清工具调用边界,就把所有事都做成“智能体”。
11. 看完本目录后,下一步怎么走
如果你现在最缺的是:
LLM 生产化视角:去看 LLM专题知识库、RAG 与检索:去看 知识库与检索Agent、工作流、协议:去看 AI Agents专题平台交付与治理:去看 平台工程上线安全和审批边界:去看 安全治理
12. 建议同时对照的官方资料
以下入口在 2026-07-08 检查时可访问,适合作为本目录的“外部一手资料地图”。
12.1 OpenAI
- Quickstart
- Text generation
- Prompt engineering
- Prompt guidance
- Conversation state
- Token counting
- Structured outputs
- Function calling
- Evaluation best practices
- Safety best practices
12.2 Anthropic
- Working with Messages
- Prompt engineering overview
- Prompting best practices
- Context windows
- Tool use overview
- Prompt caching
12.3 Google Gemini
13. 这组基础资料和官方文档怎么搭配读
一个比较稳的方式是:
- 先用本目录建立中文主线和工程边界。
- 再去官方文档确认当前 API 形态、参数、限制和最佳实践。
- 不把官方文档当“教程合集”,而是当规范和一手行为说明。
换句话说:
- 本目录负责帮你“连起来看”。
- 官方文档负责帮你“按当前版本看准”。
如果你能把这两层结合起来,后面进入更复杂的 RAG、Agent、协议和平台治理,就不会只是看热闹。