Skip to content

2017-2021:Transformer 与基础模型

这一段 AI 从任务模型走向基础模型。Transformer 让序列建模摆脱了传统 RNN 的效率瓶颈,预训练和规模化让模型开始具备跨任务迁移能力。NLP 率先进入“预训练模型 + 下游适配”的时代。

核心变化

变化说明
Attention 成为核心机制模型可以更直接地建模长距离依赖,训练并行度更高
预训练成为默认路线先在大规模语料上学习通用表示,再适配具体任务
从理解模型走向生成模型BERT 强化理解任务,GPT 系列强化生成和 few-shot 能力
模型规模成为关键变量参数量、数据量、计算量与能力之间的关系被系统关注
多模态基础能力出现雏形CLIP、DALL-E 等工作让文本、图像和生成能力开始融合

代表作品与节点

年份代表作品 / 模型价值
2017Transformer用自注意力机制重塑序列建模
2018BERT推动双向预训练语言模型成为 NLP 主流
2018GPT展示生成式预训练在语言理解任务上的迁移潜力
2019GPT-2展示大规模语言模型的零样本和生成能力
2020GPT-3few-shot prompting 让“用自然语言描述任务”变得可行
2021CLIP把图像和文本放进共同表示空间,影响后续多模态模型
2021DALL-E展示文本到图像生成的基础模型路线

为什么这一段如此关键

Transformer 改变的不只是模型结构。它让模型可以用统一架构处理语言、代码、图像、语音等不同模态,也让“通过规模获得通用能力”成为主流工程路线。

GPT-3 之后,Prompt 不再只是提示词技巧,而开始成为一种人机接口。应用开发者不用为每个任务重新训练模型,而是通过提示、示例、上下文、函数调用和检索来组织模型能力。

参考资料