Generative AI
8/3/26About 3 min
Generative AI
这里主要整理大模型时代最常见的一条主线: 预训练模型学到通用能力,经过微调和对齐变得可用,再通过推理系统、多模态桥接和应用层封装进入真实产品。
System Map
Core model
Text Models
语言模型、decoder-only 思路,以及从 token prediction 到能力涌现的主线。
AdaptationFine-tuning
SFT、FFT、PEFT,关注下游任务适配与训练成本。
Capability pipelineTraining Systems
Data、objective、optimization、parallelism、checkpoint 和 experiment lineage。
PreferenceAlignment
从 RLHF 到 RLVR,回答“模型为什么更像人类想要的样子”。
ServingInference
Prefill / Decode、KV Cache、系统瓶颈与线上吞吐优化。
Beyond textMultimodal
视觉编码器、VLM、扩散和音频,把文本模型扩展到更多模态。
Product layerApplication
RAG、Agent、工具调用与 prompt 设计,关注能力如何落地。
Suggested Reading Order
Text -> Pretraining -> Training: 先理解模型本体与能力如何获得。Fine-tuning -> Alignment: 再看如何适配任务、偏好与可验证目标。Inference: 理解 decoding、KV Cache、quantization 与 serving。Multimodal: 在序列建模基础上扩展到图像、视频、音频。Application: 最后把能力接入 RAG、Agent、工具与产品 workflow。
Core Questions
- 模型是怎么学会生成的: 自回归、扩散、masked prediction 等范式有什么差别?
- 模型怎么变得“能用”: SFT、instruction tuning、偏好学习各自解决什么问题?
- 模型怎么跑得动: KV Cache、量化、系统优化的核心矛盾是什么?
- 模型怎么连接现实世界: 多模态编码器、工具调用、RAG 分别承担什么角色?
High-Value Links
- Text Model Notes
- Pretraining
- Mixture of Experts
- Long Context
- Reasoning
- Training Systems
- Fine-tuning
- Alignment
- Inference
- KV Cache
- Decoding
- Quantization
- Multimodal
- RAG
- Agent
Capability Delivery Loop
01Pre-train
从大规模数据中学习通用表示和生成能力。
02Adapt
通过 SFT、PEFT 和偏好优化获得目标任务行为。
03Serve
在显存、吞吐、延迟和成本约束下交付模型能力。
04Ground & Act
用 RAG、工具和 agent orchestration 连接外部知识与环境。
Evaluation Must Match the Layer
- 模型层:能力、泛化、校准、幻觉与安全。
- 推理层:首 token 延迟、生成速度、吞吐、显存和成本。
- RAG 层:检索召回、上下文相关性、答案忠实度。
- Agent 层:任务完成率、工具错误、恢复能力、资源消耗和长程稳定性。
