Large Language Models
8/23/26About 1 min
Large Language Models
LLM 把语言建模扩展为通用 sequence prediction:模型根据上下文估计下一个 token 或其他生成目标,再通过数据规模、architecture、post-training 和工具环境形成可用能力。
Knowledge Map
Capability acquisition
Pretraining
目标函数、数据 mixture、scaling、optimization 和 contamination。
Dense architectureTransformer
Tokenization、embedding、attention、FFN、normalization 和 position。
Sparse capacityMixture of Experts
Router、expert capacity、load balance、communication 和 serving。
Context scalingLong Context
Position、attention cost、retrieval、memory 和 effective context use。
Test-time computationReasoning
Decomposition、verification、search、tools 和 compute allocation。
Alternative generationDiffusion Language Models
非自回归或迭代 refinement 的文本生成范式。
Model Lifecycle
tokenizer + architecture + pretraining data
→ base model
→ instruction / preference / verifiable training
→ inference configuration
→ RAG / tools / product policy
→ evaluation and production feedback“模型能力”是整个组合的行为,不只来自权重。
Modeling Objectives
- Autoregressive:按顺序预测下一个 token,生成路径自然但 decode 串行。
- Autoencoding / masked modeling:恢复被遮盖内容,适合双向表征。
- Denoising / diffusion:从被破坏序列迭代恢复,探索不同生成顺序。
Read a New LLM
- Architecture 是 dense、MoE、recurrent 还是 hybrid?
- Tokenizer、context 和 position strategy 是什么?
- Pretraining data、objective 与 compute budget 如何组成?
- Post-training 使用 demonstration、preference 还是 verifier?
- Evaluation 是否区分 memorization、reasoning、tools 与 contamination?
- Serving 的 memory、latency、throughput 和 deployment constraint 是什么?
