专题研究深度学习:LLM
深度学习:LLM
从语言建模与 Transformer 开始,理解大语言模型的训练、推理和应用边界。
parz1创刊于 2026持续修订
本辑之问
大语言模型为何只是在预测下一个 Token,却表现出理解与推理的形态?
LLM 的能力来自数据、架构、训练目标与推理过程的共同作用,而不是单一算法的魔法。
讨论范围Token / Attention / 预训练 / 对齐 / 推理
文章与论证
定义:语言模型在预测什么
从概率建模与 Token 序列理解模型的基本任务。
- 01语言模型在预测什么下一个 Token 预测如何构成语言模型的训练目标。待刊
- 02Token 与 Tokenization文本如何被切分、编码,并成为模型能够处理的离散序列。待刊
架构:上下文如何成为表示
Attention 如何组织关系,Transformer 又如何扩展这种计算。
- 03Attention 与 Transformer模型如何在序列中选择信息,并形成上下文相关的表示。待刊
系统:能力如何被训练、约束与调用
从预训练到推理,观察模型能力形成和暴露的完整链路。
- 04预训练、指令微调与对齐通用预测能力如何被塑造成可遵循指令的模型行为。待刊
- 05LLM 推理与上下文管理模型能力如何在上下文窗口、采样与系统约束中被调用。待刊
本专题将随阅读、写作与修订持续生长。