专题研究深度学习:LLM

深度学习:LLM

从语言建模与 Transformer 开始,理解大语言模型的训练、推理和应用边界。

parz1创刊于 2026持续修订

本辑之问

大语言模型为何只是在预测下一个 Token,却表现出理解与推理的形态?

LLM 的能力来自数据、架构、训练目标与推理过程的共同作用,而不是单一算法的魔法。

讨论范围Token / Attention / 预训练 / 对齐 / 推理

文章与论证

定义:语言模型在预测什么

从概率建模与 Token 序列理解模型的基本任务。

  1. 01语言模型在预测什么下一个 Token 预测如何构成语言模型的训练目标。待刊
  2. 02Token 与 Tokenization文本如何被切分、编码,并成为模型能够处理的离散序列。待刊

架构:上下文如何成为表示

Attention 如何组织关系,Transformer 又如何扩展这种计算。

  1. 03Attention 与 Transformer模型如何在序列中选择信息,并形成上下文相关的表示。待刊

系统:能力如何被训练、约束与调用

从预训练到推理,观察模型能力形成和暴露的完整链路。

  1. 04预训练、指令微调与对齐通用预测能力如何被塑造成可遵循指令的模型行为。待刊
  2. 05LLM 推理与上下文管理模型能力如何在上下文窗口、采样与系统约束中被调用。待刊

本专题将随阅读、写作与修订持续生长。