大语言模型入门:从 Transformer 到对齐

LLM / INTRODUCTION

大语言模型并不是一个装满答案的数据库。更准确地说,它是一个根据已有上下文预测下一个 Token 的概率模型。规模、数据和训练方法让这个简单目标产生了翻译、问答、写代码与多步推理等复杂能力。

从一句话开始

给定一段文本 x₁, x₂, …, xₜ,语言模型学习的是下一个 Token 的条件概率:

P(x₁, …, xₙ) = ∏ P(xₜ | x₁, …, xₜ₋₁)

生成时,模型先计算词表中每个候选 Token 的概率,再按一定策略选择一个,将它接到上下文末尾并继续预测。聊天、续写和代码补全,本质上都可以还原为这个循环。

“大”主要体现在三个方面:参数量大、训练数据多、计算量高。参数并不直接保存一条条句子,而是把语言中的统计关系压缩进神经网络权重。

文本如何进入模型

01

Tokenization

分词器把文本切成 Token,并映射成整数 ID。Token 可能是一个汉字、单词片段、标点或特殊符号。

02

Embedding

每个 ID 被转换为连续向量。语义或用法相近的 Token,经过训练后通常会形成相近的表示。

03

Position

注意力本身不包含顺序概念,因此还需要位置编码,让模型区分“猫追狗”和“狗追猫”。

分词方式会影响序列长度、计算成本和多语言表现。模型看到的不是原始字符串,而是一串 Token ID 及其向量表示。

Transformer 做了什么

现代 LLM 大多采用 Decoder-Only Transformer。它反复堆叠注意力层和前馈网络,让序列中的每个位置汇总与当前预测相关的信息。

自注意力

同一组输入会被投影成 Query、Key 和 Value。Query 与各个 Key 的相似度决定应该从哪些 Value 中读取更多信息:

Attention(Q, K, V) = softmax(QKᵀ / √dₖ) V

例如,在处理“它”时,某些注意力头可能更多关注前文中的实体;处理代码括号时,另一些头可能关注对应的结构位置。多头注意力允许模型同时学习不同类型的关系。

因果掩码

训练 Decoder-Only 模型时,第 t 个位置不能看到未来 Token,否则预测任务就失去了意义。因果掩码将右侧信息遮住,使训练过程与实际生成保持一致。

从会续写到会对话

01Pre-training

在大规模语料上进行下一个 Token 预测,学习语言、知识和基本能力。

02Supervised Fine-tuning

使用指令—回答样本,让基础模型学会遵循任务格式和对话习惯。

03Preference Alignment

利用人类或规则偏好优化回答,使输出更有帮助、更安全且更符合预期。

预训练得到的是 Base Model;指令微调得到更适合交互的模型;偏好对齐常见方法包括 RLHF、DPO 等。三阶段解决的问题不同,不能简单地把“对话能力”全部归因于参数规模。

当算力有限时,LoRA、QLoRA 等参数高效微调方法只训练少量新增参数,从而降低显存和存储成本。

模型如何生成答案

模型输出的是概率分布,解码策略决定如何从分布中选 Token:

策略特点适合场景
Greedy每次选择概率最高的 Token,稳定但容易重复确定性任务、简单抽取
Temperature调整概率分布的平滑程度控制保守或发散程度
Top-k / Top-p只在高概率候选集合中采样对话、创作与开放式生成

推理速度还会受到上下文长度、KV Cache、批处理和量化方式影响。上下文越长,模型可利用的信息越多,但计算与显存成本也随之增加。

能力与边界

  • 生成不等于检索:模型按概率生成文本,可能产生语法通顺但事实错误的内容。
  • 上下文不等于长期记忆:窗口外的信息不会自动保留,需要借助检索、数据库或外部记忆系统。
  • 语言能力不等于环境行动:要完成长期任务,还需要工具调用、状态管理、规划和反馈机制。
  • 规模不自动保证可靠:评测集、数据分布与提示方式都会影响观察到的能力。

RAG 通过检索外部资料补充上下文,Agent 通过工具与环境交互;它们扩展了模型的使用方式,但不会从根本上消除错误。

建议的学习顺序

  1. 理解 Token、Embedding 与下一个 Token 预测。
  2. 推导一次缩放点积注意力,并实现一个最小 Transformer Block。
  3. 区分 Encoder-Only、Encoder-Decoder 和 Decoder-Only。
  4. 训练一个小型语言模型,完整经历数据处理、预训练和指令微调。
  5. 再进入 LoRA、RAG、Agent、对齐与评测等应用主题。

参考资料

本文的知识结构主要参考 Datawhale 的 Happy-LLM:从零开始构建大模型,并按“建立整体地图”的目标重新组织。希望继续动手实践,可以沿着其 Transformer、预训练、微调、RAG 与 Agent 章节学习。