大模型基础名词词典
一、模型本体
权重(Weights / Parameters)
- 是什么:模型里那几千万/几十亿个"学出来的数字"。模型 = 固定架构(代码)+ 权重(数字),推理就是拿输入和这些数字做矩阵运算。
参数(Parameters)
- 是什么:权重(乘法系数)+ 偏置(加性项)的统称。口语里"权重"常代指全部参数。"模型多大"通常说的就是参数量。
基座模型(Base / Pretrained Model)
- 是什么:大规模预训练后、还没做指令微调的模型。只会"续写文本",不理解"这是一道题、该给简洁答案"。
指令微调模型(Instruction-tuned / Instruct Model)
- 是什么:在基座模型上,用大量"(指令,理想回答)"对继续训练(SFT),再用人类反馈对齐(RLHF),让它学会"听懂指令、好好回答"。
Transformer / 注意力机制(Attention)
- 是什么:当前大模型的主流架构;注意力是它的核心——让每个 token 在生成时"关注"输入里相关的其他 token。
多头注意力(Multi-head Attention)
- 是什么:Transformer 的核心机制。把"注意力"拆成多个"头"并行计算,每个头关注不同子空间(语法、语义、指代…),再把结果拼回。
位置编码(Positional Encoding)
- 是什么:给每个 token 注入"位置信息",让模型知道词序。否则"猫吃鱼"和"鱼吃猫"对它只是同一堆 token。
多模态(Multimodal)
- 是什么:模型同时理解文本 + 图像 + 音频等多种输入(甚至图文混合生成)。
模型尺寸与开源 / 闭源
- 是什么:参数量(7B / 13B / 70B…)大致决定能力下限;开源(Qwen、Llama)vs 闭源(GPT、Claude)影响部署方式、权重修改、API 接入的灵活度。
二、输入与输出
Token / 分词(Tokenization)
- 是什么:模型不直接吃字符,而是把文本切成最小单位 token(常是子词,不一定是整词;中文常切成字/子词)。
分词器(Tokenizer,BPE / WordPiece / SentencePiece)
- 是什么:执行"分词"的具体算法,决定文本怎么被切成 token、词表长什么样。
词表(Vocabulary)
- 是什么:模型认识的全部 token 集合,通常几万量级。生成时"下一个词"就在这张表的范围里选。
Embedding(词嵌入)
- 是什么:把 token id 映射成一个高维向量;语义相近的词,向量也相近。模型真正的计算在向量空间里进行。
input_ids
- 是什么:token 在词表里的整数编号序列,是送进模型的实际输入。
上下文窗口(Context Window)
- 是什么:模型一次能"看到"的最大 token 数(输入 + 已生成)。超出部分要么被截断,要么靠记忆压缩。
- 硬件视角:窗口有硬上限,根本原因是 HBM 容量被 KV Cache 吃满,见六、推理的硬件视角。
三、生成过程
自回归生成(Autoregressive Generation)
- 是什么:一个一个吐 token,每一步都基于前面所有 token 预测"下一个最可能的词"。
推理(Inference)
- 是什么:用训练好的权重跑前向计算、产出结果。区别于"训练"。
训练 / 预训练 / 微调(Training / Pretraining / Fine-tuning)
- 是什么:训练 = 调整权重以最小化预测误差。预训练在海量无标注文本上自监督学语言规律;微调在特定任务/指令数据上继续训练(含 SFT、RLHF)。
- 展开:完整的训练流水线(预训练 → SFT → 对齐 → 推理训练)见五、训练阶段。
logits
- 是什么:模型最后一层输出的原始分数(未归一化),经 softmax 后变成"下一个词"的概率分布。
温度(Temperature)/ Top-p / 采样
- 是什么:控制生成的随机性。
temperature高 → 分布更平、更随机;低 → 更确定。do_sample决定是"按分布抽样"还是"贪心取最大"。top-p/top-k限制只在概率最高的若干词里抽。
量化(Quantization)
- 是什么:把 fp32 权重压缩成 int8/int4 等,大幅减小体积、加速推理,代价是略损精度。
四、现象与提示词
幻觉(Hallucination)
- 是什么:模型生成流畅但事实错误的文本——它"编造"得理直气壮。
- 延伸:手写工具调用(Function Calling)用外部反馈治幻觉;ReAct 论文笔记 专门讲了怎么边想边查兜底。
思维链(Chain-of-Thought, CoT)
- 是什么:让模型"把思考步骤一步步写出来再给答案",而非直接蹦结果。对数学/逻辑题效果显著。
- 延伸:手写 ReAct Loop 把 CoT 的"想"和工具调用串成循环;ReAct 论文笔记 对比了 CoT 与 ReAct 各自的失败模式。
提示词(Prompt / 提示工程)
- 是什么:写给模型的指令与上下文。提示工程就是"怎么把话说清楚、让模型听话"的技巧(零样本/少样本、角色设定等)。
五、训练阶段:从裸模型到可用助手
现代 LLM 不是一步训出来的,而是分阶段把【基座模型】逐步打磨成"能用的助手"。下面每条都能在上方找到对应的基础词条(用【】标出)。
① 预训练(Pretraining)—— 最贵、最基础
- 数据:万亿级 token 的无标注文本(网页 / 书籍 / 代码)。
- 任务:自监督的"预测下一个词",没有人工标注,靠文本自身当标签。
- 产出:【基座模型】。它只会续写,不懂"这是问题"。
② 监督微调 SFT(Supervised Fine-Tuning)
- 数据:大量人工写的"(指令,理想回答)"对。
- 任务:在基座上继续训练,学会"用户给指令,我就按要求答"。
- 产出:【指令微调模型】——这正是 base vs instruct 的分水岭。
③ 偏好对齐(RLHF / DPO)
- 数据:人类对"哪个回答更好"的成对比较。
- 做法:RLHF 先训奖励模型打分,再用强化学习(PPO)让模型往高分走;DPO 直接偏好优化,不必单独训奖励模型、不必跑 RL 循环,现在更主流。
- 目标:让回答"有用、无害、诚实",而非只追求续写流畅。
④(可选)推理训练(RLVR)
- 数据:可自动验证对错的题(数学、代码)。
- 做法:用强化学习奖励"推理过程正确、答案对",逼出长链思考。
- 产出:推理模型(o1/o3、DeepSeek-R1 这类)。
附:蒸馏(Distillation)
- 是什么:用小模型(学生)模仿大模型(老师)的输出,用更少参数逼近老师能力。"distil"= 蒸馏后的(GPT-2)。
训练机制(权重到底怎么被"学"出来的)
- 损失函数 / 交叉熵(Loss / Cross-entropy):衡量"模型预测离标准答案差多少"。训练的目标就是把这个值压到最低。
- 梯度 / 反向传播(Gradient / Backpropagation):对损失求偏导,得到"每个权重该往哪调、调多少",从输出层反向传回逐层更新【权重】。
不同模型走到了哪几步
| 模型 | 训练阶段 |
|---|---|
distilgpt2(base) | ① 预训练 + 蒸馏,没做 ②③ |
gpt-4o-mini | ① → ② SFT → ③ 对齐,完整流水线 |
Qwen2.5-0.5B-Instruct | 同上 ①②③,所以能答对 Paris |
六、推理的硬件视角:GPU / HBM / KV Cache
前面讲的 token、生成都是"软件视角"。为什么生成一个词要动用显卡、为什么长上下文贵、为什么模型要量化——答案在硬件。这一节和【上下文窗口】【量化】【自回归生成】直接相关。
GPU(图形处理器)
- 是什么:海量核心的并行处理器。LLM 每次前向计算几乎都是"大矩阵乘法"(权重 × 激活),这种高度并行的张量运算正好是 GPU 的强项。
- GPU vs CPU:CPU 核少但单核快,擅长串行逻辑;GPU 核多且规整,擅长并行数值计算。所以跑模型用 GPU,写业务代码用 CPU。
HBM(高带宽显存 / High Bandwidth Memory)
- 是什么:紧贴 GPU 芯片、堆叠其上的高速显存(VRAM)。带宽极高(如 H100 约 3.35 TB/s),但容量有限(通常几十~上百 GB)。
- 为什么关键:推理时权重、激活值、KV Cache 都要放在 HBM 里,并被反复搬进计算单元做矩阵乘。瓶颈常常是"内存带宽够不够快/够不够大",而不只是"算力(FLOPS)够不够"。
KV Cache(键值缓存)
- 是什么:注意力机制里每个 token 会算出 Key、Value 向量。【自回归生成】时若每次都给前面所有 token 重算一遍注意力,极其浪费;KV Cache 把已算过的 K、V 缓存下来,新 token 只需算自己的 QKV 并去查缓存。
- 代价:KV Cache 占用随序列变长线性膨胀,大小 ≈ 层数 × 序列长度 × 2(K,V) × 隐藏维度 × 每元素字节数,吃掉的正是 HBM。
三者关系链
GPU 算力(FLOPS) ──执行──▶ 矩阵乘(权重 × 激活)
▲
│ 数据要不断从显存搬进来
HBM(高带宽显存) ──存放──▶ 权重 + 激活 + KV Cache
▲
│ 容量有限(几十~上百 GB)
KV Cache 随上下文变长而膨胀 ──挤占──▶ HBM 容量一句话:推理 = GPU 反复把 HBM 里的权重/激活搬来搬去做矩阵乘;KV Cache 是其中随对话变长而增长的那块,context window 上限本质受 HBM 容量约束。
深入:Prefill vs Decode(为什么首 token 和后续 token 不一样)
- Prefill(预填充):一次性并行处理整段输入 prompt,计算密集(compute-bound),对应"首 token 延迟 TTFT"。
- Decode(解码):之后逐 token 生成,每步只算一个新 token,受 HBM 带宽限制(memory-bound),KV Cache 逐轮变大,对应"每 token 延迟 TPOT"。
- 这也解释了:长 prompt 开头慢、之后稳定吐字。
七、应用层:Agent 与工具调用
前面六节是"模型本身",这一节是"拿模型来干什么"——工具调用、Agent、RAG 这些应用层概念都落在这里。
智能体(Agent)
- 是什么:能自主多步规划 + 调用工具(Function Calling) 来完成任务的系统,而非一问一答。
- 为什么在基础名词里:Agent = 【指令微调模型】+【自回归生成】+ 工具调用,是前面所有概念的组合体。
检索增强(RAG)
- 是什么:回答前先去外部知识库检索,把相关内容拼进上下文再生成。"让模型查资料,而不是凭记忆编"。
对齐与安全(护栏 / 提示注入)
- 是什么:用输入/输出过滤、拒答、护栏等手段,防模型被"提示注入"(在 prompt 里塞指令骗它干坏事)或被诱导输出有害内容。
基准测试(Benchmark,如 MMLU)
- 是什么:用标准题库统一衡量模型能力,回答"谁更强、强在哪"。