Skip to content

大模型基础名词词典

一、模型本体

权重(Weights / Parameters)

  • 是什么:模型里那几千万/几十亿个"学出来的数字"。模型 = 固定架构(代码)+ 权重(数字),推理就是拿输入和这些数字做矩阵运算。

参数(Parameters)

  • 是什么:权重(乘法系数)+ 偏置(加性项)的统称。口语里"权重"常代指全部参数。"模型多大"通常说的就是参数量。

基座模型(Base / Pretrained Model)

  • 是什么:大规模预训练后、还没做指令微调的模型。只会"续写文本",不理解"这是一道题、该给简洁答案"。

指令微调模型(Instruction-tuned / Instruct Model)

  • 是什么:在基座模型上,用大量"(指令,理想回答)"对继续训练(SFT),再用人类反馈对齐(RLHF),让它学会"听懂指令、好好回答"。

Transformer / 注意力机制(Attention)

  • 是什么:当前大模型的主流架构;注意力是它的核心——让每个 token 在生成时"关注"输入里相关的其他 token。

多头注意力(Multi-head Attention)

  • 是什么:Transformer 的核心机制。把"注意力"拆成多个"头"并行计算,每个头关注不同子空间(语法、语义、指代…),再把结果拼回。

位置编码(Positional Encoding)

  • 是什么:给每个 token 注入"位置信息",让模型知道词序。否则"猫吃鱼"和"鱼吃猫"对它只是同一堆 token。

多模态(Multimodal)

  • 是什么:模型同时理解文本 + 图像 + 音频等多种输入(甚至图文混合生成)。

模型尺寸与开源 / 闭源

  • 是什么:参数量(7B / 13B / 70B…)大致决定能力下限;开源(Qwen、Llama)vs 闭源(GPT、Claude)影响部署方式、权重修改、API 接入的灵活度。

二、输入与输出

Token / 分词(Tokenization)

  • 是什么:模型不直接吃字符,而是把文本切成最小单位 token(常是子词,不一定是整词;中文常切成字/子词)。

分词器(Tokenizer,BPE / WordPiece / SentencePiece)

  • 是什么:执行"分词"的具体算法,决定文本怎么被切成 token、词表长什么样。

词表(Vocabulary)

  • 是什么:模型认识的全部 token 集合,通常几万量级。生成时"下一个词"就在这张表的范围里选。

Embedding(词嵌入)

  • 是什么:把 token id 映射成一个高维向量;语义相近的词,向量也相近。模型真正的计算在向量空间里进行。

input_ids

  • 是什么:token 在词表里的整数编号序列,是送进模型的实际输入。

上下文窗口(Context Window)

  • 是什么:模型一次能"看到"的最大 token 数(输入 + 已生成)。超出部分要么被截断,要么靠记忆压缩。
  • 硬件视角:窗口有硬上限,根本原因是 HBM 容量被 KV Cache 吃满,见六、推理的硬件视角

三、生成过程

自回归生成(Autoregressive Generation)

  • 是什么:一个一个吐 token,每一步都基于前面所有 token 预测"下一个最可能的词"。

推理(Inference)

  • 是什么:用训练好的权重跑前向计算、产出结果。区别于"训练"。

训练 / 预训练 / 微调(Training / Pretraining / Fine-tuning)

  • 是什么:训练 = 调整权重以最小化预测误差。预训练在海量无标注文本上自监督学语言规律;微调在特定任务/指令数据上继续训练(含 SFT、RLHF)。
  • 展开:完整的训练流水线(预训练 → SFT → 对齐 → 推理训练)见五、训练阶段

logits

  • 是什么:模型最后一层输出的原始分数(未归一化),经 softmax 后变成"下一个词"的概率分布。

温度(Temperature)/ Top-p / 采样

  • 是什么:控制生成的随机性。temperature 高 → 分布更平、更随机;低 → 更确定。do_sample 决定是"按分布抽样"还是"贪心取最大"。top-p/top-k 限制只在概率最高的若干词里抽。

量化(Quantization)

  • 是什么:把 fp32 权重压缩成 int8/int4 等,大幅减小体积、加速推理,代价是略损精度。

四、现象与提示词

幻觉(Hallucination)

  • 是什么:模型生成流畅但事实错误的文本——它"编造"得理直气壮。
  • 延伸:手写工具调用(Function Calling)用外部反馈治幻觉;ReAct 论文笔记 专门讲了怎么边想边查兜底。

思维链(Chain-of-Thought, CoT)

  • 是什么:让模型"把思考步骤一步步写出来再给答案",而非直接蹦结果。对数学/逻辑题效果显著。
  • 延伸:手写 ReAct Loop 把 CoT 的"想"和工具调用串成循环;ReAct 论文笔记 对比了 CoT 与 ReAct 各自的失败模式。

提示词(Prompt / 提示工程)

  • 是什么:写给模型的指令与上下文。提示工程就是"怎么把话说清楚、让模型听话"的技巧(零样本/少样本、角色设定等)。

五、训练阶段:从裸模型到可用助手

现代 LLM 不是一步训出来的,而是分阶段把【基座模型】逐步打磨成"能用的助手"。下面每条都能在上方找到对应的基础词条(用【】标出)。

① 预训练(Pretraining)—— 最贵、最基础

  • 数据:万亿级 token 的无标注文本(网页 / 书籍 / 代码)。
  • 任务:自监督的"预测下一个词",没有人工标注,靠文本自身当标签。
  • 产出:【基座模型】。它只会续写,不懂"这是问题"。

② 监督微调 SFT(Supervised Fine-Tuning)

  • 数据:大量人工写的"(指令,理想回答)"对。
  • 任务:在基座上继续训练,学会"用户给指令,我就按要求答"。
  • 产出:【指令微调模型】——这正是 base vs instruct 的分水岭。

③ 偏好对齐(RLHF / DPO)

  • 数据:人类对"哪个回答更好"的成对比较。
  • 做法RLHF 先训奖励模型打分,再用强化学习(PPO)让模型往高分走;DPO 直接偏好优化,不必单独训奖励模型、不必跑 RL 循环,现在更主流。
  • 目标:让回答"有用、无害、诚实",而非只追求续写流畅。

④(可选)推理训练(RLVR)

  • 数据:可自动验证对错的题(数学、代码)。
  • 做法:用强化学习奖励"推理过程正确、答案对",逼出长链思考。
  • 产出:推理模型(o1/o3、DeepSeek-R1 这类)。

附:蒸馏(Distillation)

  • 是什么:用小模型(学生)模仿大模型(老师)的输出,用更少参数逼近老师能力。"distil"= 蒸馏后的(GPT-2)。

训练机制(权重到底怎么被"学"出来的)

  • 损失函数 / 交叉熵(Loss / Cross-entropy):衡量"模型预测离标准答案差多少"。训练的目标就是把这个值压到最低。
  • 梯度 / 反向传播(Gradient / Backpropagation):对损失求偏导,得到"每个权重该往哪调、调多少",从输出层反向传回逐层更新【权重】。

不同模型走到了哪几步

模型训练阶段
distilgpt2(base)① 预训练 + 蒸馏,没做 ②③
gpt-4o-mini① → ② SFT → ③ 对齐,完整流水线
Qwen2.5-0.5B-Instruct同上 ①②③,所以能答对 Paris

六、推理的硬件视角:GPU / HBM / KV Cache

前面讲的 token、生成都是"软件视角"。为什么生成一个词要动用显卡、为什么长上下文贵、为什么模型要量化——答案在硬件。这一节和【上下文窗口】【量化】【自回归生成】直接相关。

GPU(图形处理器)

  • 是什么:海量核心的并行处理器。LLM 每次前向计算几乎都是"大矩阵乘法"(权重 × 激活),这种高度并行的张量运算正好是 GPU 的强项。
  • GPU vs CPU:CPU 核少但单核快,擅长串行逻辑;GPU 核多且规整,擅长并行数值计算。所以跑模型用 GPU,写业务代码用 CPU。

HBM(高带宽显存 / High Bandwidth Memory)

  • 是什么:紧贴 GPU 芯片、堆叠其上的高速显存(VRAM)。带宽极高(如 H100 约 3.35 TB/s),但容量有限(通常几十~上百 GB)。
  • 为什么关键:推理时权重、激活值、KV Cache 都要放在 HBM 里,并被反复搬进计算单元做矩阵乘。瓶颈常常是"内存带宽够不够快/够不够大",而不只是"算力(FLOPS)够不够"

KV Cache(键值缓存)

  • 是什么:注意力机制里每个 token 会算出 Key、Value 向量。【自回归生成】时若每次都给前面所有 token 重算一遍注意力,极其浪费;KV Cache 把已算过的 K、V 缓存下来,新 token 只需算自己的 QKV 并去查缓存。
  • 代价:KV Cache 占用随序列变长线性膨胀,大小 ≈ 层数 × 序列长度 × 2(K,V) × 隐藏维度 × 每元素字节数,吃掉的正是 HBM。

三者关系链

GPU 算力(FLOPS) ──执行──▶ 矩阵乘(权重 × 激活)

        │ 数据要不断从显存搬进来
   HBM(高带宽显存) ──存放──▶ 权重 + 激活 + KV Cache

        │ 容量有限(几十~上百 GB)
   KV Cache 随上下文变长而膨胀 ──挤占──▶ HBM 容量

一句话:推理 = GPU 反复把 HBM 里的权重/激活搬来搬去做矩阵乘;KV Cache 是其中随对话变长而增长的那块,context window 上限本质受 HBM 容量约束。

深入:Prefill vs Decode(为什么首 token 和后续 token 不一样)

  • Prefill(预填充):一次性并行处理整段输入 prompt,计算密集(compute-bound),对应"首 token 延迟 TTFT"。
  • Decode(解码):之后逐 token 生成,每步只算一个新 token,受 HBM 带宽限制(memory-bound),KV Cache 逐轮变大,对应"每 token 延迟 TPOT"。
  • 这也解释了:长 prompt 开头慢、之后稳定吐字。

七、应用层:Agent 与工具调用

前面六节是"模型本身",这一节是"拿模型来干什么"——工具调用、Agent、RAG 这些应用层概念都落在这里。

智能体(Agent)

  • 是什么:能自主多步规划 + 调用工具(Function Calling) 来完成任务的系统,而非一问一答。
  • 为什么在基础名词里:Agent = 【指令微调模型】+【自回归生成】+ 工具调用,是前面所有概念的组合体。

检索增强(RAG)

  • 是什么:回答前先去外部知识库检索,把相关内容拼进上下文再生成。"让模型查资料,而不是凭记忆编"。

对齐与安全(护栏 / 提示注入)

  • 是什么:用输入/输出过滤、拒答、护栏等手段,防模型被"提示注入"(在 prompt 里塞指令骗它干坏事)或被诱导输出有害内容。

基准测试(Benchmark,如 MMLU)

  • 是什么:用标准题库统一衡量模型能力,回答"谁更强、强在哪"。

Released under the MIT License.