人人都会AI编程

2.1 参数、参数量与模型规模的含义

更新时间:2026-07-09

在第 1 章中,我们反复提到一个概念:大模型把人类知识“压缩进数百亿级参数中”。但“参数”到底是什么?为什么同样叫“70B 模型”,有的能在笔记本上跑,有的却需要八卡服务器?本节把这三个词掰开揉碎讲清楚。这是你在阅读技术报告、选购模型或评估部署成本时,最基础也最容易被混淆的“行业普通话”。


一、参数是什么?可学习的“旋钮”

用最直白的话说,参数(Parameters)就是神经网络中那些可以被训练改变的数字

在大语言模型里,它们主要以两种形态存在:

  • 权重(Weights):连接神经元之间的强度系数,通常以矩阵形式组织。例如,Transformer 中的 Q/K/V 投影矩阵、前馈网络(FFN)的权重矩阵。
  • 偏置(Biases):附加在神经元上的微调项,数量级通常远小于权重,但在某些架构中会被省略(如 Llama 系列部分层使用 RMSNorm 而不使用偏置)。

这些参数在训练开始时被随机初始化,随后通过反向传播不断调整。训练完成后,它们被冻结为一组高精度浮点数(通常是 FP16、BF16 或 FP32)。当你下载一个“70B 模型”的权重文件时,你下载的其实就是这一大堆数字。

直觉类比:把模型想象成一个拥有几亿个旋钮的巨型调音台。每个旋钮控制信号在某条通路上的放大或衰减。训练过程就是不断旋转这些旋钮,直到整个调音台对输入的语音(文本)输出正确的混音(下一个词)。参数越多,调音台能调节的通路就越复杂,能处理的音色(语言模式)就越丰富。


二、参数量:怎么数、怎么看

参数量就是模型中所有可学习数字的总个数。它是衡量模型“大小”的最直观指标。

常见量级对照表(以公开模型为例)

| 参数量级 | 代表模型 | 定位 |
|---------|---------|------|
| ~1B–3B | Phi-3 Mini、Qwen2-1.5B、Gemma 2B | 端侧/手机本地运行 |
| ~7B–9B | Llama 3 8B、Mistral 7B、Qwen2-7B | 开发者首选,单卡可微调 |
| ~13B–14B | Llama 2 13B、Qwen2-14B | 单卡推理流畅,效果提升明显 |
| ~30B–70B | Llama 3 70B、Qwen2-72B、Mixtral 8×22B | 企业级应用,需多卡或量化 |
| ~100B+ | GPT-3 175B、Llama 3.1 405B | 基座模型,少数大厂自研 |
| ~万亿级 | GPT-4(推测)、Mixtral 8×7B(总参数量) | 顶级闭源模型或 MoE 架构 |

单位换算:1B = 10 亿(Billion),1M = 100 万(Million)。行业口语中常说“7B 模型”“70B 模型”,指的就是参数量。

参数量怎么算? 对于标准 Transformer Decoder,有一个粗略的估算公式:

参数量 ≈ 2 × 隐藏层维度 × 层数 × 注意力头数相关项 + 词表维度 × 词表大小

但作为使用者,你不需要手动计算。技术报告(Model Card)会直接给出总数。


三、模型规模:不止于“多少 B”

在日常交流中,“模型规模”常被直接等同于参数量,但在工程和技术评估中,模型规模是一套更完整的画像,至少包括:

| 维度 | 含义 | 为什么重要 |
|------|------|-----------|
| 参数量 | 总权重数量 | 决定存储与推理成本 |
| 隐藏层维度(Hidden Size, d_model) | 每层向量的宽度,如 4096 | 决定单层的表达能力 |
| 层数(Num Layers) | Transformer Block 的堆叠深度,如 32 层 | 决定信息抽象的深度 |
| 注意力头数(Attention Heads) | 并行注意力的分支数 | 影响多语义关联的捕捉能力 |
| FFN 中间维度 | 前馈层的升维倍数(通常 2.7×–4× 隐藏层维度) | 参数量的大头在这里 |
| 上下文窗口(Context Length) | 单次能处理的 Token 上限,如 128K | 直接决定长文档处理能力(详见 2.3 节) |

实用认知:两个模型可能参数量接近,但“身材”完全不同。例如,一个 7B 模型可能是“矮胖型”(隐藏层维度中等、层数较多),另一个可能是“瘦高型”(维度较大、层数较少)。这会影响它们在不同任务上的表现:前者可能更擅长长程依赖,后者可能在知识密度上更高。


四、参数规模为什么重要?三个核心逻辑

1. 知识容量的“物理上限”

1.1 节说过,模型没有外挂数据库,知识全在参数里。参数越多,能编码的事实、概念和关系就越丰富。你可以把参数量理解为大脑的“皮层面积”——面积太小,装不下百科全书的细节。

2. 复杂模式的拟合能力

语言不是线性的。讽刺、多步推理、代码的跨函数引用,都需要高维非线性变换。参数规模直接决定了模型能拟合的函数复杂度。小模型能学会“主谓宾”,但很难学会“先理解需求,再调用工具,最后根据返回结果修正答案”这类复合模式。

3. 涌现能力(Emergence)的前提

2.4 节将详细讨论涌现能力。这里先给一个结论:某些能力(如上下文学习、链式推理)似乎只在模型达到一定规模后才会“突然”出现。虽然学界对“涌现是否只是评估指标的假象”仍有争论,但工业界的共识是——如果你想让模型拥有通用的、跨任务的聪明劲儿,参数规模必须跨过某个阈值(通常在 6B–13B 以上,且随任务难度递增)。


五、实用认知:关于参数规模的四个真相

真相 1:参数量 ≠ 实际能力,对齐质量很关键

一个未经充分对齐的 70B 基座模型,可能在对话体验上不如一个经过精良 SFT+RLHF 的 7B 模型。参数规模给出的是能力上限,而数据质量和训练方法决定实际能发挥多少

真相 2:参数量直接决定你的钱包和硬件预算

这是工程选型中最硬的约束。记住两条粗略公式:

  • 推理显存(FP16/BF16,无量化)

每 1B 参数 ≈ 2 GB 显存
因此,70B 模型全精度推理需要约 140 GB 显存——这远超单张 RTX 4090(24 GB),需要 2 张 A100(80 GB×2)或 8 张 4090 配合张量并行。

  • 推理显存(INT4 量化)

每 1B 参数 ≈ 0.5 GB 显存
70B 模型可压缩到约 35–40 GB,配合 CPU 卸载甚至能在消费级硬件上运行,但会损失少量精度。

此外,KV-Cache(键值缓存) 在长文本推理时会额外吃掉大量显存。1.4 节提到的推理工程层,很大程度上就是在和参数规模带来的显存压力搏斗。

真相 3:MoE 架构打破了“总参数量=激活参数量”的等式

以 Mixtral 8×7B 为例,它的总参数量约为 47B(8 个 7B 专家网络 + 路由参数),但每次前向传播只激活其中 2 个专家,实际参与计算的参数(激活参数量)约 13B。这意味着:

  • 下载和加载时需要 47B 的磁盘/显存;
  • 但推理速度和计算成本接近 13B 模型。

在评估 MoE 模型时,务必分清“总参数量”和“激活参数量”,否则会被硬件需求吓到,或错误估计推理成本。

真相 4:小模型在垂直场景可以反杀大模型

如果你拥有高质量的领域数据,对 7B 模型做全量微调(Full Fine-tuning),它在特定任务上的表现完全可能超过零样本(Zero-shot)的 GPT-4。参数规模是通用能力的护城河,但垂直深度可以通过数据来弥补。这也是 2.2 节“预训练、微调、对齐”范式的商业基础。


六、小结

参数是大语言模型的“物理实体”,参数量是其最直观的规模指标,而模型规模则是包含架构尺寸、上下文长度在内的综合能力画像。

关键 takeaway:

  • 参数 = 可学习的浮点权重,是知识压缩的物理载体;
  • 参数量决定成本底线:每 1B 参数对应约 2GB 全精度显存,这是硬件选型的硬约束;
  • 参数量不直接等于效果:训练数据质量、对齐精度和架构效率同样关键;
  • 警惕 MoE 陷阱:总参数量大不代表推理慢,关键看激活参数量。

在 2.2 节中,我们将进入这些参数的生命周期——它们不是生来就固定不变的,而是经历了预训练(Pre-training)→ 微调(Fine-tuning)→ 对齐(Alignment)三个阶段的锻造。理解参数的“成长史”,是你判断“一个模型为什么这样回答”的深层钥匙。