人人都会AI编程

13.1 Meta Llama 系列:Llama 2 / Llama 3 架构特点、授权协议与生态

更新时间:2026-07-09

在 12 章的闭源模型对比中,我们看到了 GPT-4、Claude 等第一梯队的能力高度。但在开源世界,Meta 的 Llama 系列是迄今为止对整个行业生态影响最深远的基座模型。它不仅是绝大多数开发者接触的第一个“可本地部署的大模型”,更催生了开源社区数以万计的衍生微调模型。

本节从架构、授权与生态三个维度,拆解 Llama 2 与 Llama 3 的技术画像。这是你在做私有化部署、二次开发或商业选型时,无法绕过的基座模型常识。


一、架构基因:Dense Decoder-only 路线的极致优化

Llama 全系列坚守 Decoder-only Transformer(详见 3.7 节),没有采用 Mistral 或 GPT-4 传闻中的 MoE(混合专家,6.5 节)路线。Meta 的选择逻辑很直白:在推理阶段,Dense 模型的 latency 更可控、显存占用更可预测,工程落地更成熟。

Llama 1 时代奠定了几项关键架构选择,Llama 2/3 均予以继承并发扬:

  • 预归一化(Pre-Norm)+ RMSNorm:替代传统 LayerNorm,训练稳定性更好(3.6 节)。
  • SwiGLU 激活函数:替代 ReLU,提升表征能力(3.6 节)。
  • 旋转位置编码(RoPE):支持相对位置感知,并为后续长上下文扩展留下接口(3.5 节)。
  • 无偏置项(No Biases):去除线性层和归一化层的 bias,降低参数量和过拟合风险。

从 Llama 2 到 Llama 3,核心变化不是颠覆架构,而是在 Dense 框架内把 Scaling Laws 推到极致


二、Llama 2:开源商用化的分水岭

2023 年 7 月发布的 Llama 2,是 Meta 首次将模型权重对商业用途开放(附条件),直接引爆了开源大模型创业潮。

模型规格与架构细节

| 规格 | 7B | 13B | 70B |
|------|----|-----|-----|
| 隐藏层维度 | 4096 | 5120 | 8192 |
| 层数 | 32 | 40 | 80 |
| 注意力头数 | 32 | 40 | 64 |
| 上下文长度 | 4K | 4K | 4K |
| 词表大小 | 32K | 32K | 32K |
| 预训练数据量 | ~2T tokens | ~2T tokens | ~2T tokens |
| 注意力机制 | MHA | MHA | GQA |

关键设计:分组查询注意力(GQA)。Llama 2 仅在 70B 版本引入 GQA(Grouped-Query Attention),而 7B/13B 仍使用标准多头注意力(MHA)。GQA 通过让多个查询头共享同一组 K/V 投影,显著减少推理时的 KV-Cache 显存占用(16.5 节),这是大模型落地时降低推理成本的关键杠杆。

对齐与安全性

Llama 2 的对齐流程非常重:在预训练后,经历了 SFT → RLHF(PPO) → Ghost Attention 多轮迭代。Meta 专门强调了其“红队测试”(Red Teaming)投入,试图在安全性和有用性之间取得平衡。实际效果是:Llama 2-Chat 版本的安全护栏较严,但也因过度拒答(over-refusal)被社区诟病。


三、Llama 3:开源基座的新天花板

2024 年 4 月(8B/70B)和 7 月(405B)发布的 Llama 3 系列,是 Meta 对“开源能否追上闭源”这一问题的正面回应。

1. 模型规格与关键升级

| 规格 | 8B | 70B | 405B |
|------|-----|------|--------|
| 隐藏层维度 | 4096 | 8192 | 16384 |
| 层数 | 32 | 80 | 126 |
| 注意力头数 | 32 | 64 | 128 |
| 上下文长度 | 8K → 128K | 8K → 128K | 8K → 128K |
| 词表大小 | 128K | 128K | 128K |
| 预训练数据量 | >15T tokens | >15T tokens | >15T tokens |
| 注意力机制 | GQA | GQA | GQA |

架构层面的显著变化

  • 全系列 GQA:即使是 8B 小模型也使用 GQA,这意味着 Llama 3 在设计和优化之初就把“推理效率”放在了与“训练效果”同等重要的位置。
  • 128K 词表:采用类 tiktoken 的分词器,大幅压缩多语言文本(尤其是非英语、代码)的序列长度。对中文开发者而言,同样句子的 Token 数比 Llama 2 减少约 15%–30%,直接降低推理成本。
  • 长上下文扩展:预训练阶段使用 8K 上下文,后通过后续训练扩展到 128K。RoPE 的基频(theta)被调整以支持外推,属于“短窗口练能力、长窗口补范围”的典型工程策略(8.6 节)。
  • 405B 的坚守:在 GPT-4 被普遍猜测为 MoE 架构时,Llama 3 405B 坚持 Dense 路线,用 126 层、1.6 万维度的极端深度和宽度换取单一前向路径的性能。这需要 16K+ H100 级别的训练集群,是 18–19 章算力中心规划的极端案例。

2. 训练后(Post-training)范式转变

Llama 3 放弃了 PPO(5.2 节),转而采用 SFT + 拒绝采样(Rejection Sampling, RS) + DPO(5.3 节) 的流水线。DPO 的工程落地难度远低于 RLHF,且 Meta 在多轮迭代中交替使用 RS 和 DPO,逐步提升模型在推理、代码、指令遵循上的硬实力。


四、授权协议:有条件开放的“商业自由”

Llama 系列并非传统意义上的“开源”(如 Apache 2.0 或 MIT)。Meta 使用了专门的 Llama Community License Agreement,其条款是选型时必须评估的法律硬约束。

Llama 2 与 Llama 3 的核心条款

  1. 免费商用边界
  • 如果你的公司月活跃用户数(MAU)低于 7 亿,可以免费商用,无需向 Meta 申请额外授权。
  • 如果超过 7 亿 MAU(或年总收入达到对应规模),必须向 Meta 申请商业许可,Meta 可以拒绝。
  1. 竞业禁止与模型提升限制
  • 不得使用 Llama 的输出来训练、微调或改进任何与 Llama 构成竞争关系的模型。这意味着你不能轻易拿 Llama 3 做教师模型去蒸馏一个自己的开源基座模型。
  • 这一条款的模糊性曾引发社区广泛讨论,也是国内大厂在做模型蒸馏时的重要合规考量。
  1. 可接受使用政策(AUP)
  • 禁止用于监控、欺诈、儿童剥削、军事用途等。违规使用将导致授权自动终止。
  1. 与 Apache 2.0 的本质区别
  • Apache 2.0 授予不可撤销的专利授权,且无任何用户规模限制。Llama License 本质上是附条件的数据使用授权,而非真正的开源软件许可证。

实用建议:如果你的产品计划出海或在资本市场接受尽调,务必让法务审阅 Llama License。对于 MAU 较大的互联网平台或计划将模型作为核心 API 售卖的云厂商,这一点尤为关键。


五、生态版图:从 Hugging Face 到端侧部署

Llama 系列的成功,有一半功劳归于其爆炸式生长的工具生态。

1. 社区微调与衍生模型

  • Llama 2 时代:Vicuna、WizardLM、Chinese-Alpaca-2、百川早期版本(部分技术验证)等均基于 Llama 2 微调。Hugging Face 上的 Llama-2-based 模型一度超过 3 万个。
  • Llama 3 时代:社区迅速跟进,诞生了大量领域专用版(医疗、法律、代码)和多语言增强版(如中文微调版、日语版)。由于 128K 词表和 GQA 的统一,生态迁移成本比 Llama 1→2 时更低。

2. 部署与推理工具链

  • llama.cpp:将 Llama 量化(INT4/INT8,22.2 节)并跑在笔记本 CPU/Mac 上的标志性项目,催生了 Ollama、LM Studio 等傻瓜化工具。
  • vLLM / TensorRT-LLM:企业级高并发推理的首选(23.1、23.2 节),对 GQA 和分页注意力(PagedAttention)有原生优化。
  • 移动端:通过 MLX(Apple Silicon)、Qualcomm AI Stack 等框架,Llama 3 8B 已可在手机、PC 端侧离线运行(25.2 节)。

3. 国内适配

Llama 系列是国内算力中心(第 18–21 章)和国产 GPU(16.3 节)适配最充分的海外基座。华为昇腾、海光 DCU、寒武纪等均提供了 Llama 2/3 的迁移案例和通信优化方案。对于需要私有化部署且受限于闭源 API 合规要求的国内政企客户,Llama 3 是目前最稳妥的开源英文基座选择之一。


六、选型结论:Llama 2 与 Llama 3 如何抉择

| 场景 | 建议 |
|------|------|
| 全新项目,无历史包袱 | 直接选 Llama 3 8B/70B。8B 质量已接近 Llama 2 13B,且推理更快。 |
| 端侧/边缘设备,资源极度受限 | Llama 3 8B INT4 是首选;若硬件只支持 Llama 2 且生态已固化,可维持。 |
| 需要 GPT-4 级别能力的私有化部署 | Llama 3 405B 是目前唯一公开权重、可本地部署的顶级 Dense 模型,但需准备 8×H100(FP8)或更多显存。 |
| 商业授权敏感 | 若 MAU 可能突破 7 亿,或需基于模型输出训练自有基座,建议同时评估 Qwen、Mistral 等真正宽松开源协议(Apache 2.0)的替代品。 |
| 中文为主的业务 | Llama 3 中文能力较 Llama 2 有质的提升,但仍弱于 Qwen、Baichuan 等原生中文优化模型。建议做中文继续预训练(Pre-training)或高质量 SFT(10.3 节)。 |

Llama 系列的最大贡献,在于证明了高质量基座模型的开放权重足以支撑起一个完整的产业生态。在 13.2 节中,我们将转向国内开源的标杆——阿里通义千问(Qwen)系列,看看它在全尺寸覆盖、多模态扩展和协议友好性上,如何走出与 Llama 不同的开源路线。