通过 13.1 至 13.5 节的梳理,我们已经分别认识了 Llama、通义千问、Mistral、智谱 GLM 以及各垂直领域开源模型的技术性格。但在真实的落地场景中,开发者很少只面对单一模型,而是需要在同一标尺下做横向取舍:同样 70B 级别,Llama 3 与 Qwen2 谁的硬件门槛更低?同样可商用,Apache 2.0 与 Llama Community License 的风险边界差在哪里?
本节把选型中最硬的五个维度拉通对比。这是你从“技术爱好者”切换为“技术决策者”的必经之路。
一、参数量:不仅看“多少 B”,还要看“怎么长”
参数量是开源模型最显眼的标签,但对比时容易陷入两个误区:
1. 总参数量 ≠ 实际计算负担(MoE 陷阱)
- 稠密模型(Dense,如 Llama 3 70B、Qwen2 72B):总参数 = 激活参数,推理时所有权重都参与计算。
- MoE 模型(如 Mixtral 8×7B):总参数量 47B,但每次只激活约 13B。这意味着加载模型需要 47B 的显存/内存,但生成速度和算力消耗接近 13B 级别。评估硬件门槛时必须分清楚“加载成本”和“计算成本”。
2. 同量级下的“身材差异”
两个 7B 模型,隐藏层维度、层数、FFN 升维比例不同,实际表现可能悬殊。例如 Mistral 7B 采用滑动窗口注意力(SWA)和 GQA,在 7B 量级中效率显著优于早期架构。因此不要只看数字,要同步扫一眼架构创新点(见 13.3 节)。
二、训练数据:规模、质量、语言配比与隐私红线
开源模型的技术报告(Model Card)通常会披露训练数据规模,但“谁的数据更好”远比“谁的数据更多”更难量化。
| 评估子维度 | 实用看点 |
|-----------|---------|
| Token 规模 | 当前主流基座模型普遍进入“万亿 Token”时代(如 Llama 3 系列约 15T,Qwen2 系列约 7T+)。规模是必要条件,但非充分条件。 |
| 数据质量与清洗 | 真正拉开差距的是清洗管线。同样的 Common Crawl 原始语料,去重、过滤、去毒、质量分级的策略不同,模型智商差异巨大。Mistral 7B 曾以“更小参数比肩 13B”出圈,核心胜点之一就是数据精选。 |
| 语言配比 | 国内用户务必关注。Llama 3 以英文为主,中文占比低,原生中文能力弱于同尺寸 Qwen、GLM;Qwen2 和 GLM-4 在中文语料占比和清洗上投入更重,中文指令遵循和知识准确性显著更优。 |
| 数据截止时间 | 决定模型的“知识新鲜度”。开源基座模型的知识截止日期通常比闭源 API 早 3–12 个月。 |
实用建议:如果你做中文 RAG 或客服,优先选中文数据占比高、且持续开源更新指令版本的模型(如 Qwen、GLM),而非单纯追逐英文榜高分。
三、基准成绩:怎么看才不会被“刷榜”误导
基准测试(Benchmark)是开源模型发布时的必考科目,但对比时需要建立批判性视角:
1. 区分“基座分数”与“对齐分数”
- 基座模型(Base/Pretrianed)的分数反映知识储备和原始推理能力;
- 对话模型(Instruct/Chat)经过 SFT+RLHF,分数通常更高,尤其是 HumanEval(代码)、MT-Bench(对话)这类指令评测。
对比时必须同条件对比,拿别人家的 Chat 模型比自家的 Base 模型毫无意义。
2. 国际榜与中文榜不可偏废
| 评测方向 | 代表基准 | 说明 |
|---------|---------|------|
| 通用知识 | MMLU | 多学科选择题,目前 70B 级模型普遍 80+,7B 级多在 60–75 区间 |
| 数学推理 | GSM8K、MATH | 看逐步推理能力,小模型通常靠 CoT 勉强及格,大模型优势明显 |
| 代码能力 | HumanEval、MBPP | 垂直代码模型(CodeLlama、DeepSeek-Coder、Qwen-Coder)通常吊打通用模型 |
| 中文能力 | C-Eval、CMMLU | 国内开发者必看,部分英文强模型在此会出现“水土不服” |
3. 警惕“刷榜”与评测污染
开源社区存在训练数据混入测试集的风险(Benchmark Contamination)。如果一个 7B 模型在某项基准上突然远超所有同行,要查看其技术报告是否披露了去污染措施。
四、授权协议:开源模型的“商业生命线”
这是技术团队最容易忽视、法务团队最敏感的维度。“开源”不等于“免费商用”。
| 协议类型 | 代表模型 | 核心约束 | 实用风险 |
|---------|---------|---------|---------|
| Apache 2.0 | Mistral 7B、Qwen2(7B 及以下部分版本)、Llama 2/3 的某些衍生微调版 | 极宽松:可商用、可修改、可闭源二次分发,仅需保留声明 | 低。适合绝大多数中小企业直接商用。 |
| Llama Community License | Llama 2、Llama 3 系列 | 允许商用,但有月活 7 亿用户上限;禁止用于改进其他独立模型(蒸馏限制);某些高风险行业(如军事、监控)受限 | 中。若你的产品用户量爆发或涉及模型蒸馏训练,需向 Meta 申请特殊许可。 |
| 自定义商用授权 | Qwen2(72B 等部分版本)、GLM-4、ChatGLM3 | 通常允许商用,但可能要求登记、保留水印、或限制竞争性使用 | 中。需逐条阅读 Model License,必要时请法务审核。 |
| Research-Only / 非商用 | 部分学术机构发布的实验模型 | 仅限研究 | 高。误用于商业产品将构成违约。 |
实用建议:
- 下载权重前,务必在 Hugging Face 或 GitHub 仓库根目录找到 LICENSE 文件,不要只看博客宣传。
- 如果你计划基于开源模型训练自己的专有模型(尤其是用其输出做合成数据再蒸馏),Llama 系列的反蒸馏条款是重大雷区,应优先选择 Apache 2.0 或明确允许蒸馏的模型。
五、硬件要求:你的显卡能不能扛住?
这是选型中最硬性的物理约束。以下给出推理场景的显存估算(FP16/BF16 精度,未计入 KV-Cache 冗余,实际部署需上浮 10%–20%):
| 模型规模 | FP16 显存估算 | 量化后(INT4) | 推荐硬件配置 |
|---------|--------------|---------------|-------------|
| 1B–3B | 2–6 GB | 1–2 GB | 消费级显卡(RTX 3060/4060),甚至 CPU 可跑 |
| 7B–9B | 14–18 GB | 4–5 GB | 单卡 RTX 4090(24 GB),可流畅推理 + LoRA 微调 |
| 13B–14B | 26–28 GB | 7–8 GB | 单卡 A100 40GB(FP16);或 4090 用 INT4/GGUF |
| 70B–72B | 140–144 GB | 35–40 GB | 企业级门槛:FP16 需 2×A100 80GB 或 8×A100 40GB(张量并行);INT4 可压到单卡 A100 80GB 或 2×4090 |
| MoE(如 Mixtral 47B) | 加载需 ~94 GB | 加载需 ~24 GB | 加载显存按总参数算,推理速度按激活参数算。INT4 量化后可在单卡 4090/A100 40GB 加载运行 |
微调与训练另有公式:
- 全参数微调(Full Fine-tuning):显存需求 ≈ 4–6 倍推理显存(需存储优化器状态、梯度)。7B 模型全参微调需要 80GB+,70B 模型需要数百 GB 集群。
- 参数高效微调(PEFT,如 LoRA/QLoRA):7B 模型可在 RTX 4090(24GB)上完成;70B 模型可在单卡 A100 80GB 上通过 QLoRA 完成。详见 10.2 节。
六、综合对照速查表
| 模型系列 | 代表型号 | 总参数量 | 激活参数 | 核心语言优势 | 授权宽松度 | FP16 单卡可行性 |
|---------|---------|---------|---------|-------------|-----------|---------------|
| Llama 3 | 8B / 70B | 8B / 70B | 8B / 70B | 英文(中文弱) | 中(月活/蒸馏限制) | 8B 可 / 70B 不可 |
| 通义千问 Qwen2 | 7B / 72B | 7B / 72B | 7B / 72B | 中英文均衡 | 中高(小尺寸 Apache 2.0) | 7B 可 / 72B 不可 |
| Mistral | 7B | 7B | 7B | 英文 | 高(Apache 2.0) | 可 |
| Mixtral | 8×7B | 47B | ~13B | 多语言 | 高(Apache 2.0) | 加载需大显存 |
| GLM-4 | 9B(开源版) | 9B | 9B | 中文、长文本 | 中(自定义商用许可) | 可 |
| CodeLlama | 7B–70B | 7B–70B | 7B–70B | 代码(多语言) | 同 Llama 限制 | 同 Llama |
七、选型提醒:没有“最好”的模型,只有“最合适”的模型
五个维度往往此消彼长:
- Llama 3 70B 英文基座能力顶尖,但中文场景需要大量补充训练,且授权有天花板;
- Qwen2 72B 中文体验原生最优,但 FP16 推理需要重资产硬件;
- Mistral 7B 在 Apache 2.0 下最省心,但面对超复杂推理任务时能力上限不如 70B 级;
- Mixtral 8×7B 试图用 MoE 兼顾性能与速度,但部署复杂度高于稠密模型。
一个快速决策原则:
- 先做授权过滤(排除法务不可接受的);
- 再做硬件过滤(排除跑不起的);
- 最后在做语言场景与基准测试的交叉验证。
至此,第 13 章对主流开源模型的解剖已经完成。在下一章(第 14 章),我们将把视野从“模型本身”提升到“决策框架”,系统回答:在什么业务场景下该选开源私有化部署,什么场景下该选闭源 API,以及如何在成本、效果、周期之间做权衡。