人人都会AI编程

1.1 大语言模型(LLM)的核心定义与技术本质

更新时间:2026-07-08

一、一句话定义:它到底是什么?

大语言模型(Large Language Model, LLM) 是一种基于 Transformer 深度学习架构、通过海量文本进行自监督预训练得到的超大规模神经网络。它的核心功能是:接收人类输入的自然语言,计算并生成统计意义上最合理的语言回应。

这个定义里藏着三个关键词,也是理解后续所有技术演进的基石:

  • Transformer 架构:目前几乎所有主流 LLM 的“骨架”,由注意力机制(Attention)驱动,擅长捕捉长距离文本关联。
  • 自监督预训练:不需要人工一句句标注答案,而是让模型在海量无标注文本中自己“找规律”。
  • 超大规模:参数量通常以“亿”为单位起步,训练数据和算力消耗同样达到工业级。

二、“大”在哪里?三个可量化的维度

日常说“大模型”,很多人只想到参数多。实际上“大”是一个系统工程,体现在三个相互制约的维度:

| 维度 | 量级参考(以主流前沿模型为例) | 实际意义 |
|------|-------------------------------|----------|
| 参数规模 | 数十亿(1B)到数千亿(100B+),甚至万亿级 | 模型的“脑容量”,直接决定能记忆和拟合多少复杂模式 |
| 数据规模 | 通常需要万亿(Trillion)级别的 Token | 相当于读了人类积累的大部分高质量数字化文本 |
| 算力规模 | 数千张高端 GPU/TPU 集群,连续训练数月 | 提供足够的计算密度,让参数从随机状态收敛到有序状态 |

这三个维度缺一不可。参数小但数据大,模型“消化不良”;参数大但算力不足,训练无法收敛。这也是 1.4 节将要展开的五层架构(算法、数据、算力、工程、应用)中最核心的三角关系。

三、技术本质:一个高级的“文字接龙”引擎

如果把 LLM 的内部机制剥到最底层,它的技术本质是一个条件概率生成器。用大白话说:它一辈子只练了一个技能——“给前面这段话,接下一个最可能的词”

这个过程的专业名称叫自回归生成(Autoregressive Generation),运行逻辑如下:

  1. 切分:你输入的句子被切成 Token(可以是字、词或子词片段,详见 2.3 节);
  2. 编码:Transformer 通过注意力层扫描整个上下文,把文本映射成高维向量;
  3. 预测:模型输出一个概率分布,预测词汇表里每一个 Token 作为“下一个词”的可能性;
  4. 采样:从中选择一个 Token(通常选概率最高的,也可以按温度参数随机采样);
  5. 循环:把新 Token 拼回句子末尾,重新输入模型,继续预测下一个。

所以,当你看到 LLM 洋洋洒洒写出一篇论文、一段代码或一首诗歌时,它并非在“构思”整体结构,而是一步一步地做局部最优的概率接龙。这种机制解释了为什么它有时会在长文本后半段“跑偏”——因为早期的某个高概率选择,可能已经把后续生成引入了一条逻辑歧路。

四、知识存储:没有硬盘,只有权重

另一个必须建立的认知是:LLM 内部没有数据库,没有知识图谱,也没有可供查询的文档库。它“知道”的一切,全部以浮点数的形式存储在数百亿个参数(权重)之中。

训练过程可以看作一种极端的有损压缩

  • 输入端:数万亿 Token 的人类文明文本(维基百科、书籍、代码、网页);
  • 输出端:一组高维矩阵参数;
  • 压缩方式:通过反向传播不断调整权重,使得模型在预测下一个词时的错误率最小化。

结果是,事实性知识被编码成了向量空间中的几何关系。例如:

  • “法国”和“巴黎”在参数空间中距离很近;
  • “国王 - 男人 + 女人 ≈ 女王”这种语义关系,被编码为向量运算;
  • 编程语言的语法规则,体现为特定神经元激活模式。

但这也带来了固有的局限:

  • 知识是静态的:模型无法自动知道训练截止日期之后发生的事;
  • 知识是隐式的:你无法像查 SQL 数据库那样精确检索它的某个“记忆”;
  • 知识会串线:相似概念在向量空间中可能重叠,导致它把张冠李戴的事实说得非常自信——这就是 2.4 节将详细讨论的“幻觉”(Hallucination)。

五、实用认知:四个“不是”

在与 LLM 打交道时,无论是使用现成产品还是基于它开发应用,先纠偏四个常见误解,能避免很多坑:

1. 它不是搜索引擎
搜索引擎是检索已存在的信息,并明确告诉你信息来源;LLM 是合成新的文本序列。当你问一个冷门问题时,搜索引擎可能返回“无结果”,而 LLM 可能会根据相关模式的统计规律,一本正经地编造出看似合理的答案。

2. 它不是人,没有意识、情感或主观意图
它没有“自我”模型,也没有持续存在的记忆(除非外挂记忆模块)。每一次 API 调用,本质上都是一次独立的概率计算。它表现得“友善”或“谦虚”,只是因为训练数据中的类似对话模式被赋予了高概率,而非它真的拥有性格。

3. 它不是严格的逻辑推理机
它在数学、代码等任务上表现惊人,但这更多是对训练数据中大量逻辑链条的统计复现。遇到训练数据覆盖不足的多步复杂推理时,它更像是一个“直觉很快但容易粗心”的实习生,而不是一个步步为营的数学家。

4. 它不是越大越万能
参数规模大确实能解锁一些“涌现能力”(Emergent Abilities,详见 2.4 节),但如果你的应用场景非常垂直(如特定行业的客服、专业法律文书),一个经过微调的小模型往往比通用大模型更精准、更便宜、更快。这也是 2.2 节“预训练、微调、对齐”范式的现实出发点。

六、小结

大语言模型的技术本质可以浓缩为:

基于 Transformer 架构,通过海量文本自监督学习,将人类语言知识压缩进数百亿级参数中,并以自回归方式逐 Token 生成文本的超大规模概率模型。

理解这一点,你就明白了为什么它能写诗、能编程、能对话,却也会胡说八道、不懂实时信息、对复杂逻辑偶尔犯低级错误。接下来,在 1.2 节中,我们将沿着时间线回溯,看看这个“概率接龙”机器是如何从 20 世纪简单的统计语言模型,一步步进化为今天这种人机交互范式的。