人人都会AI编程

一篇论文,八个人:Transformer"八子"如何撑起半个AI江湖

更新时间:2026-08-05

2017年6月,谷歌的八名研究员往arXiv上传了一篇论文,标题带着点理工男的浪漫——《Attention Is All You Need》(注意力就是你所需要的一切)。当时没多少人意识到,这篇论文会成为整个大模型时代的地基:今天叫得上名字的模型,从GPT到Claude,从Gemini到DeepSeek,全部建立在它提出的Transformer架构之上。如今它的引用量已超过十万次,是人工智能史上被引用最多的论文之一。

更有意思的是作者栏那八个名字。此后几年里,他们陆续离开谷歌,创办的公司估值加起来超过千亿美元,几乎撑起了半个AI创业江湖。

自注意力:一场"并行化"的革命

Transformer到底解决了什么问题?这要从它的前辈RNN(循环神经网络)说起。

RNN处理文本像一个逐字阅读的人:读到第100个词时,前面99个词的信息只能靠"记忆"一层层传递,既慢又容易遗忘。而Transformer提出的自注意力(Self-Attention)机制,相当于让人同时扫视整段文字,自动计算每个词与其他所有词的关联强度。

它的核心操作可以概括为三个角色:每个词同时拿出Query(我要找什么)、Key(我是什么)和Value(我携带的信息),通过Query与所有Key的匹配度,加权汇总所有人的Value。一次矩阵运算,全句关系尽收眼底。

这一设计带来两个决定性的优势:一是并行,训练速度相比RNN提升了几个数量级,让"堆算力、扩规模"成为可能;二是长距离依赖,句子开头和结尾的词可以直接对话,不再隔着层层传递而衰减。可以说,没有Transformer,就没有后来Scaling Law(规模法则)大放异彩的舞台。

八个人的"散伙饭"

论文发表后,八位作者没有一位留在谷歌安享成果,而是各奔东西:

  • Noam Shazeer:Transformer之外,他还是MoE(混合专家)架构的开创者。2021年创立Character.AI,做出现象级的AI角色陪伴产品。2024年,谷歌以约27亿美元的授权协议把他"请"了回去,成为业内津津乐道的"最贵返聘"。
  • Aidan Gomez:论文署名时他还是个20岁的实习生,后来创立Cohere,主攻企业级大模型,估值超50亿美元。
  • Llion Jones:远赴东京,与前谷歌科学家David Ha创立Sakana AI,探索从自然界汲取灵感的模型融合方法。
  • Ashish Vaswani与Niki Parmar:论文的一作和三作,先是共同创立Adept,后又双双离开再创立Essential AI,专注让模型学会使用工具。
  • Jakob Uszkoreit:跨界创立生物科技公司Inceptive,用AI设计RNA分子——把语言模型的思路搬到了生命科学。
  • Łukasz Kaiser:加入OpenAI,成为GPT-4和o1推理模型的核心作者之一,从架构的发明者变成了最强大脑的建设者。
  • Illia Polosukhin:走得最早,论文发表前就已离职,创立了区块链项目NEAR Protocol,如今在探索AI与去中心化计算的结合。

为什么偏偏是谷歌"放走"了他们

这个故事最值得玩味的地方在于:发明了Transformer的谷歌,一度成了大模型浪潮的追赶者。

原因并不复杂。大公司要照顾既有业务和声誉风险,论文变成产品的链条天然更长;而研究员们站在技术曲线的最前端,比任何高管都清楚这项技术值多少钱。当创新的速度超过组织的消化能力,人才带着认知出走,几乎是必然结局。

类似剧情在AI史上反复上演:OpenAI的创始团队来自谷歌和学术界,Anthropic的核心成员出自OpenAI,DeepSeek的背后站着量化出身的幻方。技术的火种,总是在流动中蔓延。

结语

八个人,一篇论文,一段各奔前程的江湖故事。Transformer的意义早已超出技术本身——它证明了一个朴素的道理:真正改变世界的,往往不是巨头的战略,而是几个聪明人在正确的时间,把一个优雅的直觉写成了论文。

而"注意力就是你所需要的一切"这句话,或许也是对创业者最好的隐喻:在噪音最大的时代,看清真正重要的东西,然后全情投入。