2012年,多伦多大学一个叫AlexNet的神经网络横扫ImageNet图像识别竞赛,把错误率一口气拉低十个百分点,深度学习革命就此引爆。但很少有人追问:这场比赛的舞台是谁搭的?答案是一位曾在洗衣店帮工的中国移民女孩——李飞飞。可以说,没有她赌上学术生涯建起的ImageNet,AlexNet再天才也无用武之地。
洗衣店、餐馆与普林斯顿
1976年,李飞飞出生于北京,在成都长大。15岁那年随父母移民美国新泽西州,一家人挤在狭小公寓里,靠开一间干洗店维生。为了贴补家用,她课余时间去中餐馆端盘子,在自家店里接电话、熨衣服。英语不好,她就抱着词典啃,靠数理天赋硬闯——物理和数学不需要太多词汇量。
1995年,她以全额奖学金考入普林斯顿大学物理系。大学期间,每到周末她仍要坐火车回家看店。后来她常半开玩笑地说,自己是在洗衣店的蒸汽味里读完本科的。物理训练给了她一种独特的直觉:重要的不是解出哪道题,而是找到真正值得问的问题。2005年,她在加州理工学院拿到博士学位,研究方向是计算机视觉——让机器学会"看"。此后她辗转伊利诺伊大学香槟分校和普林斯顿任教,2023年出版的自传《我看见的世界》(The Worlds I See),把这段移民岁月写得坦率而动人。
一场不被看好的豪赌
2007年,已是普林斯顿助理教授的李飞飞提出一个近乎疯狂的想法:建一个覆盖两万多个类别、上千万张图片的标注数据集,让算法有东西可学。
当时学界的主流是"巧模型"——设计精巧的算法,在几百张小图上跑实验。同行对她的计划冷嘲热讽:有人劝她"做点正经研究",资助申请也接连被拒。理由很简单:标注1400万张图,得花多少人力?算下来一个研究生要干上百年。
转机来自亚马逊的众包平台Mechanical Turk。李飞飞把标注任务拆成小单,全球数万名网友在线完成,硬是在两年多时间里建起ImageNet——1400多万张图、两万多个类别,全部免费开放。为了保证质量,团队设计了交叉验证机制,同一张图由多人独立标注、相互校验。她还顺手办起竞赛ILSVRC,邀请全世界的算法来打榜,谁识别得准,谁就站上领奖台。
AlexNet时刻:数据赢了
前几年,参赛的算法进步平平,质疑声未消。直到2012年,Hinton的学生Ilya Sutskever和Alex Krizhevsky带着GPU训练的深度神经网络AlexNet登场,以15.3%的错误率碾压亚军的26.2%,直接把第二名甩开一个时代。一夜之间,所有人意识到:算法、算力、数据这三块拼图里,李飞飞补上的是最被低估的那一块。没有ImageNet提供的千万级标注数据和公开擂台,深度学习的春天恐怕还要再晚上几年。她后来在演讲中说过一句广为流传的话:数据将重新定义我们对智能的思考方式。
回头看,这是一个极具讽刺意味的反转——当年嘲笑"堆数据没前途"的学界,此后十年集体转向"大力出奇迹"。今天大模型时代的Scaling Law(规模法则),本质上是ImageNet故事的放大版。
从谷歌回到斯坦福
2017年,李飞飞出任谷歌云首席科学家,推动AI民主化,喊出"AI没有国界,AI的福祉亦无边界"。在大厂的高光时刻里,她始终惦记着另一件事:如果AI只掌握在少数公司和少数人群手中,这场革命就会走偏。2018年她回到斯坦福,联合创立HAI研究院(以人为本人工智能研究院),主张技术必须服务于人、受人类价值观约束。她还创办非营利组织AI4ALL,专门帮助女性和少数族裔学生进入AI领域——那个曾经在中餐馆打工的女孩,想为更多"局外人"推开这扇门。
第二次点火:World Labs与空间智能
2024年,48岁的李飞飞首次创业,成立World Labs,方向是"空间智能"(Spatial Intelligence):让AI理解并生成三维世界,而不只是处理二维图片和一维文字。公司成立不到一年估值即突破10亿美元,2025年发布首个成果Marble——输入一句话或一张图,就能生成可自由漫游的3D世界。
她的判断是:语言模型只是智能的一半。语言是人类文明后天发明的符号系统,而空间感知是老祖宗几亿年进化出来的本能——猫不懂语法,却能在三维世界里精准跳跃、捕猎、避险。今天的AI会写诗却不会"走进"世界,这本身就是一种残缺。让模型理解深度、遮挡、物理规律,具备空间智能,是通往AGI绕不开的一步。2024年她在TED演讲中把这一愿景讲得明明白白,台下掌声雷动——这场景,像极了2007年那个被嘲笑的计划终于等到回响的时刻。
结语
李飞飞的两次豪赌有着相同的配方:在所有人都追逐精巧模型时,她押注被忽视的底层要素——上次是数据,这次是空间。下一次ImageNet时刻何时到来,没人知道,但历史已经给过一次答案。从洗衣店到AI革命的中心,她证明的其实是一件事:真正的远见,往往长得像固执。