世界太吵,来原声听播客

Huberman Lab

视觉是智能基石,AI应增强而非取代人的能动性

视觉是智能的基石;AI 必须增强人的能动性而不是取代它;人类最珍贵的认知,恰恰从未上传到互联网。

视觉ImageNet空间智能AI教育具身智能科学发现
李飞飞用进化史、ImageNet 和照顾父母的亲身体验讲 AI 的边界,不堆术语。适合想听一线视角而非宏大叙事的人。

核心论点 · 点时间戳可跳到原声

4:37

视觉是智能基石

李飞飞把视觉放在智能的核心位置,理由来自两个层面。进化史上,5.4 亿年前三叶虫等海洋动物第一次获得感光能力,随之而来的是寒武纪生命大爆发;在 AI 领域,视觉在算法和数据两方面推动现代人工智能。她还提醒,人类大脑大约一半的皮层活动与视觉功能有关。因此,理解视觉不只是理解眼睛,而是理解智能本身的起点。

— Fei-Fei Li
9:24

ImageNet 与现代 AI 拐点

李飞飞 2006 年在普林斯顿做助理教授时意识到,AI 算法真正的瓶颈是缺乏数据。她受认知神经科学启发,决定构建大规模数据集,于是有了 ImageNet:1500 万张图像,目标是让机器认识日常物体。2012 年之前,机器表现远不如人类,人类在 1000 类识别任务上的误差率约 4%;2012 年神经网络算法大幅降低误差,构成拐点,到 2016 年左右算法超越人类。ImageNet 把算法、数据和 GPU 三者合到一起,成为现代 AI 的转折点。

— Fei-Fei Li
29:54

视频生成:数据比肌肉理解更重要

2023 年前后多个团队把视频加入训练数据,2024 年 1 月 Sora 发布,用户输入文字就能生成几秒视频,比如猫跑向老鼠。李飞飞强调,算法并不理解猫的肌肉结构,它只是从大量视频里学到猫运动的合理模式。这跟人类通过观察学习相似——不是先有生物学知识,而是先有海量数据。视频生成的意义在于,它让 AI 从静态图像走向动态世界的预测。

— Fei-Fei Li
37:41

AI 无法访问未被记录的人脑信息

李飞飞同意,AI 无法捕捉高度个性化、未被记录的人类认知行为,比如毕加索创作时的独特想法。互联网是最大的多模态人类行为集合,但那些从未被上传的思维和情感不在其中,无论 AI 多强大也访问不到。她据此认为人类仍保持独特性,同时 AI 也能以创造性方式组合已有信息。AI 的边界不是算力,而是人类有没有把某个认知过程数字化。

— Fei-Fei Li
49:41

增强能动性,拒绝傲慢修辞

李飞飞强调,AI 应当增强人的能动性,而不是剥夺它。她批评当前 AI 领域一些领导者,用居高临下的语言谈论 AI,暗示 AI 会取代人类,这种言论既不健康也无益。她还指出「你们不懂」式的公众修辞很危险,主张通过公共教育让公众了解利弊,但最终选择权要留在公众手里。基因检测就是一个例子:早期有恐惧,但人们最终需要自己决定。

— Fei-Fei Li
1:00:45

AI 重写科学发现方式

李飞飞说,AI 会彻底改变科学发现的方式。传统科学依赖人类大脑的智慧与速度,但 AI 能存储海量信息、跨学科综合知识,这给生物医学等领域带来巨大机遇。她以视觉和嗅觉为例,说明 AI 能跨越单个人类专家的知识边界,把不同领域连接起来。这种能力让 AI 不只是生成对话,而是成为科研基础设施的一部分。

— Fei-Fei Li
1:29:33

年轻一代的工具风险与苏格拉底式提示

李飞飞担心 AI 可能剥夺年轻一代的能动性和学习动机,比如无休止刷短视频;但她反对因噎废食、完全禁止学生使用 AI。她认为在正确引导下,AI 能成为强大的学习工具,让这一代人比我们更聪明。她甚至给出一个测验:谁是人类最好的提示者?答案是苏格拉底——他的方法本身就是通过提问来寻求真理。提示词不是技术细节,而是公共教育的一部分。

— Fei-Fei Li
1:50:48

World Labs 与空间智能

李飞飞 2024 年初创办 World Labs,专注空间智能和物理智能,她认为这是 AI 的下一个前沿。公司的基础模型用于生成 3D、4D 世界,服务创作者、机器人训练和建筑设计,目标明显超出语言本身。她还反复强调,人类应当主动想象和设计 AI 的未来,不能交给公司或投资人单方面决定。空间智能是视觉是智能基石这一判断的下一个落点。

— Fei-Fei Li

原话 · 已逐字校验

I see vision as a cornerstone of intelligence.

我将视觉视为智能的基石。

Fei-Fei Li4:37

we need to think about AI as a tool that helps us in our agency. It it should not take away our agency.

我们需要将 AI 视为帮助我们增强能动性的工具,它不应剥夺我们的能动性。

Fei-Fei Li49:41

The absolute bad outcome is that our young generation. There. Agency. And human level motivation of learning and living is taken away by tools.

最糟糕的结果是,我们年轻一代的能动性以及学习和生活的内在动机被工具夺走。

Fei-Fei Li1:29:33

Who is humanity's best prompter? I'm going to flunk this quiz. Socrates, if he were alive. Because that is the method of prompting. Right, think about it. What is Socrates method? Is prompting and seeking truth by asking questions.

谁是人类最好的提示者?我这次考试要不及格了。苏格拉底,如果他活着的话。因为那就是提示的方法。对,想想看。苏格拉底的方法是什么?是通过提问来提示和寻求真理。

Fei-Fei Li1:35:00

They are the most important people in our society. We should be talking to them. We should be uplifting them. We should be supporting them. We should be providing resources to them.

他们是我们社会中最重要的人。我们应该与他们交谈。我们应该提升他们。我们应该支持他们。我们应该为他们提供资源。

Fei-Fei Li2:02:02

数字与实体

动物首次感光时间5.4 亿年前4:37
人类大脑视觉相关皮层活动比例约一半6:53
ImageNet 图像数量1500 万张9:24
ImageNet 挑战赛人类误差率约 4%16:03
父亲手术出血量相比典型手术少 10 倍1:07:02
David 蛋白棒蛋白质含量20 克1:19:36
David 蛋白棒卡路里1501:19:36
World Labs 成立时间2024 年初1:50:48
ChatGPT 发布时间2022 年 11 月2:03:03

术语

ImageNetImageNet
李飞飞主导构建的大规模视觉数据集,1500 万张图像,1000 个物体类别。
空间智能空间智能
理解和生成三维空间的能力,World Labs 认为这是 AI 下一阶段的突破点。
具身智能具身智能
AI 通过物理身体与真实世界交互的智能,例如机器人护理老人。
多模态多模态
同时处理文本、图像、声音等多种信息形式,互联网被视为最大的多模态集合。

收听指南

谁该听

教育者、家长、AI 创业者和工程师,以及关心技术边界与公共讨论的人。