視覺是智能基石,AI應增強而非取代人的能動性
視覺是智能的基石;AI 必須增強人的能動性而不是取代它;人類最珍貴的認知,恰恰從未上傳到互聯網。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
視覺是智能基石
李飛飛把視覺放在智能的核心位置,理由來自兩個層面。進化史上,5.4 億年前三葉蟲等海洋動物第一次獲得感光能力,隨之而來的是寒武紀生命大爆發;在 AI 領域,視覺在算法和數據兩方面推動現代人工智能。她還提醒,人類大腦大約一半的皮層活動與視覺功能有關。因此,理解視覺不只是理解眼睛,而是理解智能本身的起點。
— Fei-Fei LiImageNet 與現代 AI 拐點
李飛飛 2006 年在普林斯頓做助理教授時意識到,AI 算法真正的瓶頸是缺乏數據。她受認知神經科學啟發,決定構建大規模數據集,於是有了 ImageNet:1500 萬張圖像,目標是讓機器認識日常物體。2012 年之前,機器表現遠不如人類,人類在 1000 類識別任務上的誤差率約 4%;2012 年神經網絡算法大幅降低誤差,構成拐點,到 2016 年左右算法超越人類。ImageNet 把算法、數據和 GPU 三者合到一起,成為現代 AI 的轉折點。
— Fei-Fei Li視頻生成:數據比肌肉理解更重要
2023 年前後多個團隊把視頻加入訓練數據,2024 年 1 月 Sora 發布,用戶輸入文字就能生成幾秒視頻,比如貓跑向老鼠。李飛飛強調,算法並不理解貓的肌肉結構,它只是從大量視頻裡學到貓運動的合理模式。這跟人類通過觀察學習相似——不是先有生物學知識,而是先有海量數據。視頻生成的意義在於,它讓 AI 從靜態圖像走向動態世界的預測。
— Fei-Fei LiAI 無法訪問未被記錄的人腦信息
李飛飛同意,AI 無法捕捉高度個性化、未被記錄的人類認知行為,比如畢加索創作時的獨特想法。互聯網是最大的多模態人類行為集合,但那些從未被上傳的思維和情感不在其中,無論 AI 多強大也訪問不到。她據此認為人類仍保持獨特性,同時 AI 也能以創造性方式組合已有信息。AI 的邊界不是算力,而是人類有沒有把某個認知過程數字化。
— Fei-Fei Li增強能動性,拒絕傲慢修辭
李飛飛強調,AI 應當增強人的能動性,而不是剝奪它。她批評當前 AI 領域一些領導者,用居高臨下的語言談論 AI,暗示 AI 會取代人類,這種言論既不健康也無益。她還指出「你們不懂」式的公眾修辭很危險,主張通過公共教育讓公眾瞭解利弊,但最終選擇權要留在公眾手裡。基因檢測就是一個例子:早期有恐懼,但人們最終需要自己決定。
— Fei-Fei LiAI 重寫科學發現方式
李飛飛說,AI 會徹底改變科學發現的方式。傳統科學依賴人類大腦的智慧與速度,但 AI 能存儲海量信息、跨學科綜合知識,這給生物醫學等領域帶來巨大機遇。她以視覺和嗅覺為例,說明 AI 能跨越單個人類專家的知識邊界,把不同領域連接起來。這種能力讓 AI 不只是生成對話,而是成為科研基礎設施的一部分。
— Fei-Fei Li年輕一代的工具風險與蘇格拉底式提示
李飛飛擔心 AI 可能剝奪年輕一代的能動性和學習動機,比如無休止刷短視頻;但她反對因噎廢食、完全禁止學生使用 AI。她認為在正確引導下,AI 能成為強大的學習工具,讓這一代人比我們更聰明。她甚至給出一個測驗:誰是人類最好的提示者?答案是蘇格拉底——他的方法本身就是通過提問來尋求真理。提示詞不是技術細節,而是公共教育的一部分。
— Fei-Fei LiWorld Labs 與空間智能
李飛飛 2024 年初創辦 World Labs,專注空間智能和物理智能,她認為這是 AI 的下一個前沿。公司的基礎模型用於生成 3D、4D 世界,服務創作者、機器人訓練和建築設計,目標明顯超出語言本身。她還反覆強調,人類應當主動想像和設計 AI 的未來,不能交給公司或投資人單方面決定。空間智能是視覺是智能基石這一判斷的下一個落點。
— Fei-Fei Li原話 · 已逐字校驗
I see vision as a cornerstone of intelligence.
我將視覺視為智能的基石。
Fei-Fei Li4:37
we need to think about AI as a tool that helps us in our agency. It it should not take away our agency.
我們需要將 AI 視為幫助我們增強能動性的工具,它不應剝奪我們的能動性。
Fei-Fei Li49:41
The absolute bad outcome is that our young generation. There. Agency. And human level motivation of learning and living is taken away by tools.
最糟糕的結果是,我們年輕一代的能動性以及學習和生活的內在動機被工具奪走。
Fei-Fei Li1:29:33
Who is humanity's best prompter? I'm going to flunk this quiz. Socrates, if he were alive. Because that is the method of prompting. Right, think about it. What is Socrates method? Is prompting and seeking truth by asking questions.
誰是人類最好的提示者?我這次考試要不及格了。蘇格拉底,如果他活著的話。因為那就是提示的方法。對,想想看。蘇格拉底的方法是什麼?是通過提問來提示和尋求真理。
Fei-Fei Li1:35:00
They are the most important people in our society. We should be talking to them. We should be uplifting them. We should be supporting them. We should be providing resources to them.
他們是我們社會中最重要的人。我們應該與他們交談。我們應該提升他們。我們應該支持他們。我們應該為他們提供資源。
Fei-Fei Li2:02:02
數字與實體
| 動物首次感光時間 | 5.4 億年前 | 4:37 |
| 人類大腦視覺相關皮層活動比例 | 約一半 | 6:53 |
| ImageNet 圖像數量 | 1500 萬張 | 9:24 |
| ImageNet 挑戰賽人類誤差率 | 約 4% | 16:03 |
| 父親手術出血量相比典型手術 | 少 10 倍 | 1:07:02 |
| David 蛋白棒蛋白質含量 | 20 克 | 1:19:36 |
| David 蛋白棒卡路里 | 150 | 1:19:36 |
| World Labs 成立時間 | 2024 年初 | 1:50:48 |
| ChatGPT 發布時間 | 2022 年 11 月 | 2:03:03 |
術語
- ImageNetImageNet
- 李飛飛主導構建的大規模視覺數據集,1500 萬張圖像,1000 個物體類別。
- 空間智能空間智能
- 理解和生成三維空間的能力,World Labs 認為這是 AI 下一階段的突破點。
- 具身智能具身智能
- AI 通過物理身體與真實世界交互的智能,例如機器人護理老人。
- 多模態多模態
- 同時處理文本、圖像、聲音等多種信息形式,互聯網被視為最大的多模態集合。
收聽指南
教育者、家長、AI 創業者和工程師,以及關心技術邊界與公共討論的人。