世界太吵,來原聲聽播客

TWIML AI

語音 AI 的瓶頸不是模型,是 150 毫秒的生物學約束

人類視聽感知只有 6-10 赫茲,模型必須在這個時間窗內被打斷;而高保真音頻意味著每秒更多 token,token 越多參數就得越小——這是語音 AI 繞不開的物理取捨。

語音AI多模態實時推理情感智能數據工程

原視頻在 YouTube 上放不出來,用音頻聽:

前半段是產品與架構的實操判斷,後半段關於 EQ、基準和個性化學習循環的部分更值錢,但需要耐心聽到 45 分鐘以後。

核心論點 · 點時間戳可跳到原聲

6:09

150 毫秒是硬約束,不是工程調優

Alex 給出的起點是生物學:光子打到視網膜到皮層做出反應大約 150 毫秒,這個數字穩定到可以當作神經退行性疾病的非侵入式診斷指標——有病變時信號繞路,耗時更長。人類視聽感知實際運行在 6 到 10 赫茲,雖然我們覺得世界很流暢。所以他們的模型把打斷處理做在 150 毫秒左右的時間窗內。這不是「儘量快」的工程目標,而是對齊人類感知幀率的硬性設計輸入。

— Alexander Smola
8:11

token 頻率和參數量是零和的

音頻要先轉成 token 送進 LLM 骨幹,再轉回音頻。高保真需要高 token 頻率,但高 token 頻率意味著每秒要 prefill 和生成大量 token,成本隨之上升。於是出現一個不愉快的兩難:每秒 token 多,模型參數就不能太大;每秒 token 少,才養得起更多參數。文本是終極壓縮格式,每秒只要 3 到 5 個 token,音頻輕鬆上 10 個以上。10 token/秒意味著每個 token 覆蓋約 100 毫秒——這就是為什麼用戶體驗工程和科學研究必須同時做。

— Alexander Smola
11:14

頭像視頻大部分是無聊的,所以能壓

WAN、Flux 這類模型能生成 10 秒左右的視頻片段,但要做一小時視覺一致的連續流就得改模型。Alex 的關鍵洞察是:如果你知道這是頭像視頻,背景裡就不會有賽車飛馳,大部分畫面相當無聊。所以可以把這段訪談的視聽流壓成相當高效的碼流;只有當他瘋狂揮手時碼率才會飆升,但正常人不會這麼幹。這是「先定價格再倒推架構」的具體落點——不是追求最漂亮的畫質,而是做用戶付得起的東西。

— Alexander Smola
15:17

教模型新模態,它會忘掉舊本事

他們沒自建 LLM,而是用高質量 LLM 已有的智能,讓它多學一個模態。但風險是災難性遺忘。Alex 舉了朋友的例子:在德國收養了一個拉美孩子,只跟她說德語,幾個月內女孩忘光了所有西班牙語單詞。LLM 也一樣,只讓它處理音頻,很快會忘掉推理和語言本身。所以必須維持一個能打的 mid/post-training LLM 流水線,同時定義能把音頻和文本嫁接到一起的任務,就像多語言模型必須知道 dog 和 Hund 指的是同一個東西。

— Alexander Smola
20:24

一億小時音頻,自建數據中心才存得起

他們的訓練數據規模在 1 億小時音頻量級,Alex 換算成大約 200 個人生——如果活 75 年且一直處在嘈雜環境,能聽到的音頻差不多就是這個量。這些數據可以從網上爬,但需要抽取、打標、歸一化、轉寫,大量額外處理。自建數據中心在這裡幫了大忙:放在 NeoCloud 上存儲賬單會把人吃掉,放在三大雲廠商上更糟。他還提到一個時間點:硬盤價格現在大約是去年的三倍,所以接下來得省著點用。

— Alexander Smola
23:28

用中世紀統計法從噪聲裡榨標籤

面對不完美的處理工具產生的噪聲標籤,Alex 的論證是:只要噪聲是無偏的,大量重複測量取平均就能得到比單次更好的估計。他舉了中世紀的「腳尺」——讓人走出教堂,取前 12 個男人,去掉腳最長和最短的各兩個(可能因為畸形),剩下 8 個取平均,就得到一英尺的估計。他說穩健迴歸和估計已經存在了半個千年。具體到音頻:知道這是兩人播客、知道 TWIML 通常是 Sam 加一個人,就能輕鬆分離說話人,拿到大量單人音頻,進而標註得更好,形成飛輪。

— Alexander Smola
33:43

端到端音頻模型註定又小又笨

Alex 把架構選擇講得很直白:端到端音頻模型有它的位置——響應快、體積小、延遲低,但也相當笨。想讓它變聰明,算力成本就變得不可承受。所以他們的做法是兩階段:理解和推理在一端完成,後端觸發合適的工具調用,再把答案收回來,就像多線程編程裡主線程派發並行線程再取回結果。對用戶來說,給他們的模型寫 prompt 和給普通 LLM 寫 prompt 長得一樣,只是他們的模型還會說話。

— Alexander Smola
36:46

比 GPT 便宜十倍,但關掉了思考

Alex 聲稱在 BigBench Audio、Complex Function Bench 這類基準上,他們比 GPT、Gemini、Grok 更好,成本只有 OpenAI 模型的十分之一。但他自己加了一個腳註:這是在關閉 thinking 的情況下測的。理由是不能讓模型停頓思考再回答,那感覺非常不自然,人類也不這麼幹。這暴露了語音場景的一個根本約束——推理能力必須藏在後臺,前臺不能有可見的思考停頓。

— Alexander Smola
43:54

蘋果的開機進度條是騙你的

Alex 用這個例子講人類對延遲的容忍度:人類對延遲非常寬容,前提是被告知有延遲。蘋果開機畫面線性推進,快結束時突然切換成已啟動;微軟的進度條走到 99% 然後卡兩分鐘。他說微軟的進度條是真相,蘋果在騙你——蘋果測量上次開機耗時,加一點點,然後做一個定時走完的假進度條。這是「不用解決不可能的技術問題就能創造好體驗」的障眼法。

— Alexander Smola
50:58

別拿電影當人類互動的參照系

在討論 EQ 時,Alex 警告說電影是糟糕的參照點:浪漫喜劇裡那個痴迷的男主角最後得到女孩,本質是跟蹤,現實中警察會上門;動作片里人們動輒拳腳相向,最後接吻和好,現實中你會進監獄。他說更真實的素材是脫口秀之類,但即便那樣,他也真誠希望沒人會拿 Dr. Phil 訓練模型並假定那是正常人類行為。好消息是 LLM 現在有不錯的心理理論,能提供一些基礎。

— Alexander Smola
55:01

個性化是升級版 CRM,但不止於此

Alex 把學習循環拆成兩層:一層是全局改進,比如知道侮辱用戶會讓人不快(他承認這是極端例子),這類跨交互的學習讓整體模型變好;另一層是個人化,比如知道 Alex 喜歡方程、事實和技術細節,社交上可能有點稜角,下次交互就能更好地為他定製。他形容這像「升級版的 CRM,只不過現在給每個人配一個」,同時模型也在所有交互上學習。他還提到 Nvidia 發布的數字人格和場景被他們用於 RSI 研究。

— Alexander Smola

原話 · 已逐字校驗

it takes about 150 milliseconds for you know basically a photon hitting your retina to your cortex actually doing something with it and that number is reasonably stable that you can actually use that as a non-invasive diagnostic to find out whether you have a neurodeenerative disease

光子打到視網膜、到皮層真正做出反應,大約需要 150 毫秒,這個數字相當穩定,穩定到可以當作非侵入式診斷指標,用來判斷你是否患有神經退行性疾病。

Alexander Smola6:09

many tokens per second means your model cannot have too many parameters whereas if you have a smaller number of tokens per second you can afford more parameters right text is you know the ultimate compressed format in that sense

每秒 token 多,模型就不能有太多參數;每秒 token 少,才養得起更多參數。從這個意義上說,文本是終極的壓縮格式。

Alexander Smola9:12

she adopted uh a kid from Latin America. So, this was in Germany, and she spoke only German to her. And within a matter of months, the girl had forgotten every single word of Spanish

她收養了一個拉美孩子,在德國,她只跟孩子說德語。幾個月之內,女孩忘光了所有西班牙語單詞。

Alexander Smola15:17

if somebody gives you free steel, you don't build a steel mill, you build a car

如果有人白送你鋼鐵,你不會去建鋼廠,你會去造車。

Alexander Smola30:38

the Microsoft boot screen is the truth. What Apple does is very cleverly they measure the boot time that it took last time and they add a tiny amount to it and then they have a fake boot uh progress bar that's timed to go all the way to the end within the time that it took last time to boot

微軟的開機畫面才是真相。蘋果的做法很聰明:他們測量上次開機花了多久,加上一點點,然後做一個假的進度條,定時在上次開機耗時內走完。

Alexander Smola43:54

this is a slightly different optimization uh track rather than models for code generation, right? They worry about task completion. In our case, we worry about human happiness

這是一條不同的優化路線,不同於代碼生成模型。它們關心任務完成,我們關心人類是否愉快。

Alexander Smola46:56

the obsessed guy who in the end gets the girl essentially stalks her, right? If if if you if you did that in reality, you'd the police would show up and and lock you up

那個痴迷的男主角最後得到了女孩,本質上是在跟蹤她。如果你在現實中這麼做,警察會上門把你關起來。

Alexander Smola50:58

Brilliance is good, but brilliance is not repeatable and automatable

才華是好事,但才華不可複製、不可自動化。

Alexander Smola1:00:02

數字與實體

人類視聽感知頻率約 6-10 赫茲7:09
模型打斷處理時間窗約 150 毫秒7:09
文本 token 速率每秒 3-5 個 token9:12
音頻 token 速率每秒 10 個以上9:12
訓練音頻數據量約 1 億小時20:24
訓練數據相當於人生時長約 200 個人生(按 75 年計)20:24
硬盤價格變化約為一年前的三倍21:26
語音模型成本對比約為 OpenAI 模型的十分之一36:46
音頻模型工作量相對語言模型約二分之一到三分之一31:40

術語

Proactbench主動性基準
衡量語音模型是否能在對話中主動介入、判斷何時該打斷的基準。
Ibench交互基準
同一團隊發布的基準,衡量打斷性、響應性和音頻與內容匹配度。
back channeling反饋性應答
對話中「嗯」「對」這類表示在聽的短回應,日語中尤其常見。
millennial sandwich千禧三明治
表揚、批評、再表揚的溝通策略,用於傳達負面反饋而不激怒對方。
theory of the mind心理理論
模型推斷他人信念、意圖和情緒狀態的能力。

收聽指南

誰該聽

做語音/多模態產品的工程師和創業者,尤其是需要判斷實時推理成本、打斷延遲和 EQ 基準的人。

可跳過

開頭 5 分鐘關於 ChatGPT 語音模式好不好用的閒聊可以跳過。