世界太吵,来原声听播客

TWIML AI

语音 AI 的瓶颈不是模型,是 150 毫秒的生物学约束

人类视听感知只有 6-10 赫兹,模型必须在这个时间窗内被打断;而高保真音频意味着每秒更多 token,token 越多参数就得越小——这是语音 AI 绕不开的物理取舍。

语音AI多模态实时推理情感智能数据工程

原视频在 YouTube 上放不出来,用音频听:

前半段是产品与架构的实操判断,后半段关于 EQ、基准和个性化学习循环的部分更值钱,但需要耐心听到 45 分钟以后。

核心论点 · 点时间戳可跳到原声

6:09

150 毫秒是硬约束,不是工程调优

Alex 给出的起点是生物学:光子打到视网膜到皮层做出反应大约 150 毫秒,这个数字稳定到可以当作神经退行性疾病的非侵入式诊断指标——有病变时信号绕路,耗时更长。人类视听感知实际运行在 6 到 10 赫兹,虽然我们觉得世界很流畅。所以他们的模型把打断处理做在 150 毫秒左右的时间窗内。这不是「尽量快」的工程目标,而是对齐人类感知帧率的硬性设计输入。

— Alexander Smola
8:11

token 频率和参数量是零和的

音频要先转成 token 送进 LLM 骨干,再转回音频。高保真需要高 token 频率,但高 token 频率意味着每秒要 prefill 和生成大量 token,成本随之上升。于是出现一个不愉快的两难:每秒 token 多,模型参数就不能太大;每秒 token 少,才养得起更多参数。文本是终极压缩格式,每秒只要 3 到 5 个 token,音频轻松上 10 个以上。10 token/秒意味着每个 token 覆盖约 100 毫秒——这就是为什么用户体验工程和科学研究必须同时做。

— Alexander Smola
11:14

头像视频大部分是无聊的,所以能压

WAN、Flux 这类模型能生成 10 秒左右的视频片段,但要做一小时视觉一致的连续流就得改模型。Alex 的关键洞察是:如果你知道这是头像视频,背景里就不会有赛车飞驰,大部分画面相当无聊。所以可以把这段访谈的视听流压成相当高效的码流;只有当他疯狂挥手时码率才会飙升,但正常人不会这么干。这是「先定价格再倒推架构」的具体落点——不是追求最漂亮的画质,而是做用户付得起的东西。

— Alexander Smola
15:17

教模型新模态,它会忘掉旧本事

他们没自建 LLM,而是用高质量 LLM 已有的智能,让它多学一个模态。但风险是灾难性遗忘。Alex 举了朋友的例子:在德国收养了一个拉美孩子,只跟她说德语,几个月内女孩忘光了所有西班牙语单词。LLM 也一样,只让它处理音频,很快会忘掉推理和语言本身。所以必须维持一个能打的 mid/post-training LLM 流水线,同时定义能把音频和文本嫁接到一起的任务,就像多语言模型必须知道 dog 和 Hund 指的是同一个东西。

— Alexander Smola
20:24

一亿小时音频,自建数据中心才存得起

他们的训练数据规模在 1 亿小时音频量级,Alex 换算成大约 200 个人生——如果活 75 年且一直处在嘈杂环境,能听到的音频差不多就是这个量。这些数据可以从网上爬,但需要抽取、打标、归一化、转写,大量额外处理。自建数据中心在这里帮了大忙:放在 NeoCloud 上存储账单会把人吃掉,放在三大云厂商上更糟。他还提到一个时间点:硬盘价格现在大约是去年的三倍,所以接下来得省着点用。

— Alexander Smola
23:28

用中世纪统计法从噪声里榨标签

面对不完美的处理工具产生的噪声标签,Alex 的论证是:只要噪声是无偏的,大量重复测量取平均就能得到比单次更好的估计。他举了中世纪的「脚尺」——让人走出教堂,取前 12 个男人,去掉脚最长和最短的各两个(可能因为畸形),剩下 8 个取平均,就得到一英尺的估计。他说稳健回归和估计已经存在了半个千年。具体到音频:知道这是两人播客、知道 TWIML 通常是 Sam 加一个人,就能轻松分离说话人,拿到大量单人音频,进而标注得更好,形成飞轮。

— Alexander Smola
33:43

端到端音频模型注定又小又笨

Alex 把架构选择讲得很直白:端到端音频模型有它的位置——响应快、体积小、延迟低,但也相当笨。想让它变聪明,算力成本就变得不可承受。所以他们的做法是两阶段:理解和推理在一端完成,后端触发合适的工具调用,再把答案收回来,就像多线程编程里主线程派发并行线程再取回结果。对用户来说,给他们的模型写 prompt 和给普通 LLM 写 prompt 长得一样,只是他们的模型还会说话。

— Alexander Smola
36:46

比 GPT 便宜十倍,但关掉了思考

Alex 声称在 BigBench Audio、Complex Function Bench 这类基准上,他们比 GPT、Gemini、Grok 更好,成本只有 OpenAI 模型的十分之一。但他自己加了一个脚注:这是在关闭 thinking 的情况下测的。理由是不能让模型停顿思考再回答,那感觉非常不自然,人类也不这么干。这暴露了语音场景的一个根本约束——推理能力必须藏在后台,前台不能有可见的思考停顿。

— Alexander Smola
43:54

苹果的开机进度条是骗你的

Alex 用这个例子讲人类对延迟的容忍度:人类对延迟非常宽容,前提是被告知有延迟。苹果开机画面线性推进,快结束时突然切换成已启动;微软的进度条走到 99% 然后卡两分钟。他说微软的进度条是真相,苹果在骗你——苹果测量上次开机耗时,加一点点,然后做一个定时走完的假进度条。这是「不用解决不可能的技术问题就能创造好体验」的障眼法。

— Alexander Smola
50:58

别拿电影当人类互动的参照系

在讨论 EQ 时,Alex 警告说电影是糟糕的参照点:浪漫喜剧里那个痴迷的男主角最后得到女孩,本质是跟踪,现实中警察会上门;动作片里人们动辄拳脚相向,最后接吻和好,现实中你会进监狱。他说更真实的素材是脱口秀之类,但即便那样,他也真诚希望没人会拿 Dr. Phil 训练模型并假定那是正常人类行为。好消息是 LLM 现在有不错的心理理论,能提供一些基础。

— Alexander Smola
55:01

个性化是升级版 CRM,但不止于此

Alex 把学习循环拆成两层:一层是全局改进,比如知道侮辱用户会让人不快(他承认这是极端例子),这类跨交互的学习让整体模型变好;另一层是个人化,比如知道 Alex 喜欢方程、事实和技术细节,社交上可能有点棱角,下次交互就能更好地为他定制。他形容这像「升级版的 CRM,只不过现在给每个人配一个」,同时模型也在所有交互上学习。他还提到 Nvidia 发布的数字人格和场景被他们用于 RSI 研究。

— Alexander Smola

原话 · 已逐字校验

it takes about 150 milliseconds for you know basically a photon hitting your retina to your cortex actually doing something with it and that number is reasonably stable that you can actually use that as a non-invasive diagnostic to find out whether you have a neurodeenerative disease

光子打到视网膜、到皮层真正做出反应,大约需要 150 毫秒,这个数字相当稳定,稳定到可以当作非侵入式诊断指标,用来判断你是否患有神经退行性疾病。

Alexander Smola6:09

many tokens per second means your model cannot have too many parameters whereas if you have a smaller number of tokens per second you can afford more parameters right text is you know the ultimate compressed format in that sense

每秒 token 多,模型就不能有太多参数;每秒 token 少,才养得起更多参数。从这个意义上说,文本是终极的压缩格式。

Alexander Smola9:12

she adopted uh a kid from Latin America. So, this was in Germany, and she spoke only German to her. And within a matter of months, the girl had forgotten every single word of Spanish

她收养了一个拉美孩子,在德国,她只跟孩子说德语。几个月之内,女孩忘光了所有西班牙语单词。

Alexander Smola15:17

if somebody gives you free steel, you don't build a steel mill, you build a car

如果有人白送你钢铁,你不会去建钢厂,你会去造车。

Alexander Smola30:38

the Microsoft boot screen is the truth. What Apple does is very cleverly they measure the boot time that it took last time and they add a tiny amount to it and then they have a fake boot uh progress bar that's timed to go all the way to the end within the time that it took last time to boot

微软的开机画面才是真相。苹果的做法很聪明:他们测量上次开机花了多久,加上一点点,然后做一个假的进度条,定时在上次开机耗时内走完。

Alexander Smola43:54

this is a slightly different optimization uh track rather than models for code generation, right? They worry about task completion. In our case, we worry about human happiness

这是一条不同的优化路线,不同于代码生成模型。它们关心任务完成,我们关心人类是否愉快。

Alexander Smola46:56

the obsessed guy who in the end gets the girl essentially stalks her, right? If if if you if you did that in reality, you'd the police would show up and and lock you up

那个痴迷的男主角最后得到了女孩,本质上是在跟踪她。如果你在现实中这么做,警察会上门把你关起来。

Alexander Smola50:58

Brilliance is good, but brilliance is not repeatable and automatable

才华是好事,但才华不可复制、不可自动化。

Alexander Smola1:00:02

数字与实体

人类视听感知频率约 6-10 赫兹7:09
模型打断处理时间窗约 150 毫秒7:09
文本 token 速率每秒 3-5 个 token9:12
音频 token 速率每秒 10 个以上9:12
训练音频数据量约 1 亿小时20:24
训练数据相当于人生时长约 200 个人生(按 75 年计)20:24
硬盘价格变化约为一年前的三倍21:26
语音模型成本对比约为 OpenAI 模型的十分之一36:46
音频模型工作量相对语言模型约二分之一到三分之一31:40

术语

Proactbench主动性基准
衡量语音模型是否能在对话中主动介入、判断何时该打断的基准。
Ibench交互基准
同一团队发布的基准,衡量打断性、响应性和音频与内容匹配度。
back channeling反馈性应答
对话中「嗯」「对」这类表示在听的短回应,日语中尤其常见。
millennial sandwich千禧三明治
表扬、批评、再表扬的沟通策略,用于传达负面反馈而不激怒对方。
theory of the mind心理理论
模型推断他人信念、意图和情绪状态的能力。

收听指南

谁该听

做语音/多模态产品的工程师和创业者,尤其是需要判断实时推理成本、打断延迟和 EQ 基准的人。

可跳过

开头 5 分钟关于 ChatGPT 语音模式好不好用的闲聊可以跳过。