世界太吵,来原声听播客

ML Street Talk

语音识别没解决:客服场景里,模型仍频繁出错

做语音客服系统的客户反馈是:即便是最常见的客服场景,语音识别也远没有被解决,系统还在不断犯错,需要大量工程兜底。

语音识别TTS神经编解码器DPO说话人分离Mistral

原视频在 YouTube 上放不出来,用音频听:

工程细节密度很高,从编码器帧率、codec 谱系到 DPO 对齐都给了具体做法,适合正在做语音 agent 落地的人;闲聊向的听众可以跳过。

核心论点 · 点时间戳可跳到原声

11:43

音频原生理解替代转录+LLM级联

Voxtral Chat 是音频输入、文本输出的理解模型,可以直接问「什么时候提到了这个话题」这类带时间戳的问题。传统做法是先转录成文字再喂给LLM,Pavan 认为级联会丢信息——情绪、语气这些不在转录文本里的东西,原生模型能直接从音频里注意到,而转录必须提前决定要在中间表示里保留哪些细节。

— Pavan Kumar Reddy
15:43

音频被当成普通token喂进解码器

Voxtral 用一个3B文本模型做主干,音频编码器把声音压成连续向量,每80毫秒产出一个token(约每秒12.5个),直接当token序列喂进解码器,和文本token一视同仁。编码器结构很接近Whisper,但没有单独的预训练阶段,而是和主干一起端到端训练——他们坚持「方案越简单越经得起时间考验」。

— Pavan Kumar Reddy
21:53

流式转录的延迟是一个可调参数

借鉴 Kyutai 的 Delayed Streams Modeling,Voxtral Realtime 让模型每80毫秒直接吃一帧音频,并把「目标延迟」当成喂给模型的一个参数:延迟设得越短,字幕出现得越快但歧义越大;等得越久,消歧越充分、错误率越低。同一路音频可以同时开两条流,一条快的给字幕用,一条慢的留给需要准确记录的场景做纠错。

— Pavan Kumar Reddy
33:46

用连续隐向量取代离散codec token

主流TTS用残差矢量量化(RVQ)生成离散token,一个时间步要预测30多个codebook,相当于每步再套一层30步的自回归,又慢又复杂。Mistral 的TTS改用flow matching头直接预测连续隐向量的速度场,推理时只是沿速度场做固定步数的积分,步数可控,在速度和质量之间的取舍更细腻。

— Pavan Kumar Reddy
37:55

编解码器谱系:EnCodec到Mimi到自研FSQ

神经编解码器这条线从 EnCodec 的RVQ演进到 Kyutai 的 Mimi:Mimi 把codebook分成语义和声学两类,语义codebook接受蒸馏监督、离文本空间更近,生成时先猜语义再猜声学。Mistral 保留了语义codebook,但把声学部分换成了FSQ(有限标量量化)——21个数值级别、36维,离散和连续两种用法可以互换。

— Pavan Kumar Reddy
56:53

说话人分离远没解决,尤其超过两人时

Pavan 直言说话人分离「远没解决」,尤其是四五个人开会互相打断的场景。没有视频只靠听,连人类标注员都很难分清「是同一个人打断自己」还是「换了人说话」——模型面对的是单声道、单流的纯音频输入,天花板本身就受限,而现有系统离这个天花板还差得远。

— Pavan Kumar Reddy
1:03:02

自回归模型一旦犯错就会自我强化

转录出现幻觉、卡死循环、整段漏译,根源常是自回归架构本身:模型一旦犯了一次错、被推出训练分布之外,就会在错误上继续「自证」下去。修复靠DPO——收集模型自己生成的坏样本当负例,配上人工修正当正例,直接给出「这样不对」的负向监督,这是纯预训练和SFT都给不了的。

— Pavan Kumar Reddy
1:28:32

客户反馈:客服场景语音识别仍远没解决

和客户聊下来,即便是最主流的客服场景,反馈也是「远没解决」,系统会犯很多错误,还要靠大量工程兜底处理边界情况。跨出头部语种或安静录音环境后,转录质量会明显跳水;工厂车间这类背景噪音大、人声嘈杂的场景尤其难。也正因为语音模型足够小,针对具体场景做定制的成本远低于微调一个文本大模型。

— Pavan Kumar Reddy

原话 · 已逐字校验

It's an audio input text-to-text LLM model. So you give it audio input and a textual instruction, or it doesn't need a textual instruction because your question can be in the audio, and then the model produces a text response.

这是一个音频输入、文本输出的LLM模型。你给它音频输入和文字指令——甚至不需要文字指令,因为你的问题本身就可以在音频里——然后模型给出文本回答。

Pavan Kumar Reddy9:29

we wanted to see explore approaches which are more controllable, which provide you a more delicate tradeoff between the number of steps and the quality.

我们想探索更可控的方法,能在步数和质量之间做出更精细的权衡。

Pavan Kumar Reddy33:46

the semantic codebook gets a distillation supervision. The motivation behind this is to keep this codebook closer to the text space.

语义codebook会接受一种蒸馏监督,目的是让这个codebook更接近文本空间。

Pavan Kumar Reddy37:55

it's actually quite challenging. I think it's far from solved, in my opinion, especially multi-speaker, more than two speakers, in the context of a meeting.

这其实相当有挑战性。我认为这远没有解决,尤其是多说话人、两人以上的会议场景。

Pavan Kumar Reddy56:53

some of the front-tier speech models could do what I can only describe intuitively as active speaker locking, which meant if there was crosstalk, it would lock on to what it thought was... was the active speaker, and it would continue to transcribe that voice and ignore other voices.

有些前沿语音模型会出现一种我只能直观地称之为「锁定当前说话人」的现象:一旦出现交叉说话,它就会锁定它认为的那个活跃说话人,持续转录这个人的声音,忽略其他人。

once the model makes a few mistakes, it tends to commit to those mistakes. And especially when those mistakes take the model out of its training distribution, that's usually the scenario where it goes into a degenerate mode of infinite generations or looping the same prediction or skipping a whole segment of transcription.

模型一旦犯了几个错误,就会倾向于把这些错误坚持下去。尤其当这些错误让模型偏离了训练分布,它往往就会进入退化模式:无限生成、重复同一个预测,或者跳过整段转录。

Pavan Kumar Reddy1:03:02

the primary complaint is, it's far from solved in the precise scenarios that deploying it, and it makes a ton of mistakes. Even for the most prominent customer service case, they feel it's not solved.

客户最主要的抱怨是:在他们实际部署的具体场景里,这远没有解决,会犯大量错误。即便是最常见的客服场景,他们也觉得没有解决。

Pavan Kumar Reddy1:28:32

数字与实体

音频编码器帧率每80毫秒1个token,约12.5 token/秒15:43
传统RVQ codebook数量30多个33:46
FSQ声学codebook量化设置21个数值级别,36维38:55
流式转录较激进的目标延迟示例160毫秒54:50

术语

VoxtralVoxtral
Mistral 的音频理解/生成模型系列,能直接听懂音频并用文本回答问题
Delayed Streams Modeling (DSM)延迟流建模
Kyutai 提出的流式语音范式,把目标延迟当成喂给模型的参数以权衡实时性与准确率
FSQ (Finite Scalar Quantization)有限标量量化
用固定数值级别做量化,替代残差矢量量化作为codec的离散化方式
RVQ (Residual Vector Quantization)残差矢量量化
传统神经编解码器的离散化方式,多层codebook逐级预测还原音频
DPO (Direct Preference Optimization)直接偏好优化
用「更好/更差」样本对训练模型,直接给出负向监督
Flow matching流匹配
通过预测速度场并做积分来生成连续向量的生成式建模方法

收听指南

谁该听

正在做语音识别、TTS或语音agent落地的工程师,以及关注级联系统vs端到端语音模型路线之争的从业者。

可跳过

开头0-9分钟是Mistral公司业务和产品线介绍,可直接跳到9:29听模型技术细节。