語音識別沒解決:客服場景裡,模型仍頻繁出錯
做語音客服系統的客戶反饋是:即便是最常見的客服場景,語音識別也遠沒有被解決,系統還在不斷犯錯,需要大量工程兜底。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
音頻原生理解替代轉錄+LLM級聯
Voxtral Chat 是音頻輸入、文本輸出的理解模型,可以直接問「什麼時候提到了這個話題」這類帶時間戳的問題。傳統做法是先轉錄成文字再餵給LLM,Pavan 認為級聯會丟信息——情緒、語氣這些不在轉錄文本里的東西,原生模型能直接從音頻裡注意到,而轉錄必須提前決定要在中間表示裡保留哪些細節。
— Pavan Kumar Reddy音頻被當成普通token喂進解碼器
Voxtral 用一個3B文本模型做主幹,音頻編碼器把聲音壓成連續向量,每80毫秒產出一個token(約每秒12.5個),直接當token序列喂進解碼器,和文本token一視同仁。編碼器結構很接近Whisper,但沒有單獨的預訓練階段,而是和主幹一起端到端訓練——他們堅持「方案越簡單越經得起時間考驗」。
— Pavan Kumar Reddy流式轉錄的延遲是一個可調參數
借鑑 Kyutai 的 Delayed Streams Modeling,Voxtral Realtime 讓模型每80毫秒直接吃一幀音頻,並把「目標延遲」當成餵給模型的一個參數:延遲設得越短,字幕出現得越快但歧義越大;等得越久,消歧越充分、錯誤率越低。同一路音頻可以同時開兩條流,一條快的給字幕用,一條慢的留給需要準確記錄的場景做糾錯。
— Pavan Kumar Reddy用連續隱向量取代離散codec token
主流TTS用殘差矢量量化(RVQ)生成離散token,一個時間步要預測30多個codebook,相當於每步再套一層30步的自迴歸,又慢又複雜。Mistral 的TTS改用flow matching頭直接預測連續隱向量的速度場,推理時只是沿速度場做固定步數的積分,步數可控,在速度和質量之間的取捨更細膩。
— Pavan Kumar Reddy編解碼器譜系:EnCodec到Mimi到自研FSQ
神經編解碼器這條線從 EnCodec 的RVQ演進到 Kyutai 的 Mimi:Mimi 把codebook分成語義和聲學兩類,語義codebook接受蒸餾監督、離文本空間更近,生成時先猜語義再猜聲學。Mistral 保留了語義codebook,但把聲學部分換成了FSQ(有限標量量化)——21個數值級別、36維,離散和連續兩種用法可以互換。
— Pavan Kumar Reddy說話人分離遠沒解決,尤其超過兩人時
Pavan 直言說話人分離「遠沒解決」,尤其是四五個人開會互相打斷的場景。沒有視頻只靠聽,連人類標註員都很難分清「是同一個人打斷自己」還是「換了人說話」——模型面對的是單聲道、單流的純音頻輸入,天花板本身就受限,而現有系統離這個天花板還差得遠。
— Pavan Kumar Reddy自迴歸模型一旦犯錯就會自我強化
轉錄出現幻覺、卡死循環、整段漏譯,根源常是自迴歸架構本身:模型一旦犯了一次錯、被推出訓練分布之外,就會在錯誤上繼續「自證」下去。修復靠DPO——收集模型自己生成的壞樣本當負例,配上人工修正當正例,直接給出「這樣不對」的負向監督,這是純預訓練和SFT都給不了的。
— Pavan Kumar Reddy客戶反饋:客服場景語音識別仍遠沒解決
和客戶聊下來,即便是最主流的客服場景,反饋也是「遠沒解決」,系統會犯很多錯誤,還要靠大量工程兜底處理邊界情況。跨出頭部語種或安靜錄音環境後,轉錄質量會明顯跳水;工廠車間這類背景噪音大、人聲嘈雜的場景尤其難。也正因為語音模型足夠小,針對具體場景做定製的成本遠低於微調一個文本大模型。
— Pavan Kumar Reddy原話 · 已逐字校驗
It's an audio input text-to-text LLM model. So you give it audio input and a textual instruction, or it doesn't need a textual instruction because your question can be in the audio, and then the model produces a text response.
這是一個音頻輸入、文本輸出的LLM模型。你給它音頻輸入和文字指令——甚至不需要文字指令,因為你的問題本身就可以在音頻裡——然後模型給出文本回答。
Pavan Kumar Reddy9:29
we wanted to see explore approaches which are more controllable, which provide you a more delicate tradeoff between the number of steps and the quality.
我們想探索更可控的方法,能在步數和質量之間做出更精細的權衡。
Pavan Kumar Reddy33:46
the semantic codebook gets a distillation supervision. The motivation behind this is to keep this codebook closer to the text space.
語義codebook會接受一種蒸餾監督,目的是讓這個codebook更接近文本空間。
Pavan Kumar Reddy37:55
it's actually quite challenging. I think it's far from solved, in my opinion, especially multi-speaker, more than two speakers, in the context of a meeting.
這其實相當有挑戰性。我認為這遠沒有解決,尤其是多說話人、兩人以上的會議場景。
Pavan Kumar Reddy56:53
some of the front-tier speech models could do what I can only describe intuitively as active speaker locking, which meant if there was crosstalk, it would lock on to what it thought was... was the active speaker, and it would continue to transcribe that voice and ignore other voices.
有些前沿語音模型會出現一種我只能直觀地稱之為「鎖定當前說話人」的現象:一旦出現交叉說話,它就會鎖定它認為的那個活躍說話人,持續轉錄這個人的聲音,忽略其他人。
once the model makes a few mistakes, it tends to commit to those mistakes. And especially when those mistakes take the model out of its training distribution, that's usually the scenario where it goes into a degenerate mode of infinite generations or looping the same prediction or skipping a whole segment of transcription.
模型一旦犯了幾個錯誤,就會傾向於把這些錯誤堅持下去。尤其當這些錯誤讓模型偏離了訓練分布,它往往就會進入退化模式:無限生成、重複同一個預測,或者跳過整段轉錄。
Pavan Kumar Reddy1:03:02
the primary complaint is, it's far from solved in the precise scenarios that deploying it, and it makes a ton of mistakes. Even for the most prominent customer service case, they feel it's not solved.
客戶最主要的抱怨是:在他們實際部署的具體場景裡,這遠沒有解決,會犯大量錯誤。即便是最常見的客服場景,他們也覺得沒有解決。
Pavan Kumar Reddy1:28:32
數字與實體
| 音頻編碼器幀率 | 每80毫秒1個token,約12.5 token/秒 | 15:43 |
| 傳統RVQ codebook數量 | 30多個 | 33:46 |
| FSQ聲學codebook量化設置 | 21個數值級別,36維 | 38:55 |
| 流式轉錄較激進的目標延遲示例 | 160毫秒 | 54:50 |
術語
- VoxtralVoxtral
- Mistral 的音頻理解/生成模型系列,能直接聽懂音頻並用文本回答問題
- Delayed Streams Modeling (DSM)延遲流建模
- Kyutai 提出的流式語音範式,把目標延遲當成餵給模型的參數以權衡實時性與準確率
- FSQ (Finite Scalar Quantization)有限標量量化
- 用固定數值級別做量化,替代殘差矢量量化作為codec的離散化方式
- RVQ (Residual Vector Quantization)殘差矢量量化
- 傳統神經編解碼器的離散化方式,多層codebook逐級預測還原音頻
- DPO (Direct Preference Optimization)直接偏好優化
- 用「更好/更差」樣本對訓練模型,直接給出負向監督
- Flow matching流匹配
- 通過預測速度場並做積分來生成連續向量的生成式建模方法
收聽指南
正在做語音識別、TTS或語音agent落地的工程師,以及關注級聯系統vs端到端語音模型路線之爭的從業者。
開頭0-9分鐘是Mistral公司業務和產品線介紹,可直接跳到9:29聽模型技術細節。