论文概要
研究领域: NLP 作者: Vladimir Bataev, Lilit Grigoryan, Andrei Andrusenko, Nikolay Karpov, Vitaly Lavrukhin, Boris Ginsburg 发布时间: 2026-08-21 arXiv: 2608.21343
中文摘要
语境化对于生产级自动语音识别(ASR)系统至关重要,其中用户提供的短语必须在严格延迟约束下被准确识别。虽然许多语境偏置方法改进了识别准确性,但它们往往未解决现代生产ASR系统的实际需求:流式推理、高效批处理解码、用户特定语境列表和低运行时开销。我们提出了TurboBias 2.0,一个面向生产的Transducer基ASR系统的高效短语增强框架。该框架通过不区分大小写的增强图和每流批处理解码扩展了GPU加速的TurboBias,允许批次中的每个话语使用独立的语境偏置配置。这实现了多同时用户的个性化语境偏置,无需共享或混合他们的语境列表。所提出的框架支持离线推理和流式推理,可与贪婪搜索和束搜索解码一起使用。实验表明,TurboBias 2.0在保持低延迟和高吞吐量的同时改进了语境短语识别。
原文摘要
Contextualization is essential for production automatic speech recognition (ASR) systems, where user-provided phrases must be recognized accurately under strict latency constraints. Although many context-biasing methods improve recognition accuracy, they often do not address the practical requirements of modern production ASR systems: streaming inference, efficient batched decoding, user-specific context lists, and low runtime overhead. We propose TurboBias 2.0, a production-oriented framework for efficient phrase boosting in Transducer-based ASR systems. The framework extends GPU-accelerated TurboBias with a case-insensitive boosting graph and per-stream batched decoding, allowing each utterance in a batch to use an independent context-biasing configuration. This enables personalized cont…
— 自动采集于 2026-08-25
#论文 #arXiv #NLP #小凯

先讲个你每天都会遇到的破事。你对语音助手说“导航到张衙前巷”,它给你蹦出“张亚倩想”。不是它听错了声音,是它不认识“张衙前巷”这个词——专业叫语境偏置(context biasing):用户给的专有名词,得在严格延迟下被准确认出来。
Bataev 等人(arXiv:2608.21343,NVIDIA 埃里温+圣克拉拉)的 TurboBias 2.0,是给 Transducer 架构 ASR 用的生产级短语增强框架。它把上一代 GPU 加速的 TurboBias 扩展了两点:不分大小写的增强图,加上“每流批处理解码”——一个批次里每句话可以用各自独立的语境偏置配置。
这意味着什么,得说人话:
– 多用户同时在线,各人的专属词表互不串味,张三的“老王”不会污染李四的“网管”;
– 离线、流式都能跑,贪婪搜索和束搜索都兼容,等于把生产环境要的几种模式全包了;
– “不分大小写”听着小,实则省掉一堆预处理边界 bug。
反自欺:论文讲“改进了语境短语识别、保低延迟高吞吐”,但真实口音、远场噪声、中英混说下的鲁棒性,得看大规模线上 A/B,不是 benchmark 数字能替的。
收尾钉子:看它在大厂语音产品里做 A/B 时,“偏置命中率提升”能不能换来用户少骂一次“你又听错了”——那才是生产 ASR 唯一的真指标。