Improving Contextual ASR via Multi-grained Fusion with Large Language Models 文章主要内容和创新点主要内容本文针对端到端自动语音识别(ASR)模型在识别上下文相关关键词(如专有名词、用户特定实体)时的不足,提出了一种结合大型语言模型(LLMs)的多粒度融合方法。该方法整合了令牌级(token-level)和短语级(phrase-level)融合的优势,通过后期融合策略将ASR的声学信息与LLM的丰富上下文知识结合,在保证非关键词文本识别准确性的同时,显著提升了关键词识别性能。实验在中英数据集(如Aishell、RWCS-NER、Slidespeech)上验证了该方法的有效性,关键词相关指标达到当前最优水平,消融实验进一步证实了令牌级和短语级融合组件的互补作用。创新点提出多粒度融合方法:首次在令牌级和短语级同时融合语音与文本模态,兼顾细粒度令牌精度和整体短语级理解,解决了单一粒度融合的局限性。高效利用LLM能力:借助LLM强大的上下文推理能力,将声学证据与语言知识结合,生成更准确、符合上下文的转录结果,且无需对LLM进行微调或编码音频。性能与效率平衡:在中英数据集上,关键词相关指标(如召回率、偏置错误率)优于现有方法,同时保持非关键词文本的识别精度,且模型复杂度适中,满足实时性要求。翻译部分摘要尽管端到端自动语音识别(ASR)模型在通用语音转录任务中表现出色,但它们在准确识别上下文相关关键词(如专有名词或用户特定实体)时往往存在困难。以往的研究通过