Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models

发布时间:2026/7/21 23:23:03
Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models 一、文章主要内容总结该研究针对文本到音频(TTA)生成中特定声音事件合成缺失或不完美的问题,提出了一种基于大型音频语言模型(LALM)的反馈驱动检索增强生成(RAG)方法。核心思路是利用LALM评估预训练TTA模型的生成输出,识别缺失或质量不佳的声音事件,从外部数据库检索相关音频样本,并通过解耦交叉注意力机制将检索信息融入生成过程,无需从零训练专用RAG模型。研究在扩散模型(如AudioLDM2)和流匹配模型(如TangoFlux)等不同预训练TTA模型上进行实验,使用AudioCaps、AudioSet等数据集构建训练/测试集,通过Fréchet距离(FD)、KL散度、Inception Score(IS)、CLAP分数等指标评估。结果表明,该方法在分布内(AudioCaps测试集)和分布外(RiTTA Count测试集)场景下均实现性能提升,且优于现有专用RAG-based TTA方法。二、创新点总结提出反馈驱动的RAG框架:基于LALM实现对TTA生成输出的自动评估与缺失事件识别,打破传统RAG方法依赖专用模型训练的局限,可适配各类预训练TTA模型。LALM优化策略:通过低秩适配(LoRA)对Qwen2.5-Omni进行有监督微调(SFT),显著提升其识别缺失声音事件的准确性,甚至超越Gemini 2.5 Pro。轻量级音频融合器:设计基于解耦交叉注意力的音频融合模块,将检索到的音频特征注入预训练TTA模型,在冻结原始模型参数的前提下实现高效微调,降低训练开销,同时增强复杂多事件音频场景的生成效果。通用性与低成本