实验室1篇论文于ICASSP2026发表

近日,我实验室一篇论文被语音信号处理领域顶级国际会议 IEEE ICASSP 2026(International Conference on Acoustics, Speech and Signal Processing,于 2026 年 5 月 4—8 日在西班牙巴塞罗那举行)正式录用并发表。

论文题为 《PhoenixDSR: Phoneme-Guided and LLM-Enhanced Dysarthric Speech Recognition(音素引导与大语言模型增强的构音障碍语音识别)》,作者为吴宇轩、徐轶凡、王俊坤、赵鑫、姜佳勇、罗兆杰,由东南大学数字医学工程全国重点实验室、东南大学生物科学与医学工程学院及深圳河套研究院共同完成,通讯作者为罗兆杰。

摘要: 受限于数据稀缺与说话人个体差异,自动语音识别(ASR)在构音障碍语音上的表现仍不理想。本文提出 PhoenixDSR——一个以音素为中介的识别框架,将声学层面的变异与语言层面的解码相解耦。框架首先利用在健康语音上训练的 Wav2Vec2-CTC 识别器,将语音映射为稳定、可解释的音素序列;进而从有限的构音障碍对齐数据中估计一个融合全局规律与说话人个性化模式的加权混淆概率矩阵;最后通过一个轻量级大语言模型(LLM)解码器,在文本—音素双向映射、构音障碍到健康语音的归一化、音素到文本解码以及编辑操作预测等多个任务上联合训练,从而实现上下文驱动的系统性音素纠错。在公开的 CDSD 数据集上,PhoenixDSR 取得了 18.3% 的字符错误率(CER)和 13.7% 的音素错误率(PER),优于端到端微调与 LLM 后编辑等方法;消融实验验证了音位规则预训练与混淆先验的有效性。少样本个性化仅需更新先验即可获得额外提升,无需进一步梯度训练。通过将可解释的音素级先验与上下文感知解码相结合,PhoenixDSR 实现了数据高效且鲁棒的构音障碍语音识别。