热点事件持续更新
音素引导初始化方法用于LLM语音识别
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
论文提出一种面向基于 LLM 的语音识别的音素引导初始化方法:在端到端框架内,先分别预训练音频编码器完成语音到音素(S2P)转换、LLM 完成音素到字素(P2G)转换,再将二者连接并端到端微调。实验覆盖日语 CSJ、中文 AISHELL-1,以及 Common Voice 25.0 中的 Tatar 和 Urdu 低资源语言,结果显示该方法匹配或优于级联 S2P-P2G 基线和无 P2G 初始化的端到端模型。该论文已被 IEEE SLT 2026 接收。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
论文提出音素引导初始化方法,匹配或优于基线,已被IEEE SLT 2026接收。报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · Audio and Speech面向基于 LLM 的语音识别的音素引导初始化方法
论文提出音素引导初始化方法,在端到端框架内先分别预训练音频编码器完成语音到音素(S2P)转换、LLM 完成音素到字素(P2G)转换,再连接并端到端微调。在日语 CSJ、中文 AISHELL-1 及 Common Voice 25.0 的 Tatar 和 Urdu 低资源语言上,该方法匹配或优于级联 S2P-P2G 基线和无 P2G 初始化的端到端模型。论文已被 IEEE SLT 2026 接收。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。