热点事件持续更新
DirectSpeech2LLM:缓解语音大模型提示过拟合的端到端框架
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
DirectSpeech2LLM 提出端到端框架,用于缓解 Speech-LLM 仅用 ASR 指令训练后无法泛化到新指令的提示过拟合问题。该框架在冻结的 LLM 嵌入矩阵上计算基于距离的 CTC 损失,并用贪心 CTC 标签生成几何与时间对齐的语音嵌入。仅用 960 小时 LibriSpeech ASR 数据训练,即在 ASR 上超越级联系统,并零样本泛化到语音翻译与情感识别,接近级联系统上限。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · Computation and LanguageDirectSpeech2LLM:缓解 Speech-LLM 提示过拟合的端到端框架
DirectSpeech2LLM 提出端到端框架,缓解 Speech-LLM 仅用 ASR 指令训练后无法泛化到新指令的提示过拟合。该框架在冻结的 LLM 嵌入矩阵上计算基于距离的 CTC 损失,并用贪心 CTC 标签生成几何与时间对齐的语音嵌入。仅用 960 小时 LibriSpeech ASR 数据训练,即在 ASR 上超越级联系统,并零样本泛化到语音翻译与情感识别,接近级联系统上限。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。