Skip to content

#语音

3 today
TodayOct 1Thu
  1. arXiv · Audio and Speech62

    Tacit-TTS:从自回归解码到掩码预测的高效无转录语音克隆

    Tacit-TTS 从 IndexTTS2 蒸馏而来,用掩码非自回归生成替代自回归文本到语义解码,并引入训练免声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。在两条英文和两条中文数据集上,长于 5 秒的语音生成速度比 IndexTTS2 快 10 倍以上,零样本质量相当,且无需参考语音转录,支持跨语言与非词汇参考(如八种其他语言、婴儿咿呀和合成乱码)。

    Why it matters: 用掩码非自回归替代自回归语义解码,配合无训练声学长度估计和 ReFlow 蒸馏,在零样本克隆质量不变时实现 10 倍以上加速。

  2. arXiv · Artificial Intelligence60

    Talk2Agent:评测文本智能体的语音接口

    Talk2Agent 评测语音接口将人类口语指令传递给 LLM 电脑使用智能体的效果,基于 WildClawBench 和 OSWorld 构建口语任务版本,评测专用 ASR、音频大模型、上下文偏置和 LLM 本体修复等方法,并提出免执行、基于任务意图的评测框架,在 32 小时真实语音上 Pearson 相关性比 WER/CER 提升 0.246。

    Why it matters: 为语音接口到文本智能体的信息保真度提供了可复现的评测框架和量化结果。

  3. arXiv · Artificial Intelligence67

    VAmoS Part Deux:更难、更真实的语音智能体模拟基准

    论文提出 VAmoS Energy 基准,在100个公用事业账单与支付协助通话中测试语音智能体处理多请求、背景语音和用户耐性的能力。智能体拥有16个工具并由 Stripe 账单孪生与 Apache Fineract 引擎支撑,通话需通过验证才能访问账户;LLM-as-a-verifier 与代码验证器一致率为99.1%。

    Why it matters: 背景电视噪声使完成率从38.7%骤降至8.6%,揭示语音智能体在真实噪声环境中仍存在显著脆弱性。