跳到正文

#语音

今日 2 条
今天9月30日周三
  1. arXiv · Computation and Language39

    FD-VAD:流式全双工语音的语义端点检测

    FD-VAD 是一种无需 ASR 的流式语义端点检测模型,将有界因果音频窗口直接映射为 Continue/Stop 决策,在 TurnBench dev 集上以零样本方式达到 EOT 召回率 0.853(FP<=0.10)。模型融合冻结语音编码器、轻量模态适配器与参数高效适配的语言模型,采用末段训练目标与置信度门控端点提交机制,在领域内和对话评测中均优于强基线。

  2. arXiv · Audio and Speech22

    InstCharVoice:基于自然语言指令的字符级可控文本转语音框架

    InstCharVoice 提出一个统一框架,将自然语言指令映射到字符级声学控制,在 WordVoice-5A-zh 语料上使用 Qwen3-Omni 构建指令标注。模型通过关键词预测与接地感知损失加权,聚焦指令相关字符并预测其声学属性,再生成语音 token。实验显示在指令遵循和关键词级声学控制上优于代表性 ITTS 系统,同时保持自然度与字符级可控性。

9月29日周二
9月26日周六
9月25日周五
9月23日周三
9月16日周三
9月10日周四
8月27日周四
8月25日周二
  1. Mistral AI39

    Mistral 与 HUMAIN 宣布战略合作,推进沙特及区域主权 AI

    Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 的数据中心基础设施,双方还计划在沙特推进联合 go-to-market 策略,面向受监管行业。

8月11日周二
7月30日周四
  1. Google DeepMind48

    Google 在 Flow Music 上线 Lyria 3.5,升级音乐性、歌词、人声与创作控制

    Google 在 Flow Music 中上线新一代音乐生成模型 Lyria 3.5,在音乐性、歌词、人声质量和创作控制四方面带来提升。该模型可生成更复杂自然、旋律结构更丰富的作品,歌词的提示词遵循与结构意识更好,人声更具情感表现力且发音改善,用户还能更便捷地控制输出节奏与时长。

7月1日周三
6月9日周二
  1. Google DeepMind61

    Gemini 3.5 Live Translate:流畅自然的语音翻译

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。

    推荐理由:Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。

4月16日周四
3月24日周二
  1. Mistral AI65

    Mistral 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布 Voxtral TTS,4B 参数、支持 9 种语言的多语言文本转语音模型,提供自然、情感化语音生成与低延迟流式输出。模型通过 API 和 Mistral Studio 开放,定价 $0.016/1k 字符,并提供开源权重。

    推荐理由:原文给出延迟、定价与多语言支持等具体指标,读者可据此评估其是否适配自有语音 Agent 流程。

3月12日周四
2月23日周一
  1. Together AI64

    语音模型在街名转录上如何失败及应对方法

    Together AI 发布 SF Streets 和 US Streets 两个新基准,测试发现 15 个主流语音模型对街名的平均转录错误率达 39%,非英语母语者比英语母语者准确率低 18 个百分点,导航偏差平均多 1.2 英里。

    推荐理由:研究揭示了主流语音模型在街名转录上的显著误差,并给出小样本合成数据的改进方法,对导航和应急调度场景具有直接参考价值。

7月17日周四
  1. Mistral AI61

    Le Chat 新增深度研究、语音对话与项目管理功能

    Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。

    推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。

7月15日周二
  1. Mistral AI69

    Mistral AI 发布 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均采用 Apache 2.0 开源许可。模型支持最长 30 分钟音频转录和 40 分钟理解,内置问答与摘要功能,并原生支持多语言自动识别。

    推荐理由:Voxtral以不到同类API一半的价格提供接近商用水平的语音理解能力,为开源ASR与闭源服务之间的鸿沟提供了可部署的替代方案。