跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

8条精选相关主题多模态AI 视频产品更新

最新精选

第 1–8 条 · 共 8 条
9月29日周二
  1. The Decoder79

    ElevenLabs 发布 v4 语音模型,AI 声音更具表现力且更一致

    ElevenLabs 发布 v4 语音模型,新架构提升方向遵循与长内容声音一致性,支持 90+ 语言及原生口音克隆。Turbo 变体实现 150 毫秒语音启动,在 Artificial Analysis 发音基准测试中得分 91.7%,盲测中约四分之三听众更偏好 v4。标准版 API 定价 $80/百万字符,Turbo 版 $40,即日起至 10 月 12 日临时降价至 $22 和 $11。

    推荐理由:新版本在发音基准测试中得分91.7%,Turbo变体可在150毫秒内开始语音生成,为实时语音代理提供了速度与表达兼顾的方案。

9月25日周五
9月16日周三
8月27日周四
6月9日周二
  1. Google DeepMind61

    Gemini 3.5 Live Translate:流畅自然的语音翻译

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。

    推荐理由:Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。

3月24日周二
  1. Mistral AI65

    Mistral 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布 Voxtral TTS,4B 参数、支持 9 种语言的多语言文本转语音模型,提供自然、情感化语音生成与低延迟流式输出。模型通过 API 和 Mistral Studio 开放,定价 $0.016/1k 字符,并提供开源权重。

    推荐理由:原文给出延迟、定价与多语言支持等具体指标,读者可据此评估其是否适配自有语音 Agent 流程。

7月17日周四
  1. Mistral AI61

    Le Chat 新增深度研究、语音对话与项目管理功能

    Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。

    推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。

7月15日周二
  1. Mistral AI69

    Mistral AI 发布 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均采用 Apache 2.0 开源许可。模型支持最长 30 分钟音频转录和 40 分钟理解,内置问答与摘要功能,并原生支持多语言自动识别。

    推荐理由:Voxtral以不到同类API一半的价格提供接近商用水平的语音理解能力,为开源ASR与闭源服务之间的鸿沟提供了可部署的替代方案。