跳到正文
热点事件持续更新

JoyAI-Voice 2.0 全连续自回归语音生成模型发布

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

JoyAI-Voice 2.0 提出端到端拟人语音生成模型,采用全连续双编码器架构,将原始语音编码为连续 latent 并分块,由语义-声学双编码器分解后融合,送入因果自回归 Transformer 进行规划,再由局部扩散 Transformer 渲染完整 latent,最终以 48 kHz 合成语音。该模型相关论文发布于 arXiv 的 Audio and Speech 栏目,属一手研究报道。目前公开信息仅涉及模型架构与合成流程,未披露发布时间、参数规模、数据集、评测指标或开源计划等细节,也无其他来源报道可供交叉验证。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · Audio and Speech
    JoyAI-Voice 2.0:基于语义-声学联合表征的全连续自回归语音生成模型

    JoyAI-Voice 2.0 提出端到端拟人语音生成模型,采用全连续双编码器架构,将原始语音编码为连续 latent 并分块,由语义-声学双编码器分解后融合送入因果自回归 Transformer 规划,局部扩散 Transformer 渲染完整 latent 以 48 kHz 合成。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。