arXiv · Audio and Speech· Yafeng Chen (Intern), Boya Dong (Intern), Yankun Huang (Intern), Hao Li (Intern), Jingdong Li (Intern), Xiangyu Liang (Intern), Hao Ni (Intern), Wenchao Wang (Intern), Yuxuan Wang (Intern), Zhangyu Xiao (Intern), Wei Deng (Intern), Nan Duan (Intern), Yu Gu (Intern), Wenhao Guan (Intern), Weisheng Han (Intern), Yabin Li (Intern), Yuan Liu (Intern), Jiaxin Ye (Intern), Fan Yu, Lin Zhu·· 4 hr agoAI score41
JoyAI-Voice 2.0:基于语义-声学联合表征的全连续自回归语音生成模型
JoyAI-Voice 2.0: A Full-Continuous Autoregressive Speech Generation Model with Semantic-Acoustic Joint Representation
AI brief
JoyAI-Voice 2.0 提出端到端拟人语音生成模型,采用全连续双编码器架构,将原始语音编码为连续 latent 并分块,由语义-声学双编码器分解后融合送入因果自回归 Transformer 规划,局部扩散 Transformer 渲染完整 latent 以 48 kHz 合成。
Source: arXiv · Audio and Speech · arxiv.org