跳到正文
热点事件持续更新

Encoder-free Speech-LLM通过元数据监督预训练提升说话人辨识与副语言理解

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026-10-02,arXiv Audio and Speech 频道发布一手论文,提出 metadata-supervised pretraining(MSP)方法,用于无编码器 Speech-LLM 的训练。该方法利用说话人身份、情感等语音元数据进行监督预训练,并引入 speaker-aware utterance composition(SAUC)与随机跨度掩码正则化,以提升模型在说话人辨识与副语言理解方面的能力。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Audio and Speech
    教大语言模型识别说话人:Metadata-Supervised Pretraining 用于无编码器语音-LLM

    论文提出 metadata-supervised pretraining(MSP),利用说话人身份和情感等语音属性训练无编码器 Speech-LLM,并引入 speaker-aware utterance composition(SAUC)和随机跨度掩码正则化。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。