arXiv · Computation and Language· David Porte\v{s}, Ale\v{s} Hor\'ak·· 3 小时前AI 评分34
Prosody-to-Text:基于低通滤波语音预测文本
Prosody-to-Text: Predicting text from low-pass filtered speech
AI 导读
研究者微调 Whisper 模型,仅使用约 450Hz 截止的低通滤波(12 个最低 Mel 频段)从韵律模式恢复原文,WER 为 36%,10% 的语句被完美恢复,40% 的语句 WER 不超过 25%。在给定正确前缀时,下一个 token 的预测准确率达 79%。结果表明低频语音特征与词汇内容的关联强于此前认知,或可用于引导现代 LLM 的文本生成。
来源:arXiv · Computation and Language · arxiv.org