Closing the Modality Reasoning Gap for Speech Large Language Models Paper • 2601.05543 • Published Jan 9 • 1
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness Paper • 2511.07931 • Published Nov 11, 2025
The Singing Voice Conversion Challenge 2025: From Singer Identity Conversion To Singing Style Conversion Paper • 2509.15629 • Published Sep 19, 2025
AnyAccomp: Generalizable Accompaniment Generation via Quantized Melodic Bottleneck Paper • 2509.14052 • Published Sep 17, 2025 • 1
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment Paper • 2505.04113 • Published May 7, 2025
Vevo2: Bridging Controllable Speech and Singing Voice Generation via Unified Prosody Learning Paper • 2508.16332 • Published Aug 22, 2025
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling Paper • 2508.16790 • Published Aug 22, 2025 • 10
From Judgment to Interference: Early Stopping LLM Harmful Outputs via Streaming Content Monitoring Paper • 2506.09996 • Published Jun 11, 2025 • 2
Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement Paper • 2502.07243 • Published Feb 11, 2025 • 1
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training Paper • 2502.03128 • Published Feb 5, 2025 • 2
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer Paper • 2409.00750 • Published Sep 1, 2024 • 6
SingVisio: Visual Analytics of Diffusion Model for Singing Voice Conversion Paper • 2402.12660 • Published Feb 20, 2024
Leveraging Content-based Features from Multiple Acoustic Models for Singing Voice Conversion Paper • 2310.11160 • Published Oct 17, 2023