2026
WorldSpeech: A Multilingual Speech Corpus from Around the World
A. Asonitis, L. A. Lanzendörfer, F. Berdoz, R. Wattenhofer
Under Review
@misc{asonitis2026worldspeechmultilingualspeechcorpus, title={WorldSpeech: A Multilingual Speech Corpus from Around the World}, author={Antonis Asonitis and Luca A. Lanzendörfer and Frédéric Berdoz and Roger Wattenhofer}, year={2026}, eprint={2605.09167}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2605.09167}, }

65k hours across 80+ languages, sourced from government proceedings, international broadcasts and public-domain audiobooks. 150k+ HuggingFace downloads; #1 trending in its first month of release.

High-Fidelity Speech Enhancement via Discrete Audio Tokens
L. A. Lanzendörfer, F. Berdoz, A. Asonitis, R. Wattenhofer
ICASSP 2026
@InProceedings{Lanzendörfer2026highfidelity, author= {Luca Lanzendörfer and Frédéric Berdoz and Antonis Asonitis and Roger Wattenhofer}, title= {{High-Fidelity Speech Enhancement via Discrete Audio Tokens}}, booktitle= {{Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Catalonia, Spain}}, month= {May}, year= {2026}, }
Post-Training Speech Enhancement Language Models with Perceptual Rewards
F. Berdoz, L. A. Lanzendörfer, A. Asonitis, R. Wattenhofer
Oral, Interspeech 2026
@misc{berdoz2026posttrainingspeechenhancementlanguage, title={Post-Training Speech Enhancement Language Models with Perceptual Rewards}, author={Frédéric Berdoz and Luca A. Lanzendörfer and Antonis Asonitis and Roger Wattenhofer}, year={2026}, eprint={2606.21458}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2606.21458}, }
Multilingual Speech Editing
A. Asonitis, L. A. Lanzendörfer, F. Berdoz, R. Wattenhofer
Oral, ICML 2026 Workshop on Machine Learning for Audio
@misc{asonitis2026multilingualspeechediting, title = {Multilingual Speech Editing}, author = {Antonis Asonitis and Luca A. Lanzend{\"o}rfer and Fr{\'e}d{\'e}ric Berdoz and Roger Wattenhofer}, year = {2026}, note = {Under review} }
Autoregressive Zero-Shot Voice Conversion
L. A. Lanzendörfer, F. Berdoz, A. Asonitis, R. Wattenhofer
Oral, ICML 2026 Workshop on Machine Learning for Audio
Semantic Calibration in Media Streams
F. Berdoz, L. A. Lanzendörfer, A. Asonitis, R. Wattenhofer
Under Review
GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech
A. Asonitis, F. Verdini, A. Farhadipour, P. Zuluaga
Under Review
The Limits of Reference-Free Speech Quality Metrics as Evaluators and Rewards on Modern Text-to-Speech
A. Asonitis, P. Zuluaga, F. Verdini, A. Farhadipour
Under Review
Controlling Speaking Rate in Autoregressive TTS via Activation Steering
F. Verdini, A. Asonitis, A. Farhadipour, P. Zuluaga
Under Review
OmniTag-LLM: A Multimodal Large Language Model for Multilingual Multitask Speech Labeling
A. Farhadipour, F. Verdini, A. Asonitis, P. Zuluaga
Under Review
Datasets
Multilingual Audio Alignments
A. Asonitis, et al.

The largest multilingual word and phoneme aligned speech dataset, 45k+ downloads, reached #3 Trending Worldwide in the Audio domain.