Comparison Table

CodecFlat Token Rate (tok/sec)CodebooksFramerate (Hz)Vocab Size
DAC8019891024
SNAC 24kHz~1503varies4096
WavTokenizer40 or 7514096
X-Codec2~50165536

Flat Token Rate — codecs produce a (codebooks × timesteps) matrix. Flattened into a 1D sequence for autoregressive modeling, the total tokens/sec is codebooks × framerate.

DAC produces 9 codebooks at 89 frames/sec → 801 tok/sec. High quality, but sequences are ~10× longer than WavTokenizer for the same audio duration. Memory-intensive for LLM training.

SNAC matches DAC in perceptual quality with ~3–6× lower token rate. Best general-purpose choice for speech tasks.

WavTokenizer achieves extreme compression (40–75 tok/sec, single codebook). Excellent for clean TTS tasks. Performs poorly on degraded/noisy speech — it was not trained on such data and can introduce artifacts.

X-Codec2 — stable at version 1.3.0. Single codebook, low token rate, large vocabulary. Pairs well with Llasa for TTS.

When to Use Each

TaskRecommended Codec
Speech enhancement (noisy input)SNAC or DAC
TTS / zero-shot voice cloningX-Codec2 or WavTokenizer
Speech editingDAC (fine-grained control)
Autoregressive LM on long audioWavTokenizer or X-Codec2
Codec quality researchDAC (richest representation)