Yudong - Yudong‘s Blog

Neural Audio Codec 详解：Encodec / SoundStream / DAC / Mimi（现代语音 AI 的「分词器」全解析）

Neural Audio Codec Explained: the 'tokenizer' of modern speech AI — RVQ-VAE foundations, Encodec/SoundStream/DAC/Mimi evolution, 2024 trends

本文是一篇详细的 Neural Audio Codec 技术拆解：从 RVQ-VAE 数学骨架、SoundStream 开山之作、Encodec 工业化标准、DAC 高保真、Mimi 流式 + 12.5 Hz 革命，到与 TTS / 语音 LLM 的集成、PyTorch 代码与 2024 单 codebook 趋势。TTS 系列第 5 篇。

2025-12-02 1

F5-TTS / E2-TTS 详解：Flow Matching 怎样杀进 TTS（DiT + 音频填空 + Sway Sampling 全解析）

F5-TTS Explained: pure Flow Matching + DiT for zero-shot TTS — no AR, no codec, no phoneme alignment, just 16 ODE steps with Sway Sampling

本文是一篇详细的 F5-TTS / E2-TTS 技术拆解：从 Conditional Flow Matching 数学基础、E2-TTS 音频填空训练范式、F5-TTS 的 ConvNeXt 文本编码器与 Sway Sampling 推理技巧，到完整 PyTorch 调用、性能对比表与 VALL-E / CosyVoice 2 三路线终极比较。TTS 系列第 4 篇，Bitter Lesson 在 TTS 的胜利。

2025-11-09 1

CosyVoice 2 详解：阿里开源 TTS 凭什么对标 ElevenLabs（监督式语义 token + Qwen2.5 LM + Flow Matching 全解析）

CosyVoice 2 Explained: Alibaba's open-source TTS that rivals ElevenLabs — supervised semantic tokens + Qwen2.5 LM + Flow Matching + 150ms streaming

本文是一篇详细的 CosyVoice 2 技术拆解：从监督式语义 token 替代 Encodec 的设计哲学、Qwen2.5-0.5B AR LM、Conditional Flow Matching decoder、HiFi-GAN vocoder、chunk-aware 流式合成（150ms FTL），到 SEED-TTS 性能对比、与 VALL-E/F5-TTS 工程化取舍、CosyVoice 3 一瞥与工程化伦理。中文 TTS 工业部署事实标准的深度文。

2025-10-19 1

VALL-E 详解：把 TTS 当成神经 codec 上的语言模型

VALL-E Explained: Microsoft's TTS reframed as a neural codec language model — 3-second prompt zero-shot voice cloning powered by Encodec + AR/NAR Transformers

本文是一篇详细的 VALL-E 技术拆解：从 Encodec 的 RVQ-VAE 离散化、AR + NAR 双 Transformer 架构、3 秒音色克隆推理流程，到 VALL-E X / VALL-E 2 / NaturalSpeech 3 演进，以及与 CosyVoice 2 / F5-TTS 的工程化对比。ASR Whisper 的姊妹篇，TTS 系列第 2 篇。

2025-09-26 1

TTS 三十年技术演进史：从 HMM 到 Diffusion 再到 Neural Codec（语音合成范式革命全景解析）

TTS Evolution Explained: 30 years of text-to-speech paradigm shifts — from HMM and Unit Selection through WaveNet, Tacotron, VITS, VALL-E to F5-TTS and CosyVoice 2

本文是一篇详细的 TTS 30 年技术演进史：从 1990 年代的拼接合成 / HTS，经 WaveNet 与 Tacotron 的端到端革命，到 FastSpeech 并行化、VITS 端到端、VALL-E codec LM 范式革命、F5-TTS Flow Matching、CosyVoice 2 中文 SOTA。ASR 系列的姊妹篇，TTS 系列开篇。

2025-09-11 1

Streaming ASR 实战：Chunked Attention、KV Cache、Look-ahead 全解析（流式语音识别架构与源码详解）

Streaming ASR Explained: turn an offline ASR model into a voice agent — chunked attention, KV cache, look-ahead, dynamic chunk training

本文从工程视角彻底拆透流式 ASR：算法延迟 vs 计算延迟、流式三大天敌、Chunked Attention 与 Dynamic Chunk Training、KV Cache、Causal Conv、Whisper 流式化、RNN-T 天然流式、VAD + Endpoint 工业架构、Moshi/GPT-4o Realtime 端到端语音 LLM。CTC、Whisper、RNN-T、Conformer、SSL 系列的姊妹篇。

2025-08-17 1

Wav2Vec 2.0 / HuBERT / WavLM 三部曲：语音自监督预训练演进史（Self-Supervised Speech Pre-Training Explained）

The Self-Supervised Speech Trilogy: Wav2Vec 2.0, HuBERT, WavLM — how BERT-style pretraining came to speech

本文是一篇详细的语音自监督预训练 (SSL) 拆解：从 Wav2Vec 2.0 的对比学习 + 量化、HuBERT 的 k-means 伪标签 + 掩码预测，到 WavLM 的话语混合与门控相对位置偏置。配 PyTorch 微调代码、SUPERB 性能表，与 Whisper / Conformer / RNN-T 系列互链。

2025-03-15 1

Conformer Explained：Convolution-augmented Transformer 如何统治 ASR Backbone（架构与源码详解）

Conformer Explained: convolution-augmented Transformer — the de-facto encoder for modern speech recognition

本文是一篇详细的 Conformer 技术拆解：从纯 Transformer 在 ASR 上的局限、Macaron 双 FFN + Convolution Module 的设计哲学，到完整 PyTorch 实现、S/M/L 三种官方配置和 Squeezeformer / Zipformer 变体演进。CTC、Whisper、RNN-T 系列的姊妹篇。

2024-12-21 1