MOSS-TTS-Nano:僅 0.1B 參數、可在 CPU 實時運行的多語言微型語音合成模型
此模型採取了極端且正確的『反規模化』策略,在維持 48kHz 高採樣率的前提下將參數壓至 0.1B,成功將 TTS 從 GPU 依賴轉向端側普及。然而,其自然度必然存在天花板,僅適用於『功能性』而非『藝術性』的語音場景;且其環境依賴(如 pynini)增加了初次部署的摩擦成本。
GitHub →
此模型採取了極端且正確的『反規模化』策略,在維持 48kHz 高採樣率的前提下將參數壓至 0.1B,成功將 TTS 從 GPU 依賴轉向端側普及。然而,其自然度必然存在天花板,僅適用於『功能性』而非『藝術性』的語音場景;且其環境依賴(如 pynini)增加了初次部署的摩擦成本。
GitHub →