面壁与清华开源的免费语音合成工具,能说9种国内方言

做视频配音、有声书、方言内容的人,大概都踩过同一个坑,要么花钱买配音会员,要么用免费工具,出来的声音像机器人念稿。最近试了个面壁智能开源的项目 VoxCPM2,有点东西,关键是开源协议允许免费商用,顺手聊聊。

VoxCPM2

它到底是什么

简单说,这是个语音合成模型,由 OpenBMB(面壁智能)和清华大学人机交互实验室一起搞的。和传统语音合成不一样,它不走先切词再编码那套离散流程,而是端到端直接生成连续语音,所以听着更自然,不像在念课文。

底座是 MiniCPM-4,20亿参数,在 200多万小时的多语种音频上训出来的,多语言、多方言才扛得住。

几个值得一提的点

  • 30种语言加9种中国方言,中文英语日语法语不用说,四川话粤语吴语东北话河南话陕西话山东话天津话闽南话都覆盖,直接给文本就能合成,不用额外标语言
  • 音色设计,用大白话描述就能凭空捏一个声音,温柔的中年女声、带点沙哑的年轻男声,不用先录参考音频
  • 声音克隆,给一段音频就能模仿,还能叠情绪、语速、表现力去控制,再加对应文字喂进去能无缝续写,还原度很高
  • 输出 48kHz 高保真,哪怕参考音频只有 16kHz,经它的 AudioVAE V2 也能提到 48kHz,听着更通透
  • 实时流式合成,在 RTX 4090 上实时因子压到 0.3 左右,基本跟得上实时对话的节奏

普通人能拿来干嘛

说点实在的。做视频号、B站的,再也不用对着配音会员纠结买不买。想做有声书但嫌自己声音不好听的,用音色设计捏一个满意的。家里长辈说方言,想做个语音播报或者留个声音纪念的,方言支持直接派上用场。想克隆自己声音批量回语音消息的,也不是不行。

想试不用装环境

不想折腾本地,面壁那边搭了个官方在线试用页,浏览器打开直接输文字就能听,先感受下声音自然不自然。要本地玩,环境要求 Python 3.10 以上、PyTorch 2.5 以上、CUDA 12 以上,装起来一条命令。

1
pip install voxcpm

最简的一段 Python 调用长这样。

1
2
3
4
5
6
7
8
9
from voxcpm import VoxCPM
import soundfile as sf

model = VoxCPM.from_pretrained("openbmb/VoxCPM2", load_denoiser=False)
wav = model.generate(
text="VoxCPM2 是目前推荐使用的多语言语音合成版本。",
cfg_value=2.0, inference_timesteps=10, seed=42,
)
sf.write("demo.wav", wav, model.tts_model.sample_rate)

不想写代码,命令行直接 design 或者 clone,或者跑个本地网页 demo 都行。模型权重在 Hugging Face 和 ModelScope 上都能下,搜 openbmb/VoxCPM2 就行。

先说好几个坑

这项目香,但也不是零门槛。它吃显卡,本地玩至少得有块像样的独显,纯 CPU 跑会慢到怀疑人生。克隆声音好玩归好玩,官方也明确提醒严禁拿去冒充他人或者搞欺诈,公开内容最好标清楚是 AI 生成的。非程序员装环境跑命令还是有门槛,纯小白建议先去官方在线试用页摸起,不费事就能听个大概。

整体看,开源又允许免费商用,在语音合成圈不算常见,中文和方言支持也实打实,做内容生产的值得备一个。

你平时用哪个配音或者语音合成工具,体验怎么样,评论区聊聊,我看看还有没有更省事的替代。


面壁与清华开源的免费语音合成工具,能说9种国内方言
https://www.91hym.cn/fun/642.html
作者
菊座
发布于
2026年7月20日
许可协议