VoxCPM

VoxCPM

新一代免分词文本转语音 零样本声音克隆技术

文本转语音

选择声音,输入文本,然后生成清晰自然的音频。

生成语音
支持输入多种语言,系统将根据文本语言生成对应语音。
0 / 120 字符,剩余 120 字符预计消耗 0 积分
🚀
Elon Musk
EN
Deep, conversational and confident male voice. Perfect for online courses and e-learning. Incredible emotional authenticity.
🧽
SpongeBob
EN
Exceptionally energetic and playful voice. Vibrant, child-like male voice perfect for motivational content and sports commentary.
🦅
Donald Trump
EN
Deep, authoritative male voice. Confident, conversational tone perfect for podcasts and voiceovers.
👩
Friendly Women
EN
Warm and friendly female voice. Natural and engaging, perfect for customer service and narration.
🎙️
Energetic Male
EN
Energetic youthful male voice. Great for commercials, social media, and dynamic content.
👩
AD学姐
ZH
自信俏皮活力的女声,语速较快,适合短视频、抖音内容、直播带货。AI TTS技术,声音真实自然。
🐴
赛马娘
ZH
充满朝气、励志且友好的年轻女声。适合短视频、TikTok内容,以及客户服务与虚拟助手。声音富有感染力。
🐺
灰太狼
ZH
青青草原狼大王的雄音,浑厚有力的男声,适合角色扮演和故事叙述。
☯️
太乙真人
ZH
哪吒太乙真人声音,沉稳大气的男性声音,适合神话故事和角色扮演。
🧔
丁真
ZH
年轻温暖的男声,富有叙事感,适合短视频、TikTok内容创作。声音自然流畅。

VoxCPM 技术架构

深入了解VoxCPM的核心技术原理和创新架构设计

MiniCPM-4骨干网络

基于边缘部署优化的MiniCPM-4大语言模型作为核心架构,通过分层语言建模技术实现文本语义理解与语音特征提取的有效整合,支持上下文感知的语音生成。

免分词端到端架构

摒弃传统TTS文本分词预处理,在连续语音空间直接建模。通过端到端扩散自回归架构,实现文本到语音的无损转换,保持语音自然流畅度。

FSQ量化技术

采用有限标量量化技术对语音特征进行高效编码,在保持音频质量的同时显著降低计算复杂度和存储需求。

局部扩散Transformer

结合扩散模型和Transformer架构的优势,通过局部扩散机制实现高质量语音生成,在保证音频质量的同时达到RTF 0.17的高效推理性能。

零样本声音克隆

仅需少量参考音频(3-10秒),即可提取说话人音色、口音和情感基调的细微特征,实现高保真声音克隆。

技术性能指标

基于国际权威基准测试,VoxCPM在多个关键指标中表现卓越

0.17
实时因子(RTF)

比播放速度快6倍

0.93%
字符错误率(CER)

中文语音识别准确率

77.2%
声音相似度

中文声音克隆相似度

1.85%
词错误率(WER)

英文语音识别准确率

基于Seed-TTS-eval等权威基准测试评估结果

技术对比矩阵

VoxCPM与主流TTS模型的全面性能对比

VoxCPM
RTF
0.17
CER(%)
0.93
相似度(%)
77.2
零样本
多语言
开源
CosyVoice
RTF
0.25
CER(%)
3.2
相似度(%)
0.88
零样本
多语言
开源
F5-TTS
RTF
0.42
CER(%)
4.1
相似度(%)
0.85
零样本
多语言
开源
SparkTTS
RTF
0.31
CER(%)
2.8
相似度(%)
0.89
零样本
多语言
开源

VoxCPM在速度、准确性和功能完整性方面领先同类产品

核心能力音频演示

体验VoxCPM在跨语言克隆、情感表达和上下文感知生成方面的卓越表现

跨语言 - 英→中

英语说话人声音克隆为中文语音

跨语言 - 中→英

中文说话人声音克隆为英文语音

情感 - 开心

情感丰富的开心语调表达

情感 - 悲伤

情感丰富的悲伤语调表达

上下文感知 - 新闻

智能新闻播报风格

上下文感知 - 故事

智能故事讲述风格

更多音频示例请访问官方演示页面

技术深度探索

探索VoxCPM的技术细节,获取开发资源和学术研究

学术论文

详细的技术原理、实验结果和性能评估报告

阅读论文

开源代码

完整源代码、模型权重和训练脚本

访问仓库

快速开始

仅需几个简单步骤即可部署和使用VoxCPM模型

开始使用

模型下载

预训练模型权重,可直接用于推理

下载模型

API文档

详细的API接口说明和使用示例

查看文档

社区支持

加入开发者社区获取技术支持和讨论

加入讨论

技术亮点

Apache 2.0开源许可证
500M模型参数
1.8M Hours训练数据
RTX 4090推荐硬件

应用场景

VoxCPM在多个领域展现出卓越性能,为创新应用提供强大支持

有声书制作

快速生成具有一致声音的高质量有声书

语言学习

个性化语音教育,多语言口音训练

内容创作

视频配音和播客制作的专业语音解决方案

无障碍应用

为视障人士提供个性化阅读体验

快速开始

仅需几步即可开始使用VoxCPM,部署并体验免分词TTS技术

1

环境配置

首先克隆仓库并安装依赖:

git clone https://github.com/OpenBMB/VoxCPM.git
cd VoxCPM
pip install -r requirements.txt
2

模型下载

下载预训练模型权重:

huggingface-cli download openbmb/VoxCPM --local-dir ./checkpoints/VoxCPM
3

快速使用

使用Python脚本进行语音合成:

Initialize model
from voxcpm import VoxCPM
model = VoxCPM.from_pretrained("./checkpoints/VoxCPM")
Speech synthesis
text = 'Hello, this is VoxCPM speech synthesis demo'
audio = model.tts(text)
audio.save("output.wav")

系统要求

Python 3.8+
PyTorch 1.13.0+
CUDA 11.6+(推荐RTX 4090或更高)
内存:16GB+ RAM
显存:12GB+ VRAM

常见问题

关于VoxCPM技术和使用的常见问题与解答