
VoxCPM
新一代免分词文本转语音 零样本声音克隆技术
文本转语音
选择声音,输入文本,然后生成清晰自然的音频。
VoxCPM 技术架构
深入了解VoxCPM的核心技术原理和创新架构设计
MiniCPM-4骨干网络
基于边缘部署优化的MiniCPM-4大语言模型作为核心架构,通过分层语言建模技术实现文本语义理解与语音特征提取的有效整合,支持上下文感知的语音生成。
免分词端到端架构
摒弃传统TTS文本分词预处理,在连续语音空间直接建模。通过端到端扩散自回归架构,实现文本到语音的无损转换,保持语音自然流畅度。
FSQ量化技术
采用有限标量量化技术对语音特征进行高效编码,在保持音频质量的同时显著降低计算复杂度和存储需求。
局部扩散Transformer
结合扩散模型和Transformer架构的优势,通过局部扩散机制实现高质量语音生成,在保证音频质量的同时达到RTF 0.17的高效推理性能。
零样本声音克隆
仅需少量参考音频(3-10秒),即可提取说话人音色、口音和情感基调的细微特征,实现高保真声音克隆。
技术性能指标
基于国际权威基准测试,VoxCPM在多个关键指标中表现卓越
比播放速度快6倍
中文语音识别准确率
中文声音克隆相似度
英文语音识别准确率
基于Seed-TTS-eval等权威基准测试评估结果
技术对比矩阵
VoxCPM与主流TTS模型的全面性能对比
| 模型 | RTF | CER(%) | 相似度(%) | 零样本 | 多语言 | 开源 |
|---|---|---|---|---|---|---|
VoxCPM 免分词架构 | 0.17 | 0.93 | 77.2 | |||
CosyVoice | 0.25 | 3.2 | 0.88 | |||
F5-TTS | 0.42 | 4.1 | 0.85 | |||
SparkTTS | 0.31 | 2.8 | 0.89 |
VoxCPM在速度、准确性和功能完整性方面领先同类产品
核心能力音频演示
体验VoxCPM在跨语言克隆、情感表达和上下文感知生成方面的卓越表现
跨语言 - 英→中
英语说话人声音克隆为中文语音
跨语言 - 中→英
中文说话人声音克隆为英文语音
情感 - 开心
情感丰富的开心语调表达
情感 - 悲伤
情感丰富的悲伤语调表达
上下文感知 - 新闻
智能新闻播报风格
上下文感知 - 故事
智能故事讲述风格
更多音频示例请访问官方演示页面
应用场景
VoxCPM在多个领域展现出卓越性能,为创新应用提供强大支持
有声书制作
快速生成具有一致声音的高质量有声书
语言学习
个性化语音教育,多语言口音训练
内容创作
视频配音和播客制作的专业语音解决方案
无障碍应用
为视障人士提供个性化阅读体验
快速开始
仅需几步即可开始使用VoxCPM,部署并体验免分词TTS技术
环境配置
首先克隆仓库并安装依赖:
模型下载
下载预训练模型权重:
快速使用
使用Python脚本进行语音合成:
系统要求
常见问题
关于VoxCPM技术和使用的常见问题与解答