通义百聆迎来重磅升级 Fun-CosyVoice3正式开源 可实现极速克隆音色
智通财经·2025-12-15 08:45
通义百聆语音模型升级发布 - 公司发布Fun-CosyVoice3模型升级,首包延迟降低50%,中英混字准确率翻倍,支持9种语言、18种方言口音、跨语种克隆与情感控制 [1] - 公司正式开源Fun-CosyVoice3(0.5B)版本,该版本提供zero-shot音色克隆能力,仅需一段3秒以上参考音频即可复刻音色并合成新语音,支持本地部署和二次开发 [1] - 公司推出轻量化Fun-ASR-Nano模型,总参数量压缩至0.8B,推理成本更低,现已开源并支持本地部署与定制化微调 [1] Fun-CosyVoice3模型关键性能提升 - 模型首包延迟降低50%,支持双向流式合成,实现“输入即发声”,适用于语音助手、直播配音、无障碍阅读等实时场景 [2] - 模型中英混说词错误率相比之前降低56.4%,能精准自然地处理含专业术语、大小写混排及语码转换的句子 [2] - 在zero-shot TTS评测中,模型内容一致性与音色相似度全面提升,复杂场景字符错误率相对降低26%,接近人类录音水平 [2] - 模型支持9种通用语言、18种中文方言、9种情感控制,并具备跨语种音色复刻能力,可用一段普通话录音生成粤语、日语、英语等语音并保持音色高度一致 [2] Fun-ASR模型能力增强与落地 - Fun-ASR是基于数千万小时真实语音数据训练的端到端语音识别大模型,已在钉钉“AI听记”、视频会议等场景大规模落地 [2] - 本次升级重点优化了嘈杂环境鲁棒性、多语言自由混说、中文方言与口音覆盖、歌词识别及定制化能力 [2] - 模型将流式识别模型的首字延迟降低到160毫秒 [2]