声音克隆:录 6~10 秒,
之后用你的声音念任意文案
不用念完整篇,不用训练模型。给一段干净干音,软件自动裁出最饱满的一段并识别出参考文本, 之后你输入什么,它就用你的音色念什么。克隆服务跑在你自己电脑上,声音文件不出本机。
三步,五分钟上手
导入干音
把 6~10 秒的干净录音拖进软件。超过 10 秒也没关系,软件会自动裁出最饱满的一段,切割边界落在语音停顿的中点上,不会把字切一半。
确认参考文本
软件自动识别干音内容填进参考文本框,识别结果是简体中文。只要核对一遍是否与「实际说到」的一致即可。
输入文案出成品
把要念的内容写进去,选好语气,点合成。音色就是你的,之后想改文案不用重新录干音。
效果演示
下面是用真实克隆流程跑出来的样音,未做后期处理。先听再决定要不要买。
assets/audio/clone/,文件名写成
名称-说明.mp3(例:女声样例-6秒干音克隆.mp3),本页会自动列出来,不需要改代码。
提示:样音用的是本机默认参数。你拿到的实际效果取决于干音质量,多半会比演示更好或更差一点点 —— 这一项跟录音环境关系最大。
五条效果边界,买之前请先知道
这些是实测结论,我们写清楚而不是等你买回来才发现。
干音质量决定上限
背景噪音、混响、多人说话都会明显拉低还原度。手机在安静房间里录也能用,但不要贴着风扇、不要在有回音的卫生间录。
情绪底色来自干音
想要明显的开心或低落,最有效的做法是换一段那种情绪干音当参考,而不是在参数里许愿。这一点界面里也照实写了。
参考音频 6~10 秒是甜点区
太短模型学不到音色,太长反而会让它自己报警「参考文本过长」,出现乱码和时长失控。所以别硬塞一分钟素材。
音高微调有边界
变调会把共振峰一起按比例搬走,幅度大了会听出「夹子音」。所以预设的音高都收在 ±1.5 半音以内,更大的调整留给你在音调滑块上自己做。
不是变声器
克隆是「用你的音色念新内容」,不是把你的录音改成别人的声音。它不会改变你说的语气细节,也不会做成实时变声。
买之前先确认你的电脑跑得动
本地克隆要占几个 GB 内存做推理,配置太低会非常慢。按下面的线来对:
| 项目 | 最低可用 | 推荐 |
|---|---|---|
| 系统 | Windows 10 64 位 | Windows 11 |
| 内存 | 8 GB(须关掉浏览器再用) | 16 GB 以上 |
| CPU | 近几代四核 | 带 AVX2 的六核以上 |
| 显卡 | 不需要,纯 CPU 也能跑 | 有独显更快(非必须) |
| 磁盘 | 约 8 GB 空间放模型与环境 | SSD |
说明:克隆靠 CPU 推理,没有独显也能用,只是慢一些。内存是最容易踩的坑 —— 16 GB 的机器如果同时开着一堆浏览器标签,实际可用可能只剩 3~4 GB,克隆会直接失败。
购买 PC 版
告诉客服你要做的是哪类活儿(口播 / 有声书 / 课程 / 短剧),可以少买用不上的时长。
已在别处购买过?卡密在软件「授权激活」页填入即可,桌面版 / 网页版 / 小程序端同一套卡密通用。