已对接桶 ruichen(华南-广州 · 公共读 · Endpoint gz.bcebos.com)。策略:启用后全部持久化媒体一律镜像到 BOS(视频库、切好的片段、缩略图、BGM、参考视频、配音、音色参考、成片)。
目录约定:videos/ 源片 · segments/ 切好的片段 · thumbs/ 缩略图 · audio//bgm//voice/ 音频 · output//lecture/ 成片 · ref/ 参考视频。本地仍保留供渲染;播放优先 BOS。上传失败会写入记录的 bosError 并在进度文案中提示。
在百度网盘开放平台创建应用后获取 token;用于把网盘视频拉到本平台 OSS。
需先在讯飞开放平台「一句话复刻·标准版」开通免费测试包;克隆走 HTTP REST + MD5 鉴权,合成走 WebSocket + HMAC-SHA256 鉴权;训练约 2–10 分钟。
文本始终原样送模型,不做任何谐音改写。中英混合讲稿选 auto,英文会走英文发音前端。
克隆音色时会把参考 wav 同步到此目录,并把该路径交给 GPT-SoVITS。工坊与模型同机时可直接写入;Windows 本地 + 隧道时需手动把 wav 拷到服务器对应路径。线上已跑通示例:/www/wwwroot/default/gpt_sovits/refs。
运行 GPT-SoVITS 的 API 服务(默认端口 9880),不消耗任何云端 key。服务器上已装成 systemd 服务 gptsovits,可在「声音克隆」页直接启动/重启/停止;手动启动等价于 python api.py -dr 参考.wav -dt 参考文字 -dl zh -p 9880。
音频要求:清晰无背景音的人声。MiniMax 建议 10 秒~5 分钟;本地 GPT-SoVITS 5 秒即可零样本。本地模型克隆时请填写「参考音频文字稿」。
调用 POST {地址}/audio/transcriptions。不配也不影响使用 —— 参考片段只有几秒钟,手动打十几个字即可。配上之后,创建音色时可一键把参考片段转成文字稿。