
GPT-SoVITS實戰指南用1分鐘音頻克隆出專屬TTS聲音【免費下載鏈接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)項目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一個開源的少樣本語音克隆項目喂給它 5 秒參考音頻即可零樣本合成語音提供約 1 分鐘的目標人聲數據則能微調出一個音色貼合的專屬 TTS 模型。適合想快速搭建語音合成能力、又不想折騰完整 TTS 訓練流水線的開發者。 能力與適用場景速覽維度說明零樣本合成提供 5 秒人聲樣本 參考文本直接生成目標音色語音少樣本微調約 1 分鐘訓練數據即可微調 GPT/SoVITS 雙模型提升音色相似度語言覆蓋中文、英語、日語、韓語、粵語支持跨語言推理與句內混讀配套工具鏈UVR5 人聲分離、自動音頻切片、多語言 ASR 轉寫與可視化校對聲碼器集成 BigVGANv3 原生輸出 24kv4 原生輸出 48k 音頻官方說明見 docs/cn/README.md模型架構實現集中在GPT_SoVITS/AR/models/與GPT_SoVITS/module/models.py。 四步跑通首次安裝已驗證的環境組合Python 3.10/3.11 PyTorch 2.5.1CUDA 12.4或 PyTorch 2.7.0CUDA 12.8。1. 獲取代碼git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS2. 創建虛擬環境conda create -n GPTSoVits python3.10 conda activate GPTSoVits3. 運行安裝腳本自動安裝 ffmpeg、PyTorch、依賴包并下載預訓練模型到GPT_SoVITS/pretrained_models、G2PW 中文音素模型到GPT_SoVITS/textbash install.sh --device CU128 --source HF --download-uvr5--device可選CU126 | CU128 | ROCM | MPS | CPU--source可選HF | HF-Mirror | ModelScope。Windows 用戶也可以直接下載官方整合包雙擊go-webui.bat啟動。macOS 上官方建議選CPU因為 Mac GPU 訓練出的模型質量明顯偏低。4. 啟動 WebUIpython webui.py瀏覽器訪問http://localhost:9874即進入主界面ASR 校對 9871、推理 9872、UVR5 9873端口定義在 config.py。首次使用某類 ASR 模型時會自動聯網下載離線環境可提前把模型放進tools/asr/models。? 從原始音頻到第一條合成語音整個流程在 WebUI 的訓練數據準備與模型訓練兩個標簽頁內完成按序執行即可導入與切片填入原始音頻路徑用內置 slicer 切成適合訓練的小片段長音頻自動按靜音分割。去噪可選底噪較大的樣本先過一遍降噪工具。ASR 轉寫自動識別生成文本標注。中文/粵語走 FunASR 后端多語言默認 Fun-ASR-Nano也可換 Faster Whisper見tools/asr/funasr_asr.py、tools/asr/fasterwhisper_asr.py。人工校對在可視化校對界面逐條修正錯字、補標點這一步直接決定訓練上限。導出標注文件格式為四段式語言碼支持zh / en / ja / ko / yuevocal_path|speaker_name|language|text D:\GPT-SoVITS\xxx\clip001.wav|xxx|zh|你好這是第一段訓練文本。微調訓練切到訓練標簽頁先訓 GPT 語義模型s1再訓 SoVITS 聲學生成模型s2對應倉庫中的GPT_SoVITS/s1_train.py與GPT_SoVITS/s2_train.py。訓練權重按版本分目錄存放如GPT_weights_v2Pro、SoVITS_weights_v2Pro配置文件參考GPT_SoVITS/configs/train.yaml如precision: 16-mixed、gradient_clip: 1.0。推理試聽進入1-GPT-SoVITS-TTS / 1C-inference頁簽選擇剛訓好的權重、上傳 5–10 秒參考音頻并填參考文本輸入目標文本生成 WAV。?? 選版本與調合成參數版本怎么挑均為 config.py 中實際注冊的版本版本定位適用數據輸出規格v2經典款預訓練擴到 5k 小時弱參考音頻更穩平均音質即可32kv2Pro / v2ProPlus性能超過 v4顯存占用略高于 v2速度接近 v2平均音質即可32kv3音色相似度更高GPT 更穩少復讀、少漏字情感更豐富需要較高質量訓練集原生 24kv4修復 v3 的金屬感偽影原生 48k 輸出官方視為 v3 直接替代需要較高質量訓練集原生 48k官方結論訓練集音質一般時 v1/v2/v2Pro 出效果更穩v3/v4 的合成音色更貼合參考音頻而非整個訓練集。推理側旋鈕WebUI 與 API 共用參考音頻長度 5–15 秒越貼近目標文本的語域語氣越自然top_k默認 15、top_p默認 1.0、temperature默認 1.0控制隨機性復讀或跑題時調低 top_kspeed默認 1.0調語速sample_steps默認 32影響生成步數is_half控制 fp16 半精度NVIDIA 顯卡默認開啟以省顯存由環境變量is_half控制。推理速度參考官方 v2 ProPlus 實測 RTFRTX 4090 約 0.0141400 字約 3.36 秒出 4 分鐘音頻RTX 4060 Ti 約 0.028M4 純 CPU 約 0.526。 常見坑位與排查WebUI 打開后連不上頁面現象終端正常打印但瀏覽器打不開 9874 端口。 可能原因端口被占用或防火墻攔截。 解決換一個空閑端口后重啟或用瀏覽器直接訪問終端輸出的完整 URLDocker 場景下確認--service-ports已生效。中文合成讀音錯亂、出現拼音或英文現象中文文本被按英文規則讀。 可能原因GPT_SoVITS/text下缺少G2PWModel目錄中文音素模型沒裝。 解決重新執行install.sh --device ... --source ...或手動把 G2PWModel 壓縮包解壓重命名后放入該目錄。CUDA 版本對不上安裝失敗或回退 CPU現象腳本提示找不到驅動回退 CPU或運行時出現 CUDA 報錯。 可能原因驅動只支持 CUDA 12.6 卻選了 CU128。 解決用nvidia-smi查看 CUDA Version據此在--device中指定CU126或CU128。ASR 一直轉寫失敗或卡住現象切片后的音頻沒有生成文本標注。 可能原因首次使用需聯網下載 ASR 模型網絡不通時靜默失敗。 解決換--source HF-Mirror環境或手動下載模型放入tools/asr/models后再跑。v3/v4 合成有明顯金屬感或發悶現象高語速段出現金屬味整體偏悶。 可能原因v3 的非整數倍上采樣偽影或 v3 原生 24k 輸出被放大后渾濁。 解決換 v4 權重原生 48kv4 用戶還可用tools/AP_BWE_main/的 24k→48k 超分模型處理舊產物。音色不像目標說話人現象合成語氣平穩但音色偏離參考人。 可能原因訓練數據過少、參考音頻含伴奏或底噪或參考音頻與訓練集音色差異過大。 解決擴充到 3–5 分鐘干凈人聲參考音頻選目標說話人的典型片段重跑微調平均音質數據優先選 v2Pro 系版本。 API 集成與容器化部署HTTP APIapi.py默認監聽 9880 端口GPT_SoVITS/inference_webui.py也可獨立起推理端。核心端點有POST /set_model切換權重、POST /change_refer換參考音頻、POST /合成。合成請求體示例{ refer_wav_path: GPT_weights_v2Pro/prompt.wav, prompt_text: 參考音頻的文本內容, prompt_language: zh, text: 你好這是一段 API 合成測試, text_language: zh, top_k: 15, temperature: 1.0, speed: 1.0 }Docker 部署docker-compose.yaml提供GPT-SoVITS-CU126、GPT-SoVITS-CU128及對應-Lite不含 ASR 與 UVR5 模型四個服務在倉庫根目錄執行docker compose run --service-ports GPT-SoVITS-CU128Windows Docker Desktop 默認共享內存偏小按需調大shm_size想用 fp16 設環境變量is_halftrue。需要最新代碼時可bash docker_build.sh --cuda 12.8本地構建。批量處理切片、ASR、推理都有 CLI 入口例如python tools/slice_audio.py、python tools/asr/funasr_asr.py -i 輸入目錄 -o 輸出文件 -l zh適合放進腳本做批量任務。下一步先跑通install.shwebui.py用 1 分鐘音頻走完切片 → 校對 → 微調 → 推理全流程拿到第一條合成語音后再考慮換版本或上 API。深入細節按 docs/cn/README.md 和GPT_SoVITS/AR/models/源碼逐層看即可。【免費下載鏈接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)項目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考