
SadTalker 完整部署教程一張照片加一段音頻本地跑通會說話的數字人【免費下載鏈接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation項目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker如果你手里有一張人物照片想讓它配上語音開口說話又不想實拍剪輯SadTalker 就是干這個的輸入一張人像加一段音頻輸出口型與語音對齊的說話頭視頻。它發表在 CVPR 2023全流程離線普通電腦也能本地運行。能力與適用場景核心鏈路是人像 音頻 → 說話頭視頻模型先從音頻里估計 3D 面部運動系數再把表情和頭部動作渲染到畫面上所以口型同步是它的強項。它提供了幾種現成的使用方式不用自己寫代碼WebUI 圖形界面啟動 Gradio 頁面瀏覽器里傳照片和音頻就能生成命令行python inference.py增強、姿態、分辨率等參數都可控制批量處理src/generate_batch.py可以一次出多張圖Stable Diffusion WebUI 擴展能裝進已有的 SD 環境里輸入素材要求寫實風格人像官方明確說明不適合動漫風圖片。做口播視頻、課程配音、產品介紹片段的個人用戶都能直接用。安裝環境要求與首次運行清單新手不用背命令按下面清單逐項過一遍跑完就能見到第一條視頻系統與硬件Windows 10/11、macOS、Linux 都行內存 8GB 以上、預留 10GB 以上磁盤比較穩妥安裝依賴Windows 用戶直接雙擊webui.batmacOS/Linux 在終端跑bash webui.sh兩者都會自動裝好依賴。想手動裝的話參照 docs/install.md重點是 Python 3.8 和ffmpeg下載模型執行bash scripts/download_models.sh權重會落到checkpoints/和gfpgan/weights/網絡不穩時也可手動下載后解壓到這兩個目錄準備素材一張寫實風格正面人像音頻用 wav 或 mp3 格式examples/source_image/和examples/driven_audio/里就有現成樣例git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker bash scripts/download_models.sh上面做完后啟動 WebUI 上傳素材即可生成也可以直接在命令行跑 python inference.py --driven_audio examples/driven_audio/deyu.wav \ --source_image examples/source_image/art_17.png --enhancer gfpgan結果會保存在results/下的時間戳子文件夾里。本地部署、Docker 與云端三種運行方式怎么選運行方式你能得到什么需要注意什么適合誰本地部署WebUI/命令行數據不出本機參數完全可控無次數限制首次要裝依賴、下模型占 10GB 以上磁盤個人用戶、數據敏感場景Docker 容器環境隔離、一條命令啟動、遷移復制方便需要熟悉 Docker 和 GPU 透傳技術愛好者、企業用戶云端托管體驗打開即用、零安裝依賴網絡可能排隊或有使用額度限制臨時試用、一次性需求Docker 啟動命令以及 WSL、macOS 的相關細節都寫在 docs/install.md。常見報錯怎么修 ??Q提示 ffmpeg 無法識別先安裝ffmpegLinux 走 conda、macOS 走 brew、Windows 可走 scoop確認它加進了系統 PATH 再啟動。Q提示模型文件缺失或損壞模型文件不會自動下載。重跑bash scripts/download_models.sh或手動下載后放到checkpoints/和gfpgan/weights/細節見 docs/FAQ.md。Q音頻報 Invalid data found 錯誤只支持 wav 和 mp3 兩種音頻格式先轉碼再試。QCUDA out of memory顯卡顯存不夠調低輸出分辨率或關閉增強選項也可以設置環境變量PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128后再啟動。QMac M1 報 Illegal Hardware Error單獨執行pip install dlib重裝 dlib再重新啟動。素材挑選與參數微調效果很吃素材正面、清晰的寫實人像最容易出好結果側臉和被遮擋的臉容易翻車。常用參數組合可查 docs/best_practice.md全身圖--preprocess full搭配--still只動臉部并保留原始姿態表情幅度--expression_scale默認 1.0調大動作更明顯建議在 0.5~1.5 之間試面部增強加--enhancer gfpgan提升面部細節適合分辨率偏低的原圖借動作用--ref_eyeblink/--ref_pose傳入參考視頻眨眼和頭部動作會更自然跑通之后往哪兒走批量出片src/generate_batch.py一次生成多張圖批量需求能省不少時間接入 Stable Diffusion WebUI看 docs/webui_extension.md3D 人臉可視化與自由視角--face3dvis和--input_yaw等模式見 docs/face3d.md從克隆倉庫到出第一條視頻的距離沒想象中遠參數也沒幾個值得反復調。先用官方樣例素材跑一遍熟悉效果再換成自己的素材逐個試參數幾輪就能上手。【免費下載鏈接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation項目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考