
OpenMontage 如何在 NVIDIA GPU 上啟用本地視頻生成并選擇匹配的 Wan、Hunyuan 模型【免費下載鏈接】OpenMontageWorlds first open-source, agentic video production system. 12 production pipelines, 100 tools, 700 agent skill and production-knowledge files. Turn your AI coding assistant into a full video production studio.項目地址: https://gitcode.com/GitHub_Trending/op/OpenMontage如果你有一塊 NVIDIA 顯卡想讓 OpenMontage 不調(diào)用任何云端 API 就能自己生成視頻需要完成三件事裝好 GPU 依賴棧、在.env里開啟本地生成開關、按顯存大小選一個能跑起來的 Wan 或 Hunyuan 模型。做完后wan_video、hunyuan_video等本地工具會被注冊進工具菜單整個流程免費且離線。本文基于 docs/PROVIDERS.md 的 Local Video Generation (GPU Required) 一節(jié)、Makefile 和 README.md 整理。前提條件一塊顯存足夠的 NVIDIA GPU本地視頻生成要求 CUDA 運行時即 NVIDIA 卡具體顯存門檻見下面的選型表。Python 3.10。Makefile 的ensure-venv會檢查解釋器版本缺失時提示安裝uv或更高版本 Python 后重試。項目已 clone 到本地并可以運行make。第一步安裝 GPU 依賴棧在項目根目錄執(zhí)行make install-gpu這個目標由 Makefile 定義實際做兩件事pip install -r requirements-gpu.txt—— 安裝 requirements-gpu.txt 中列出的torch2.0、torchaudio2.0、torchvision0.15pip install diffusers transformers accelerate—— 本地視頻生成依賴的推理庫。如果沒有make也可以按 docs/PROVIDERS.md 給出的手動方式安裝pip install diffusers transformers accelerate torch pillow requests注意requirements-gpu.txt文件頭注明這些依賴是在requirements.txt基礎之外追加安裝的。如果還沒跑過make setup項目核心依賴PyYAML、pydantic、fastapi 等尚未安裝先執(zhí)行make setup。第二步在 .env 中啟用本地生成make setup會從.env.example生成.env。在.env中加入兩行# 1. 打開本地視頻生成開關 VIDEO_GEN_LOCAL_ENABLEDtrue # 2. 按你的 GPU 顯存選一個模型 VIDEO_GEN_LOCAL_MODELwan2.2-ti2v-5bVIDEO_GEN_LOCAL_ENABLED接受true、1、yes見 tools/video/_shared.py 中的判斷邏輯。VIDEO_GEN_LOCAL_MODEL決定加載哪個本地檢查點可選值及其顯存要求來自 docs/PROVIDERS.md模型值名稱顯存質(zhì)量速度文檔給出的定位wan2.2-ti2v-5bWAN 2.2 TI2V (5B)12GBExcellentMedium默認值。720p 24fps一個檢查點覆蓋 T2V/I2V/V2Vwan2.1-1.3bWAN 2.1 (1.3B)6GBGoodFast入門級顯卡快速迭代僅文生視頻wan2.1-14bWAN 2.1 (14B)24GBExcellentSlowWan 2.1 系中質(zhì)量最高hunyuan-1.5Hunyuan 1.512GBVery goodMedium面向中端顯卡ltx2-localLTX-28GBGoodFastest快速草稿、最低延遲cogvideo-5bCogVideo (5B)10GBGoodMedium平衡選項cogvideo-2bCogVideo (2B)6GBFairFast低顯存實驗如何為 Wan 和 Hunyuan 做選型按顯存分檔Wan 與 Hunyuan 的選擇邏輯是12GB 顯存如 3060 12G/4070 級別Wan 2.2 TI2V 5B 與 Hunyuan 1.5 都要求 12GB。Wan 2.2 TI2V 5B 是文檔標注的默認模型一個檢查點同時支持 text-to-video、image-to-video、video-to-videoHunyuan 1.5 在 tools/video/_shared.py 的HUNYUAN_VARIANTS中標記t2v與i2v均為支持默認輸出 848x480。兩者都能跑文檔沒有在這兩個之間做質(zhì)量排序可按自己偏好的模型系列選。6GB 顯存只能選wan2.1-1.3b或 CogVideo 2B。注意 Wan 2.1 1.3B 官方?jīng)]有 I2V 權(quán)重docs/PROVIDERS.md明確 Wan 2.1 never shipped 1.3B I2V weights它只適合文生視頻。24GB 顯存wan2.1-14b提供 Wan 2.1 系最高質(zhì)量支持 T2V/I2V/V2V/首尾幀插值等全部 Wan 操作但速度標記為 Slow。8–10GB 顯存標題場景之外的替代選項是ltx2-local8GB最快和cogvideo-5b10GB但 CogVideo 只有文生視頻不支持圖生視頻。一個容易混淆的點本地 Hunyuanhunyuan_video模型值hunyuan-1.5需要 GPU 且免費與騰訊云 Hunyuanhunyuan_cloud_video需要TENCENT_TOKENHUB_API_KEY按次付費是兩條互不相干的路徑環(huán)境變量也不同。本文只覆蓋前者。驗證本地工具已生效運行項目自帶的 preflight 檢查它會調(diào)用工具注冊表并打印當前環(huán)境可用/不可用的 provider 菜單make preflight該命令在 Makefile 中定義為執(zhí)行registry.discover()后輸出registry.provider_menu()的 JSON。本地視頻生成正確啟用后菜單中應出現(xiàn)wan_video、hunyuan_video、cogvideo_video、ltx_video_local這幾個由VIDEO_GEN_LOCAL_ENABLED解鎖的工具見 docs/PROVIDERS.md 的 Provider-to-Tool Mapping 表中Local GPU一行。之后通過 AI 編碼助手調(diào)用wan_video或hunyuan_video時工具會按所選檢查點的operations能力表拒絕它做不了的操作例如用wan2.1-1.3b請求圖生視頻會被直接拒絕而不是悄悄加載錯誤的 14B 檢查點。NVIDIA 驅(qū)動版本不一致的處理docs/PROVIDERS.md專門記錄了一個 NVIDIA 特有的坑如果已加載的 kernel 模塊與用戶態(tài)驅(qū)動庫版本不一致nvmlInit會失敗表現(xiàn)為CUDA 計算本身仍然能跑但 PyTorch 在組裝 OOM 報告時會調(diào)用 NVML導致真實的顯存不足OOM以 internal assert 的形式爆出int8/int4精度的 bitsandbytes 無法加載。排查方法是對比兩條命令的輸出cat /proc/driver/nvidia/version nvidia-smi如果兩者顯示的驅(qū)動版本不一致文檔給出的解決辦法是重啟機器。wan_video工具會檢測這種狀態(tài)并在結(jié)果中說明。12GB 顯卡的顯存適配參數(shù)如果你按文檔實測遇到 12GB 卡上顯存吃緊wan_video提供兩個都默認auto的參數(shù)precisionauto/bf16/int8/int4offload_modeauto/model/sequential。文檔給出的 12GB 實測數(shù)據(jù)來源docs/PROVIDERS.md屬文檔示例/實測值不是固定預期bf16 的 5B transformer 常駐約 10GB用offload_modemodel時峰值達 10.85GB僅 512x320換成offload_modesequential逐個子模塊流式加載后同一張卡峰值降到 1.97GB可以舒服地渲染 704x480代價是每個去噪步約 4s 的 PCIe 傳輸。在 12GB GPU 上auto會自動選擇sequential。已知限制圖生視頻不是所有模型都支持Wan 2.1 1.3B 沒有 I2V 權(quán)重CogVideo 僅文生視頻。每個變體的真實能力列表在 tools/video/_shared.py 的operations字段wan_video對不支持的操作會直接拒絕。TI2V 線的 720p 是 1280x704 而不是 1280x720Wan 2.2 TI2V 的 VAE 空間壓縮 16 倍、transformer 再 2 倍 patching寬高必須是 32 的倍數(shù)而 720 不是其他線是 16 的倍數(shù)。幀數(shù)落在4k 1。長片段的漂移Wan 大約按 5 秒一段訓練請求更長片段duration_seconds時工具會串聯(lián)多段每段以上一段末幀作為新幀 0。文檔指出串聯(lián)會漂移對比度和色彩漸變correct_drift默認開啟用于校正如需逐鏡頭控制可用segment_prompts。完成以上步驟后你的驗證落點就是make preflight菜單中出現(xiàn)本地視頻工具且wan_video/hunyuan_video能按所選檢查點的operations正常執(zhí)行請求。若某操作被拒回查所選模型在operations列表里的能力而不是懷疑開關沒生效。【免費下載鏈接】OpenMontageWorlds first open-source, agentic video production system. 12 production pipelines, 100 tools, 700 agent skill and production-knowledge files. Turn your AI coding assistant into a full video production studio.項目地址: https://gitcode.com/GitHub_Trending/op/OpenMontage創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考