
faster-whisper 語音識別教程如何在 1 分鐘內轉寫 13 分鐘音頻【免費下載鏈接】faster-whisperFaster Whisper transcription with CTranslate2項目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 把長音頻轉成文字比原版 Whisper 更快、更省內存。它是基于 CTranslate2 重寫的語音識別引擎最高可達原版 4 倍速度。如果你還在跑原版 Whisper 做批量轉寫這篇教程適合你。用原版 Whisper 轉寫時你會撞上這 3 個問題跑原版 large-v2 模型13 分鐘音頻要 2 分 23 秒顯存占用 4708MBCPU 上 small 模型更慢要 6 分 58 秒。原版還要求系統單獨安裝 FFmpeg容器環境經常卡在依賴上。faster-whisper 換用 CTranslate2 推理引擎并內置 PyAV 解碼音頻不需要在系統裝 FFmpeg。? 3 分鐘安裝并完成第一次轉錄要求 Python 3.9一條命令安裝pip install faster-whisper按模型名加載時對應的 CTranslate2 權重會自動從 Hugging Face Hub 下載。最小可運行示例from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})注意segments是生成器進入循環后轉寫才真正開始。3 個值得深挖的核心能力VAD 語音活動檢測先跳過靜音再轉寫傳vad_filterTrue轉寫前用內置 Silero VAD 切掉靜音段。默認策略保守只移除超過 2 秒的靜音想切得更碎可用vad_parameters把min_silence_duration_ms調低到 500。參數定義見 faster_whisper/vad.py。批量轉寫默認開啟 VAD。詞級時間戳精確到每個單詞word_timestampsTrue會把每個片段拆成單詞每個單詞帶起止時間適合做字幕對齊、關鍵詞定位。批量推理GPU 吞吐明顯提升BatchedInferencePipeline可直接替換WhisperModel.transcribe。以 distil-large-v3 在 GPU 上batch_size16為例耗時從 46 分 12 秒降到 25 分 50 秒transformers 實現跑同一任務WER 為 13.527 對 14.801。更多參數可在 faster_whisper/transcribe.py 中查閱。 基準對比耗時與內存差多少GPU 端large-v2RTX 3070 Ti 8GBCUDA 12.4均為 13 分鐘音頻實現精度耗時顯存openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisperint859s2926MBfaster-whisperbatch_size8int816s4500MBCPU 端small 模型i7-12700K8 線程原版 6 分 58 秒faster-whisper fp32 為 2 分 37 秒int8 為 1 分 42 秒內存從 2335MB 降到 1477MB。 5 條部署建議compute 類型、CUDA 版本與批大小GPU 場景優先compute_typefloat16顯存吃緊時換int8_float16。僅用 CPU建議compute_typeint8small 模型下耗時減半內存省 780MB1477MB 對 2257MB。CUDA 版本不匹配最新版 ctranslate2 只支持 CUDA 12 cuDNN 9CUDA 11 用戶降級到 ctranslate23.24.0。倉庫提供基于 nvidia/cuda 鏡像的部署參考見 docker/Dockerfile。長音頻批處理批量會推高內存int8 從 2926MB 升到 4500MB按空閑顯存定 batch_size。做橫向對比確保 beam size 一致faster-whisper 默認 beam_size5原版默認是 1否則數據不可比。3 個常見落地場景會議錄音轉寫VAD 自動跳過靜音段算力不浪費在無聲音上視頻字幕生成詞級時間戳讓字幕對齊精確到單詞多語言語料本地化自動檢測語言并返回置信度單條音頻還是批量任務faster-whisper 都用更少的時間和內存給出同樣的文字結果把現有轉寫流水線里的引擎換掉即可。【免費下載鏈接】faster-whisperFaster Whisper transcription with CTranslate2項目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考