
Buzz 完整本地離線音頻轉錄指南免費把錄音變成文字和字幕【免費下載鏈接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.項目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 Whisper 的本地離線音頻轉錄工具跑在你自己的電腦上把錄音、視頻、YouTube 鏈接里的語音免費轉成文字和帶時間軸的字幕全程不上傳、不聯網也能用。被錄音堆成山的日子該結束了你大概遇到過這樣的局面三個月的播客訪談原聲堆在文件夾里加起來二十個小時。自己敲字一分鐘音頻至少敲三分鐘算下來一周時間搭進去丟給在線轉寫服務一小時十幾塊先不說文件得傳到別人服務器——而受訪對象明明交代過內容不能上云。偏偏公司內網還不穩定排到一半任務斷了前功盡棄。Buzz 就是沖著貴、泄密、斷網就癱這三件事來的轉錄在你本機完成一分錢不花斷網照常跑。下面帶你從安裝到出字幕完整走一遍。它和在線轉寫服務的差別在哪先看一張表幾個關鍵維度一目了然維度在線轉寫服務Buzz數據去向上傳到第三方服務器始終留在本機費用按時長計費或訂閱開源免費斷網時直接不可用完整可用硬件利用取決于對方服務器本機 GPU/CPU 直接干活輸出形態平臺內查看為主TXT / SRT / VTT 文件自由導出支撐這些差別的是三個可以單獨拎出來的底氣隱私是默認狀態不是付費選項。音頻從導入到出結果每一步都在你自己的磁盤上發生。商業會議、用戶訪談這類敏感素材不存在先傳上去再回來的環節。開源意味著免費是長期的。代碼完全開放社區迭代活躍你踩到的坑大概率在下個版本就被修掉而不是一封工單等一周。后端選項給得很足。NVIDIA 顯卡走 CUDA 加速Mac 走 Apple Silicon 優化還有 Whisper.cpp 后端兼容 Vulkan、吃集成顯卡甚至純 CPU。沒有獨顯只是快慢問題不是能不能用的問題。五步跑通你的第一個轉錄任務第一步安裝。去下載對應系統的安裝包Windows 雙擊安裝程序未簽名出現警告時選仍要運行macOS 裝.dmgLinux 用 Flatpak 或 Snap 一條命令裝好。第二步把音頻丟進來。Buzz 認 MP3、WAV、FLAC、MP4、AVI 這些主流格式導入入口有四個挑順手的工具欄上的按鈕、快捷鍵CtrlOmacOS 為 CmdO、直接把文件拖進窗口或者粘貼一個YouTube 鏈接——它會自動拉取音頻進流程做字幕不用再手動下載一遍。第三步配置任務。導入后面板里會展開任務類型、語言、模型、導出格式幾個選項后面一節細講第一次全用默認也能跑。第四步點運行。任務進隊列開始處理進度條在任務列表里實時更新多個文件排隊并發不用干等。第五步拿結果。狀態變成Completed后雙擊那一行打開轉錄查看器逐句文本帶時間戳可以搜索、可以跟著音頻播放對照、可以直接導出成文件。四個參數決定轉錄結果好壞任務類型轉錄還是翻譯。選轉錄輸出和原聲同語言選翻譯Buzz 會把非英語內容直接轉成英文文本。做中英對照稿、給外文訪談出英文底稿就靠切換到翻譯。語言設置能手動就別自動。自動檢測大部分時候靠譜但混著口音、夾雜外語的音頻容易判錯語言一錯全錯。事先知道錄音是什么語言就手動指定準確率會穩很多。模型大小速度和精度的天平。從 Tiny 到 Large 分好幾檔檔位在偏好設置的模型頁里已下載的顯示在列沒下載的可以一鍵補。日常材料 Small/Medium 是甜點區間Tiny/Base 快適合實時場景和低精度要求Large 準重要內容和專業術語多的材料值得等它。輸出格式TXT、SRT、VTT 可以多選。要純文字稿勾 TXT給視頻配字幕勾 SRT 或 VTT。勾選是獨立的一次處理可以同時產出三份文件省得重復跑。拉開差距的幾個進階功能 字幕整形把一屏放不下的字幕救回來長錄音轉出的字幕常有兩個毛病一行太長觀眾讀不完或者一句被切成三行頻繁跳。打開轉錄查看器里的Resize設一個目標最大長度它會按標點和語義重新斷句把每行裁得整齊。開過詞級時間戳的轉錄還能更進一步按停頓間隙合并碎字幕、按標點拆長句、按最大長度強制分塊甚至統一延長每條字幕的停留時間。適配不同視頻平臺的字幕規范基本就是改這幾個數字的事。實時轉錄邊說話邊出字Buzz 能直接吃麥克風輸入人還在說屏幕上文字已經蹦出來了還能投到一個獨立的演示窗口里放大展示。線上會議邊開邊出紀要、課堂實時記筆記、直播加字幕都是它的典型主場。說話人識別多人對話各歸各位多人錄音最煩的是通篇分不清誰在說話。在轉錄查看器里點Identify speakersBuzz 會自動給不同發言者的句子打上標簽還能試聽某位說話人的十秒片段確認身份然后把Speaker 0改成對方的真名。勾選合并選項后同一人的連續句子會并成一段訪談整理直接省掉一半工時。語音提取與降噪嘈雜環境的保險絲環境雜、背景音樂重的時候轉錄前先勾提取語音Extract speech把人聲分離到獨立音軌再識別準確率提升明顯。另外還有個 DeepFilterNet 降噪插件轉錄前用模型把背景噪聲濾掉吵錄音也能救一救。讓 Buzz 替你值班監控、插件和命令行文件夾監控在偏好設置里指定一個監控目錄之后新音頻文件一落進去Buzz 自動開跑全程無人值守。每周固定更新的播客、攢了一堆待處理的課程錄音最適合交給它。插件系統Help → Plugins 里管理開關、排序、配參數都行。內置插件包括AI 摘要轉錄完自動提煉要點走 OpenAI 兼容接口、字幕自動整形轉完直接按字幕規格重組、跳過已轉錄文件批量重跑時自動識別已完成項避免重復勞動、增強語言檢測用本地 Whisper 先判語言再轉錄、導出 DOCX結果直接變 Word 文檔、DeepFilterNet 降噪。要哪個開哪個。想看插件實現可以直接翻 buzz/plugins/。命令行給腳本黨留的后門批量任務和定時腳本都好用。完整參數見 docs/docs/cli.md。# 轉錄單個文件指定中文同時導出 SRT 字幕、VTT 和 TXT 三種格式 buzz add --task transcribe --language zh --srt --vtt --txt interview.mp3 # 用 Whisper.cpp 后端把法語訪談翻譯成英文 buzz add --task translate --model-type whispercpp --language fr interview-fr.mp3四類人四種用法照抄就行學生課程錄音導入 → 轉錄 時間戳 → 文字筆記復習時點哪句跳哪句多語言課程也能直接出字幕。視頻創作者成片視頻導入 → 轉錄 Resize 統一行寬 → 導出 SRT 進剪輯軟件字幕環節從半小時手工活變幾分鐘自動活。職場人會議實時轉錄 說話人識別 → 結構清晰的紀要當場生成敏感內容全程不出本機。研究者一文件夾訪談錄音 文件夾監控 → 批量轉寫出說話人標簽 → 文本直接進內容分析流程。把準確率再提五點的實戰技巧先定模型再調別的。重要材料上 Large 檔日常材料 Small 起步同一份音頻先跑一遍小模型摸底確認值得再換大模型重跑別一上來就全用大模型干等。讓硬件配得上模型。有 NVIDIA 顯卡就確認 CUDA 后端生效速度能快數倍Mac 直接走 Apple Silicon 優化路徑純 CPU 環境模型降一檔體驗更順。輸入先做減法。錄音時盡量安靜、音量適中事后補救就勾提取語音或開降噪插件噪聲少一分錯字少一片。把專有名詞塞進初始提示詞。高級設置里的 Initial prompt 框填入人名、地名、專業術語這些詞的識別率肉眼可見地漲技術講座和醫學訪談尤其受益。批量任務組合拳。文件夾監控負責進料跳過已轉錄插件負責去重小模型先過一遍、大模型挑重點重跑——三招疊上去批量處理的等待時間能砍掉大半。常見疑問速答Buzz 必須聯網嗎不用。所有處理都在本機只有你主動選 OpenAI API 后端時才需要網絡。支持多少種語言99 種以上中、英、日、法、德等主流語言全覆蓋識別和翻譯都支持。處理速度如何取決于音頻長度、模型大小和硬件。有 GPU 的機器通常能做到接近實時甚至更快慢就換 Whisper.cpp 后端或降一檔模型。音頻有長度限制嗎沒有硬性限制幾秒鐘的語音到幾小時的長錄音都能處理。離線電腦怎么裝在聯網電腦上把模型下好整份拷到離線機器的相同緩存目錄偏好設置里可一鍵打開該目錄之后斷網照常轉錄。收尾Buzz 做的其實不只是轉文字這件事它把轉錄從一項要花錢、要上傳、看網絡臉色的外包活變成了你電腦里一項隨時可用、完全可控的能力。錄音不再只是躺在硬盤里、再也不會被第二遍翻出的文件而是可搜索、可剪輯、可進工作流的文字資產。現在就把 Buzz 裝上丟進你第一段落灰的錄音——進度條走完的那一刻你會明白這一下午值了。【免費下載鏈接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.項目地址: https://gitcode.com/GitHub_Trending/buz/buzz創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考