
Umi-OCR 免費離線文字識別實戰指南從截圖OCR到批量PDF的4個實操任務【免費下載鏈接】Umi-OCROCR software, free and offline. 開源、免費的離線OCR軟件。支持截屏/批量導入圖片PDF文檔識別排除水印/頁眉頁腳掃描/生成二維碼。內置多國語言庫。項目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免費、開源的離線 OCR 軟件核心功能是把圖片、截圖和 PDF 文檔里的文字識別成可編輯文本全程不需要聯網。如果你需要經常從屏幕截圖提取代碼、批量整理掃描件、或者把 OCR 接進自動化腳本這篇指南都會覆蓋到。讀完之后你能獨立完成從安裝到接口調用的整個流程。快速上手Umi-OCR 是綠色軟件不需要安裝步驟整個過程大概兩分鐘下載發行版壓縮包.7z格式或.7z.exe自解壓包建議放在純英文路徑下。解壓到任意目錄。自解壓包可以直接雙擊運行無需再裝解壓軟件。進入解壓目錄雙擊Umi-OCR.exe啟動程序Linux 下運行umi-ocr.sh。首次啟動時界面語言會跟隨系統自動切換如果不符合預期去「全局設置」→「語言/Language」手動調整。打開「截圖OCR」標簽頁按快捷鍵框選一塊屏幕區域右側就會出現識別結果。下面這張主界面預覽圖展示了軟件的標簽頁布局頂部一排就是截圖OCR、批量OCR、文檔識別、二維碼等各個功能頁小提示軟件右上角可以鎖定標簽頁防止誤觸關閉左上角能切換窗口置頂做截圖識別時很有用。典型實操任務裝好之后下面四個任務基本覆蓋了 Umi-OCR 的全部日常用法你可以按順序逐個試一遍。從屏幕截圖中提取代碼片段適用情況看文檔、讀代碼截圖時想把畫面上的代碼原樣復制下來。操作步驟打開「截圖OCR」標簽頁。用默認快捷鍵喚起截圖鼠標框選包含代碼的區域也可以從別處復制圖片后直接粘貼進來。在右側設置中找到「文本后處理 - 排版解析方案」切換為單欄-保留縮進。等待識別完成在識別記錄欄中劃選文本并復制。粘貼到編輯器里檢查縮進是否與原圖一致。關鍵設置設置項改成什么為什么排版解析方案single_code單欄-保留縮進專為代碼截圖設計保留行首縮進和行中空格排版解析方案普通文檔時multi_para多欄-按自然段換行默認自動識別多欄布局按自然段換行適合大部分場景糾正文本方向截圖內容傾斜時啟用能識別傾斜或倒置文字但會稍降速度效果檢查把結果粘貼到支持等寬縮進的編輯器里if、for等關鍵字的層級和原圖對齊說明縮進被正確保留。把一批掃描件圖片轉成可搜索文本適用情況手上有一整文件夾掃描圖片想一次導出 txt / Markdown / CSV。操作步驟切到「批量OCR」標簽頁。把圖片或文件夾拖進左側列表支持jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff幾百張一起導也沒問題。在右欄設置中選擇輸出格式txt、jsonl、md、csv(Excel)。點擊「開始任務」等進度條走完。到輸出目錄打開結果文件核對內容。關鍵設置設置項改成什么為什么保存格式需要表格化就用csv(Excel)寫文檔用md不同格式對應不同后處理用途限制圖像邊長大圖/長圖時調高數值邊長超 960 的大圖會被壓縮調高可提升精度任務完成后自動關機晚上跑完大批量任務時勾選掛機批量處理跑完自動關機省時間文字識別 - 糾正文本方向掃描件有傾斜時啟用同上會稍降速度效果檢查隨機抽兩三張原始圖片對比輸出文件里對應段落的文字順序和換行是否符合閱讀習慣。如果你的圖片帶有固定位置的水印或 LOGO可以在右欄進入「忽略區域」編輯器按住右鍵畫出多個矩形框把這些區域圈起來——注意只有完全落在框內的整個文本塊才會被忽略所以框盡量畫大一點把水印可能出現的所有位置都包進去。把 PDF 掃描件轉成雙層可搜索 PDF適用情況有掃描版 PDF想要既保留原圖、又能搜索和復制文字的文檔。操作步驟打開「文檔識別」標簽頁。導入文檔支持pdf, xps, epub, mobi, fb2, cbz。如有固定頁眉頁腳干擾設置忽略區域排除這些文字。選擇保存類型并啟動任務。打開輸出的雙層 PDF嘗試搜索其中一段文字。關鍵設置設置項改成什么為什么忽略區域圈出頁眉、頁腳所在橫條排除頁碼、公司抬頭等重復文字的干擾任務完成后自動關機/休眠大批量時勾選與批量OCR一致適合掛機處理保存類型雙層可搜索PDF在原始圖層上疊加文字層可搜索可復制效果檢查在輸出的 PDF 里搜索一段正文關鍵詞能高亮命中說明文字層已正確嵌入。掃描和生成二維碼適用情況照片里有二維碼、條形碼要讀出來或者想把一段文字變成二維碼圖片。操作步驟打開「二維碼」標簽頁。掃碼方向截圖、粘貼或拖入本地圖片。查看識別結果支持一圖多碼和 19 種協議QRCode、PDF417、EAN13 等。生成方向輸入文本按需選擇糾錯等級等參數生成二維碼圖片。關鍵設置設置項改成什么為什么糾錯等級打印物選高一級二維碼被磨損、遮擋時仍能被掃出圖片尺寸生成時手動指定寬高默認是最小適配長度對外張貼可放大效果檢查生成的二維碼用掃碼槍或手機掃一遍解碼出的內容與輸入文本完全一致。性能調優Umi-OCR 內置PaddleOCR和RapidOCR兩套離線引擎插件在全局設置中可以隨時切換。簡單記法PaddleOCR 速度稍快適合日常主力RapidOCR 兼容性好老系統如 Windows 7上更穩妥。注意后端對并發支持較差任務本身是串行處理的所以調優重點在參數而不是堆并發。典型場景推薦引擎線程數內存其他關鍵參數日常截圖、短文檔PaddleOCR1串行處理常規tbpu.parser multi_para代碼截圖PaddleOCR1串行處理常規tbpu.parser single_code大批量普通圖片RapidOCR1串行處理常規輸出csv配忽略區域超大分辨率長圖PaddleOCR1串行處理偏高ocr.limit_side_len 2880或4320傾斜/倒置文字PaddleOCR1串行處理常規ocr.cls true老系統Win7RapidOCR1串行處理常規保持默認參數即可軟件界面上的所有設置最終都保存在./UmiOCR-data/.settingsini 格式常用關鍵參數如下可以直接手動改這個文件# 文字識別OCR引擎參數PaddleOCR適用 ocr.language models/config_chinese.txt # 語言/模型庫切換見下表 ocr.cls false # 糾正文本方向傾斜文字才開啟 ocr.limit_side_len 960 # 限制圖像邊長大圖精度要求高時調高 # 文本后處理 tbpu.parser multi_para # 排版解析方案代碼截圖用 single_code tbpu.ignoreArea [] # 忽略區域矩形框列表排除水印如果你的識別內容以英文或日文為主把ocr.language換成對應模型文件即可模型文件語言適用內容models/config_chinese.txt簡體中文默認中文文檔、中文代碼注釋models/config_en.txt英文英文文檔、代碼models/config_chinese_cht(v2).txt繁體中文繁體資料models/config_japan.txt日本語日文文檔models/config_korean.txt???韓文文檔models/config_cyrillic.txtРусский俄文文檔界面語言方面Umi-OCR 支持繁中、英語、日語等多國語言在全局設置里隨時可切記住改完.settings文件后運行umi-ocr --reload即可讓軟件重新加載配置并刷新設置界面不用重啟程序。自動化集成Umi-OCR 提供兩種正式的外部調用方式都有完整文檔命令行手冊 和 HTTP接口手冊。命令行入口就是主程序本身常用指令包括umi-ocr --screenshot截屏識別、umi-ocr --path D:/xxx.png識別指定圖片或文件夾、umi-ocr --qrcode_read掃碼、umi-ocr --qrcode_create生成二維碼。結果可用--clip復制到剪貼板或用--output file.txt寫入文件。批量識別一個文件夾并導出結果的典型用法umi-ocr --path D:/scans --output D:/result.txt umi-ocr --screenshot --clipHTTP 接口全局設置中默認開啟 HTTP 服務端口默認1224可在設置里改開啟后即可通過網絡請求調用 OCR、文檔識別、二維碼等功能參數細節見 接口文檔。一個最小的 Python 調用示例import base64, requests with open(D:/img.png, rb) as f: img_b64 base64.b64encode(f.read()).decode() resp requests.post(http://127.0.0.1:1224/api/ocr, json{ base64: img_b64, options: {ocr.language: models/config_chinese.txt, tbpu.parser: single_code, data.format: text} }) print(resp.json()[data])全局設置頁中可以看到 HTTP 服務開關和端口配置需要局域網訪問時把主機切換為「任何可用地址」兩個實用提示一是不要并發調用 HTTP 接口長時間連續調用偶發ECONNREFUSED報錯時重新發一次請求即可二是命令行模式下管道重定向可能失效程序間調用建議改用 HTTP 轉發命令行接口見 argv.md。想深入二次開發的源碼在 UmiOCR-data/py_src/ 目錄插件放在UmiOCR-data/plugins/。常見問題速查現象常見原因快速處理大圖識別精度不高邊長被壓縮到 960設置中把「限制圖像邊長」調高到 2880 或 4320傾斜/倒置的文字識別錯未啟用方向分類開啟「糾正文本方向」ocr.cls true接受速度略降結果里混著水印、頁眉頁腳固定區域文字未被排除用「忽略區域」編輯器畫矩形框圈住干擾區截圖時界面閃爍、UI 錯位顯卡硬件加速沖突全局設置→界面和外觀→切換「渲染器」方案命令行輸出收不到結果管道重定向受限用--output寫文件或改用 HTTP 轉發命令行接口HTTP 調用偶發連接報錯后端并發能力有限改為串行調用失敗后直接重發請求其中「忽略區域」最值得多花兩分鐘理解它只忽略完整落在框內的整個文本塊而不是框內的單個字符。所以框要畫得比水印位置更大、把水印可能出現的全部范圍都包住如果某個該忽略的文本塊沒被去掉多半是它只有一部分落在框內把框擴大重畫即可。另一個高頻問題是渲染器沖突如果只有截圖時閃屏、平時正常基本可以確定是硬件加速渲染的問題切到全局設置里的另一檔渲染方案或關閉硬件加速一般立刻恢復。小結回顧一下Umi-OCR 的核心價值在于完全免費、開源解壓即用Windows 7 與 Linux 都支持。全程離線運行識別數據不出本機適合處理敏感文檔。截圖OCR、批量OCR、文檔識別、二維碼四大場景全覆蓋。排版解析 忽略區域兩個后處理功能把「能識別」變成「好用」。命令行 HTTP 雙接口可無縫接入自動化流程。下一步建議先按「快速上手」跑通一次截圖識別再試一次「單欄-保留縮進」解析代碼截圖。打開 命令行手冊在終端執行一次umi-ocr --screenshot --clip。閱讀 HTTP 接口文檔調用一次參數查詢接口get_options看看全部可用參數。有二次開發需求的話瀏覽 UmiOCR-data/py_src/ 的源碼結構。現在就解壓一份發行版對著任意一張帶代碼的截圖試試「截圖OCR」兩分鐘內你就能拿到第一個可用的識別結果。【免費下載鏈接】Umi-OCROCR software, free and offline. 開源、免費的離線OCR軟件。支持截屏/批量導入圖片PDF文檔識別排除水印/頁眉頁腳掃描/生成二維碼。內置多國語言庫。項目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考