
如何用RapidOCR識別多語言圖片文字3步跑通指南【免費(fèi)下載鏈接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR你要從一批票據(jù)掃描件、商品截圖里把所有文字摳出來里面中文、日文混著排。RapidOCR 是一個(gè)多語言 OCROptical Character Recognition即從圖片里識別文字工具。它接收一張圖片輸出文字框坐標(biāo)、文字內(nèi)容和置信度。裝好后模型會自動下載本機(jī)幾分鐘內(nèi)就能跑起來。讀完這篇你能在本機(jī)識別出第一張圖片里的文字。它基于 PaddleOCR 模型、OnnxRuntime 和 OpenVINO專門做多語言 OCR。第一點(diǎn)它默認(rèn)帶 ONNX 模型不用裝 PaddlePaddle 框架百度的深度學(xué)習(xí)框架裝完包就能識別。第二點(diǎn)推理后端真正運(yùn)行模型的組件可在 OnnxRuntime、OpenVINO、TensorRT 之間切換適配不同硬件。默認(rèn)配置會依次跑檢測、方向分類、識別三步。 五分鐘跑通安裝與第一次識別RapidOCR 安裝只需要一條命令pip install rapidocr # 從 PyPI 安裝 RapidOCR 及其全部依賴源碼開發(fā)可以改從倉庫源碼安裝日常使用 pip 裝就夠了。裝完還會帶上 rapidocr 命令終端里用 rapidocr --img 你的圖片.jpg 也能直接識別。模型文件在第一次識別時(shí)自動下載。這段代碼識別一張本地圖片并打印結(jié)果from rapidocr import RapidOCR engine RapidOCR() print(engine(your_image.jpg)) # 改成你自己的圖片路徑運(yùn)行后你應(yīng)看到一個(gè) RapidOCROutput 對象txts 字段是識別出的文字scores 是每行置信度boxes 是各文字框的坐標(biāo)。 按需使用下面三個(gè)場景覆蓋了 RapidOCR 使用教程里最常見的需求。當(dāng)你要識別日文、韓文、阿拉伯文等非中文時(shí)RapidOCR 多語言識別的模型按語言區(qū)分默認(rèn)是中文模型ch。這段把識別模型切成日文engine RapidOCR(params{Rec.lang_type: japan}) result engine(japan.jpg) print(result.txts)倉庫自帶的日語示例圖夾雜少量中文適合驗(yàn)證 japan 模型的識別效果如果切換后識別結(jié)果還是亂碼通常是Rec.lang_type沒設(shè)對仍在使用中文模型把它重新設(shè)成目標(biāo)語言即可。處理純文本圖片如果你的輸入已經(jīng)是單行文字裁剪圖就不必再做檢測和方向分類關(guān)掉它們可以省時(shí)間。這段關(guān)閉檢測后直接識別result engine(text_crop.jpg, use_detFalse, use_clsFalse) print(result.txts)單行橫排文字圖適合驗(yàn)證關(guān)閉檢測后的純識別模式如果結(jié)果為空或亂碼通常是圖里其實(shí)有多行文字或背景雜色把use_det改回True即可。當(dāng)你要導(dǎo)出和可視化識別結(jié)果時(shí)想把結(jié)果存成文件、或檢查文字框位置時(shí)結(jié)果對象自帶導(dǎo)出和可視化方法。這段保存一張帶框和文字的圖片并導(dǎo)出 JSONresult engine(doc.jpg) result.vis(vis_result.jpg) # 保存可視化圖片 print(result.to_json()) # 或?qū)С?JSON如果vis()沒存出文件而是給出警告通常是檢測結(jié)果為空boxes 為 None檢查圖片里是否真有文字即可。架構(gòu)速覽數(shù)據(jù)怎么流的RapidOCR 的數(shù)據(jù)流走三步先由檢測模塊定位文字框方向分類區(qū)分橫排豎排把裁剪圖轉(zhuǎn)正再由識別模塊完成文字識別。全程閾值在 python/rapidocr/config.yaml 里也可以在引擎構(gòu)造函數(shù)的 params 中覆蓋。三個(gè)模型按需加載跳過檢測就不會加載檢測模型。? 調(diào)優(yōu)與避坑下面是三個(gè)常見的 RapidOCR 調(diào)優(yōu)問題都能靠參數(shù)解決誤檢多把非文字也識別出來→ 檢測閾值box_thresh默認(rèn) 0.5文字框外擴(kuò)系數(shù)unclip_ratio默認(rèn) 1.6復(fù)雜背景下容易被框進(jìn)來 → 調(diào)用時(shí)調(diào)高閾值如engine(img, box_thresh0.7)。結(jié)果偏少、漏字→ 結(jié)果過濾參數(shù)text_score默認(rèn) 0.5置信度低于它的行會被丟棄 → 降到 0.3如engine(img, text_score0.3)。大圖推理偏慢→ 預(yù)處理默認(rèn)max_side_len為 2000大圖會先縮放到 2000px 以內(nèi)再檢測 → 網(wǎng)頁截圖這類場景可在配置里寫Global.max_side_len: 1500。下一步把示例腳本改成遍歷你目錄下的所有 jpg循環(huán)調(diào)用 engine 批量識別。結(jié)果不符合預(yù)期時(shí)先到 docs/ 里查參數(shù)說明?!久赓M(fèi)下載鏈接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考