RapidOCR 快速上手指南:3步跑通第一次OCR文字识别

RapidOCR 快速上手指南:3步跑通第一次OCR文字识别 RapidOCR 快速上手指南3步跑通第一次OCR文字识别【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCRRapidOCR 是一款完全开源、免费的 OCR 文字识别工具包把文字检测、识别和离线部署都放进你自己的机器里运行时不依赖任何云端 API。它基于 ONNX Runtime、OpenVINO、PaddlePaddle、TensorRT、PyTorch 等主流推理引擎内置十余种语言模型适合需要本地文字识别、或想把 OCR 能力嵌进自己项目的开发者和普通用户。⚡ 5分钟装好 RapidOCR 并完成第一次识别一条命令安装依赖你只需要安装两个包不用预先下载模型。首次运行时所需模型会自动拉到本地的 models 目录pip install rapidocr onnxruntime五写行脚本跑出识别结果下面这段脚本完成三件事初始化引擎、传入图片、拿到结果。初始化引擎≈给识别流程点火之后的每次调用都是离线完成的from rapidocr import RapidOCR engine RapidOCR() result engine(test.jpg) print(result) result.vis(vis_result.jpg)result里包含每段文字的内容、置信度和所在位置的框result.vis一行就能存出带框标注的可视化图片。第一次调用会触发模型下载稍等片刻即可之后无论断网与否识别照常进行。3个真实场景实战批量处理一整个目录的图片想批量识别一文件夹截图时记住一点引擎实例是可复用的。你循环遍历文件名、逐张调用engine(img)即可每张图返回自己的文本、置信度和位置框攒起来写进 CSV 或 Markdown 就是完整结果。结果对象里还有各步骤耗时elapse_list哪一步慢一目了然。仓库自带测试图片就在 python/tests/test_files/可以直接拿来练手一键切换识别语言默认配置面向中英文混排。要识别日文、韩文等其他文字只需在初始化时用params指定语言对应模型会自动下载japan_engine RapidOCR(params{Rec.lang_type: japan}) result japan_engine(japan.jpg)常用语言编码如下编码语言ch中文默认en英文japan日文korean韩文latin拉丁字母cyrillic西里尔字母arabic阿拉伯文th泰文完整清单见 utils/typings.py。拿一张日文图试试效果终端免代码识别装完rapidocr包后自带命令行入口终端里直接给图出结果-vis参数会同时保存带框标注的图rapidocr -img test.jpg --lang_type japan -vis常用选项--text_score 0.7调整置信度门槛-word额外返回单词级框。按影响分类调参速度、精度、置信度参数可以在三个地方给初始化引擎时params、每次调用时如engine(img, text_score0.7)、或整体改配置文件 config.yaml。常用参数按它影响什么归了个类影响面参数默认值说明速度 vs 精度Det.model_type/Rec.model_typesmalltiny最小最快medium精度最高模型代际ocr_versionPP-OCRv6版本越新精度越好模型略大结果过滤Global.text_score0.5调低保留更多结果调高过滤低置信度文字流程开关use_det/use_cls/use_rectrue整张图都是文字时可跳过检测省时间单词级框return_word_boxfalse打开后额外返回每个单词的框GPU 加速EngineConfig.onnxruntime.use_cudafalse打开走 GPU用device_id指定显卡识别流程本身是三段流水线检测负责找到文字在哪分类负责纠正颠倒的文字识别负责读出内容。三段都可以单独开关和调参。内部结构速览Python 主体在 python/rapidocr/ch_ppocr_det、ch_ppocr_cls、ch_ppocr_rec三个目录对应检测、分类、识别三段inference_engine/封装了六套推理引擎main.py 负责把整条流水线串起来。测试用例在 python/tests/各引擎的一键镜像环境在 docker/C、Java 等其他语言组件在 cpp/、jvm/ 等子目录提供入口说明。写在最后RapidOCR 把原本要自己训练、部署的完整 OCR 流水线压缩成一次导入加上离线运行、多语言和多引擎兼容是本地文字识别很省心的地基。更多细节可以翻 README-CN.md 和 python/ 下的源码。【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考