扫描PDF补全元数据:OCRmyPDF 的 4 个参数和 1 条批量命令

扫描PDF补全元数据:OCRmyPDF 的 4 个参数和 1 条批量命令 扫描PDF补全元数据OCRmyPDF 的 4 个参数和 1 条批量命令【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF扫描件搜不到文字点开属性标题、作者全是空的。用 OCRmyPDF 给扫描 PDF 补上 OCR 文本层同时把 PDF 元数据填好、改对就靠 4 个参数和 1 条命令。这张图是 OCRmyPDF 处理一份扫描件的过程其中一行日志正在报告 PDF/A 下被跳过的元数据。先说结论跑完这套你手里的扫描 PDF 会变成两样东西能搜到文字的文本层加一条填好标题、作者、关键词的元数据。你输入你得到一个扫描 PDF带 OCR 文本层、可搜索的新 PDF--title、--author等参数元数据里对应字段被写入你会遇到的3种情况标题、作者丢了想补回去现象打开扫描件属性栏 Title、Author 一片空白。做法跑一次ocrmypdf把缺失的字段当参数传进去。输入是你的输入.pdf输出是输出.pdf元数据随之一并写入。ocrmypdf --title 年度报告 2023 --author 张三 输入.pdf 输出.pdf一批文件想统一作者现象部门归档要求所有文件作者一致手动改太慢。做法还是--author只是配一个循环。具体写法放在后面的进阶玩法里。只想看一眼不想改动现象你已经处理过只想知道现在标题、作者、关键词是什么。做法不用动文件直接读。pdfinfo 输出.pdf会把元数据逐行列出来给你核对。三步跑通装依赖装好后终端里能直接敲ocrmypdf命令。# 用 pip 安装 OCRmyPDF需要 Python 3 环境 pip install ocrmypdf跑命令给一个扫描 PDF 补文本层并写入元数据输入输入.pdf得到输出.pdf。# --title / --author / --keywords 写入元数据其余字段自动保留 ocrmypdf --title 年度报告 2023 --author 张三 \ --keywords 年报,财务 输入.pdf 输出.pdf看结果用pdfinfo读出元数据确认写入成功。输入是输出.pdf打印出标题、作者、关键词等字段。# 读取输出 PDF 的元数据 pdfinfo 输出.pdf这是一份待 OCR 的扫描文档OCRmyPDF 会先把它变成可搜索文本再写入元数据。进阶玩法一个最短的批量循环给当前目录所有 PDF 统一作者结果存成带processed_前缀的新文件。# 批量给目录下所有 PDF 统一作者输出到 processed_ 前缀 for f in *.pdf; do ocrmypdf --author 张三 $f processed_${f%.*}.pdf done源码索引元数据读取与覆盖src/ocrmypdf/_metadata.pyget_docinfo元数据修复与 PDF/A 清理src/ocrmypdf/_metadata.pyrepair_docinfo_nuls、_unset_empty_metadata命令行参数定义src/ocrmypdf/cli.py扫描件文本层渲染src/ocrmypdf/fpdf_renderer/renderer.py容易踩的坑 ⚠️现象作者没写进去 → 原因--author 传了空字符串会被_unset_empty_metadata直接移除 → 解法要么传真实值要么干脆不传这个参数。现象日志报 Some input metadata could not be copied because it is not permitted in PDF/A → 原因输出是 PDF/A部分字段被规范禁止 → 解法查看 XMP 元数据或改输出普通 PDF。现象标题莫名变成 Untitled → 原因Ghostscript 在输入缺标题时默认填了 Untitled → 解法OCRmyPDF 会自动删掉该默认值或用--title显式指定。你现在可以做的3件事跑一遍ocrmypdf --title ... --author ...给你的扫描件补上元数据用pdfinfo核对输出 PDF 的标题、作者、关键词是否到位把进阶玩法的循环套到整个目录批量统一作者【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考