PDF 翻译工具 PDFMathTranslate 使用指南:外文论文秒变排版原样的中文版

PDF 翻译工具 PDFMathTranslate 使用指南:外文论文秒变排版原样的中文版 PDF 翻译工具 PDFMathTranslate 使用指南外文论文秒变排版原样的中文版【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate先说结论PDFMathTranslate命令名叫pdf2zh是一款 AI 驱动的PDF 翻译工具专门处理科学论文这类排版命根子文档——公式、图表、目录、注释全部留在原位只把文字换成目标语言。它支持 Google、DeepL、OpenAI、Ollama 等 20 多种翻译服务用法有 3 种本地图形界面、Docker 共享部署、命令行脚本自动化。下面按你的使用场景直接给命令照抄就能跑。图里是一次真实运行的全过程拖入英文 PDF选翻译服务几分钟后得到中文版。左右两栏是同一页的原稿与译文对比一下就知道值不值得继续往下看。本地一键翻译外文 PDF适合一个人、一台机器不想装多余东西。前置条件只有一个——Python 版本在 3.11–3.12 之间。安装只要一行pip install pdf2zh这条命令把翻译工具连同依赖全部装好装完终端里多出一个pdf2zh命令。然后看你喜欢哪种操作方式图形界面派。敲下面这条命令它会启动一个本地 Web 服务pdf2zh -i浏览器一般会自动弹出没弹的话手动访问http://localhost:7860把 PDF 拖进去、选好服务、点翻译完事。命令行派。翻译一篇论文就一句pdf2zh your_document.pdf跑完后当前目录会多出两个文件your_document-mono.pdf纯译文和your_document-dual.pdf中英对照版。想换翻译服务加一个参数比如pdf2zh your_document.pdf -s deepl。提示如果默认用的 Google 服务访问不畅换-s bing或-s deeplx这类不需要 Key 的服务即可服务清单见 docs/ADVANCED.md。团队共享部署 PDF 翻译服务适合实验室、课题组、公司团队。目标是服务器装一次全组用浏览器没人需要在本地碰 Python。官方 Docker 镜像两条命令搞定docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zh第一条拉镜像第二条在后台启动容器并把本机 7860 端口映射出去。之后团队成员打开http://服务器IP:7860就是上面那个图形界面开箱即用。如果容器里默认的翻译服务不好使用--env注入密钥即可例如docker run -d -p 7860:7860 -e DEEPL_AUTH_KEY你的Key byaidu/pdf2zh。想给组员设账号密码加--authorized users.txt参数格式见 docs/ADVANCED.md不用改任何仓库文件。脚本自动化接入批量文献处理适合要把翻译嵌进数据流水线、定时任务或者自己写的程序。批量翻整个目录一条命令pdf2zh --dir /path/to/your/papers/目录里每个 PDF 都会生成对应译文天然适合写进 cron 或 Makefile。Python API可以直接调库不用起进程from pdf2zh import translate params {lang_in: en, lang_out: zh, service: google, thread: 4} (file_mono, file_dual) translate(files[example.pdf], **params)拿到两个文件路径后续处理归档、上传、发邮件全由你的脚本说了算。HTTP API则把翻译服务变成远程接口装pip install pdf2zh[backend]后跑pdf2zh --flask就能向http://localhost:11008/v1/translate提交任务、查进度、下载结果详细协议见 docs/APIS.md。它凭什么做到公式不飞原理只讲三句翻译前先用一个版式检测模型DocLayout-YOLO扫描每页结构把公式、图表、表格划成保护区整体跳过只对普通正文送翻译服务译文按原文坐标和字号原位回填。所以输出 PDF 的骨架和输入几乎一模一样——这也是PDF 翻译和把 PDF 转成 Word 再翻译路线的本质区别。另外还有个值得知道的模式--mode precise会调用 v2.0 翻译内核独立环境跨页语义一致性更好fast模式默认则更稳更快见 docs/ADVANCED.md。高频进阶参数速查想解决什么命令说明复杂排版翻不动、报错pdf2zh file.pdf --compatible兼容模式牺牲一点效果换成功率大文件太慢pdf2zh file.pdf -t 44 个线程并行翻译只翻摘要前 5 页pdf2zh file.pdf -p 1-5页码区间翻译换翻译服务pdf2zh file.pdf -s ollamaOllama 本地模型数据不出内网指定语言方向pdf2zh file.pdf -li en -lo ja英译日语言代码见官方文档固定翻译风格pdf2zh file.pdf --prompt prompt.txt给 LLM 类服务喂自定义提示词术语、字体等长期配置pdf2zh file.pdf --config config.json默认读取~/.config/PDFMathTranslate/config.jsonGUI 端口冲突pdf2zh -i --serverport 8080默认端口是 7860换个数字即可扫描件页面无文字pip install pdf2zh[ocr]可选 OCR 扩展自动识别纯图片页参数背后的细节每个翻译服务要配的环境变量、例外字体正则、缓存策略都在 docs/ADVANCED.md按上面表格找到参数名去查对应小节就行。常见坑自查Q首次运行卡在模型下载、报网络错误程序要拉一个版式检测模型wybxc/DocLayout-YOLO-DocStructBench-onnx国内网络建议先切镜像再启动export HF_ENDPOINThttps://hf-mirror.com pdf2zh -iWindows PowerShell 用户写成$env:HF_ENDPOINT https://hf-mirror.com即可。Q某篇 PDF 翻译中途失败或版面错乱别硬刚先切兼容模式跑一遍pdf2zh complex_document.pdf --compatibleQ同一文档翻过之后改动无效像被缓存住了程序有翻译缓存加速强制绕开它pdf2zh file.pdf --ignore-cache。QGUI 打不开提示端口占用默认 7860 被占时换一个pdf2zh -i --serverport 8080。QWindows 双击下载的 exe 打不开装一下微软的 VC 运行库vc_redist.x64再试这是 Windows 打包版的常见前置。延伸资源完整参数与全部翻译服务清单docs/ADVANCED.mdPython / HTTP 两种 API 的二次开发参考docs/APIS.md图形界面详细说明docs/README_GUI.md代理网络环境配置docs/PROXY_CONFIGURATION.md命令行核心逻辑源码pdf2zh/pdf2zh.py社区参与规范docs/CODE_OF_CONDUCT.md下一步从哪开始今天就能做完的事装好pip install pdf2zh挑一篇最近在啃的外文论文跑pdf2zh 你的论文.pdf对照生成的-dual.pdf双语版判断翻译质量是否符合你的要求——不满意就换-s再试一两个服务五分钟能试完。本周可以规划的事如果你身边有人也需要把 Docker 版部署到一台常开的机器上把http://服务器IP:7860的链接发给全组从此大家都不用各自折腾环境。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考