MinerU Gradio WebUI 完整指南:把 PDF 与 Office 文档一键转成 LLM 可用的 Markdown

MinerU Gradio WebUI 完整指南:把 PDF 与 Office 文档一键转成 LLM 可用的 Markdown MinerU Gradio WebUI 完整指南把 PDF 与 Office 文档一键转成 LLM 可用的 Markdown【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerUMinerU 是一款开源文档解析工具能把 PDF、DOCX、PPTX、XLSX 和图片转成结构化的 Markdown 与 JSON供 RAG、Agent 等 LLM 工作流直接使用。它的命令行参数不少如果你只是想传个文件、看看结果、下载 Markdown完全不需要背命令——mineru-gradio启动的 Gradio WebUI 把这些参数做成了下拉框和开关浏览器里就能完成一次完整的解析。这篇文章不按功能清单讲而是模拟一个真实诉求你手头有一份带公式和表格的技术 PDF想把它变成干净的 Markdown 丢进知识库。我们会从安装、启动到跟着这份 PDF 走一遍完整流程再到后端怎么选、常见报错怎么修最后说说 WebUI 适合什么、不适合什么。两条命令把 WebUI 跑起来先确认环境Python 3.10–3.13内存 16GB 起步推荐 32GB磁盘留 20GB 以上 SSD。GPU 方面默认的 Hybrid / VLM 后端需要 8GB 以上显存如果你只有 CPU选 pipeline 后端也能跑后面细讲。安装时带[core]这个 extras 即可它一次性装好了 VLM、pipeline 和 Gradio 三套依赖# 推荐用 uv普通 pip 也可以 uv pip install -U mineru[core]然后直接启动mineru-gradio启动后浏览器打开终端里提示的地址默认本地 7860 端口。第一次解析会自动下载所需模型之后走本地缓存。这里有个容易被忽略的机制WebUI 本身只是个前端壳。它默认会自动在后台拉起一个本地的mineru-apiFastAPI 服务来做实际解析所以下次打开 WebUI 时服务是复用的、冷启动更快。如果你已经单独部署过解析服务可以直接指过去省掉本地这份# 连到已有的 mineru-api 服务 mineru-gradio --api-url http://127.0.0.1:8000几个常用启动项--server-name 0.0.0.0允许局域网内其他机器访问比如团队共用一台解析服务器--server-port 7861换端口默认 7860--enable-vlm-preload true启动时预加载 VLM 模型第一个任务的等待时间会明显缩短--enable-http-client true在后端下拉框里额外放出远程模型服务选项适合把重计算放到另一台机器上。跟着一个任务走一遍PDF 进Markdown 出打开页面后布局是左边控制、右边结果。上传框支持 PDF、常见图片格式以及 DOCX / PPTX / XLSX拖进去即可。然后依次做四件事选后端下拉框默认选中 Hybrid推荐先不动它限制页数最大转换页数滑杆就是防止你不小心把几百页的文档一次性吃满显存的保险丝只解析前几页试效果时把它拖到 10 以内点转换看结果右侧有四个去处——原文档预览、Markdown 渲染排版后的效果公式直接渲染、Markdown 文本原始源码带复制按钮、JSON 内容列表结构化的内容清单做 RAG 切片时常用最下方是结果包下载按钮zip 里含 Markdown、JSON 和切出来的图片。左下角的状态条会逐步推进准备请求 → 检查服务 → 提交任务 → 排队 → 解析中 → 下载结果 → 整理输出 → 完成。大文档在解析中停留较久属正常现象不用怀疑它卡死了。MinerU 处理 PDF 的第一步是版面识别——先把文字块、公式、表格、图区分割出来再分别解析这也是它输出里版面结构比较可靠的原因两个小细节上传 Office 文件时页面会自动隐藏页数/解析选项这些针对 PDF 的控件改走 Office 在线预览 转换流程。那个在线预览依赖文件能被微软在线服务访问打不开也不影响转换本身。想快速试手在启动 WebUI 的目录下建一个examples文件夹放几份样例文件进去界面上就会多出一个示例折叠面板点一下就直接开始转换这个功能是默认开启的--enable-example false可关。后端怎么选pipeline、VLM 还是 Hybrid这是 WebUI 上最重要的一个下拉框。四个选项的定位官方其实写得挺直白翻译成决策语言后端一句话定位硬件要求什么时候选hybrid-engine默认混合引擎精度最高8GB 显存没特殊情况就选它vlm-engine多模态大模型端到端解析8GB 显存以中英文为主的文档追求高精度pipeline传统多模型流水线无幻觉、省资源4GB 显存纯 CPU 可跑无 GPU 环境、多语言文档、批量任务vlm / hybrid-http-client客户端模式解析算在远端 OpenAI 兼容服务上客户端 2GB 显存即可重算力的服务部署在另一台机器最后两个选项需要先加--enable-http-client true启动才出现。用法是在另一台有显存的机器上用 vLLM / SGLang / LMDeploy 等推理框架把 MinerU 的 VLM 模型跑起来WebUI 这边选 http-client 后端并填服务器地址本地这台就只是个轻客户端。多机部署时同理把--api-url指到mineru-router这类服务上即可。另外Hybrid 后端多一个解析强度选项medium 更快high 更准但更慢。默认 medium 足够日常使用遇到复杂版面再切 high。四个开关公式、表格、OCR 何时该动主界面上默认只露出后端和页数点高级选项才展开识别开关。四个开关的默认值都是开多数时候不用碰但知道它们各自的影响表格识别关掉后表格不再被解析成 HTML 结构而是整块以图片形式保留。如果你的下游只关心文字、且文档里有大量复杂三线表关掉能省不少算力。公式识别注意它的行为随后端变化——VLM 后端管的是行间display公式关掉后行间公式以图片呈现pipeline 后端连行内公式也不检测了。数学内容重的论文这个开关别关。图片分析VLM / Hybrid 后端可见关掉后图片、图表块保留原有版面位置但跳过 VLM 对图内容的理解。显存紧张时第一个考虑关它。强制 OCR这是兜底开关界面文案也写得明确——只有识别效果极差时才打开。它强制走 OCR 路径且必须先把OCR 语言选对比如扫描版英文文档选 en选错了比不开还糟。还有一个藏在启动参数里的渲染项--latex-delimiters-type控制 WebUI 里 LaTeX 的分隔符识别方式a只认$...$b只认括号方括号形式all全认默认all。如果你的 Markdown 在别的渲染器里公式显示不出来多半是分隔符不匹配用它来对齐。启动失败、显存告急高频问题的修法症状多半原因一步解决启动时报端口占用7860 已被占用mineru-gradio --server-port 7861模型下载极慢或超时默认模型源网络不通启动前设置export MINERU_MODEL_SOURCEmodelscope大文档解析到一半显存爆了页面太多、模型太大缩短最大转换页数或export MINERU_VIRTUAL_VRAM_SIZE8按实际显存约束想指定用哪块卡多卡机器默认设备不对export MINERU_DEVICE_MODEcuda:0解析慢但看不出卡在哪日志级别太粗export MINERU_LOG_LEVELDEBUG后重新启动观察 stderr 输出这些环境变量对mineru、mineru-gradio等所有命令行入口都生效优先级高于命令行参数。另外两个和吞吐相关的环境变量值得知道MINERU_PROCESSING_WINDOW_SIZE默认 64调小可降低大文档时的内存峰值、MINERU_API_MAX_CONCURRENT_REQUESTS默认 3多人共用服务时控制并发。什么时候用 WebUI什么时候别用WebUI 的价值是肉眼可见单次转换、需要人工核对公式和表格、调试参数组合它是最舒服的方式。但下面这些场景它不是最佳选择几百份文档的批量自动化直接用mineru命令行参数和 WebUI 一一对应-b后端、-f公式、-t表格、-s/-e页码范围可以放进脚本和定时任务纯 CPU 机器WebUI 能用但把后端切成pipeline才跑得动例如mineru -p input.pdf -o output -b pipeline对外提供服务部署mineru-api或加mineru-router做多 worker 路由WebUI 退化成内部调试面板用--api-url指向正式服务即可两套互不干扰。想深入了解 WebUI 的行为逻辑源码入口在mineru/cli/gradio_app.py界面布局、开关联动都在这个文件里后端的选项定义在mineru/cli/backend_options.py官方使用文档在docs/zh/usage/目录下。参数随版本演进细节以项目内文档为准。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考