MinerU Gradio WebUI 实战指南:3 个场景把 PDF 转成 Markdown MinerU Gradio WebUI 实战指南3 个场景把 PDF 转成 Markdown【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerUMinerU Gradio WebUI 是 MinerU 的可视化入口上传 PDF、选一个后端就能拿到带公式和表格的 Markdown不用背命令行参数还能在浏览器里直接预览解析效果再决定是否下载。下面按转一篇论文处理扫描件给团队共用三个场景把安装、参数和调优拆开讲。场景一转一篇学术论文先装核心包Gradio WebUI 入口就包含在里面# 安装 MinerU 核心包含 gradio webui pip install -U mineru[core]然后直接启动。不传--api-url时前端会自动拉起一个可复用的本地mineru-api并把任务提交过去你不需要自己再管一个服务进程# 启动 WebUI默认在 http://localhost:7860 打开 mineru-gradio主界面左栏是文件上传、后端选择和最大转换页数滑条右栏是 PDF 预览和 Markdown 渲染、Markdown 原文、content_list JSON 三个视图渲染视图带一键复制。支持的输入是 PDF、图片JPG/PNG 等以及 DOCX、PPTX、XLSX。论文场景下默认后端hybrid-engine通常够用它把 pipeline 版面模型和 VLM 理解结合速度和精度介于纯 pipeline 与纯 VLM 之间。如果公式多且 hybrid 精度不够切到vlm-engine公式和表格识别更准但更慢需要 8GB 显存的 GPU纯数字化的老 PDF 或者只有 CPU 的机器选pipeline。完整后端清单和默认值定义在 mineru/cli/backend_options.py前端面板逻辑在 mineru/cli/gradio_app.py。一个细节渲染视图默认只认$...$分隔符输出里如果是\(...\)形式公式就不会排版。启动时加上参数即可两种都渲染# Markdown 渲染同时支持 $ 和 \( \) 两种 LaTeX 分隔符 mineru-gradio --latex-delimiters-type all场景二扫描件和混排文档对纯数字 PDF 走默认链路就行。扫描件的关键在两个开关强制 OCR 和 OCR 语言。说白了MinerU 默认读 PDF 的文本层只有文本层不可用才跑 OCR扫描件的文本层常常残缺勾上强制 OCR是显式走 OCR 模型的保险。这里有个坑OCR 语言只在pipeline后端下生效且必须和文档语言一致中文选ch、英文选english选错识别率掉得很明显选 hybrid 后端时语言要求宽松得多。界面里的识别选项各自的作用和何时关闭控件默认什么时候关公式解析开启完全没有公式的文档关掉省一次模型推理表格识别开启以纯文字为主的报告图片/图表分析开启hybrid 的 medium 强度会自动关闭VLM 类后端保持开启Hybrid 强度mediumhigh 会启用更多分析项结果更全但更慢最大转换页数整份文档超大文档先用滑条或--max-convert-pages限制页数避免内存被打爆300 页以上的文档建议先限页再全量跑单次处理窗口默认 64 页由MINERU_PROCESSING_WINDOW_SIZE控制页数限制能直接压低峰值内存。场景三团队共用和批量处理单机用就保持默认给团队用时两个参数# 监听所有网卡暴露到局域网 mineru-gradio --server-name 0.0.0.0 --server-port 7860 # 启动阶段预加载 VLM 模型避免第一个请求卡在模型初始化 mineru-gradio --enable-vlm-preload true部署上有两种常见模式。第一种是复用同一个mineru-api服务已在跑就传--api-url指过去前端不会再拉起第二个。第二种是开 HTTP 客户端模式加--enable-http-client后下拉框会多出vlm-http-client和hybrid-http-client指向远端 vLLM/LMDeploy/SGLang 服务即可——实际跑下来发现这种组合很适合办公电脑只放前端、推理在服务器的分工vlm-http-client本地甚至不要求装 torch。多人并发时worker 并发由MINERU_API_MAX_CONCURRENT_REQUESTS控制默认 3可以按显存上调但调太大会互相挤显存。100 页 PDF 的性能参考测试条件见表格列测试硬件后端100 页耗时显存占用RTX 3060 12GBpipeline约 15 分钟约 6GBRTX 4090 24GBvlm-engine约 8 分钟约 10GBRTX 4090 24GBvlm-engine vLLM 引擎约 2 分钟约 14GB想让新人快速体验把样例文件放进启动目录的examples/文件夹再启用示例开关前端会多一个可点击的示例面板# 启用示例文件需先建 examples/ 目录放入 PDF mineru-gradio --enable-example true常见症状对照先按这张表查一遍再翻日志症状原因处理页面打不开7860 端口被占用--server-port 7861换端口模型下载超时默认模型源访问不通把模型源切换为 modelscope见下表环境变量OCR 输出乱码、缺字语言不匹配重选 OCR 语言并勾选强制 OCR显存不足进程挂掉文档过大调小最大转换页数或用环境变量限制单进程显存全局行为用环境变量统一配置优先级高于命令行参数且对所有 MinerU 命令生效变量默认用途MINERU_MODEL_SOURCEhuggingface模型下载源国内网络设为modelscopeMINERU_DEVICE_MODE自动推理设备如cuda:0MINERU_VIRTUAL_VRAM_SIZE无限制单进程显存用量GBMINERU_FORMULA_ENABLEtrue全局开关公式解析MINERU_TABLE_ENABLEtrue全局开关表格解析MINERU_PDF_RENDER_THREADS4PDF 渲染为图片的并发数MINERU_PROCESSING_WINDOW_SIZE64单次处理窗口影响大文档内存MINERU_API_MAX_CONCURRENT_REQUESTS3API worker 最大并发MINERU_LOG_LEVELINFO日志级别排障时设DEBUGMinerU WebUI 的价值在于解析结果先看到、再下载预览加三视图让质量验证不再靠运气。完整参数清单见快速使用文档。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考