FastGPT大PDF解析:Marker与MinerU视觉解析引擎怎么选、怎么接 FastGPT大PDF解析Marker与MinerU视觉解析引擎怎么选、怎么接【免费下载链接】FastGPTFastGPT is a knowledge-based platform built on the LLMs, offers a comprehensive suite of out-of-the-box capabilities such as data processing, RAG retrieval, and visual AI workflow orchestration, letting you easily develop and deploy complex question-answering systems without the need for extensive setup or configuration.项目地址: https://gitcode.com/GitHub_Trending/fa/FastGPTFastGPT 是基于 LLM 的知识库问答平台但它内置的 PDF 解析走的是逻辑抽文本路线遇到公式、表格、图片密集的文档抽出来的内容容易残缺甚至错乱。这篇文章讲清楚一件事怎么把 Marker 和 MinerU 这类视觉解析引擎接进 FastGPT配置怎么写怎么确认解析真的生效。先给结论哪类文档选哪个解析方式选之前先看文档长什么样结论其实很简单文档类型建议纯文字 PDF合同、普通报告直接用内置解析不用折腾学术文档、公式图表多Marker扫描件、混合排版、手写批注MinerU只解析一两个文件不想部署 GPU 服务商业版后台填表即可不用碰 config.json内置解析不是不能用而是它把 PDF 当纯文本读。图片、表格、公式这些非简单文本内容它理解不了。FastGPT 提供的思路是把解析这一步外包给一个独立的视觉解析服务你只负责填一个地址。接入 Marker学术文档和公式多的场景Marker 基于 Surya 视觉模型做版面识别公式、图表提取是它的强项。FastGPT 社区版从 v4.9.0 起支持通过config.json添加systemEnv.customPdfParse配置接入它商业版则直接在 Admin 后台按表单填。用 Docker 拉起 Marker 服务官方封装的镜像已适配 FastGPT 的解析接口docker pull crpi-h3snc261q1dosroc.cn-hangzhou.personal.cr.aliyuncs.com/marker11/marker_images:v0.2 docker run --gpus all -itd -p 7231:7232 --name model_pdf_v2 -e PROCESSES_PER_GPU2 crpi-h3snc261q1dosroc.cn-hangzhou.personal.cr.aliyuncs.com/marker11/marker_images:v0.2然后在 FastGPT 的config.json里加一段配置key、price按你实际填url指向解析服务的接口地址{ systemEnv: { customPdfParse: { url: http://解析服务地址/v2/parse/file, key: , price: 0 } } }改完必须重启 FastGPT 服务才生效。详细步骤见官方文档 接入 Marker PDF 文档解析。接入 MinerU扫描件和混合排版的重火力选项MinerU 组合了 YOLO、PaddleOCR 和表格识别模型对扫描件、复杂版式的处理能力更强代价是硬件门槛更高官方文档写明需要 16GB 以上 GPU 显存的推理卡推荐 32GB 以上内存。它内置的 Docker 镜像是 pipeline 模式会根据 GPU 数量开多个进程并行处理上传的 PDF多卡环境会自动分摊负载。docker pull crpi-h3snc261q1dosroc.cn-hangzhou.personal.cr.aliyuncs.com/fastgpt_ck/mineru:v1 docker run --gpus all -itd -p 7231:8001 --name mode_pdf_minerU crpi-h3snc261q1dosroc.cn-hangzhou.personal.cr.aliyuncs.com/fastgpt_ck/mineru:v1社区版的config.json配置写法和 Marker 完全一样只是url换成 MinerU 服务的地址。商业版用户则在 Admin 后台的解析服务表单里直接填配置界面长这样这一步的详细文档在 接入 MinerU PDF 文档解析。引擎装好、地址填对之后真正的开关在上传环节。在知识库和应用里打开PDF 增强解析开关服务部署好不等于生效——解析引擎只对勾了PDF 增强解析的文件工作这是最容易漏的一步。两个入口都要看知识库上传文件时上传弹窗里有PDF 增强解析勾选项应用的文件上传配置里同样有PDF 增强解析选项控制对话时用户上传的 PDF 走不走增强解析。也就是说历史里没勾过的文件不会自动重新解析想吃到新引擎的解析效果要重新上传一次。上传走的是分片上传机制前端把大文件切片逐个传大文件在网络波动下也能续传这块逻辑在 packages/web/common/file/uploader/ 里。确认解析真的生效看日志和分块结果怎么验证引擎在工作两个信号看日志。把LOG_LEVEL设为info或debug上传后应能看到类似这样的输出[Info] 2024-12-05 15:04:42 Parsing files from an external service [Info] 2024-12-05 15:07:08 Custom file parsing is complete, time: 1316ms看分块内容。视觉解析后的 PDF 分块里会携带图片链接、表格结构而不是纯文字。✅ 只要分块里出现了图片引用就说明外部引擎真正接管了解析。MinerU 的表格提取效果可以直接对照官方文档里的效果展示分块结果与 PDF 原文逐页对应图片、公式、手写体都能提取出来踩坑速查表症状原因与处理上传后没有external service日志没勾PDF 增强解析或config.json改完没重启服务日志级别看不到解析日志LOG_LEVEL需设为info或debug解析报 GPU 相关错误MinerU 要求 16GB 显存先确认显卡满足门槛分块效果没变化确认url指向的是新镜像的接口Marker v0.2 接口格式有变动需重新拉取镜像担心协议风险Marker 和 MinerU 都是 GPL-3.0 协议商用前先看协议条款内置解析侧也有个细节值得一提现在服务端默认用 LiteParse 内核解析 PDFPDF.js 作为资源加载失败时的兜底路径回退逻辑在 packages/service/worker/readFile/extension/pdf.tscustomPdfParse的类型定义在 packages/global/common/system/types/index.ts想确认自己配置的字段名可以对照这两个文件。下一步选一个引擎的 Docker 镜像拉起来把你手上最复杂的那份 PDF带公式或表格的优先传到知识库勾上PDF 增强解析看日志里出现Custom file parsing is complete且分块里带出图片链接——到这一步整条链路就跑通了剩下的就是把文档库按同样方式批量传上去。【免费下载链接】FastGPTFastGPT is a knowledge-based platform built on the LLMs, offers a comprehensive suite of out-of-the-box capabilities such as data processing, RAG retrieval, and visual AI workflow orchestration, letting you easily develop and deploy complex question-answering systems without the need for extensive setup or configuration.项目地址: https://gitcode.com/GitHub_Trending/fa/FastGPT创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考