一个接口调用十款文档解析模型:OpenDocRouter 拆解 一个接口调用十款文档解析模型OpenDocRouter 拆解原文LlamaIndex Blog - 《Introducing OpenDocRouter: every document model under one API》https://www.llamaindex.ai/blog/introducing-opendocrouter一、文档解析的难点其实不在解析在 HuggingFace 上搜 ocr能翻出上千个模型前沿实验室也几乎每个月都在推能读文档的新模型——只是价格常常不便宜。真正麻烦的是围绕它们的那些重复劳动。想让一个模型把 PDF 转成 markdown你大概都要走同样几步琢磨提示词如果有的话、处理限流、管理部署与随之而来的成本以及在新模型出来之后重新跑一遍评测看看要不要换。LlamaIndex 在 2026 年 10 月 7 日发布 OpenDocRouter就是把这部分工作产品化一个把文档转成 markdown 的平台用统一的接口去调最新的开源模型和前沿模型。每个模型背后配一套版本化的 recipe——提示词、处理流程和设置都被固化下来。这篇按原文拆开看它的接口长什么样、十款模型的价格差多少、怎么把不同模型的版面信息对齐以及它和 LlamaParse 的分工。二、最小调用只有三个字段官方给的调用示例很直白curlhttps://www.opendocrouter.ai/v1/parse\-HAuthorization: Bearer$API_KEY\-HContent-Type: application/json\-d{ model: opendatalab/mineru2.5-pro, document: { url: https://arxiv.org/pdf/1706.03762 }, layout: true }三个字段各管一件事model 选模型document 给输入layout 决定要不要带版面信息。几个边界值得先记住输入接受 PDF、PNG、JPEG或者指向这些文件的 URL。支持同步与异步两种返回。同步直接返回结果最长 50 页异步会建一个任务需要轮询取结果。单次请求的输入上限是 500 页或 50MB。接口形态之所以这么简单是因为麻烦的部分被收进了平台侧每个模型对应一套版本化的 recipe你不需要自己去追提示词也不用为换模型重写一遍管线。三、十款模型每千页成本差了 60 倍OpenDocRouter 上线时选了十款模型覆盖官方评测的两端五款前沿模型五款开源模型。前沿模型包括 Claude Opus 5.5、Gemini 3 Flash、Gemini 3.8 Flash、GPT-5.6 Terra、GPT-6 Luna开源模型包括 Infinity-Parser2-Flash、MinerU2.5-Pro、TeleOCR、dots.mocr、PaddleOCR-VL-1.6。价格截至 2026 年 10 月 7 日单位美元模型输入 /1M缓存输入 /1M输出 /1M每千页成本ParseBenchClaude Opus 5.54.000.2020.0048.82Gemini 3 Flash0.500.053.0019.67Gemini 3.8 Flash0.750.083.755.91GPT-5.6 Terra2.000.2012.0019.89GPT-6 Luna0.100.010.500.80Infinity-Parser2-Flash0.24-1.164.34MinerU2.5-Pro0.08-0.390.86TeleOCR0.25-1.222.70dots.mocr0.31-1.533.97PaddleOCR-VL-1.60.24-1.202.17这张表最该看的是最后一列。**最贵的 Claude Opus 5.5 每千页 48.82 美元最便宜的 GPT-6 Luna 只要 0.80 美元两者相差超过 60 倍。**这就是统一接口真正的价值把换模型的成本从重写管线 重新评测降到改一个字段你才有资格按质量和价格去挑。计费方式也很直接纯按 token 计费起充 25 美元。开启 layout 会额外按每百万 token 加 0.2 美元处理过程中失败的页面不计费。四、把版面信息拉齐grounding engine不同模型对 bounding box 和版面结构的保证差别很大。有的原生就能输出坐标框有的需要靠提示词催还有的干脆做不到。为此平台做了一个 grounding engine可以套在任意模型上。请求里把 layout 置为 true返回的 markdown 就会带上带坐标依据的 bounding box以及按阅读顺序排好的版面元素。更关键的是类别被统一了。所有模型输出同一套版面类别title、section_header、text、list_item、table、picture、chart、formula、caption、footnote、page_header、page_footer、code、form 和 key_value。这对下游管线的影响比看上去大。RAG 索引最怕的就是每种解析器产出一套自己的结构——今天按模型 A 的字段切块明天换成模型 B切片逻辑和元数据映射全得跟着改。统一类别之后切换模型不再意味着重写下游。五、新模型进来之前先过一遍 ParseBench平台的模型接入流程说得比较克制新模型一旦能提供就会先跑一遍 ParseBench用评测结果去标定提示词、成本和其他设置再放出来给用户。每一个模型都会在 ParseBench 上从质量和成本两个维度评测这也是选型页面的主要依据。原文没有承诺具体的更新频率只说会持续改进热门模型——包括更好的提示词、更低延迟的托管方式。想确认某个模型是否已上线直接看官方模型与评测列表最稳妥。六、它和 LlamaParse 的分工这两个产品容易被混在一起原文把边界划得很清楚。OpenDocRouter 的定位是快速托管最新模型让开发者方便地在已有模型之间切换和路由并且只为实际用量付费。它强调的是接口简单、模型覆盖广。LlamaParse 则是托管文档平台带的是手工调优的解析档位、企业级控制、自托管部署以及 schema 抽取、索引这类额外 API。一句话区分想要最新的模型 按量付费 自己控管线看 OpenDocRouter想要开箱可用的解析质量 企业治理能力看 LlamaParse。七、这类模型路由器值不值得接我的判断是分场景的。如果文档解析只是管线里的一环而你的痛点是不知道该选哪个模型、换一次成本太高那么这种统一接口确实能省下不少事——尤其是它把评测和价格摊在同一张表上的做法。但如果你的场景对解析质量有明确的硬要求比如特定版式的合同、票据或者有严格的数据合规约束那还是得自己拿真实样本跑一轮平台给的是 ParseBench 上的通用结论不等于你的文档分布上的结论。还有一个现实提醒这类平台的模型清单和价格变动很快文中的价格只是 10 月 7 日的快照未验证最新版本接入前请以官方文档和定价页面为准。八、小结OpenDocRouter 这套设计的可学之处不在支持十个模型这个数量而在它把三件容易被忽略的事做成了接口的一部分第一把评测和计费放在一起展示让选型从感觉变成算账第二用 grounding engine 把各家模型的版面输出对齐成同一套类别换模型不等于重写下游第三把每个模型的提示词与设置固化成版本化 recipe新增模型有明确入口。写 RAG 或文档类 Agent 的时候这三条思路可以直接借用——哪怕你不接这个平台。