
如何保留公式和双栏排版翻译英文论文PDFMathTranslate 全流程指南【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate把英文 PDF 论文翻译成中文最怕的是公式被拆散、双栏排得七零八落。PDFMathTranslate包名pdf2zh是一款开源的 PDF 全文翻译工具它靠大模型翻译加上版面检测在输出中文的同时保住原文的版式结构。为什么普通翻译工具不够用直接复制文本喂给机器翻译得到的是失去上下文的段落行内公式变成乱码字符串图表编号串了位双栏阅读顺序也被打乱。对科研文献来说这些细节恰恰是理解内容的前提。PDFMathTranslate 的思路是先解析版面、再翻译文本非文字元素公式、图表、目录保持原样只处理语言部分从源头上避免了翻着翻着排版散了的问题。这个项目一句话讲明白它的技术底座是两部分大模型负责语言转换内置的 DocLayout-YOLO 模型负责识别页面上的公式、图表等元素。跑完一次翻译当前目录会得到两个文件xxx-mono.pdf是纯中文译文xxx-dual.pdf是中英对照版本两者可分别用于精读和查证。三分钟跑起来前置条件只有一条Python 3.11 或 3.12。然后两条命令pip install pdf2zh pdf2zh document.pdf执行完成后document-mono.pdf和document-dual.pdf就生成在工作目录里默认翻译服务是 Google无需任何密钥。不想敲命令的话装完执行pdf2zh -i进浏览器操作想容器化部署或直接用 Windows 免安装版release 页的 exe也各有一条路下文都会讲到。选一种适合你的用法命令行—— 适合脚本化、批处理场景pdf2zh document.pdf -s openai:gpt-4o-mini浏览器图形界面—— 适合偶尔翻一两篇执行pdf2zh -i浏览器访问http://localhost:7860/上传文件、选服务、点翻译右侧实时预览。Docker 容器—— 适合部署到服务器两条命令docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zhMCP 服务器—— 把翻译能力挂进 Claude Desktop 之类的客户端执行pdf2zh --mcp启动 STDIO 模式加--sse参数则走 SSE 模式。常用参数速查参数作用示例-s切换翻译服务支持服务名:模型名写法pdf2zh paper.pdf -s deepl-p指定要翻译的页码范围pdf2zh paper.pdf -p 1-3,5-li/-lo源语言 / 目标语言pdf2zh paper.pdf -li en -lo ja-t翻译并发线程数pdf2zh paper.pdf -t 2--ignore-cache跳过翻译缓存强制重新翻译pdf2zh paper.pdf --ignore-cache--dir批量翻译整个目录pdf2zh --dir /path/to/papers/ -o results/--prompt自定义 LLM 提示词文件pdf2zh paper.pdf --prompt prompt.txt--config加载 JSON 配置文件pdf2zh -i --config config.json关于翻译缓存相同的文本片段只调用一次 API之后直接复用结果。同一批文献反复处理、或多人共用机器时这部分能省掉可观的时间和额度。翻译效果是否保住排版以官方演示里的 Nature 论文为例英文版经过版面解析后译文页完整保留了双栏结构——图表编号、脚注、页眉期刊名、卷期、DOI都留在原来的位置公式比如 (\frac{b}{c} k) 这类符号按原文样式输出没有被翻译成文字或拆断。换句话说你拿到的不是一篇翻译过的文档而是一份排版与原文一致的中文版。三个使用前提要留意扫描版 PDF 需要先 OCR。工具解析的是 PDF 内嵌的文本层纯图片扫描件里没有文本可读。先用 OCR 生成带文字层的版本再交给它处理。首次运行要下载模型网络受限地区需配镜像。程序依赖wybxc/DocLayout-YOLO-DocStructBench-onnx模型部分地区拉取会卡住。Windows CMD 下执行set HF_ENDPOINThttps://hf-mirror.comPowerShell 下执行$env:HF_ENDPOINT https://hf-mirror.com再启动即可。第三方服务要先设好密钥环境变量。比如 DeepL 需要DEEPL_AUTH_KEYOpenAI 需要OPENAI_API_KEY等各服务对应的变量名和项目内 docs/ADVANCED.md 中的服务对照表一致设置完成后再用-s指定服务。它适合谁研究生和科研人员啃外文文献的主力人群mono版精读、dual版对照查证学生党图形界面零门槛一篇论文三分钟起步需要批量处理文献的读者--dir加翻译缓存整个文件夹一次跑完。项目已被 EMNLP 2025 收录维护保持活跃。想上手的话从这一条命令开始pip install pdf2zh参数细节查 docs/ADVANCED.md 即可覆盖绝大多数场景。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考