pdf2zh 快速指南:5 分钟译出保留排版的 PDF 双语版 pdf2zh 快速指南5 分钟译出保留排版的 PDF 双语版【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate你从外文 PDF 论文里选中一段话粘进翻译工具公式变成一堆乱码、双栏排版散架的那一刻就该换思路了。PDFMathTranslatePython 包名pdf2zh做这种 PDF 论文翻译的方式不同先用版面分析模型把每页切成正文、公式、图片、表格等区域只翻译文本部分再把译文按原坐标回填公式和编号都留在原位。它是什么保留排版的 PDF 全文翻译器一句话定位免费开源、保留排版的 PDF 全文翻译器。核心能力看这张表能力说明排版保留公式、图表、目录、注释位置样式不变支持多栏与跨页文档双版本输出一次运行同时产出paper-mono.pdf纯译文和paper-dual.pdf双语对照可插拔翻译服务Google、DeepL、OpenAI、Gemini、Ollama、DeepSeek 等十余种也兼容任意 OpenAI 格式接口多种使用形态命令行、Web 界面、Docker 容器、MCP 服务、Python/HTTP API按需取用左半边是英文原文右半边是跑完之后的中文页面公式和编号仍停在原处三步跑通第一个翻译先说结论不用先配任何密钥。默认翻译服务是 Google免费且免 API Key所以下面三步就是验证装好没有的最短路径。安装需要 Python 3.11~3.12pip install pdf2zh对任意 PDF 执行翻译结果落在当前目录pdf2zh paper.pdf确认生成了两个文件paper-mono.pdf纯译文和paper-dual.pdf双语对照打开对照原文看一眼验证完成。✅小提醒首次运行会下载一个几十 MB 的版面检测模型下载失败别慌往下翻到踩坑清单。按场景选用法个人使用命令行翻译论文常用参数就这几个不用死记# 指定源语言和目标语言 pdf2zh paper.pdf -li en -lo zh # 只翻译第 1~3 页和第 5 页 pdf2zh paper.pdf -p 1-3,5 # 换用 DeepL结果输出到 out 目录 pdf2zh paper.pdf -s deepl -o out # OpenAI 服务并直接指定模型名 pdf2zh paper.pdf -s openai:gpt-4o-mini-t控制线程数长文档可以适当调大-f/-c用正则声明不翻译的字体或字符数学、代码字体默认已受保护输入不局限于本地文件PDF 的网络地址也能直接传给命令。团队共用一个界面或一台容器Web 界面装好后运行pdf2zh -i浏览器打开http://localhost:7860/服务、语言、页码范围全部点选配置完成后直接预览并下载两个版本适合不想记参数的同事。两个实用开关--share生成对外可访问的临时链接--authorized users.txt用用户名,密码文件限定能登录的人还能自定义登录页。Docker 方式适合全队共用一台机器两条命令docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zh第一条拉取镜像第二条后台启动并把 7860 端口映射出来浏览器打开后就是和本机 GUI 同一套界面。想二次定制仓库里的 Dockerfile 和 docker-compose.yml 可以直接改。开发者接进自己的工作流在 Python 脚本里直接调用from pdf2zh import translate (file_mono, file_dual) translate( files[example.pdf], lang_inen, lang_outzh, servicegoogle, thread4 )HTTP API 面向做在线服务的场景pip install pdf2zh[backend]后运行pdf2zh --flask和pdf2zh --celery worker就能通过 REST 接口提交任务、查进度、下载结果。想把翻译塞进 AI 助手运行pdf2zh --mcp加--sse走 SSE 模式即可把它注册成 MCP 服务之后用自然语言让 Claude Desktop 这类客户端替你找文件、跑翻译。细节都在 docs/APIS.md。踩坑清单首次运行模型下载失败 →设置 Hugging Face 镜像源再跑Windows 用set HF_ENDPOINThttps://hf-mirror.comPowerShell 用$env:HF_ENDPOINThttps://hf-mirror.com。扫描版、图片型 PDF 翻不出来 →程序只认 PDF 内嵌文本层纯图片页没有可翻译内容先做 OCR 再处理。换 DeepL、OpenAI 等付费服务报鉴权错 →需在环境变量或配置文件中提供 API Key配置默认路径为~/.config/PDFMathTranslate/config.jsonGoogle、Bing 这类免费服务不用配。译文腔太泛不像领域文献 →用--prompt prompt.txt写自己的翻译指令模板支持${lang_in}、${lang_out}、${text}三个变量在这里注入术语要求很有效。同一文档反复翻译扣额度 →译文默认走缓存二次运行不重复调 API需要强制重译时加--ignore-cache。个别阅读器打开译文乱码 →输出默认做字体子集化以减小体积兼容性不佳时用--skip-subset-fonts关闭即可。判断值不值得装适合你手头是带文本层的电子 PDF学术论文、技术报告、标准文档、教材想靠-dual.pdf做 PDF 双语对照、顺便学表达科研或工程团队要批量、可复现地处理整个目录的文献pdf2zh --dir /path/to/papers/开发者想把翻译接进自己的系统或 AI 助手API / MCP。不适合或者要留意扫描版 PDF 没有文本层先 OCR 再谈翻译翻译质量完全取决于你选的服务默认 Google 免配置要求高就换 DeepL 或大模型本地运行要 Python 3.11~3.12不满足就用 Docker 或 Windows 免安装版绕开--mode precise是实验特性还要先跑pdf2zh-setup-precise正式交付建议先用默认模式。装好后先把三步流程走一遍几分钟就能拿到第一份双语对照论文顺手验证环境和模型都正常。完整参数、各翻译服务与环境变量对照表在 docs/ADVANCED.md集成开发看 docs/APIS.md。项目以 AGPL-3.0 协议开源可自由使用、修改和分发。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考