
PDF论文翻译怎么保住公式排版pdf2zh快速上手【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate用机翻软件啃外文论文翻完往往排版全乱公式散架、表格错位、双栏结构消失。PDFMathTranslate 就是冲着这个问题来的命令行叫pdf2zh它把 PDF 科学论文全文翻译成中文公式、图表、目录和双栏结构原样保留还顺带生成中英双语对照版。两条命令完成 pdf2zh 安装与首次翻译结论先行装完跑一条命令当前目录会多出两个 PDF——xxx-mono.pdf纯译文版和xxx-dual.pdf中英对照版。pip install pdf2zh pdf2zh document.pdf第一条命令自动装好全部依赖onnxruntime、pdfminer、gradio 都会带进来不用手动补第二条默认走 Google 翻译不需要任何 API 密钥。首次运行比之后慢不少因为它要从 Hugging Face 下载版面模型wybxc/DocLayout-YOLO-DocStructBench-onnx属于正常现象网络通就行。跑之前核对三件事Python 版本必须是 3.11 或 3.12项目声明3.11,3.133.10 和 3.13 都不行首次运行需要联网拉模型断网会卡在下载环节Windows 上跑 exe 版若报 DLL 加载失败先装 VC 2015–2022 运行库进阶用法批量、GUI、容器与 MCP 四种方式单文件跑通后按场景从下面四个入口挑一个。批量翻译整个论文目录pdf2zh --dir /path/to/papers/ -o results/它会递归扫描目录里所有 PDF逐个翻译产物统一放进-o指定的目录不用一篇篇敲命令。启动 Web 图形界面运行pdf2zh -i然后在浏览器打开http://localhost:7860/。在网页里选翻译服务、指定页码范围、实时预览效果适合不想记参数的场景。用 Docker 部署 pdf2zh 服务两条命令拉起容器化版本docker pull byaidu/pdf2zh再docker run -d -p 7860:7860 byaidu/pdf2zh。容器起好后同样是 7860 端口的 Web 界面适合不想配 Python 环境的机器。注册成 MCP 服务接 Claude Desktop运行pdf2zh --mcp以 STDIO 模式启动 MCP 服务器把配置写进 Claude Desktop之后在对话里直接翻 PDF。具体配置项写法看 docs/ADVANCED.md。pdf2zh 参数速查表日常 80% 的场景记住这 8 个就够参数作用示例-p指定翻译页码pdf2zh paper.pdf -p 1-3,5只翻第 1–3 页和第 5 页-s切换翻译服务-s deepl、-s openai:gpt-4o-mini-li/-lo源语言 / 目标语言-li en -lo zh-t翻译并发线程数-t 4四线程-o输出目录缺省为当前目录-o results/--ignore-cache忽略翻译缓存强制重翻pdf2zh paper.pdf --ignore-cache--prompt加载自定义 LLM 提示词文件--prompt my_prompt.txt--config加载 JSON 配置文件--config config.json公式与排版为什么不丢原理速览版面检测模型逐页扫描把每个元素分类公式、图片、表格、目录以及纯文字块。只有文字块被送进翻译服务其余一律不动译文再用原字体回填到原文位置。整个过程相当于对 PDF 文本层做一台外科手术——只替换文字骨架纹丝不动所以版式漂移极少。检测逻辑的源码在 pdf2zh/doclayout.py。三个最高频的坑与解法⚠️ 下面三种情况覆盖了绝大多数报错按现象 → 原因 → 一句解决对照排查。扫描版 PDF 翻不动现象是命令跑完却取不到内容原因是扫描件只有图片没有文本层而 pdf2zh 解析的正是文本层解决先用 OCR 工具给 PDF 补出文本层再投入翻译。模型下载卡住现象是首次运行长时间停在模型下载原因是部分地区访问 Hugging Face 受限解决运行前先设镜像——set HF_ENDPOINThttps://hf-mirror.comcmd 终端用上面这行PowerShell 写成$env:HF_ENDPOINT https://hf-mirror.com。切换服务后报鉴权错误现象是用deepl、openai等服务时提示鉴权失败原因是DEEPL_AUTH_KEY、OPENAI_API_KEY等环境变量没设置解决到 docs/ADVANCED.md 的表格里查对应服务的变量名设好再执行。需要精读外文文献的读者学生与研究人员都适用一条命令换一份保排版的中文 PDF。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考