ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

免费把英文PDF变成中英对照版:BabelDOC 快速上手指南

免费把英文PDF变成中英对照版:BabelDOC 快速上手指南 免费把英文PDF变成中英对照版BabelDOC 快速上手指南【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOCBabelDOC 是一个开源的 PDF 翻译工具你丢一份英文论文进去它输出原文和译文左右并排的中英对照 PDF公式、字号和版面尽量保留翻译走任意 OpenAI 兼容接口。40页论文两周读完先看看你常走的三条弯路导师丢来一篇 40 页的英文论文两周要交综述。你大概率会试这三招选中复制丢给网页翻译上下标和公式全碎整页截图走 OCR双栏论文的阅读顺序经常反参考文献被并成一坨先转 Word 再翻版面直接崩掉图表全飘。问题不在语言能力在 PDF 本身就是印出来的文本——你需要的是能读懂版面结构、只翻译文字、再按原样式重新排版的工具。一条命令装好并跑通 BabelDOC推荐用 uv 安装一行搞定首次运行会自动下载字体和版面分析模型uv tool install --python 3.12 BabelDOC装完备一个 OpenAI 兼容的 key官方接口、DeepSeek、Ollama 本地模型都行最小可跑命令长这样路径建议用绝对路径babeldoc --files /path/to/paper.pdf \ --openai --openai-model gpt-4o-mini \ --openai-base-url https://api.openai.com/v1 \ --openai-api-key 你的key进度条跑完、命令正常退出就算成功。要改源码或跟最新提交git clone https://gitcode.com/GitHub_Trending/ba/BabelDOC进目录后uv run babeldoc --help即可。首次运行会产出哪两个 PDF 文件落在当前目录或--output指定的目录双语 PDF原页和译页左右并排这就是你要的中英对照版本单语 PDF纯译文只读译文时不用左右分屏。整个流程丢进英文 PDF → 解析、翻译、重排版 → 得到对照 PDF中间不用你干预。BabelDOC 怎么做到不崩版面它内部是一条管线先用内置解析器把页面切成段落、公式、表格区域解析管线在 babeldoc/format/pdf/document_il/大模型只翻译纯文本公式符号原样保留最后按原文的字体字号重排成对照页。对你来说这意味着输出还是 PDF能直接存档、打印原文译文并排对照着读不用来回翻页gpt-4o-mini 这类便宜模型就够用40 页论文的 API 花费可控。高频 BabelDOC 参数速查参数作用--pages 1,3,5-8只翻指定页先试读、控制费用--files a.pdf --files b.pdf一次批量处理多个 PDF--lang-in/--lang-out源/目标语言默认en→zh--no-dual/--no-mono只出两种文档之一省一半生成时间--max-pages-per-part长文档按页拆分翻译完成后自动合并--qps每秒请求数上限默认 4限额紧就调低--output指定输出目录默认当前目录--glossary-files是被低估的参数传一份三列source,target,tgt_lng的 CSV示例见 docs/example/demo_glossary.csv命中的术语会被强制塞进提示词专名译法就稳定了。--max-pages-per-part也值得记一下文档一长就分批翻再合并中途失败只重跑那一批。实际用前绕开这几个坑 ⚠️扫描件译文盖住原文互相叠字检测会漏判白底黑字的扫描件加--ocr-workaround会在译文下垫白色底块并强制文字黑色。输出 PDF 在某些阅读器打不开先试--enhance-compatibility它等价于--skip-clean --dual-translate-first --disable-rich-text-translate的组合注意跳过 clean 的代价是文件变大。长文档中途失败翻译有缓存重跑不会重复消耗 API但--ignore-cache是强制重翻别习惯性带上。本地模型别忘改 keyOllama 这类服务不校验随便填个a就能过。作者区和参考文献可能被并成一段官方承认的已知问题另有不支持横线、首字下沉等限制个别段落粘连别怀疑自己操作错了。非英中语言对先用--pages抽几页试项目主要打磨英文→中文其他方向未经充分测试。命令行之外还能做什么想看每个阶段怎么实现的docs/ImplementationDetails/ 里解析、找段落、样式与公式、排版各有专篇想嵌进自己的 Zotero 工作流或批量文献脚本它提供 Python API官方视为内部接口嵌入时注意钉住版本要 Web 界面或更多翻译服务社区有自部署项目 PDFMathTranslate-next无外网环境用--generate-offline-assets打一个离线资产包分发即可。备齐一个 API key跑一条命令半小时后你就拿到一份可以左右对照阅读的中英双语 PDF。对论文翻译这个高频场景BabelDOC 目前是开源方案里把版面不崩做得最省心的那一个。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进