ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Chandra 2 的 90 语言多语言 OCR 基准测试全解读:FULL_BENCHMARKS 数据逐项分析

Chandra 2 的 90 语言多语言 OCR 基准测试全解读:FULL_BENCHMARKS 数据逐项分析 人工智能基础模型计算机视觉【免费下载链接】chandraOCR model that handles complex tables, forms, handwriting with full layout.项目地址https://gitcode.com/GitHub_Trending/ch/chandra点击查看免费下载本文围绕 Chandra OCR 2 的 90 语言完整基准测试文档 FULL_BENCHMARKS.md 展开逐项解读 Chandra 2 与 Gemini 2.5 Flash 在 90 种语言上的 OCR 表现并补充该基准在 Chandra 2 评估体系中的定位、复现方式与部署参考。读完本文你将掌握这份 90 语言成绩表的全部数据、背后的测试设计逻辑以及如何借助仓库脚本复现同类基准评测。图为仓库 README 中 43 语言子集的模型平均分对比Datalab API / Chandra 2 / Chandra 1 / Gemini 2.5 Flash / GPT-5 Mini90 语言完整评估是这一评估体系在低资源语言方向上的扩展。基准测试的背景为什么需要一份 90 语言 OCR 评测根据 README.md 的说明Chandra 2 的开发把多语言能力作为重点方向但当时没有一个足够好的公开多语言 OCR 基准因此项目自行构建了一套评估集测试维度覆盖表格、数学公式、阅读顺序、版面布局和文本准确率。FULL_BENCHMARKS.md 正是这一评估体系在最大规模上的扩展覆盖 90 种语言横跨拉丁字母、阿拉伯字母、天城文、西里尔字母、汉字/假名、泰文、缅文、高棉文、格鲁吉亚文、亚美尼亚文等书写系统对比对象为 Chandra 2 与 Gemini 2.5 Flash 两个模型文档开篇即说明平均分明显低于 43 语言基准原因是 90 语言集合纳入了大量低资源语言low-resource languages。总体成绩Chandra 2 领先约 12 个百分点FULL_BENCHMARKS.md 给出的总体成绩如下模型平均分Chandra 272.7% ± 1.2%Gemini 2.5 Flash60.8% ± 1.3%需要正确理解这个平均分的含义它是90 种语言成绩的算术平均大量低资源语言如普什图语 ps、意第绪语 yi、维吾尔语 ug 均在 30% 以下显著拉低了均值两个模型都标注了 ±1.2% / ±1.3% 的误差区间两者均值差约 11.9 个百分点远超误差带可视为系统性差距若只看常见语言对应 README.md 的 43 语言子集Chandra 2 平均 77.8%整体水平更高——这说明差异主要来自低资源语言的覆盖能力。90 种语言逐语言成绩完整数据下表完整收录 FULL_BENCHMARKS.md 逐语言列出的全部结果单位为 %LanguageChandra 2Gemini 2.5 Flashaf80.4%85.8%am34.4%0.5%ar68.4%84.4%as35.8%23.1%az75.2%74.0%be80.7%66.4%bg83.1%64.3%bn72.8%55.3%br90.0%69.4%bs84.8%85.1%ca85.1%88.0%cs85.3%79.1%cy82.2%77.6%da91.1%86.0%de94.8%88.3%el85.6%83.5%en96.6%90.3%eo80.1%71.9%es89.3%86.8%et75.2%73.7%eu80.2%74.6%fa75.1%61.8%fi83.4%86.0%fr93.7%86.1%fy81.2%70.1%ga80.9%70.1%gd71.8%59.5%gl80.9%80.9%gu70.8%47.6%ha72.1%59.1%he70.4%50.9%hi78.4%82.7%hr90.1%88.2%hu82.1%84.5%hy64.2%42.1%id91.6%88.3%is77.3%72.2%it94.6%85.7%ja86.9%80.0%jv73.2%80.4%ka77.0%39.3%kk80.5%77.2%km46.1%6.3%kn63.2%24.5%ko81.5%84.8%ku62.0%63.2%ky81.2%69.8%la73.8%70.5%lo60.9%13.3%lt79.8%70.5%lv76.9%81.5%mg81.2%78.4%mk83.5%77.4%ml64.3%23.8%mn88.4%71.4%mr75.0%69.7%ms79.3%79.8%my55.9%15.8%ne45.3%43.0%nl88.6%87.5%no90.5%87.8%or31.1%11.2%pa48.3%22.4%pl91.5%91.1%ps12.6%13.3%pt95.2%89.4%ro84.5%76.7%ru85.5%82.8%sa51.1%44.6%sd50.0%29.3%si62.4%26.2%sk77.3%81.2%sl81.0%80.1%so82.4%69.9%sq75.3%77.1%sr90.3%89.7%su85.7%96.4%sv93.3%91.1%sw88.9%80.9%ta77.7%53.9%te58.6%33.3%th62.6%66.7%tr84.1%84.1%ug25.8%5.4%uk91.0%87.9%ur44.1%57.6%uz77.2%52.8%vi82.6%89.5%xh82.1%62.1%yi24.9%6.8%zh88.7%70.0%成绩分布解读从数据中能观察到什么以下观察均基于上表数值不涉及任何额外假设1. 高资源语言双方都接近饱和。德语 de94.8% vs 88.3%、英语 en96.6% vs 90.3%、葡萄牙语 pt95.2% vs 89.4%、意大利语 it94.6% vs 85.7%、法语 fr93.7% vs 86.1%、瑞典语 sv93.3% vs 91.1%等主流语言上Chandra 2 保持稳定领先波兰语 pl91.5% vs 91.1%、印尼语 id91.6% vs 88.3%、丹麦语 da91.1% vs 86.0%、乌克兰语 uk91.0% vs 87.9%同样占优。2. 低资源与非拉丁书写系统是差距的主要来源。阿姆哈拉语 am34.4% vs 0.5%、高棉语 km46.1% vs 6.3%、老挝语 lo60.9% vs 13.3%、缅甸语 my55.9% vs 15.8%、格鲁吉亚语 ka77.0% vs 39.3%、卡纳达语 kn63.2% vs 24.5%、马拉雅拉姆语 ml64.3% vs 23.8%、僧伽罗语 si62.4% vs 26.2%、意第绪语 yi24.9% vs 6.8%、维吾尔语 ug25.8% vs 5.4%、信德语 sd50.0% vs 29.3%等场景中Chandra 2 的优势往往以倍数计——这正是平均分被低资源语言拉低背后的真实图景。3. 少数语言 Gemini 2.5 Flash 反超。巽他语 su96.4% vs 85.7%、越南语 vi89.5% vs 82.6%、爪哇语 jv80.4% vs 73.2%、印地语 hi82.7% vs 78.4%、加泰罗尼亚语 ca88.0% vs 85.1%、阿拉伯语 ar84.4% vs 68.4%等此外拉脱维亚语 lv、斯洛伐克语 sk、芬兰语 fi、泰语 th、乌尔都语 ur、库尔德语 ku、普什图语 ps 也略高于 Chandra 2。整体而言Chandra 2 领先的语言数量显著多于落后语言且领先幅度普遍更大。4. 完全持平的语言存在。加利西亚语 gl 双方同为 80.9%土耳其语 tr 同为 84.1%。与 43 语言基准README的关系README.md 提供了一份覆盖 43 种最常见语言、横跨 5 个模型Datalab API、Chandra 2、Chandra 1、Gemini 2.5 Flash、GPT-5 Mini的对照表其平均分对比为模型43 语言平均分Datalab API80.4%Chandra 277.8%Chandra 169.4%Gemini 2.5 Flash67.6%GPT-5 Mini60.5%对比两组数据可以看到同一条评估主线Chandra 2 相比 Chandra 1 在多语言上的提升幅度巨大77.8% vs 69.4%差距 8.4 个百分点而 FULL_BENCHMARKS 的 90 语言评估把同一模型放进了更严苛的低资源语言场景中Chandra 272.7%相对 Gemini 2.5 Flash60.8%的领先优势反而扩大。这也解释了为什么 FULL_BENCHMARKS.md 开篇专门提醒90 语言的平均分不能与 43 语言的平均分直接比较。多语言之外olmocr 基准与吞吐量的参考数据多语言评估之外README.md 还用公认的 olmOCR 基准对 Chandra 2 做了版面级评测Chandra 2 在该基准上整体得分85.8 ± 0.8其中表格 92.1、Long tiny text 93.7 是强项吞吐量方面在单张 NVIDIA H100 80GB GPU 上使用 vLLM、96 条并发序列跑多样化文档数学、表格、扫描件、多栏版面测得 1.44 pages/s、平均延迟 60s、P95 延迟 156s、失败率 0%README 同时估算真实业务场景约 2 pages/s。需要说明这些数据仅覆盖 README 记录的单一配置不构成对任意环境的性能承诺。在仓库中复现与验证基准仓库提供了端到端复现 olmOCR 基准的脚本与文档可用来理解这套评估体系的实际运行方式多语言基准本身的数据集未随仓库分发但评测流程与脚本一致安装依赖pip install -e .或pip install chandra-ocr另装huggingface_hub unicodeit启动 vLLM 服务在一个终端执行chandra_vllm该命令由 pyproject.toml 注册实际入口为 chandra/scripts/vllm.py会拉起 Docker 容器并加载datalab-to/chandra-ocr-2权重到 8000 端口安装上游评分工具pip install olmocr[bench]并用playwright install chromium准备 KaTeX 数学渲染环境运行评测在另一终端执行python -m chandra.scripts.olmocr_bench --bench-dir ./olmOCR-bench/bench_data首次运行会从 HuggingFace 下载 olmOCR-bench 数据随后用 olmocr_bench.py 逐页 OCR 并调用上游脚本打分。olmocr_bench.py 还提供一组实用参数--image-dpi渲染 DPI默认 300、--workersvLLM 并发请求数默认 32、--vllm-api-base覆盖服务器地址、--skip-inference复用已生成的候选结果只重新打分、--skip-scoring只产出候选 markdown、--stock使用 DPI-192 且不做任何输出后处理用于对照基线。这些参数与脚本内的后处理逻辑LaTeX→Unicode、sub/sup 转换、去除合成图注等共同保证了评分口径的一致性详细步骤见 chandra/scripts/OLMOCR_BENCH.md。结论与阅读指引FULL_BENCHMARKS.md 给出的核心结论可以概括为在覆盖 90 种语言的综合评测中Chandra 2 平均 72.7%领先 Gemini 2.5 Flash 约 12 个百分点领先主要来自低资源语言与非拉丁书写系统。对于日常使用这一结论意味着若业务涉及阿拉伯语、印地语、俄语、中文等常见语言两模型差异相对可控可结合 43 语言表按需选择若业务面向高棉语、缅甸语、老挝语、格鲁吉亚语、卡纳达语等低资源语言Chandra 2 是数据上明显更可靠的选择若需要在自己的数据上验证效果可参考 chandra/scripts/OLMOCR_BENCH.md 的复现流程或直接使用 chandra/scripts/cli.py 提供的 CLIchandra input.pdf ./output --method vllm做小规模实测。如需查阅 43 语言完整对照表、olmocr 基准明细与吞吐量配置可继续阅读 README.md本文所引全部数据均出自 FULL_BENCHMARKS.md 与 README.md未做任何外推。赞分享人工智能基础模型计算机视觉【免费下载链接】chandraOCR model that handles complex tables, forms, handwriting with full layout.项目地址https://gitcode.com/GitHub_Trending/ch/chandra点击查看免费下载相关推荐KOReader 电子书阅读器完整指南10 分钟装好PDF 重排、长按查词全搞定KOReader 电子书阅读器完整指南10 分钟装好PDF 重排、长按查词全搞定 三天前我把一本扫描版 PDF 拷进电纸书放大看字糊、不放大看不清读了两桌面应用跨平台嵌入式Laya 研究仓库深度解析可复现基准测试、逐语言评估与多语言决策引擎的证据链Laya 研究仓库深度解析可复现基准测试、逐语言评估与多语言决策引擎的证据链 本指南围绕 Laya 仓库中的 research/ 目录展开它是 Laya 决人工智能NLP强化学习Surya OCR项目中的语言参数内部机制解析Surya OCR项目中的语言参数内部机制解析 Surya OCR作为一个先进的OCR识别框架其语言参数的设计理念和内部工作机制值得深入探讨。该项目采用了独特计算机视觉深度学习上一篇readme-md-generator终极指南一键生成专业README文件下一篇ANIMATED TAB BAR热重载方案加速动画开发迭代创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进