
距离 2025 年 12 月 Wordvice AI率检测工具 1.0 发布已过去 9 个月我们完成了一次大规模模型迭代。过去 9 个月人工智能技术迭代速度极快新技术层出不穷。人机协同写作的模式也在持续演变围绕 AI 生成文本检测方法、人工审核规范以及伦理层面应对措施的讨论始终十分活跃但在行业尚未形成统一共识的背景下AI 技术仍在高速发展。Wordvice 在这样的产业环境中持续优化现有模型性能同时不断探索模型与服务的底层创新。尤其是我们计划在 2026 年 EMNLP 会议上发表的论文《Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing》风格作为混淆因素AI 检测非母语学术写作中的假阳性查看博文介绍为本次迭代奠定了扎实的技术基础。今天Wordvice AI率检测工具 2.0 正式上线。本次更新的核心目标并非单纯扩大可检测的 AI 生成文本范围而是重点提升在 Wordvice 真实使用场景下对 AI 改写文本、模糊边界案例的稳定检测能力同时强化了句子级检测详情展示功能帮助用户更好地理解和复查检测结果。Wordvice AI率检测工具 2.0 的核心特性如下基于多源数据训练的 AI 生成文本检测模型针对高频误判困难案例优化的困难负样本挖掘Hard Negative Mining, HNM技术可在文档中以句子为单位可视化展示 AI 生成模式相似度较高片段的边界检测器Boundary Detector内部评估结果显示最终模型在领域内测试集上 F1 值达 0.9773AUROC 达 0.9979尤其是在 AI 改写文本AI Rewrite专项评估中F1 值达 0.9819召回率达 0.9917表现优异。需要特别说明的是高性能指标并不意味着检测结果可以作为判定文本撰写主体的确凿证据。AI率检测工具的输出仅代表文本与训练集中 AI 生成模式的相似程度信号必须结合写作过程、上下文语境、修改记录以及人工审核结果综合解读。与此同时我们也调整了使用额度政策。所有付费用户的 AI率检测工具月度使用额度提升至 100 万字基本可满足无限制使用需求。做出这一调整是因为 AI率检测工具的价值不止于单篇文档的检测结果确认更在于写作过程中持续排查、修正 AI 生成特有的表达痕迹AI Slop最终产出更高质量的文章。Wordvice 在韩国出版文化产业振兴院的官方支持下启动了 AI率检测工具升级项目并计划于今年年底前完成第二次大规模迭代。第二次更新将不止于 AI 风格文本检测还将针对 AI 不规范使用可能引发的实际问题新增引用错误校验、逻辑一致性验证等功能敬请期待。本文将详细介绍 AI Detector 2.0 的模型结构、训练方法、评估数据及具体性能等技术细节。Detector 2.0 做了哪些技术升级1. 覆盖真实使用场景下的多元写作模式Detector 2.0 基于约 60 万条人类撰写与 AI 生成的文本样本训练涵盖学术文本和通用文本包含各类 AI 生成、AI 改写案例旨在学习真实使用场景中可能出现的广泛写作模式。但仅扩充训练数据量远远不够。我们对初期模型的错误案例分析后发现误判往往集中在特定边界场景比如模型判定为 AI 生成、实际为人类撰写的文本或是 AI 生成但表达高度接近人类写作、被模型漏判的文本。Detector 2.0 专门筛选了这类困难案例纳入额外训练集中重点学习。2. 通过困难负样本挖掘HNM针对性优化困难案例第一阶段训练完成后模型会自动筛选出判定难度较高的案例用于追加训练我们内部将这一流程称为困难负样本挖掘Hard Negative Mining, HNM。具体而言我们在人类撰写文本中筛选出模型判定为 AI 生成概率较高的案例在 AI 生成文本中筛选出模型判定为 AI 生成概率较低的案例。这并非简单收集模型分类错误的样本而是无论分类正确与否重点聚焦模型在区分人类与 AI 写作边界时难以判别的案例。第二阶段训练中我们提升了筛选出的困难案例的训练权重增加其被调用的频率。通过这种方式模型不止学习容易区分的样本更重点攻克实际检测中判定难度较高的文本。3. 新增文档级结果下的句子级详情展示Detector 2.0 新增了分析功能用户不仅可以查看整篇文档的检测结果还可以定位文档内部 AI 生成模式相似度较高的具体片段。边界检测器Boundary Detector是一个 Token 级模型会对文本中每个 Token 属于人类写作或 AI 生成模式进行分类再将每个 Token 的得分汇总到词、句子层级帮助用户直观查看文档中 AI 生成模式较为突出的区间。边界分析与 Detector 2.0 的独立句子分析是两条相互独立的路径边界高亮功能通过汇总 Token 级预测结果展示文档内部的细节模式而句子得分则由独立模型结合上下文对每个句子单独分析得出。最终检测结果会将文档级检测与句子级分析结合判定同时将上述两条分析路径作为独立的解释信息提供给用户。因此边界高亮和句子得分是基于不同逻辑产出的结果解读时需要区分二者的作用。AI 改写检测能力有哪些提升HNM 技术的效果在 AI 改写现有文本的场景中尤为显著AI 改写专项评估结果如下评估指标初期模型Detector 2.0提升幅度AI 改写 F1约 0.9550.98190.027AI 改写召回率约 0.9330.99170.059在独立的领域内测试集上最终模型 F1 值为 0.9773AUROC 为 0.9979。尤其是在 AI 改写专项评估中召回率从约 0.933 提升至 0.9917意味着在该测试集中AI 改写文本被误判为人类撰写的情况大幅减少。Detector 2.0 的目标不止于提升整体准确率数值更重要的是优化真实使用场景下现有检测器难以识别的 AI 改写文本和边界案例的检测性能。如何利用句子级检测信息如果仅提供整篇文档「与 AI 生成模式相似」的整体结果用户很难理解判定依据。Detector 2.0 的边界检测器补充了这一能力可分析文本内部 AI 生成模式相似度较高的区间支持用户在句子层级查看详情示例如下句子AI 相似度This study examines…0.82We propose a novel…0.31需要注意的是0.82 这一数值并不代表该句子有 82% 的概率由 AI 撰写。句子得分是通过边界检测器捕捉区间模式后以用户易于理解的形式呈现的相对 AI 相似度指标。因此不能仅凭某句得分较高就断定该句「由 AI 撰写」句子级信息的核心作用是帮助用户定位需要重点复查的片段。边界检测器的性能如何评估边界检测器的性能通过公开 AI 文本检测基准评估该基准用于定位人类撰写文本与 AI 生成文本的转换点。评估采用 MAE平均绝对误差指标衡量预测的人类 / AI 转换位置与实际位置的平均偏差数值越低代表边界定位越准确。在相同 SemEval 测试集上现有公开系统的结果参考如下系统整体 MAE ↓SemEval 官方基线21.54TM-TREK15.68DeepPavlov13.38Wordvice 边界检测器7.16但该表格不应被解读为系统间的直接性能排名。不同系统的训练数据、训练条件存在差异仅凭相同测试集上的数值无法判定绝对性能优劣该结果仅用于验证 Wordvice 边界检测器在同一公开基准下的边界检测能力。学术文本表现优异新场景下需谨慎解读比起只看整体性能指标更重要的是明确模型在哪些场景下表现稳定、哪些场景下存在局限。边界检测器在不同数据环境下的评估结果如下评估环境MAE ↓token 级 F1与训练分布相似的学术文本2.720.987未训练的外部领域15.960.956全部7.160.973在与训练分布相似的学术文本中边界检测器表现出较高的检测性能但在未覆盖的外部领域中误差会有所上升。这是 AI 检测系统的共性重要局限在某一数据集上取得较高整体性能不代表在所有语言、所有类型文本中都能达到同等准确率。Detector 2.0 在产品设计中也充分考虑了这一特性当输入信息不足或针对当前尚未充分验证的语言、领域时系统会提供专门提示引导用户谨慎解读结果。尤其是目前的句子级分析在英语学术文本中验证最为充分因此针对非英语文本、或与训练分布差异较大的文章句子级结果需要更加谨慎地解读。实际使用体验有哪些变化结合真实使用场景Detector 2.0 的优化方向可总结如下使用场景旧版检测痛点Detector 2.0 优化方向全文由 AI 生成难以覆盖多元生成模式训练集覆盖多元的人类与 AI 写作模式人类撰写文本经 AI 改写表达自然化后更难检测通过 HNM 重点学习困难的 AI 改写案例人类采用接近 AI 的风格写作人类文本易被误判为 AI 生成将高难度的人类写作案例纳入追加训练文档局部 AI 模式突出仅靠整体结果难以定位需复查片段通过边界检测器提供句子 / 区间级别的详情短文本或未充分验证的文本类型有限信息下易过度信任结果提供专属提示引导使用者谨慎解读