ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

DeepEval LLM评估框架:5分钟跑通第一次模型质量测试

DeepEval LLM评估框架:5分钟跑通第一次模型质量测试 DeepEval LLM评估框架5分钟跑通第一次模型质量测试【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepevalDeepEval 是一个开源的LLM 评估框架把大模型输出当成可测试对象写测试用例、用 40 余个内置指标打分并能接入 CI。适合需要系统化验证 LLM 应用质量的 AI 工程师与开发者。它解决什么问题DeepEval 解决一个具体问题用“测试”代替“凭感觉”来评估模型。以下三类情况最适合引入它RAG 知识库换模型或调整检索后回答质量会悄悄变化需要客观分数判断好坏。客服对话机器人坏例子靠人工抽查追不上需要固定指标的回归测试在质量下滑时给出信号。Agent 工具调用智能体可能选错工具或陷入循环需要对调用链做量化检查而不只看最终回答。安装并完成第一次评估需要 Python 3.9一条命令完成安装pip install deepeval再写一个 pytest 风格的测试文件仓库里已有可直接参考的示例 examples/getting_started/test_example.pyfrom deepeval import assert_test from deepeval.metrics import AnswerRelevancyMetric from deepeval.test_case import LLMTestCase def test_answer_relevancy(): test_case LLMTestCase( inputWhat if these shoes dont fit?, actual_outputWe offer a 30-day full refund., expected_outputFree full refund within 30 days., ) metric AnswerRelevancyMetric(threshold0.7) assert_test(test_case, [metric])执行deepeval test run test_example.py终端会给出每个用例的通过/失败与得分。若还需要可视化看板、标注与团队协作可接入 Confident AI 平台支持与编码工具通过 MCP 对接核心能力从数据集到回归数据集管理deepeval/dataset/EvaluationDataset批量组织测试用例Goldens 支持版本管理可导入导出 CSV/JSON。评估执行deepeval/evaluate/evaluate()本地跑完整数据集并按指标打分内置 pytest 插件可直接挂进 CI。追踪deepeval/tracing/基于 OpenTelemetry 记录每次 LLM 与工具调用为 span失败用例可定位到具体环节。对话模拟deepeval/simulator/用 LLM 扮演“用户”与机器人多轮对话把对话结果沉淀为回归数据集。 指标体系一次看懂内置指标指标实现集中在 deepeval/metrics/按场景选取即可指标评估内容AnswerRelevancyMetric回答与问题的相关程度FaithfulnessMetric回答是否以给定参考资料为依据ContextualRelevancyMetric检索到的上下文与问题的相关性ContextualRecallMetric参考资料是否覆盖期望答案要点HallucinationMetric资料中无依据的编造内容SummarizationMetric摘要对原文的忠实度ToxicityMetric/BiasMetric有害内容与偏见PIILeakageMetric是否泄露个人信息GEval用自然语言自定义任意评分标准DAGMetric结构化多步评分子标准树ToolUseMetric工具选择与调用参数是否正确ConversationCompletenessMetric多轮任务是否达成目标ExactMatchMetric/PatternMatchMetric规则匹配无需调用 LLM规则类指标如ExactMatchMetric不需要裁判模型GEval这类 LLM 指标需配置裁判模型本地或商用模型均可。三个最有价值的落地场景RAG 知识库问答用 ContextualRelevancy ContextualRecall Faithfulness 三件套区分“检索差”和“生成差”测试集固定只改检索参数或模型直接对比得分加HallucinationMetric拦截无依据回答每次回归都能得到新旧用例的逐项对比视图客服多轮对话ConversationCompletenessMetric检查对话目标是否达成用 ConversationSimulator 自动生成用户问题减少人工造例Turn 级忠实度指标跟踪单轮质量回退Agent / MCP 工具调用ToolUseMetric检查工具选择与参数AgentLoopDetectionMetric识别无限循环MCPTaskCompletionMetric评估端到端任务完成度LangChain、CrewAI 等框架如何接入deepeval/integrations/ 目录提供了主流框架的插桩集成LangChain / LangGraph自动捕获链与节点为评估轨迹LlamaIndex观察 RAG 中检索与生成各步骤OpenAI Agents / Pydantic AI / CrewAI记录智能体编排全过程Google ADK / Strands把 Agent 应用接入同一评估管线Anthropic / OpenAI SDK补丁式自动追踪代码改动最小 进阶源码目录与评估策略指标实现deepeval/metrics/测试用例定义deepeval/test_case/官方文档入口docs/content/docs/getting-started.mdxCI 用法docs/content/docs/evaluation-unit-testing-in-ci-cd.mdx制定评估策略的建议先用 10~30 条线上真实问题建基线数据集并为每个指标设定通过阈值每次改 prompt 或换模型都跑一次回归评估低于阈值即告警把失败用例当 bug 处理沿调用链定位问题出在检索、生成还是工具调用定期把线上坏例子回流进数据集让测试集随业务演进❓ 常见疑问评估本身需要调用 LLM 接口吗规则类指标如ExactMatchMetric不需要AnswerRelevancyMetric、GEval等基于 LLM 的指标需要配置裁判模型本地或商用模型均可。业务数据必须上云吗核心评估在本地执行数据可以不出你的环境。Confident AI 平台是可选组件用于可视化、标注与协作。如何在 CI 中运行DeepEval 注册为 pytest 插件可直接用deepeval test run也可以像普通pytest一样运行失败即阻断构建。自定义评估标准要写代码吗GEval直接用自然语言描述标准并指定评估参数即可需要更严格结构时用DAGMetric把标准拆成子标准树。动手试试从你的应用里挑一条真实问题写进测试用例跑一遍。完整文档见 docs/content/docs/getting-started.mdx指标源码在 deepeval/metrics/。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进