DeepEval 指南:5 分钟跑通 LLM 评测的开源框架 DeepEval 指南5 分钟跑通 LLM 评测的开源框架【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval上周一个同事的 RAG 客服机器人上了线用户问鞋不合脚怎么办它答非所问地聊了一堆尺码表。问题在于改动 prompt 之后谁也没法说清回复质量到底是变好了还是变坏了全凭感觉。DeepEval 就是为这类场景做的开源 LLM 评测框架——它像 pytest 一样给 LLM 应用写单元测试指标在本地跑完打分5 分钟就能出第一份评测结果。DeepEval 是什么给 LLM 应用做单元测试DeepEval 是一个面向 LLM 应用的评测框架核心思路很简单把回答好不好变成可以断言、可以回归的测试。它内置 50 个开箱即用的评测指标覆盖 RAG、多轮对话、Agent、MCP、多模态和安全场景评测时由LLM 当裁判LLM-as-a-judge和本地 NLP 模型完成打分默认就在你的机器上执行。你不需要为每次评测单独搭一套体系pip 装完就能用。核心能力拆解按能力层看 DeepEval端到端黑盒评测用 pytest 断言跑分把整个应用当一个黑盒输入一个测试用例指标输出 0 到 1 的分数再由阈值判断通过与否。它直接挂在 pytest 插件上deepeval test run一条命令就能在 CI/CD 里跑回归不用改现有的测试流程。50 评测指标按场景选指标按用途分成几大类RAG 场景AnswerRelevancy答案相关性、Faithfulness忠实度、Contextual Recall/Precision/Relevancy 四个检索质量指标多轮对话Knowledge Retention知识保持、Conversation Completeness、Role AdherenceAgent 场景Task Completion、Tool Correctness、Step Efficiency、Plan Adherence通用与安全G-Eval 自定义标准、Bias、Toxicity、PII Leakage、JSON Correctness每个指标都能换裁判模型——不指定时默认用 OpenAI也可以换成 Ollama 本地模型或你自己的 LLM评测数据不出机器。轨迹级评测看见 Agent 的每一步用observe装饰器或框架集成LangChain、OpenAI Agents、CrewAI 等 12 个框架都有现成 handlerDeepEval 会按顺序记录模型决策、工具调用和中间步骤。这样就不止评最终答案还能评中间过程——比如 Agent 是否走了多余步骤、工具参数填得对不对。合成数据集没有 golden 数据也能开始评测绕不开拿什么数据测。DeepEval 内置合成器可以从文档自动生成单轮和多轮测试数据集覆盖手工收集困难的反例和边缘场景实现见 deepeval/synthesizer/。三步跑通第一个 LLM 评测第 1 步安装要求 Python 3.9pip install -U deepeval第 2 步写测试文件创建一个test_chatbot.py把actual_output换成你应用的真实输出from deepeval import assert_test from deepeval.metrics import GEval from deepeval.test_case import LLMTestCase, SingleTurnParams metric GEval( nameCorrectness, criteria判断 actual output 相对 expected output 是否正确, evaluation_params[SingleTurnParams.ACTUAL_OUTPUT, SingleTurnParams.EXPECTED_OUTPUT], threshold0.5, ) case LLMTestCase( input鞋不合脚怎么办, actual_output30 天内可免费全额退款。, expected_output我们提供 30 天免费全额退款。, ) assert_test(case, [metric])第 3 步运行。配置好裁判模型密钥默认 OpenAI也可deepeval set-ollama切到本地模型deepeval test run test_chatbot.py想跳过 pytest、在 notebook 里用直接调evaluate([test_case], [metric])也一样入口在 deepeval/evaluate/。功能矩阵功能说明代表内容内置指标50 个支持自定义扩展G-Eval、Faithfulness、Task Completion、Toxicity评测粒度端到端 / 轨迹 / 组件级observe追踪、框架 callback 集成框架集成12 个主流框架开箱即用LangChain、OpenAI Agents、CrewAI、LlamaIndex、Pydantic AI数据集单轮 多轮合成生成deepeval/synthesizer/基准测试十几行代码跑公开基准MMLU、GSM8K、HumanEval、DROP裁判模型任意 LLM 可替换OpenAI、Anthropic、Gemini、Ollama、自定义分人群落地建议个人开发者先把现有 prompt 改动写成测试用例改完跑一遍再合并避免越调越差裁判模型先用 Ollama 本地模型省去 API 费用指标实现可参考 deepeval/metrics/不确定指标怎么选从 G-Eval 自定义标准入手再逐步换专用指标小团队把deepeval test run接进 CIprompt 或模型变更时自动回归用合成数据集补齐手工标注没覆盖到的边缘场景挑 2-3 个业务最痛的指标如 Faithfulness设阈值而不是 50 个全上业务方用评测报告里的分数对比不同模型/架构方案代替各说各好的评审关注失败用例而非平均分失败样例才是改进方向换供应商如从 OpenAI 切到 Claude前用同一套测试用例跑一轮对比再决策新手 FAQ必须用 OpenAI 吗不必须。OpenAI 只是默认裁判模型可换成任意供应商或 Ollama 本地模型也可给单个指标传自定义 LLM。DeepEval 和 Confident AI 是同一个东西吗不是。DeepEval 是本地跑的开源评测框架Confident AI 是配套的商业平台负责共享报告、回归追踪和生产监控登录后可自动同步结果。deepeval 会收集我的数据吗默认只记录评测次数和所用指标等匿名统计可用环境变量DEEPEVAL_TELEMETRY_OPT_OUT1完全关闭细节见 docs/content/docs/faq.mdx。写在最后DeepEval 把LLM 输出质量这件模糊的事变成了一条命令就能跑、能进 CI、能换模型的回归测试。想深入的话从 docs/content/docs/getting-started.mdx 的快速入门开始即可需要源码时仓库地址为 https://gitcode.com/GitHub_Trending/de/deepeval 。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考