DeepEval|LLM 评测跑在本地 DeepEvalLLM 评测跑在本地【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval场景引入上次给客服机器人跑回归评测同事问了一句这些测试数据是不是都发去了云端 API不想依赖外部模型、也不想数据出内网的话可以用 DeepEval 做本地评测——它把用例、指标计算都放在你自己的环境里完成。你将跑通什么你能独立完成一整套 DeepEval 本地评测把 Ollama 上的开源模型接进评测流程当打分 judge定义测试用例挂上相关性指标再用一条命令跑完并拿到每个用例的得分和通过与否。整个流程不经过任何云端评测服务。原理一句话本质上就是把打分模型的调用从云端 API 换成本地推理服务指标照常工作只是把 prompt 发给你机器上的模型而不是发往 HTTP 接口。完整实操装好依赖DeepEval 挂在 Pytest 上跑安装只有一条 pip 命令随包带deepevalCLI对应文档见 getting-started。pip install -U deepeval准备本地模型依赖装好后框架需要一个能打分的模型。本地环境里最省事的起点是 Ollama它会在本机 11434 端口暴露一个推理服务若 Ollama 已在后台运行跳过这一步。ollama pull llama3 # 拉一个本地模型 ollama serve # 默认监听 http://localhost:11434接入评测上一步 Ollama 起好后它暴露的推理服务会被内置的 OllamaModel 直接对接不用自己写适配器把它传给指标即可。# test_eval.py from deepeval.test_case import LLMTestCase from deepeval.metrics import AnswerRelevancyMetric from deepeval.models import OllamaModel ... # from deepeval import assert_test case LLMTestCase( inputWhat if these shoes dont fit?, actual_outputYou can return them within 30 days., ) metric AnswerRelevancyMetric( modelOllamaModel(modelllama3), # 打分模型指向本地 Ollama threshold0.7, ) def test_relevancy(): assert_test(case, [metric])跑第一批用例上一步写好的 test_eval.py 就是一个标准 pytest 测试文件直接用随包 CLI 跑终端会逐条打印指标得分和通过状态。deepeval test run test_eval.py还能做什么端到端打分之外DeepEval 还覆盖了离线 LLM 评估的完整链路做本地模型评测时按下表按需取用能力一句话说明对应文档/模块路径LLM 测试用例生成用 ConversationSimulator 模拟多轮对话批量产出用例docs/content/docs/conversation-simulator/黄金数据集生成从你自己的文档自动生成参考答案deepeval/synthesizer/30 内置指标RAG 忠实度、毒性、角色一致性等均支持本地 judge 模型metrics 介绍框架调用追踪捕获 agent 运行的完整轨迹便于做轨迹级评估deepeval/integrations/CI/CD 回归指标写成 pytest 断言模型更新时自动回归docs/content/docs/evaluation-unit-testing-in-ci-cd.mdx踩过的坑OllamaModel 连接被拒确认ollama serve进程活着、模型已拉取默认连http://localhost:11434远程部署时显式传base_url。本地模型 JSON 输出偶尔残缺优先走支持schema参数的结构化输出路径模型实在压不住 JSON 格式就换一个 JSON 能力更强的本地模型当 judge。指标得分时高时低固定 judge 模型版本采样温度保持 0OllamaModel 默认即为 0怀疑模型被更新过用同一组用例对比重跑。接下来可以做的事读 getting-started 快速上手文档多挂几个内置指标对比得分去仓库 examples 目录看完整示例【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考