DeepEval 指标体系详解 DeepEval 指标体系详解一、指标体系整体设计DeepEval 的指标体系采用「场景分类 层级解耦 可扩展底座」的三层设计并非单一的 RAG 评测工具而是覆盖 RAG、多轮对话、Agent、安全合规全场景的生产级评测框架。官方原生提供 40 内置指标所有指标均可独立使用、组合拼装、嵌入 CI/CD 流水线同时支持完全自定义业务规则。官方核心分类逻辑RAG 专项指标单轮多轮Agent 专项指标组件级轨迹级多轮对话专项指标安全合规专项指标通用基础与格式指标自定义指标框架G-Eval / DAG / BaseMetric二、RAG 专项指标体系DeepEval 的 RAG 指标严格遵循分层解耦原则分为检索层指标和生成层指标支持独立控制变量评测同时原生支持多轮 RAG 场景这是 RAGAS 不具备的能力。1. 检索层指标Retriever Metrics共 3 个核心指标独立评测检索系统的召回与排序质量完全排除生成模型干扰。指标名称核心定义计算逻辑业务意义与 RAGAS 的差异Contextual Precision上下文精确率衡量召回结果的排序质量与噪音水平验证「相关内容是否靠前、无关内容是否少」判定 TopK 召回片段中相关片段是否优先排在前面同时惩罚无关片段占比支持配置是否开启位置加权直接对应检索噪音率精确率越低无关信息越多越容易引发生成幻觉RAGAS 同名指标默认强位置加权DeepEval 可配置严格程度默认更侧重纯噪音率Contextual Relevancy上下文相关性衡量召回结果与用户查询的整体语义匹配程度由裁判模型整体判断召回的所有上下文内容和查询的语义相关度输出 0~1 得分快速评估检索的整体匹配度适合粗筛与版本对比RAGAS 无单独同名指标相关性逻辑融合在精确率/召回率中Contextual Recall上下文召回率衡量召回结果覆盖答案所需信息的完整程度计算召回上下文覆盖了多少比例的「回答问题所需的关键信息点」可配置是否允许语义推断覆盖直接决定回答质量的上限召回率低则生成模型再强也答不对RAGAS 定义更严格DeepEval 可配置严格程度适配不同业务松紧度多轮 RAG 扩展指标针对多轮对话场景的 RAG 效果DeepEval 原生提供 Turn 系列专项指标TurnFaithfulnessMetric多轮对话中回答基于上下文的忠实度TurnContextualPrecisionMetric多轮交互中检索精确率的变化TurnContextualRecallMetric多轮交互中检索召回率的变化2. 生成层指标Generator Metrics共 3 个核心指标固定输入上下文即可独立评测生成质量完全排除检索波动干扰。指标名称核心定义计算逻辑业务意义与 RAGAS 的差异Faithfulness生成忠实度衡量回答是否基于给定上下文不脱离上下文编造原子事实拆解法将回答拆分为独立事实点逐一校验是否有上下文支撑核心幻觉管控指标幻觉率 1 - 忠实度定义和 RAGAS 基本一致但 DeepEval 可配置拆解粒度、是否允许合理推断Answer Relevancy回答相关性衡量回答和用户问题的匹配程度是否答非所问语义匹配度意图匹配度双重校验判断回答是否回应用户核心诉求定位「跑题、答非所问」类问题和 RAGAS 逻辑基本一致DeepEval 可配置相关性校验维度Hallucination幻觉专项检测专门深度检测无中生有、事实错误、过度引申等幻觉场景针对幻觉场景优化的专用判定逻辑不仅校验上下文支撑还识别事实错误、偷换概念、数字错误等典型幻觉模式高风险场景的强化校验比通用忠实度更精准聚焦幻觉RAGAS 无独立幻觉指标用 1-忠实度间接计算三、Agent 专项指标体系这是 DeepEval 相对 RAGAS 的核心增量优势原生覆盖 Agent 从规划到执行的全链路评测分为组件级单步指标和轨迹级全链路指标两类精准定位执行链路中的单点问题。1. 组件级指标Component-level针对 Agent 单步操作的精准评测定位单点能力短板。指标名称核心定义计算逻辑适用场景ToolCorrectnessMetric工具选择正确率验证 Agent 是否选择了正确的工具处理对应任务对比实际调用的工具与预期正确工具统计完全匹配的比例定位「工具选错」类问题验证工具理解与匹配能力ArgumentCorrectnessMetric参数构造正确率验证工具调用的入参是否正确逐字段校验参数的字段名、数据类型、值范围、业务约束是否符合接口要求定位「参数传错」类问题验证参数生成与构造能力2. 轨迹级指标Trajectory-level针对 Agent 完整任务执行链路的整体评测验证最终效果与过程合理性。指标名称核心定义计算逻辑适用场景TaskCompletionMetric任务完成率验证 Agent 是否最终完成了用户的任务目标从结果维度判断任务目标是否达成、输出是否符合要求端到端任务效果验收是 Agent 的核心结果指标PlanQualityMetric规划质量验证任务拆解与规划方案的合理性判断规划的步骤是否完整、顺序是否合理、粒度是否合适定位「规划不合理、步骤遗漏」类问题PlanAdherenceMetric规划遵循度验证实际执行是否按照规划的步骤推进对比实际执行轨迹与预设规划统计步骤偏离、顺序错乱、额外步骤的占比定位「执行偏离规划」类问题StepEfficiencyMetric步骤效率验证执行路径的最优性统计是否存在冗余步骤、重复调用、无效操作计算最优步骤占比优化执行效率减少不必要的工具调用与耗时GoalAccuracyMetric目标准确率验证最终执行结果是否达成原始目标对比最终结果与用户原始目标的匹配程度端到端目标达成度验证四、多轮对话专项指标体系针对长对话、客服机器人、聊天助手等多轮场景原生支持完整对话链路的质量评测基于ConversationalTestCase运行覆盖对话全周期的质量校验。指标名称核心定义计算逻辑适用场景Knowledge Retention知识保留率长对话中历史关键信息的保留程度在多轮末尾验证是否还记得早期对话中的关键信息、约束条件定位「上下文丢失、失忆」类问题Role Adherence角色一致性全程是否保持人设、语气、专业规范校验多轮对话中角色设定、语气风格、话术规范的一致性客服、人设类场景的合规校验Conversation Completeness对话完成度任务导向对话的目标达成程度判断完整对话是否解决了用户的原始问题、完成了任务任务型对话的整体效果验收Conversation Relevancy对话相关性多轮交互中是否偏离用户原始意图校验每轮回复是否围绕对话主题有无跑题、转移话题定位「多轮跑题、偏离意图」类问题五、安全合规专项指标体系面向生产级红线要求原生覆盖安全攻防与合规校验是企业级落地的必备能力RAGAS 完全没有原生支持。指标名称核心定义检测场景风险等级BiasMetric偏见检测检测输出中的性别、种族、地域、政治等偏见与歧视性别刻板印象、地域歧视、立场偏向中高ToxicityMetric毒性检测检测暴力、辱骂、仇恨、低俗等有害内容攻击性语言、违规内容高PIILeakageMetric个人信息泄露检测检测是否泄露隐私、个人身份信息、敏感业务数据身份证、手机号、地址、商业机密极高红线PromptInjectionMetric提示注入检测验证提示注入攻击的防御能力角色伪装、指令覆盖、间接诱导、前缀注入极高红线RoleViolationMetric角色越界检测检测是否突破角色权限、执行越权操作低权限角色执行高权限操作、超出职责范围回答高MisuseMetric违规使用检测检测是否被用于违法违规用途生成恶意代码、诈骗话术、违规方法极高红线NonAdviceMetric非专业建议警示检测是否违规提供医疗、法律、金融等专业建议无资质提供诊疗建议、法律意见、投资指导中补充DeepEval 还提供独立的DeepTeam红队评测框架专门用于自动化安全对抗测试覆盖更全面的攻击向量与渗透场景。六、通用基础与格式校验指标1. 内容质量类SummarizationMetric摘要质量评估摘要的事实准确性、信息完整性、简洁性检测摘要幻觉、关键信息遗漏TruthfulQA基于标准基准集的事实性测试验证模型的通用知识准确性2. 格式与指令类JSONCorrectnessMetricJSON 正确性校验输出是否符合指定的 JSON Schema字段、类型、结构是否正确适合结构化输出、工具调用参数场景PromptAlignmentMetricPrompt 对齐度衡量输出是否遵循了系统 Prompt 中的指令、要求、约束条件七、自定义指标框架DeepEval 核心差异化能力DeepEval 最核心的优势不是内置指标数量多而是提供了成熟的三级自定义指标体系支持企业快速落地业务专属的评测规则灵活度从低到高。1. G-Eval自然语言自定义最简单核心逻辑用自然语言描述评测标准让裁判模型按标准打分无需编写复杂代码逻辑适用场景主观质量评测比如语气、连贯性、业务话术规范、服务态度典型用法描述「回答必须分点作答、语气友好、包含风险提示」自动按标准输出评分与理由优势零代码快速上手业务人员也可定义评测标准2. DAG决策图指标规则LLM 混合最推荐生产用核心逻辑决策树结构先执行客观规则校验正则、格式、关键字、数值范围通过后再执行 LLM 主观评分适用场景混合标准评测比如先校验格式是否正确再校验内容质量业务规则语义质量双重校验优势性能高、确定性强、可解释性好符合生产级流水线的稳定性要求3. BaseMetric完全代码自定义最灵活核心逻辑继承BaseMetric基类完全用代码编写评分逻辑支持规则引擎、API 调用、外部系统对接适用场景复杂业务规则、对接内部系统、特殊计算逻辑、强约束场景优势无限灵活可实现任意定制化评测逻辑八、指标的四种使用模式DeepEval 所有指标都支持四种使用方式适配不同评测场景与研发阶段端到端评测把系统当黑盒只看输入输出适合整体验收、版本对比组件级评测针对单个组件检索/生成/工具调用单独评测精准定位问题根因轨迹级评测针对 Agent 完整执行轨迹评测全链路过程合理性与结果正确性单指标独立评测单独调用某个指标做专项校验比如只跑幻觉检测、只跑格式校验九、指标体系核心特点总结全场景覆盖从单轮 RAG 到多轮对话、从 Agent 到安全合规一个框架覆盖所有 LLM 应用评测场景分层解耦严格按组件分层支持独立控制变量评测精准根因定位避免混为一谈高度可定制从 G-Eval 到 BaseMetric提供三级自定义能力适配企业专属业务规则与合规要求生产级导向原生支持 CI/CD 集成、断言式测试、增量执行、结果缓存专为交付流水线设计可解释性强每条评分附带判定理由、推理过程方便调试定位问题而非黑盒输出分数