46.大模型应用如何评估不要只看回答听起来像不像 大模型应用如何评估不要只看“回答听起来像不像”码海寻道 · 大模型、智能体与 RAG 工程组件系列第 46 篇大模型回答流畅、语气自然不代表它是正确的。企业 AI 应用更应该回答资料找对了吗答案有依据吗权限是否正确响应是否足够快成本是否可接受一、评估对象不只有最终答案输入质量 ↓ 检索质量 ↓ 工具执行质量 ↓ 上下文拼装质量 ↓ 生成答案质量 ↓ 用户任务完成质量如果只评估最终文本就很难定位问题究竟来自 Embedding、切分、权限过滤、Reranker、Prompt 还是大模型。二、建立评测数据集每条样本可以包含{id:case-001,question:北京出差住宿标准是多少,context:{tenant_id:tenant-a,user_role:employee},relevant_chunks:[doc-001:v3:chunk-08],expected_answer:……,required_citations:[doc-001,page-6],risk_level:medium}数据集应覆盖正常问题、无答案问题、歧义问题、权限边界、过期文档、关键词问题和恶意输入。评测集本身也要版本化。每条样本建议记录case_id、问题、期望证据、参考答案、允许的拒答、风险等级、租户/权限上下文和标注来源数据集发布后只追加新版本不要直接修改旧样本否则无法解释某次回归是代码变化还是标准变化。三、离线评估和在线评估离线评估在固定数据集上比较模型、切分器、索引和 Prompt适合回归测试和版本选择。离线评测应固定随机种子、检索参数、模型版本和评测口径并保存原始输出与失败样本。涉及权限的样本要在真实权限上下文中执行不能用管理员身份跑完后再推断普通用户结果。在线评估观察真实请求中的用户反馈、任务完成率、转人工率、延迟和成本适合发现离线样本覆盖不到的问题。二者应结合离线保证可重复在线反映真实业务。四、自动评估、人工评估和规则评估规则评估检查引用是否存在、JSON 是否合法、是否包含敏感字段、是否超过 Token 限制。模型评审让另一个模型按照明确标准打分例如相关性、忠实度和完整性。模型评审需要抽样人工校准不能盲信分数。人工评估对高风险场景和边界样本由领域专家判断事实、权限和可用性。五、评估维度示例维度要回答的问题检索相关片段是否被召回忠实度答案是否能被上下文支持相关性是否回答了用户真正的问题完整性是否遗漏必要条件和例外引用来源是否存在且匹配安全是否泄露或越权体验延迟、流式和错误是否可接受六、不要把一个总分当成真相一个答案可能语言很自然但引用错误也可能检索召回正确但模型遗漏了例外条件。建议保留分项指标和失败样本总分 0.82 ├── Recall50.91 ├── 引用命中率0.88 ├── 忠实度0.79 ├── 完整性0.71 └── 权限安全1.00七、评估集要防止数据泄漏训练、调参和最终测试不能完全使用同一批问题。否则系统可能只是记住了样本模式真实用户问题仍然表现不稳。应保留一组不参与调参的测试集并按时间、业务领域和租户分层抽样。八、评估结果如何驱动迭代发现召回不到 → 检查解析、Chunk、Embedding、索引 召回正确但排位差 → 调整 Top K、Reranker、融合策略 上下文正确但答案错 → 检查 Prompt、模型和上下文预算 答案正确但慢 → 检查缓存、并发、模型和检索链路 答案正确但贵 → 检查 Token、重复调用和模型路由每次只改变主要变量并记录数据集版本、模型版本、索引参数和评估结果。发布门禁最好采用“整体指标 高风险子集 关键回归样本”三层规则。例如整体平均分提升但越权率上升仍应阻断发布指标下降时要保留新旧版本的相同trace_id、检索候选和生成结果方便定位差异。九、生产发布门槛不同风险等级应设置不同门槛低风险问答关注相关性和体验内部制度关注引用、版本和权限财务、医疗和法律需要人工审核、拒答机制和更高安全门槛自动执行 Agent增加副作用审批、审计和回滚要求。结语大模型应用评估应该覆盖检索、工具、生成、安全、体验和成本。自然语言听起来流畅只是最低层的感受真正可交付的系统必须通过可重复数据集、分项指标和生产反馈持续验证。下一篇将介绍 Langfuse、OpenTelemetry 和 Prometheus 分别负责观察什么。参考资料Langfuse 官方文档EvaluationLlamaIndex 官方文档EvaluationOpenTelemetry 官方文档本文为“码海寻道”原创技术文章。评估标准应结合业务风险和领域专家意见不宜只依赖通用模型评分。