RAG evaluation

RAG测评之RAG Triad

前面说过了,RAG系统中三个要素,分别是问题、答案以及检索资料。所以,我们需要有一套方法论来针对问题和答案、问题和检索资料、检索资料和答案之间的组合做全面评估。 RAG Triad(RAG 三元组)是一套专门用于评估 RAG(检索增…

TL;DR

前面说过了,RAG系统中三个要素,分别是问题、答案以及检索资料。所以,我们需要有一套方法论来针对问题和答案、问题和检索资料、检索资料和答案之间的组合做全面评估。 RAG Triad(RAG 三元组)是一套专门用于评估 RAG(检索增…

前面说过了,RAG系统中三个要素,分别是问题、答案以及检索资料。所以,我们需要有一套方法论来针对问题和答案、问题和检索资料、检索资料和答案之间的组合做全面评估。 RAG Triad(RAG 三元组)是一套专门用于评估 RAG(检索增强生成)应用质量的核心方法论。(由TruLens提出) 它不需要人工标注的标准答案(Ground-truth),而是通过分析 RAG 流程中三个最关键元素——用户提问(Query)、检索到的上下文(Context)和模型生成的回答(Response)——之间的两两关系,来对系统进行全方位的自动化体检。 根据评估对象的不同,可以分为以下三个核心的评估指标: - 检索资料(Context)和用户问题(Query)——上下文相关性(Context Relevance) - 模型生成的回答 (Response) 与 检索到的资料 (Context)——忠实度 / 依据性(Faithfulness / Groundedness) - 模型生成的回答 (Response) 与 用户提问 (Query)——答案相关性(Answer Relevance)

上下文相关性(Context Relevance)

  • 评估关系:检索到的材料 (Context) 与 用户提问 (Query)
  • 核心作用:衡量检索器“找资料”的精准度。它检测召回的文档片段中,有多少是真正能支持回答用户问题的。
  • 低分意味着:检索器捞回了大量与问题无关的噪声内容。这些冗余信息不仅浪费计算资源,还可能干扰大模型,导致最终回答质量下降。

忠实度 / 依据性(Faithfulness / Groundedness)

  • 评估关系:模型生成的回答 (Response) 与 检索到的材料 (Context)
  • 核心作用:衡量大模型“写答案”的老实程度,即是否严格基于检索到的资料来作答。
  • 低分意味着:模型出现了“幻觉”(Hallucination)。即生成的回答中包含了一些检索资料中完全不存在,甚至与资料相矛盾的信息。

答案相关性(Answer Relevance)

  • 评估关系:模型生成的回答 (Response) 与 用户提问 (Query)
  • 核心作用:衡量最终回答是否准确、完整地解决了用户的原始诉求。
  • 低分意味着:答非所问。例如用户问了“A在哪里,它的首都是什么?”,模型只回答了“A在哪里”,虽然信息正确且基于上下文,但没有完整回答问题,得分就会较低。
版本提示

模型、框架与接口会持续变化。涉及版本号、参数与生产配置时,请在实践前对照对应官方文档。

LLMentor系统化学习大模型应用工程

内容来自个人课程知识库备份,并经过结构化整理。技术版本持续演进,生产使用前请结合官方文档验证。