RAG evaluation

RAG的核心评测指标有哪些?

✅RAG测评之RAG Triad 前面说过了,RAG系统中三个要素,分别是问题、答案以及检索资料。所以,我们需要有一套方法论来针对问题和答案、问题和检索资料、检索资料和答案之间的组合做全面评估。 RAG Triad(RAG 三元组)…

TL;DR

✅RAG测评之RAG Triad 前面说过了,RAG系统中三个要素,分别是问题、答案以及检索资料。所以,我们需要有一套方法论来针对问题和答案、问题和检索资料、检索资料和答案之间的组合做全面评估。 RAG Triad(RAG 三元组)…

✅RAG测评之RAG Triad

前面说过了,RAG系统中三个要素,分别是问题、答案以及检索资料。所以,我们需要有一套方法论来针对问题和答案、问题和检索资料、检索资料和答案之间的组合做全面评估。 RAG Triad(RAG 三元组)是一套专门用于评估 RAG(检索增强生成) LLMentor 通过前面的课程,了解了RAG Triad之后,我们知道, RAG Triad 是一个评估体系或方法论。那么这里面定义的评估指标应该具体如何度量呢? 我们都知道,一个RAG系统,主要干两件事,第一件事儿是检索(Retrieval)、第二件事是生成(Generation)。所以才叫Retrieval-Augmented Generation 那么,在评测上,通常也是针对两个阶段都有各自的评估维度,同时也会结合端到端的整体评估。以下是目前业界最核心的评测指标体系:

检索层评估(Retrieval)

这部分主要衡量系统“找资料”的能力,即检索器是否能准确、全面地找到与用户问题相关的上下文信息。这个阶段,聚焦的是RAG Triad 中的上下文相关性(Context Relevance) 具体的评估指标有: - 召回率(Context Recall):衡量检索结果的“查全率”。即在所有与问题相关的文档中,系统成功检索出了多少比例。 - 精准率(Context Precision):衡量检索结果的“查准率”。即在系统检索回来的所有文档块中,真正与问题相关的比例是多少。 - F1分数:F1 Score是平衡精确率和召回率的指标,F1分数是准确率和召回率的调和平均数。它同时考虑了这两者,只有当准确率和召回率都很高时,F1分数才会高。 关于召回率(Recall)和准确率(Precision)、F1 Score, 我们前面其实也讲过的。召回率讲求的时候“宁可错杀一千,不可放过一个”。准确率讲求的是:“宁缺毋滥” 。也提到过可以使用BLEU、ROUGE、METEOR等方法来评测他们。 但是,这里提到的召回率(Context Recall)、精准率(Context Precision)和之前我们提到的传统Recall、Precision还稍有不同, - 传统的 Precision / Recall 是“死板”的数学统计。它们需要人工提前标注好Ground Truth,然后机械地对比检索回来的文档 ID 对不对。 - Context Precision / Context Recall 是“灵活”的语义评估。它们利用LLM作为裁判,直接阅读文档内容,从语义层面判断检索回来的信息到底有没有用。这是RAG评测,尤其是很多评测框架中比较常用的手段——LLM-as-a-Judge

✅Prompt评测方法

当我们设计开发出了一个提示词后,是否能让大模型给出我们想要的、高质量的回答。那就需要一套方法来评估它是否真的有效,或者说是绝大多数场景下是有效的。大模型提示词的评测方法主要分为两类:人工评测 和 自动评测。 针对提示词的评测,其实主要还是 LLMentor - MRR(平均倒数排名)/NDCG(归一化折损累计增益):衡量相关文档的排名位置。如果正确答案排在越靠前的位置,得分越高。它不仅关心“有没有找到”,更关心“找得靠不靠前”。 上下文相关性(Context Relevance)是最终的目标(即“找到的资料准不准”),而 Recall、Precision、MRR、NDCG 等,则是从不同维度去衡量这个目标达成情况的“具体尺子”。

生成层评估(Generation)

这部分主要衡量系统“写答案”的能力,即大模型是否能基于检索到的信息生成高质量、无幻觉的回答。这个阶段,聚焦的是RAG Triad 中的忠实度 / 依据性(Faithfulness / Groundedness)、答案相关性(Answer Relevance) 而这个阶段,指标更加聚焦,主要就是: - 忠实度(Faithfulness):衡量生成的答案是否严格基于检索到的上下文,是否出现了“幻觉”(即编造了上下文中不存在或与上下文矛盾的信息)。 - 答案相关性(Answer Relevancy):衡量最终生成的答案是否直接、准确地回答了用户的原始问题。 除了上面这两个外,如果RAG的问题是有标准答案的,那可还可以通过以下指标评测: - 答案正确性(Answer Correctness):这是衡量最终答案质量的“金标准”,它综合了“事实准确度”和“语义相似度”两个维度。它需要引入人工标注的标准答案(Ground Truth)作为参照,不仅要求生成的答案在语义表达上与标准答案相近(像不像),更要求核心事实(如数据、人名、结论)必须完全一致(对不对)。在主流的评估框架中,事实准确度的权重通常更高,以避免AI用“正确的废话”掩盖事实错误 答案正确性(Answer Correctness)和答案相关性(Answer Relevancy)对比: | 维度 | 答案相关性 (Answer Relevancy) | 答案正确性 (Answer Correctness) | | --- | --- | --- | | 核心拷问 | “答非所问了吗?” | “答案说对了吗?” | | 评估对象 | 评估【用户问题】与【生成答案】的意图匹配度。 | 评估【生成答案】与【标准答案(Ground Truth)】的事实一致度。 | | 是否依赖标准答案 | 不需要 | 必须依赖 | | 计算逻辑 | 让 LLM 根据答案反向生成问题,看反推的问题和原问题语义像不像。 | 结合“语义相似度”和“事实准确度(TP/FP/FN比对)”综合打分。 |

端到端与工程化评估

除了上述核心质量指标,工业级 RAG 系统还会关注以下维度: - 端到端质量(End-to-end Score):通过 A/B 测试或构建黄金测试集,综合评估用户从提问到获取最终答案的整体体验。 - 鲁棒性与安全性:评估系统在面对噪声文档、错误信息或恶意攻击时的稳定性,以及是否会产生有害、偏见或侵犯版权的内容。 - 性能与成本指标:包括检索延迟(如 Embedding 生成耗时、数据库查询耗时)、QPS(每秒查询率)、GPU/CPU 利用率以及大模型 API 的调用成本等。 - 答案正确性(Answer Correctness):有些时候,也会把前面提到的答案正确性作为端到端评测的一个指标。

版本提示

模型、框架与接口会持续变化。涉及版本号、参数与生产配置时,请在实践前对照对应官方文档。

LLMentor系统化学习大模型应用工程

内容来自个人课程知识库备份,并经过结构化整理。技术版本持续演进,生产使用前请结合官方文档验证。