一个优秀的 RAG 评测集,就像是给系统准备的一份高质量“期末考卷”。它不仅要能准确测出系统的真实水平,还要能暴露出系统的短板。结合你的实际情况,一个真正“能打”的评测集通常具备以下 4 个核心特征:
题型丰富
如果你的评测集里全是“某公司的年假是多少天”这种简单的关键词查找题,系统很容易拿高分,但这完全无法反映真实业务中的复杂情况。好的评测集应该包含不同难度和意图的题目: - 简单事实查询:考察基础的检索和提取能力。 - 多跳推理问题:答案需要跨越多个文档片段,综合归纳才能得出(例如:“对比A产品和B产品在保修政策上的区别”)。 - 模糊或对抗性提问:用户提问表述不清,或者故意问一些文档里没有的内容。这能测试你的 RAG 系统是否会产生“幻觉”(胡编乱造),或者能否优雅地回答“我不知道”。 - 长文本/综合类问题:需要系统对大段上下文进行深度总结和提炼。
严格贴合业务,避免“偏题”
直接使用网上公开的通用评测集(如 HotpotQA、Natural Questions 等)往往效果不佳,因为它们和你的业务文档风马牛不相及。 - 真实场景化:好的评测集必须基于你真实的“知识文档”生成,问题和答案的措辞要符合你所在行业(如金融、医疗、法律或企业内部IT)的专业术语和表达习惯。 - 与业务目标对齐:如果你的 RAG 系统是用于客服,那么评测集就要重点考察回复的准确性和礼貌性;如果是用于科研辅助,就要重点考察信息的全面性和深度。
高质量的 Ground Truth
评测集的“真实答案”就是阅卷的标尺。如果标尺本身是歪的,评测结果就毫无意义。 - 人工审核必不可少:无论是用 LLM 自动生成,还是用 RAGAS 工具跑出来的 QA 对,必须经过领域专家或熟悉业务的人员进行人工抽查和校准。确保每一个“真实答案”都是精准、无歧义且完全正确的。
能够支持多维度的指标评估
好的评测集不仅要能测出“系统回答得对不对”,还要能帮你诊断“到底是哪个环节出了问题”。你的评测集应该能支撑起对检索和生成多个阶段的评估,也就意味着需要包含足够的输入给到LLM,包括用户问题、AI回答、参考答案以及参考资料等。