在AI模型测评中,当发现答案准确率低时,除了怀疑我们的RAG系统回答的不好以外,还需要怀疑一下ground truth。有的时候问题根源并不在RAG系统本身,而在于评测基准(Benchmark)或标注数据存在缺陷。 Ground Truth 通常被认为是“绝对真理”。然而,在实际应用中,Ground Truth 并非完美无缺,它本身存在错误或缺陷是由多方面原因造成的:
人类标注的固有局限与主观偏差
Ground Truth 通常由人工标注生成,而人类不可避免地会引入误差。 - 疲劳与失误:在高压或重复性工作下,标注员容易出现失误。例如在医疗影像诊断中,放射科医生可能会因为疲劳,导致结节标注位置出现偏差,或者漏标不明显的病灶。 - 认知局限与盲区:在复杂的逻辑推理或Agent任务中,人类标注员可能受限于自身的知识盲区,未能想到更优的创意解决方案,甚至标注出违反系统规则的错误答案。有案例显示,在某些复杂的测试集中,人类标注的错误率甚至可能高于AI模型。 - 主观理解差异:对于边界模糊的物体(如烟雾、液体),或者存在歧义的概念(如“汽车”是否包含“卡车”),不同标注员的理解往往存在差异,导致标准答案缺乏绝对的唯一性。
答案发生变化
很多 Ground Truth 在标注时是绝对正确的,但随着时间推移,现实世界发生了变化,导致原本的标准答案变成了“错误答案”。 尤其是很多产品文档 ,随着产品不断升级,标准答案也是要跟着变化的。
模型幻觉
当 LLM 被用来生成或辅助构建 Ground Truth 时,模型本身会有幻觉的特性也会导致答案本身是错误的。
数据污染
互联网上充斥着大量虚假、低质或虚构的内容。攻击者或商业灰产可以通过伪造数据、篡改内容标注等手段进行“数据投毒”,诱导AI将有误的信息判定为标准答案。 如【如何自定义智界R7的车机壁纸】这个问题,我们的案例中就是ground turth本身有错误,因为车机系统的升级,导致旧版答案过时了。于是解决办法就是修改标准答案。
【持续更新】know-engine评测问题与优化(bad case)
智界R7的超级桌面如何开启?——召回率低 相似度检索到的分段: BM25检索到的分段: LLMentor 原标准答案:
智界R7支持自定义壁纸设置,设置手机图片为车机壁纸的方法如下:
在车机侧打开华为分享,在手机侧通过华为手机的华为分享将图片发送至车机侧的图库中;
在中控屏进入设置 > 显示 > 壁纸,选择本地壁纸,在我的壁纸点击+,添加图库图片至车机壁纸。除自定义壁纸以外,智界R7还支持勾选多个壁纸后在桌面滑动切换展示、设置随时间交替而自动变化风景状态的时光壁纸等,快去试试吧。
最新标准答案:
车机壁纸的两种设置方式及具体操作步骤:
1. 设置车机自带图片为壁纸
默认壁纸:首次上车时,系统会自动匹配与车辆外观颜色一致的随车壁纸。
切换桌面模式:可通过“设置 > 显示 > 桌面”选择“壁纸桌面”,或在中控屏使用三指及以上捏合手势,在“3D桌面”与“壁纸桌面”间切换。
自定义与自动切换:在“自定义壁纸”中勾选“本地壁纸”(时光/推荐/图库壁纸)或“更多壁纸”(在线推荐/萌宠壁纸)。支持左右滑动手动切换,或开启“自动切换”功能,实现车辆上电时自动更换壁纸。
2. 设置手机图片为壁纸
传输图片:在车机端打开“华为分享”,通过手机将图片分享至车机图库。
应用壁纸:进入“设置 > 显示 > 桌面 > 自定义壁纸 > 本地壁纸”,在“我的壁纸”中添加刚才传输的图库图片即可设为壁纸。
优化后,答案正确率从0.59提升到0.83