RAG evaluation

【持续更新】know-engine评测问题与优化(bad case)

智界R7的超级桌面如何开启?——召回率低 相似度检索到的分段:

TL;DR

智界R7的超级桌面如何开启?——召回率低 相似度检索到的分段:

智界R7的超级桌面如何开启?——召回率低

相似度检索到的分段:

0

1

2

3

4

BM25检索到的分段:

0

1
您可以通过扫码方式连接华为手机与中控屏,开启超级桌面:
1.
2.
若您的手机系统为
3.
•中控屏未登录华为帐号:
!
•中控屏与手机登录为不同华为帐号:
!

2

3

4

5

6

7

8

9

重排后的结果:

0

1

2

3

4

这里面有几个点可以做优化: 1、"# 连接超级桌面\n方法" 这种分段没必要召回,因为他没有啥用。 2、通过bm25的召回中,存在部分分段中并不包含<超级桌面>相关字符。 3、融合、重排后,"? 方法\n● 您可以通过以下任一方式在中控屏打开手机应用..." 分段出现了2次。 第一个问题的解决方式是我们需要针对markdown的标题处理更加精细一些。

✅解决mineru不支持多级标题解析的问题。

因为我们之前讲过mineru他默认是不支持多级标题的,所以文档转换成markdown之后,就都会变成1级标题。 虽然官方给出过一个解决方案:https://github.com/opendatalab/MinerU/discussions/ LLMentor 第二个问题的解决方式是我们需要针对中文做更加友好的分词、以及解决因为问题重写导致的召回不准。

✅解决中文分词不准确导致召回效果差的问题

我们虽然在ES中安装了IK分词器,但是并没有用上,所以导致中文分词是每个中文字单独作为一个分词了,就导致召回结果不好,明明相关的内容却召不回。 所以我们需要让IK分词器生效。 创建组件模板 创建索引模板 LLMentor

✅解决问题重写导致的召回不准问题

一、问题背景 know-engine 在执行 RAG 之前,会先经过 KnowEngineQueryTransformer 对用户 Query 做 LLM 改写: 二、问题表现 LLM 给出干净的改写结果后,代码额外拼接了"用户Id + LLMentor 第三个问题,其实是融合这里的问题,看上去是langchain4j的bug。解决思路:

✅解决RRF融合乱序和结果重复的问题

know-engine 采用多路召回 + RRF(Reciprocal Rank Fusion,倒数排序融合)+ Re-rank 的检索架构: 直接复用 langchain4j 自带的 dev.langchain4j.rag.cont LLMentor 前面几个优化做完之后,我们的召回率有了大大的提升,从0.09提升到了0.73! | | user_input | Context Precision | Context Recall | Answer Relevancy | Faithfulness | Answer Correctness | | --- | --- | --- | --- | --- | --- | --- | | 优化前 | 智界R7的超级桌面如何开启? | 1 | 0.09090909090909091 | 0.9465252571812449 | 0.6666666666666666 | 0.30422004352878906 | | 优化后 | 智界R7的超级桌面如何开启? | 0.5 | 0.7272727272727273 | 0.9465252571812449 | 0.7916666666666666 | 0.6122173434752715 |

智界R7的超级桌面如何开启?——上下文准确率低

上面的优化在把召回率提升之后,我们进行了新一轮的评测,发现召回率升高了,但是同时,准确率降低了,从1直接降到了0.5。 因为上下文准确率降低了,我们第一时间肯定是想去看下RAG系统召回+重排之后的参考资料是不是有问题。得到的内容如下:

[


]

这里面也有2个问题: - 1、rankingScore分数高的,并没有排在前面。 - 2、得到的结果中,有的rankingScore很低,比如-1.03 上面这两个问题都会影响召回准确率。所以我们需要优化。 第一个问题,是因为我们的代码bug导致的乱序:

✅解决引用信息补全导致参考资料乱序问题

在ProgressAwareContentAggregator中,我们做了RAG中引用材料的持久化,我们有以下代码: 但是,这么做引入了一个bug。 ProgressAwareContentAggregator#aggregate 在 R LLMentor 这个做完之后,我们的召回准确率可以从0.5大概提升到0.8左右。 第二个问题,其实是因为我们针对召回后的结果只做了top k的精排,但是没有限制分数导致的。

✅通过 minScore 解决召回准确率低的问题

现象 部分 Query 即便经过查询改写、混合检索(KNN + 全文)、BGE-RERANKER 重排序,仍会把语义相关度极低的分片喂给 LLM。不仅可能出现错误回答,还会导致召回准确率降低。 比如我们在测试的时候发现,经过重排序后有分数小 LLMentor 经过以上这个优化后, 我们的准确率可以从0.8提升到0.9999999了。优化后的召回的内容如下:

[


]

前面几个优化做完之后,我们的召回率有了大大的提升,从0.09提升到了0.73!而且因为召回的内容更准确了,所以最终忠诚度指标也跟着提升了。 | | user_input | Context Precision | Context Recall | Answer Relevancy | Faithfulness | Answer Correctness | | --- | --- | --- | --- | --- | --- | --- | | 优化前 | 智界R7的超级桌面如何开启? | 1 | 0.09090909090909091 | 0.9465252571812449 | 0.6666666666666666 | 0.30422004352878906 | | 第一次优化后 | 智界R7的超级桌面如何开启? | 0.5 | 0.7272727272727273 | 0.9465252571812449 | 0.7916666666666666 | 0.6122173434752715 | | 第二次优化后 | 智界R7的超级桌面如何开启? | 1 | 0.7272727272727273 | 0.9465252571812449 | 0.9545454545454546 | 0.6440348297216255 |

如何自定义智界R7的车机壁纸?-答案正确率低、召回率低

user_input Context Precision Context Recall Answer Relevancy Faithfulness Answer Correctness
如何自定义智界R7的车机壁纸? 1 0.4 0.9999999999999997 0.8484848484848485 0.5942829955886114

主要问题: 1、召回率低 2、答案正确率低 我们分析下标准答案:

智界R7支持自定义壁纸设置,设置手机图片为车机壁纸的方法如下:
在车机侧打开华为分享,在手机侧通过华为手机的华为分享将图片发送至车机侧的图库中;
在中控屏进入设置 > 显示 > 壁纸,选择本地壁纸,在我的壁纸点击+,添加图库图片至车机壁纸。除自定义壁纸以外,智界R7还支持勾选多个壁纸后在桌面滑动切换展示、设置随时间交替而自动变化风景状态的时光壁纸等,快去试试吧。

而know-engine给出的答案:

您可以按照以下步骤自定义智界R7的车机壁纸,打造专属个性化驾驶界面:

---

### 🖼️ **设置本地车机图片为壁纸**

1. **进入设置菜单**
   在中控屏上打开「设置」→「显示」→「桌面」→「自定义壁纸」。

2. **选择壁纸来源**
   - **本地壁纸**:可从“时光壁纸”、“推荐壁纸”中选择,或点击“我的壁纸” → 点击「添加图库壁纸」,将您已有的图片上传至车机相册并设为壁纸。
   - **更多壁纸**:支持在线下载风格化壁纸(如萌宠、艺术风等),直接勾选喜欢的样式。

3. **切换与自动更新**
   - 在桌面上左右滑动即可手动切换壁纸。
   - 勾选「自动切换壁纸」后,车辆每次上电时会自动更换不同壁纸,营造灵动视觉体验。

4. **切换桌面模式(可选)**
   - 通过三指及以上捏合手势,可在「3D 桌面」与「壁纸桌面」之间自由切换。
   - 或在「设置 > 显示 > 桌面」中选择「壁纸桌面」以启用纯壁纸视效。

---

### 📱 **将手机图片设为车机壁纸(通过华为分享)**

1. **开启华为分享**
   在车机端打开「华为分享」功能(通常位于「设置」>「连接与共享」中)。

2. **从手机发送图片**
   在手机上使用华为分享功能,将想要的图片发送至车机的图库中(需确保手机与车机在同一网络下且蓝牙/无线连接正常)。

3. **在车机上设置为壁纸**
   返回车机「设置 > 显示 > 桌面 > 自定义壁纸」→ 进入「本地壁纸」→「我的壁纸」→ 添加刚传入的手机图片,即可设为当前壁纸。

> ✅ 提示:建议使用高清图片(建议分辨率≥1920×1080),以获得更清晰的显示效果。

---

### 🎨 其他显示设置建议

- **仪表显示屏主题**:进入「设置 > 显示 > 仪表」,可选择不同主题风格(如经典、运动、科技感等)。注意:当启用辅助驾驶时,仪表会自动切换为“场景”主题,下次启动后恢复原设定。
- **系统色调节**:在P挡状态下,进入「设置 > 显示 > 系统色」,可自定义界面整体色调并实时预览,点击「应用」即刻生效。
- **亮度调节**:拖动亮度条手动调节中控屏或仪表屏亮度;也可开启「自动」模式,实现随环境光智能调节。

---

### 🔇 屏幕保护说明

- 可在「设置 > 显示 > 屏幕保护」中开启氛围感背景,点击顶部时间区域进入屏幕保护模式。
- 支持左右滑动切换不同样式,点击图片退出。
- ❗当前不支持自定义屏幕保护图片内容。

---

### 🎵 小贴士:仪表屏歌词显示

若想在仪表屏查看音乐歌词,可前往「设置 > 显示 > 高级显示设置」,开启「仪表显示歌词」开关。目前仅部分音乐应用支持此功能。

---

![图片](https://example.com/zhijie-r7-wallpaper-setting.png)
*示意图:智界R7车机壁纸设置界面*

---

通过以上方式,您可轻松实现从“随车默认壁纸”到“个性手机图定制”的全链路个性化配置,让每一次出行都充满专属仪式感。

存在问题: 1、模型虚构了一段内容:【图片 示意图:智界R7车机壁纸设置界面】 2、标准答案给的路径是【设置 > 显示 > 壁纸】,而我们的know-engine给的路径是【「设置」→「显示」→「桌面」→「自定义壁纸」】 3、回答了一些无关内容,如【其他显示设置建议】、【屏幕保护说明】、【小贴士:仪表屏歌词显示】等。 其中第二个问题主要影响的是上下文召回率和准确率。第一个和第三个问题影响的是最终的准确率。 第一个和第三个问题的解决手段是,修改提示词:

✅通过优化系统提示词,提升答案正确性

我们在评测时发现,有些问题的回答的准确率比较低,经过分析发现有这么几个问题: 1、回答中有编造的内容,如编造了一段不存在的图片。明明参考文档中没有对应的图片,但是他非要给编造一个不存在的图片说是示意图。 2、回答中有一些和问题不太相关的内容 LLMentor 第二个问题的解决手段是,修改标准答案为:

车机壁纸的两种设置方式及具体操作步骤:

1. 设置车机自带图片为壁纸
默认壁纸:首次上车时,系统会自动匹配与车辆外观颜色一致的随车壁纸。
切换桌面模式:可通过“设置 > 显示 > 桌面”选择“壁纸桌面”,或在中控屏使用三指及以上捏合手势,在“3D桌面”与“壁纸桌面”间切换。
自定义与自动切换:在“自定义壁纸”中勾选“本地壁纸”(时光/推荐/图库壁纸)或“更多壁纸”(在线推荐/萌宠壁纸)。支持左右滑动手动切换,或开启“自动切换”功能,实现车辆上电时自动更换壁纸。
2. 设置手机图片为壁纸
传输图片:在车机端打开“华为分享”,通过手机将图片分享至车机图库。
应用壁纸:进入“设置 > 显示 > 桌面 > 自定义壁纸 > 本地壁纸”,在“我的壁纸”中添加刚才传输的图库图片即可设为壁纸。
user_input Context Precision Context Recall Answer Relevancy Faithfulness Answer Correctness
如何自定义智界R7的车机壁纸? 1 0.4 0.9999999999999997 0.8484848484848485 0.5942829955886114
如何自定义智界R7的车机壁纸? 1 1 0.7917238357638827 1 0.8357999211521174

智界R7有内置ETC吗?如何开通?

user_input Context Precision Context Recall Answer Relevancy Faithfulness Answer Correctness
智界R7有内置ETC吗?如何开通? 1 0.3333333333333333 0.9691957858917203 0.8 0.3200355630339269

这个问题其实和上面的一样,也是Context Recall和Answer Correctness低,并且原因也基本一样,主要是ground truth有问题。 测评集中的标准答案是:

智界专属内置ETC,原厂车规级品质,跟随整车质保,内置美观,不怕断电,全国高速费95折,无押金,先通行后扣费。
开通方式:
场景1:车主本人购买 - 手机端激活
点击“服务”版块 > 进入“ETC服务”
点击“立即激活”
点击“个人客车办理ETC”
依次完善个人信息 > 提交审核
打开汽车中控屏 > “设置” > “连接” > 打开“ETC”
审核成功后,打开手机蓝牙 > 选择设备
激活成功,ETC可正常使用
场景2:车主授权他人购买 - 车机端激活通过汽车中控屏 > 设置 > 连接 > ETC,扫码激活内置ETC

但是实际有错误,通过翻看原始文档,发现操作路径变成了:【设置 > 连接 > 互联与服务”,打开 ETC 开关】 并且上面的"标准答案"中的内容如车主本人购买、车主授权他人购买等信息在文档中都没有。(这个答案我是从 答车主问 中清洗出来的,看来官方给的回答和文档并不一致) 这种情况,要么是文档旧了,要么是标准答案旧了,要么是两者都不旧,只是有些额外信息在文档中并未包含。 - 文档旧了——>更新文档 - 标准答案旧了——>更新测评集 - 知识库不全——>补充知识库 前面两种情况不说了,第三种情况,则是可以直接把确认标准的Q&A对,作为一个分段,直接存储到向量库中,作为知识补充。

智界R7的行车记录仪视频如何查看和导出?-上下文召回率低

user_input Context Precision Context Recall Answer Relevancy Faithfulness Answer Correctness
智界R7的行车记录仪视频如何查看和导出? 1 0.6666666666666666 0.9580134584610547 0.7428571428571429 0.6886863726761393

上下文召回率低,主要原因和上面的类似,官方给的答案中,为了装逼,提及了一个"选择视频或照片通过华为分享发送至手机。" 但是在用户手册中,根本从头到尾就没提过这玩意,原文: 经过我实测,发现就是因为标准答案中这个华为分享,影响了召回率,因为上下文召回率是通过拆解标准答案的声明,去参考资料中逐一比对。所以因为这个在参考资料中并未提及,所以影响了召回率。把参考答案中的华为分享删除后。得分如下: | user_input | Context Precision | Context Recall | Answer Relevancy | Faithfulness | Answer Correctness | | --- | --- | --- | --- | --- | --- | | 智界R7的行车记录仪视频如何查看和导出? | 1 | 0.6666666666666666 | 0.9580134584610547 | 0.7428571428571429 | 0.6886863726761393 | | 智界R7的行车记录仪视频如何查看和导出? | 1 | 1 | 0.9580134584610547 | 0.7714285714285715 | 0.7117057824747823 |

智界R7的行车记录仪视频支持直接发到手机上吗?还是必须得拔卡用电脑读?-忠诚度低

user_input Context Precision Context Recall Answer Relevancy Faithfulness Answer Correctness
智界R7的行车记录仪视频支持直接发到手机上吗?还是必须得拔卡用电脑读? 1 1 0.9580134584610547 0.5833333333333334 0.5402137883374264

忠诚度低,不到0.6分。

✅通过换模型解决忠诚度低的问题

我们的问题:智界R7那个行车记录仪拍的视频,平时怎么调出来看啊?想导出来又该咋整? 在评测时发现忠诚度比较低,才0.6都不到,于是我们开始分析回答的结果和参考资料之间的关系。 以下是一次回答结果: 这里面最大的问题就是幻觉的问题,比如以下 LLMentor | user_input | Context Precision | Context Recall | Answer Relevancy | Faithfulness | Answer Correctness | | --- | --- | --- | --- | --- | --- | | 智界R7的行车记录仪视频支持直接发到手机上吗?还是必须得拔卡用电脑读? | 1 | 1 | 0.9580134584610547 | 0.5833333333333334 | 0.5402137883374264 | | 智界R7的行车记录仪视频支持直接发到手机上吗?还是必须得拔卡用电脑读? | 1 | 1 | 0.9580134584610547 | 1 | 0.5402137883374264 |

怎么给小艺改名字?

我们的这个问题【怎么给小艺改名字?】,在评测的时候,发现所有分数都很低,包括上下文召回率、上下文准确率、回答相关性、忠诚度、以及答案正确性。 | user_input | Context Precision | Context Recall | Answer Relevancy | Faithfulness | Answer Correctness | | --- | --- | --- | --- | --- | --- | | 怎么给小艺改名字 | 0 | 0 | 0.5615605965753317 | 0 | 0.21025367567933007 |

我们评测时,know-engine的回答是:

小艺是车辆的智能语音助手,目前**无法直接更改其名字**。小艺的名字由系统固定,用户不能自定义修改。

不过,您可以通过以下方式与小艺互动,提升使用体验:

- **唤醒小艺**:说出“小艺”或“你好,小艺”即可唤醒。
- **设置语音提示音**:在“设置 > 声音 > 功能设置 > 提示音”中,可调整小艺的语音风格和音量。
- **个性化指令**:您可以为小艺设置常用指令,比如“打开空调到24度”、“播放我喜欢的音乐”,让交互更自然高效。

> ⚠️ 注意:小艺作为系统级语音助手,其名称不可更改,这是为了保证系统识别的统一性和稳定性。

如果您希望有更个性化的语音助手体验,可关注后续系统更新,未来可能支持自定义助手昵称功能。

我们给的参考答案是:

车载语音助手的默认唤醒词为“小艺小艺”,同时也支持给小艺“改名字”,方法如下:

在中控屏进入“设置 > 智慧助手 > 智慧语音 > 我的小艺”,点击“自定义唤醒词”。

设置自定义唤醒词后,仅可以通过自定义唤醒词唤醒。

这个问题的原因其实比较简单,也比较常见,那就是其实这个问题,我们的知识库中并没有包含。我们的文档中是没有任何关于小艺、改名字等说明的。 那么想要优化这个问题,有几个办法: 1、直接拒答

✅增加分层拒答能力,减少错误回答发生

一个优秀的RAG系统不仅要“答得准”,更要“知之为知之,不知为不知”。不能一本正经的胡说八道,如果是这样的话,那我和直接问豆包有啥区别? 尤其是一些专业领域、比如医疗、金融、法律等场景下,一旦回答错误,后果有可能不堪设想。 所以,在绝大多数 LLMentor 2、补充知识 这两个办法都比较常见,可以说第一个是兜底方案,第二个才是最终的解决方案。也就是说我们默认先拒答,然后再人工的识别这些拒答问题,补充更多的知识库进去。

版本提示

模型、框架与接口会持续变化。涉及版本号、参数与生产配置时,请在实践前对照对应官方文档。

LLMentor系统化学习大模型应用工程

内容来自个人课程知识库备份,并经过结构化整理。技术版本持续演进,生产使用前请结合官方文档验证。