RAG evaluation

解决中文分词不准确导致召回效果差的问题

我们虽然在ES中安装了IK分词器,但是并没有用上,所以导致中文分词是每个中文字单独作为一个分词了,就导致召回结果不好,明明相关的内容却召不回。 所以我们需要让IK分词器生效。 创建组件模板

TL;DR

我们虽然在ES中安装了IK分词器,但是并没有用上,所以导致中文分词是每个中文字单独作为一个分词了,就导致召回结果不好,明明相关的内容却召不回。 所以我们需要让IK分词器生效。 创建组件模板

我们虽然在ES中安装了IK分词器,但是并没有用上,所以导致中文分词是每个中文字单独作为一个分词了,就导致召回结果不好,明明相关的内容却召不回。 所以我们需要让IK分词器生效。

创建组件模板

PUT http

{


}

创建索引模板

PUT http

{


}

重建索引

DELETE http://127.0.0.1:9200/know-engine-vector

使用命令,或者代码重新创建一个新的索引。然后查看索引,可以看到text字段已经有analyzer和search_analyzer。

"text": {
 "type": "text",
 "fields": {
   "keyword": {
   "type": "keyword",
   "ignore_above": 256
   }
 },
 "analyzer": "ik_max_word",
 "search_analyzer": "ik_smart"
 }

在针对问题做查询,就能看到中文的分词了

版本提示

模型、框架与接口会持续变化。涉及版本号、参数与生产配置时,请在实践前对照对应官方文档。

LLMentor系统化学习大模型应用工程

内容来自个人课程知识库备份,并经过结构化整理。技术版本持续演进,生产使用前请结合官方文档验证。