data-agent

data-agent的评测

本页原始导出仅包含标题。以下内容依据章节主题补充为工程实践指南;涉及具体项目参数时,请以实际代码与配置为准。

TL;DR

本页原始导出仅包含标题。以下内容依据章节主题补充为工程实践指南;涉及具体项目参数时,请以实际代码与配置为准。

本页原始导出仅包含标题。以下内容依据章节主题补充为工程实践指南;涉及具体项目参数时,请以实际代码与配置为准。

本章目标

建立一套可重复的数据智能体评测方法,分别衡量意图理解、Schema 选择、SQL 生成、执行结果与最终回答。

核心设计

  • 离线评测集覆盖正常、歧义、越权与无解问题
  • 链路指标拆分到每一个决策节点
  • 线上反馈回流为可复现的 bad case

落地步骤

  1. 为样本保存问题、上下文、期望 SQL、期望结果与权限身份
  2. 同时统计执行成功率、结果正确率、端到端答案正确率和延迟
  3. 版本化模型、提示词、Schema 与工具配置,确保结果可追溯

常见风险

  • 只判断 SQL 能否执行会掩盖语义错误
  • 评测集与真实业务分布不一致
  • 数据库数据变化导致 golden answer 漂移

验收标准

实现完成后,应能用可复现的测试或运行轨迹证明:主流程结果正确,异常路径能够安全终止或恢复,权限和敏感信息没有越界,并且关键延迟、成本与失败原因可以被观测。

版本提示

模型、框架与接口会持续变化。涉及版本号、参数与生产配置时,请在实践前对照对应官方文档。

LLMentor系统化学习大模型应用工程

内容来自个人课程知识库备份,并经过结构化整理。技术版本持续演进,生产使用前请结合官方文档验证。