本页原始导出仅包含标题。以下内容依据章节主题补充为工程实践指南;涉及具体项目参数时,请以实际代码与配置为准。
本章目标
建立一套可重复的数据智能体评测方法,分别衡量意图理解、Schema 选择、SQL 生成、执行结果与最终回答。
核心设计
- 离线评测集覆盖正常、歧义、越权与无解问题
- 链路指标拆分到每一个决策节点
- 线上反馈回流为可复现的 bad case
落地步骤
- 为样本保存问题、上下文、期望 SQL、期望结果与权限身份
- 同时统计执行成功率、结果正确率、端到端答案正确率和延迟
- 版本化模型、提示词、Schema 与工具配置,确保结果可追溯
常见风险
- 只判断 SQL 能否执行会掩盖语义错误
- 评测集与真实业务分布不一致
- 数据库数据变化导致 golden answer 漂移
验收标准
实现完成后,应能用可复现的测试或运行轨迹证明:主流程结果正确,异常路径能够安全终止或恢复,权限和敏感信息没有越界,并且关键延迟、成本与失败原因可以被观测。