本页原始导出仅包含标题。以下内容依据章节主题补充为工程实践指南;涉及具体项目参数时,请以实际代码与配置为准。
本章目标
让 Agent 知道能做什么、不能做什么,以及何时澄清、拒绝或升级给人工。
核心设计
- 能力边界具体可判定
- 拒绝后提供安全替代方案
- 高风险动作与信息请求分级
落地步骤
- 分别定义超范围、缺信息、无权限和高风险场景
- 拒绝文案简洁说明原因与下一步
- 用对抗提示和边界样本持续回归
常见风险
- 一律拒绝导致可用性过低
- 只写抽象的“遵守安全规范”
- 模型拒绝了文本回答却仍调用危险工具
验收标准
实现完成后,应能用可复现的测试或运行轨迹证明:主流程结果正确,异常路径能够安全终止或恢复,权限和敏感信息没有越界,并且关键延迟、成本与失败原因可以被观测。