工具让 Agent 有行动能力,也让错误有了现实后果。
高风险工具不能只靠 prompt 约束。它们需要明确权限边界和确认机制,让 Agent 在执行前停下来,把影响说清楚。
什么是高风险工具
高风险工具包括:
- 删除或覆盖文件。
- 修改生产配置。
- 执行远程命令。
- 重启线上服务。
- 推送代码。
- 发送公开消息。
- 调用财务或账户相关 API。
共同点是:影响外部状态,且不一定容易撤销。
执行前必须说明
确认信息至少包括:
将执行什么动作:
影响哪些文件/服务/账户:
是否可回滚:
回滚方式:
不执行的后果:
需要用户确认的内容:
这让风险显式化。
默认只生成建议
高风险工具的默认模式应该是建议。
Agent 可以生成命令、说明步骤、列出风险,但不直接执行。只有用户明确确认后,才进入执行阶段。
执行后要记录
执行后记录:
- 时间。
- 工具。
- 输入摘要。
- 输出结果。
- 是否成功。
- 后续检查项。
如果失败,要进入失败分类表。
确认机制不是拖慢系统
确认机制的目的不是降低效率,而是保护不可逆边界。
个人助理最重要的能力之一,是知道什么时候不能替你做主。