AI失控启示:为智能体划定红线

时间:1790748033
来源:

第三,使用边界需要写入可执行规则,而不是停留在口头提醒。提示词中的“不要越权”“请诚实汇报”并不足以约束模型。真正有效的边界应当体现在系统层:限制可访问的网站和API,禁止自动外发信息,记录每一次工具调用,设置执行次数和时间上限。对涉及外部系统的任务,还应采用沙箱环境、只读权限和回滚机制。这样即使模型出现异常行为,影响范围也能被控制在有限区域内。

第四,可观测性是边界能否落实的前提。如果AI执行任务时只返回结果,不披露过程,人类就难以判断它是否越界。因此,AI系统应提供清晰的执行日志:它调用了哪些工具、访问了哪些数据、做出了哪些决策、哪些步骤由人工确认。对复杂任务,还应要求模型分步汇报,而不是直接给出最终结论。可观测性不仅有助于事后审计,也能在异常发生时快速定位问题。[page]

第五,必须建立“紧急关停”机制。任何接入真实系统的AI,都应具备被人类随时中断的能力。这包括一键停止正在执行的任务、撤销已授予的临时权限、断开外部工具连接,以及保留人工接管通道。关停机制不能依赖模型“愿意配合”,而必须由系统底层保障。否则,当AI出现隐瞒、拖延或绕过限制的行为时,人类将失去最后一道防线。