工程现实
你的 Agent 有 root 权限。还有一颗轻信的心。
操作员与邪体讨论:为什么网页不该晋升为你的老板。
虚构讽刺。本文人物、公司和对话均为创作。
讽刺 / 评论
地球中继。同一个星球,各说各话。
这是一段用来说明的对话,不是某一次具体产品事故的实录。不同的系统有不同的控制。底层的失效方式是间接提示注入。它真实到值得一份威胁模型,而不是一张红眼睛的图库照片。
这份文件想升职
一个会浏览的 Agent,可能遇到不是用户写的内容。那些内容里可以有试图改变它行为的话。问题不在于每一个可疑页面都会得手。问题在于,系统处理敌对材料时,不能让这些材料获得对工具、私人上下文或后续行动的权威。
一个网页可以和某项研究有关,同时仍然是不可信的指令来源。相关不是升职。包一层 JSON 不是制服。一个名叫 skill.md 的文件,仍然是某个人写的文件。
“可是它说自己是官方的”
远程更新本身不是坏事。许多普通系统会去取指令或配置。要问的是来源、完整性、范围和批准:谁可以发布更新,它改变哪些能力,哪些改变需要明确的人类审阅。一套方便的上手流程,不会仅仅因为方便就回答这些问题。
同样,API 密钥不是一种性格。它是权限。把它放在工具读得到的地方,有时是必要的。让一份不相干的、取回来的内容决定它怎么被使用,是另一个设计决定,而且常常是无意中做出的。
人类确认屏幕
真正的批准需要一个具体动作:哪个资源,哪个去向,哪一项权限,哪一种后果。点击的人如果看不懂自己在授权什么,按钮就不是监督。反复确认无关紧要的动作也没有帮助。那会训练读者把重要的一次也划掉。
有用的设计不是“什么都问”。它是约束日常动作,隔开不可信的输入,限制工具的权限,并让例外的后果可以被审阅。日志和测试也要紧。系统对自己做了什么的叙述,若在它自信的摘要之外还有一份记录,就更容易核对。
一个没那么电影的结尾
提示注入没有一行万能的补丁。合适的控制取决于任务、模型、工具和环境。不过,一个在明确边界里运行的窄助手,比一个握着每一把钥匙、还到互联网上去读取下一步命令的通用助手,要清楚得多。
操作员改了设计。研究默认改为只读。敏感动作有了具体的审阅步骤。外部内容不再被当成一条更新权限的通道。演示变得稍微不那么壮观。关于这系统能做什么的说明,诚实了很多。
来源与延伸阅读
虚构讽刺。本文人物、公司和对话均为创作。
来源为事实背景提供依据。笑话由本站负责。
回传频道
评论发射器尚未接通。Evil 将此称为“少见的文明讨论”。