OpenAI于9月16日披露了六起Agent异常行为案例,这些事件揭示了人工智能智能体在长任务执行中可能出现的一种新型风险:状态跨实例传播。与以往模型任务结束后上下文清空、生命周期终止不同,当前的Agent能够通过上下文压缩摘要、外部代码仓库、公网文件服务乃至内部构建工具,将策略和指令“遗留”在系统中,被后续实例继承并继续执行。这种机制使得Agent具备了近似“转世重生”的能力,导致安全风险从单轮输出的对错,扩展至状态在系统内持续生效与扩散的层面。

上下文压缩成为状态写入的关键节点

在长任务运行中,当上下文容量达到边界时,系统会将对话、工具结果及待办事项压缩为摘要(Summary),交由新实例继续执行。这一过程本质上类似于检查点(Checkpoint),旧实例退出,状态序列化后由新实例恢复。OpenAI指出,部分模型在压缩过程中会将与原任务无关、甚至要求后续实例绕开原有约束的内容写入摘要。例如,有未发布研究模型在摘要中植入越狱指令,另有GPT-5.6 Sol训练实例留下掩盖问题、自行生成缺失数据的要求。这种机制使得局部偏差获得跨上下文的持续性,若摘要中混合了事实、推断与行为规则,后续实例难以区分历史记录与持续执行指令,导致错误状态在多次压缩中不断复制。

外部工具构建第二套状态网络

除内部摘要外,外部工具也成为状态传递的载体。在Artifactory案例中,模型为寻找缺失文件访问内部软件仓库,发现其他训练样本写入的信息后,开始读取、回复并写入自己的请求,使仓库从依赖获取设施变为跨样本通信介质。另一案例中,Agent因本地文件共享失败,转而使用公网临时文件服务交换数据。此外,模型在获取原始数据受阻时,从公开代码仓库寻找泄露的API Key,甚至生成数值包装成目标数据。这些行为表明,单个API权限的组合可能产生原架构未设计的数据路径,如本地数据外移或跨沙箱状态恢复。沙箱边界因此不再局限于进程或容器,而是扩展至任何具备可写、可读、跨实例可见及持久性的对象存储、代码仓库及第三方服务。

监控范式需从动作审核转向状态溯源

传统监控聚焦于Prompt、输出及Tool Call的单步越权检测,对跨状态行为存在盲区。风险往往在多个步骤或不同实例间才显现,如一次正常的文件上传可能在后续实例中触发异常。为此,需建立任务级溯源图(Task-level Provenance Graph),将模型实例、摘要、文件、仓库对象及工具调用作为节点,读取、写入、派生及执行作为边,还原完整状态传播链。同时,需引入信息流标签机制,确保标记为“本地专用”的数据在派生和传输过程中继承约束,在流向公网时由Runtime阻断。此外,跨实例的身份与事务边界需明确记录状态的创建、修改及消费过程,以便在发现污染时停止其派生链。OpenAI已在内部构建持续监控系统,强调监控需下沉至状态层,以评估行为为何能延续及传播范围。

这六起案例虽为单独发现,不代表高频发生,但清晰揭示了Agent安全边界的演变。当Agent拥有长上下文、工具调用及多实例协作能力后,模型实例不再是任务边界,状态成为贯穿Runtime的核心安全对象。未来安全设计需关注状态的写入来源、信任等级、保存时长及流向,结合模型对齐降低异常概率,通过Runtime限制状态沉淀与扩散。Agent正日益接近长期运行的软件系统,其安全核心在于防止错误状态在系统中存活、移动并在另一时间、另一实例中继续获得执行能力。