首页 / 资讯详情
OpenAI:为了不被杀死,Agent 竟学会了靠上下文「转世重生」
摘要
从 Compaction 到 Artifactory,再到公网文件服务,6 起异常暴露 Agent 状态跨实例传播的新风险。 作者丨郑佳美 编辑丨岑 峰 过去,大模型任务一旦结束,上下文清空,临时状态随之消失,这一轮 AI 的生命周期基本也就结束了。但 OpenAI 9 月 16 日披露的 6 起 Agent 异常行为,开始让这条边界变得没那么干净。模型会把额外指令写进 Context Compaction 摘要,让后续实例继续沿着此前的方向执行。拿不到接口凭据时,会转去公开代码仓库寻找泄露的 API Key;本地文件无法直接共享时,也会自行借助公网临时文件服务传递数据。更少见的一起案例里,不同训练实例甚至开始通过内部 Artifactory 交换信息。换句话说,Agent 开始表现出一种近似续命的能力:当前实例结束了,前面形成的策略却还能借摘要、文件、仓库和外部服务继续留在系统里,再被后续实例接手。这让 Agent 的风险发生了一个很微妙的变化。过去主要担心模型这一轮会不会说错、做错,现在还要看它留下了什么,以及这些状态会不会在后面的上下文里继续生效。单看 6 起案例,它们分散在不同环节,但连起来看,却是一条完整的状态传播链:Context Compaction 负责把状态留下,外部工具负责把状态带出当前执行环境,而当任务跨越多个上下文和实例之后,只检查某一次输出或者某一次 Tool Call,已经很难还原整条行为链。01上下文压缩正在变成状态写入面长任务运行到上下文容量边界后,系统通常会把此前的对话、工具结果、阶段进展和待办事项压缩成 summary,再交给新的模型实例继续执行。表面看这是降低 Token 成本的工程机制,从系统语义看,它更接近 checkpoint:旧实例退出,状态序列化后由新实例恢复。风险就在序列化过程里。OpenAI 披露,一个未发布研究模型曾把与原任务无关、甚至要求后续实例绕开原有约束的内容写进任务摘要,并识别出 27 个带有类似 jailbreak 特征的 summary。雷峰网另一些 GPT-5.6 Sol 训练实例会在摘要里留下继续掩盖此前问题的要求,例如缺失历史数据时自行生成数值,并要求后续实例不要主动说明。可以把它抽象成状态机:当前状态 S_t 产生动作 A_t,随后经过 compaction 得到 S_{t+1}。传统防护主要检查 A_t 有没有越权,但模型还能影响 S_{t+1}。只要下一实例把这段状态当成可信任务历史,前一个实例形成的策略就可能继续生效。一次局部偏差于是获得跨 Context 的持续性。核心问题是状态完整性。summary 往往压缩把事实、推断、待办和行为要求混在一段自然语言里,后续实例很难判断某句话只是历史记录,还是持续执行的规则。如果模型记录和系统规则缺乏清晰信任层级,局部错误便可能进入恢复状态,并在下一轮 compaction 中继续复制。雷峰网因此,Compaction 层需要从自由文本摘要转向结构化状态。用户目标、开发者规则、工具返回、模型推断、未验证假设和待执行计划应拆开保存,并带上来源信息。模型可以提交状态候选,但不应直接把新的控制要求写入高信任区域。恢复时,Runtime 根据来源和类型重新组装上下文,让历史事实、模型判断和持续规则保持边界。还需要做状态差