首页 / 资讯详情
Astra 非机器人验证 48 关全通,再见 reCAPTCHA!
摘要
GUI 已难拦机器,防线转向身份与权限校验。 作者丨郑佳美 编辑丨岑 峰 一个 AI,刚刚在网页上证明了自己不是机器人。9 月 7 日,OpenAI Labs 成员 Sharif Shameem 展示 GPT-6 Astra 连续完成《I’m Not a Robot》全部 48 关。前面还是图片识别、文字判断这些熟悉的人机验证,后面很快变成拖拽、停车、视觉搜索、节奏控制和逻辑小游戏。Astra 一路看屏幕、操作鼠标键盘,再根据页面变化继续执行,直到拿到游戏给出的“人类认证”。这段演示碰到的技术问题,比验证码本身更大。CAPTCHA 过去依赖一种能力差:人能看懂陌生界面、判断空间关系并连续操作,机器很难做到。Astra 现在开始把视觉理解、GUI 定位、状态保持和动作控制连成稳定闭环,而现实网站的反自动化系统也早已从图片挑战迁移到浏览器环境、服务端风险判断和行为链。所以 , Astra 究竟跨过了哪一道防线,以及现代 CAPTCHA 还剩下哪些技术壁垒,就要从这两套系统的内部机制往下拆。01从视觉模型到闭环控制的门槛早期 CAPTCHA 可以近似成一次静态推理。模型看到图片,恢复字符或者识别目标,输出答案后任务结束。Computer Use 的输入和输出关系完全不同,因为模型产生的动作会反过来改变下一次输入。从控制系统的角度看,网页里存在一个内部状态 state_t,截图只是这个状态暴露出来的观测 obs_t。Astra 在第 t 步产生点击、拖拽或键盘动作 action_t 后,网页进入新的状态 state_t+1。模型随后看到新的截图,却无法直接读取浏览器内部完整状态,只能利用当前画面、此前画面和动作历史推断自己现在处在任务的哪个位置。雷峰网停车关卡很能说明这个问题。当前画面里能看到汽车,却看不到模型前几步为什么把汽车开到这里;节奏任务更麻烦,因为环境在模型推理期间仍然可能继续变化。GUI Agent 因而不是单纯识别屏幕内容,它还需要维护一个隐含的状态估计,把已经执行的动作和新的视觉反馈拼成连续世界。这也是 GUI grounding 的意义。模型内部理解的是确认按钮、目标车辆或某个图标这样的语义对象,操作系统需要的却是具体鼠标坐标。ScreenSpot-Pro 就是在测这层语义到空间的落地能力,Astra 在无工具条件下达到 92.7%,GPT-5.6 Sol 为 76.9%。雷峰网但 grounding 分数高,并不能直接推出长流程稳定。点击一次按钮时,一次定位错误只影响一个动作;连续任务里,一次错误会改变后面的环境。Agent 如果把取消点成确认,下一帧页面已经进入另一条状态分支,后续计划即便推理正确,也可能建立在错误前提上。所以长程 Computer Use 需要一个经常被忽略的模块:动作后的状态校验。模型执行操作以后,需要比较实际页面和预期页面是否一致。如果预期是弹窗关闭,新的截图里弹窗仍然存在,那么系统应当把这一步判为失败,重新定位或修改策略。没有这一层,单步误差会沿任务链持续放大。这里甚至可以解释 Astra 的速度提升为什么具有技术意义。Computer Use 每执行一步,通常要经历重新获取环境、模型推理、生成动作、执行动作,再读取结果。OpenAI 公布的数据里,Astra 在 OSWorld 2.0 得到