大数跨境

Astra 非机器人验证 48 关全通,再见 reCAPTCHA!

Astra 非机器人验证 48 关全通,再见 reCAPTCHA! AI科技评论
2026-09-08
10
导读:GUI 已难拦机器,防线转向身份与权限校验。
GUI 已难拦机器,防线转向身份与权限校验。

作者丨郑佳美

编辑丨岑峰

一个 AI 刚刚在网页上证明了自己不是机器人。9 月 7 日,OpenAI Labs 成员 Sharif Shameem 展示 GPT-6 Astra 连续完成《I'm Not a Robot》全部 48 关。
从图片识别、文字判断,到拖拽、停车、视觉搜索及逻辑小游戏,Astra 通过看屏幕、操作键鼠并根据页面变化持续执行,最终获得“人类认证”。这一演示揭示的技术突破远超验证码本身:传统 CAPTCHA 依赖机器难以具备的陌生界面理解、空间关系判断及连续操作能力,而 Astra 已将视觉理解、GUI 定位、状态保持和动作控制连成稳定闭环。
随着现实网站的反自动化系统从图片挑战迁移至浏览器环境、服务端风险判断和行为链分析,Astra 究竟跨过了哪道防线?现代 CAPTCHA 还剩下哪些技术壁垒?以下将从两套系统的内部机制进行深入拆解。

01

从视觉模型到闭环控制的门槛

早期 CAPTCHA 近似于一次静态推理:模型识别图片输出答案即结束。而 Computer Use 的输入输出关系截然不同,模型产生的动作会反向改变下一次输入。从控制系统角度看,网页存在内部状态 state_t,截图仅为观测 obs_t。Astra 在执行动作 action_t 后,网页进入新状态 state_t+1,模型需结合当前画面与历史动作推断任务进度。
停车与节奏关卡极具代表性:当前画面无法反映前序操作逻辑,且环境在推理期间仍在变化。因此,GUI Agent 不仅要识别内容,还需维护隐含的状态估计,将已执行动作与新视觉反馈拼凑成连续世界。
这也是 GUI grounding 的核心意义。模型理解语义对象(如确认按钮),操作系统则需要具体坐标。ScreenSpot-Pro 测试显示,Astra 在无工具条件下达到 92.7%,优于 GPT-5.6 Sol 的 76.9%。但高分不代表长流程稳定,连续任务中一次错误可能导致后续计划建立在错误前提上。
长程 Computer Use 必须具备动作后的状态校验模块。若预期弹窗关闭而截图中仍存在,系统应判定失败并修正策略,否则单步误差将持续放大。
Astra 的速度提升具有显著技术意义。Computer Use 每步需经历环境获取、推理、生成及执行动作。数据显示,Astra 在 OSWorld 2.0 得分为 72.6%(GPT-5.6 Sol 为 65.7%),模拟任务耗时从 75 分钟降至 40 分钟。延迟下降不仅减少等待时间,更缓解了动态 GUI 的 state staleness 问题:推理越慢,动作作用于过期状态的概率越高。
更快的 perception-action loop 缩短了观测与执行的时间差,允许 Agent 高频检查结果。对动态界面而言,速度本身就是控制稳定性的一部分。综上,Astra 的能力变化在于将语义理解、空间 grounding、历史状态、动作执行和反馈校验接成闭环,恰好攻克了 CAPTCHA 原本利用的机器弱点。
需注意技术边界:公开视频未披露完整 harness 及是否严格限制为 pixel-only,因此 48/48 不能作为严谨的纯视觉 benchmark。Astra 在 ScreenSpot-Pro 和 OSWorld 上的正式成绩才是更具可比性的证据。

02

现代 CAPTCHA 已经不把答案当成完整证据

当视觉 Agent 能熟练操作动态页面,仅靠认知题保障安全已显脆弱。Google 和 Cloudflare 已将判断逻辑向浏览器和服务器内部迁移。reCAPTCHA v3 针对 login、register 等 action 请求 token,后端结合风险 score 决定处理策略。其机制基于交互上下文的 score,而非依赖一次性图片题的二元结果。
Cloudflare Turnstile 将前端测量与后端决策拆分更清晰。浏览器执行计算挑战、空间证明等轻量 JS challenge 生成 token,后端调用 Siteverify 验证。token 有效期 300 秒且仅限单次使用,即便 bot 完成 challenge,其他信号仍可能导致 token 无效。
安全架构已发生根本变化:图片 CAPTCHA 的证据是答案本身,而 Turnstile 的 token 是由挑战平台签发、需服务器二次确认的短期证明。修改前端 JS 或截获旧 token 均无法绕过验证。
防线进一步延伸至浏览器和网络层。Cloudflare Bot Management 暴露 JA3、JA4 等 TLS 握手特征,并结合 JS Detections 采集浏览器信号。系统能同时观测运行环境和网络特征,而视觉 Agent 仅能看到屏幕层面。这解释了为何 Astra 通关 48 关距离攻破现代反机器人系统仍有差距:服务器可观察 Agent 看不到的状态,如 TLS 客户端特征、JS 环境合规性、token 时效性及请求序列异常。
但这层防线也非永久稳定。若 Computer Use Agent 运行在完整 Chrome 环境中,将继承真实浏览器的协议和运行时特征,与简单自动化脚本不同。虽然目前 Selenium 等框架不支持生产 challenge,但随着 Agent 深入真实浏览器栈,单纯依赖指纹区分机器将愈发困难。
现代 bot detection 正进入更棘手阶段:认知信号失效,浏览器信号趋同,服务器只能将更多证据放入时间序列和业务上下文联合判断。

03

Agent 时代,Web 看的是机器身份和权限

未来大量机器访问本身就是合法流量。用户让 Agent 查询航班、处理 CRM 任务时,服务器面对的是机器,拦截反而破坏功能。传统 human/bot 二元分类已信息量不足。Cloudflare 上线的 Web Bot Auth 基于 HTTP Message Signatures,让 Agent 生成 Ed25519 密钥并对请求签名,通过公钥验证身份及内容完整性。
这与 CAPTCHA 有本质区别:CAPTCHA 依靠行为特征分类,而请求签名解决的是密码学认证,提供可验证的主体身份。视觉能力提升无法计算出有效的 Ed25519 签名。Web Bot Auth 还通过 created 和 expires 限制时间窗口,降低重放攻击价值,显示 Agent 身份基础设施尚在快速建设中。
机器身份仅是认证,授权是另一层问题。合理模型是用户委托有限权限给 Agent,主 Agent 调用子 Agent 时权限应继续收窄。技术上,这将推动 Web 安全从 bot classifier 转向可验证的委托链。服务器判断条件变为:Agent 身份有效、用户委托有效、token 未过期、资源在授权范围内且无异常风险。
这种结构与 CAPTCHA 差异巨大:CAPTCHA 试图证明机器不在场;Agent 时代的安全体系则承认机器在场,严格限定它是谁、代表谁、可以做什么。

04

CAPTCHA 的边界到了协议层

Astra 通关 48 关并未让 reCAPTCHA 或 Turnstile 一夜失效,但它削弱了 CAPTCHA 依赖的假设:视觉理解、空间判断和连续 GUI 操作足以阻挡机器。Computer Use 正在跨过这道门槛,形成更稳定的感知 - 行动闭环。
防御体系继续向后迁移:从视觉题到浏览器信号,再到服务端验证,最终走向 Agent 的密码学身份和细粒度授权。二十多年前,CAPTCHA 的问题是屏幕对面有没有人;当机器也能稳定使用屏幕后,Web 要解决的问题变成了:这台机器是谁,谁把权限交给了它,以及这一次请求究竟被允许做到哪里。
参考链接:https://x.com/sharifshameem/status/2096847916837314853
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8942
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读237.6k
粉丝0
内容8.9k