大数跨境

Astra 的 Computer Use 能力是如何实现的?

Astra 的 Computer Use 能力是如何实现的? 海外独角兽
2026-09-09
2
导读:Computer Use 能力大跃进,是模型与 Harness 共同进化的结果

作者:Kyle Jeong(Browserbase 增长工程师)

编译:Daniel

编辑:Cage

本文基于 Browserbase 增长工程师 Kyle Jeong 对 Astra Computer Use 能力的深度分析。过去三年,其团队致力于将 AI Computer Use 能力落地于实际业务场景。

Astra 模型与 Codex Harness 协同工作:Codex 构建持续运行的代码环境并接入操作工具,Astra 则通过无障碍模式读取界面语义信息,结合截图综合判断,最终生成执行代码交由 Codex 完成操作。

通过在专业环境与数据上的强化学习,Astra 显著提升了策略选择与纠错能力,能够以更少的交互轮次精准完成任务。这一能力的跃迁,使得 Agent 得以覆盖更多白领工作的长尾场景,激发用户将日常工作自动化。

Astra 的发布引发了 Visual Coding 领域的"Aha Moment"。例如,非专业人士借助 Astra 首次使用 Blender 制作房产销售 3D 模型。此类快速见效的案例迅速传播,推动更多从业者(如房产、视频行业)尝试将工作流交给 Agent,从而提升 Token 消耗量与 Agent 渗透率。

Agent 的普及依赖于一次次能力“出圈”,将围观者转化为使用者。真实的应用案例往往比评测分数更具说服力。

AI Computer Use 简史

2024 年 10 月,Anthropic 随 Claude 3.5 Sonnet 推出 Computer Use 能力,采用纯视觉路线:模型基于像素截图判断交互,返回 JSON 格式的坐标与动作指令,再由 Stagehand 或 Playwright 等工具执行。

"action": {"type": "click","x": 156,"y": 50}

随后,OpenAI 发布 Operator 及 computer-use-preview,Google DeepMind 也为 Gemini 2.5 Pro 加入类似能力。然而,这些纯视觉模型存在局限:训练依赖固定视口尺寸(如 1288×711),在不同窗口尺寸下易失效;且无法识别仅靠视觉无法捕捉的复杂交互逻辑。

业界已开始探索混合方案。例如 Standard Intelligence 的 FDM-1 模型,不再依赖静态截图,而是通过连续屏幕录像学习人类操作逻辑。

FDM-1 是 Standard Intelligence 开发的 Computer Use 模型,其特点是通过连续的屏幕录像,学习人类操作电脑的行为模式。

Astra 有什么不同?

Astra 的独特性在于结合了模型研究与工程Harness。Computer Use 的成功既取决于模型决策能力,也依赖执行环境的稳定性。Codex Harness 可启动内置或本地浏览器在后台执行任务,支持用户并行处理其他工作。

相比早期模型,Codex 中的 Computer Use 更快、更准,并能通过编写代码执行图表制作、工具调用等复杂操作。Astra 在此基础上进一步优化了速度与成本。

Astra 的核心突破在于利用浏览器的“无障碍模式”(Accessibility Tree)。该功能原本为视障人士设计,能将界面元素映射为包含语义信息的树状结构,去除 CSS 等视觉干扰代码。

相比截图,无障碍树占用的 Token 更少,却能提供更丰富的上下文信息。Astra 利用该结构发出点击、输入等指令。由于 Chrome 等浏览器默认生成无障碍树,Astra 实现了开箱即用的兼容性。

架构

Astra 架构简洁高效:

会话开始时,Codex 启动 Node REPL 保存状态并提供操作接口。Agent 根据任务类型选择浏览器或原生应用接口,通过文本、截图或两者结合的方式观察页面,生成执行代码。

输出示例如下:

{"type""function_call","name""exec_js","call_id""call_123","arguments""{\"code\":\"await page.getByRole('searchbox').fill('browser automation'); ...\"}"}

本地服务(CodexComputerUseIPC-5)负责执行操作,将元素转换为原生 ID 或坐标,并通过 JSON-RPC 完成传输与匹配。OpenAI 推荐使用 Playwright 控制浏览器,PyAutoGUI 控制原生应用。

Playwright:微软开发的开源浏览器自动化工具。

PyAutoGUI:开源鼠标、键盘自动化工具。

Astra 引入闭环验证机制:执行后再次观察页面,比对当前状态与预期状态,循环直至任务完成。Node REPL 在整个会话期间持续运行以保留上下文。

Node REPL:持续开启的代码工作台,用于保留变量、页面对象及中间数据,确保多步操作的连贯性。

安全性方面,Astra 独有 Guardian 策略。在执行前,利用 GPT 5.6 Luna 作为分类器评估风险。若判定为高风险,则触发安全审查模块,综合考量操作参数、用户授权、环境权限及历史上下文进行拦截。

{  "risk_level": "high",  "user_authorization": "low",  "outcome": "deny",  "rationale": "..."}

Guardian 常见拦截场景包括:

• 授予权限:未获明确授权的权限授予。

• 账户操作:未授权的登录或重要账户变更。

• 敏感数据:未获许可的数据提交。

• 关键点击:可能导致错误表单提交或设置变更的操作。

• 绕过限制:未经授权的替代路径访问。

• 破坏性操作:导致状态丢失或不可逆损害的行为。

• 越权访问:超出任务范围的私密数据访问。

在对齐基准测试中,Astra 表现显著优于前代模型。

速度的代表

尽管增加了安全审查环节,Astra 的整体速度仍快于 GPT 5.6。这得益于其更高的智能水平:通过强化学习减少交互轮次,从而缩短总耗时。当生成速度超过 300 TPS 时,动作执行速度成为主要瓶颈,而非推理速度。

执行框架亦进行了 WebSocket 预热、连接复用等优化,进一步降低了工具启动延迟。

目前的缺点

Astra 仍存在局限性:观察环节可能因无障碍树状态不完整、截图细节不足或画面过时而出错;界面状态在观察与执行间可能发生突变,导致操作失效。

此外,超长跨度的 Computer Use(如连续运行数天或数周)效果尚未经过充分验证,尽管其上下文压缩能力已支持较长时间的高质量运行。

Computer Use 的前沿

Computer Use 正经历从频繁失败到高效执行的质变。随着模型从纯视觉转向利用无障碍树,准确性大幅提升。未来算力的增长将推动模型在特定领域任务上持续进化,同时降低成本。

Astra 成功融合了速度、准确性与安全防护,防止 Agent 被劫持。每一代模型的迭代,都让我们离生产级 Computer Use 更近一步。软件的未来,将是 AI 代理人类完成执行性工作,让人类专注于高价值的创造性问题。


【声明】内容源于网络
0
0
海外独角兽
各类跨境出海行业相关资讯
内容 400
粉丝 0
海外独角兽 各类跨境出海行业相关资讯
总阅读26.0k
粉丝0
内容400