大数跨境

20 个小时,100 万美元,这个 AI 硬件爆火了!

20 个小时,100 万美元,这个 AI 硬件爆火了! GitHubDaily
2026-09-18
2

年初 OpenClaw 爆火时,一款手掌大小的桌面设备:Violoop,脱颖而出被称之为「硬件龙虾」。

两者均能让 Agent 自己看屏幕、动键鼠、跨软件干活,一个装在软件里,一个直接做成了硬件。

时隔五个月,偶然间我在一个知名的众筹平台 Kickstarter 上,再次看到了 Violoop 的身影。

它以一台全新的个人 Agent 桌面硬件形态,出现在大众面前,而且具备了自我进化能力。

就在前两天,它刚上线到 Kickstarter 平台,短短 20 个小时,众筹金额就突破了 100 万美元。

一天时间就收获了将近 2000 位支持者,平台上同类型 AI 硬件,要众筹 30 到 45 天才有这个数。

但最值得关注的,并不是众筹的金额多少,而是 Violoop 与行业主流的 Agent 实现方案不一样。

它选择了一套模拟人类交互的硬件方案,通过 HDMI 捕获电脑屏幕画面,再用 USB 模拟键鼠输入。

直接接进现有的 PC 就能用,无需修改操作系统,也不需要应用提供专门的接口。

下面按三块来拆,绕开 API 之后它拿到了什么数据,这些数据怎么变成一个人的 Agent,能力涨了权限怎么管。

绕开 API,直接从屏幕拿数据

行业里稳定的 Agent 自动化方案,大部分都是想要应用开放的 API,再逐个做接口适配。

但现实是大部分的工具,比如微信、抖音、淘宝等,根本不会开放 API 给 Agent 调用。

为此 Violoop 选择用硬件模拟人的交互方式,屏幕画面从 HDMI 读,键盘鼠标信号从 USB 发。

相当于电脑的第二位操作者,当人不在的时候,它可以在授权范围内,继续处理和完成任务。

一个任务从发起、中间判断、执行失败到人工修正,整个过程产生的数据,Violoop 都能拿到。

V3-gif1--ezgif.com-video-to-gif-converter

另外 Violoop 硬件自带 26 TOPS 的端侧算力,负责屏幕感知、记忆抽取和本地的个人化计算。

高复杂度的推理任务,则交给云端大模型,云端管通用能力的上限,端侧管沉淀专属经验。

在操作过程,产生的原始屏幕数据全部留在本地处理,所有权归使用者自己,数据安全隐私。

从记忆到本能,打造个人 Agent

硬件把画面采回来了,新问题也跟着来,怎么把原始画面流变成结构化的记忆,再完成可控的个人自进化。

注意这里 Violoop 说的自进化,和学术界那种递归模型自我改写有所不同。

它不在设备上动模型架构,只做面向真实工作的可控成长,链路分三层。

第一层是多模态长期记忆系统

在授权的前提下,设备从屏幕信息里抽取和工作相关的内容,构建一个图文混合的个人知识库。

系统不会把截图原样堆着,它内置了专用的记忆抽取与重整模型,会合并重复、淘汰过期,把项目、文件、人物、事件关联起来。

另外整个记忆库是开放的,但看到哪条记错了还可以自己动手纠正,不想留的也可以删除。

团队内部实测,系统只靠持续观测,就能理解一个项目的上线节点、进度和业务指标。

第二层是工作流记忆与技能沉淀

传统 RPA 工作流,通过固定元素 ID 实现自动化脚本,当界面稍微改一下就直接失效。

而 Violoop 是将可复用的经验以工作流记忆、技能和执行路径的形式保存下来。

比如信息从哪拿、几个软件之间怎么流转、冲突时怎么取舍、哪些节点必须人来确认。

下次遇到相似任务,系统不再从零规划,直接调用历史技能,再结合新任务的条件动态调整。

可以说这一层,决定了 Agent 从拥有信息,走到能实际替人干活。

image-20260918101606945

第三层是个人化后训练

只靠外部记忆检索,每次任务都得完整推理一遍,计算开销压不下来。

Violoop 采集真实的工作轨迹、操作步骤、任务结果和人工修正,拿去对模型做个人化后训练。

把这些反复验证过的慢思考推理逻辑,蒸馏成快速响应,让经验从外部记忆迁移进模型权重。

这里需要知道,Violoop 没有在端侧训练通用大模型,而是在模型之上搭了一层个人经验层。

主要目的是,从记录这个人做过什么,变成让模型能理解能懂这个人会怎么做。

三层打通之后,Violoop 便提出了一个叫法:人工直觉(Artificial Intuition)。

让 Agent 可以我们做一些前置任务,比如整理资料、起草内容等,做完之后再交给人工来审核。

image-20260918102545590

高风险操作,必须按一下实体键

当一个能操控键鼠、能访问屏幕的 Agent 出现,那操作权限的风险控制自然是绕不开的问题。

Violoop 的做法是在硬件里放了一颗独立的安全芯片,把授权执行模块和感知、推理模块分开。

当执行发送、删除、提交、支付这类高风险的操作时,会强制要求人在设备上按实体按键确认。

V3-gif4--ezgif.com-optimize

写在最后

硬件是这个产品落地的入口,但并不是它交付的能力重点,在我看来是个人化能力的积累起点。

但 Violoop 的护城河,和占有多少原始数据没关系,屏幕数据的所有权本来就归使用者自己。

而是其从记忆、工作流到个人化训练的整条链路,加上评价机制、执行框架和硬件权限架构。

往后通用大模型会越来越强,调用成本还会持续下降,所有团队都能拿到强大的基础模型使用。

一个真实的人沉淀下来的工作经验和决策反馈,是别人拿不走的,这才是独有的优质数据资产。

当 AI 可以跟随着我们持续成长时,届时最值钱的 就不是模型有多强,而是它跟了我们多久。

今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!

【声明】内容源于网络
0
0
GitHubDaily
专注于分享 GitHub 上知名的 Python、Java、Web、AI、数据分析等多个领域的优质学习资源、开源项目及开发者工具,为 GitHub 开发者提供优质编程资讯。
内容 1486
粉丝 0
GitHubDaily 专注于分享 GitHub 上知名的 Python、Java、Web、AI、数据分析等多个领域的优质学习资源、开源项目及开发者工具,为 GitHub 开发者提供优质编程资讯。
总阅读8.0k
粉丝0
内容1.5k