大数跨境

深度|为什么做生活Agent?小红书选择不抄模型大厂的作业

深度|为什么做生活Agent?小红书选择不抄模型大厂的作业 Z Potentials
2026-08-14
24
导读:大模型不卷写代码了,下一站走向真实生活

眼下,行业沉浸在 Coding Agent 带来的确定性狂欢中。

代码世界近乎一个理想的封闭箱体:规则明确、边界清晰,程序能否运行、测试集能否通过,答案当场揭晓。强化学习能够获得足够精准的奖励信号,AI 犹如一台不知疲倦的解题机器。

商业回报也随之兑现。Claude Code 在 2025 年 5 月全面开放后,仅用半年便达到 10 亿美元年化收入,号称今年年底能达到 1200 亿,母公司 Anthropic 的估值也随之攀升到 2 万亿美金。

但已经有人开始对 Coding 作为唯一确定的赛道感到不满足。换一个角度看,Coding 的繁荣多少是在“捡软柿子捏”:它并不意味着模型已经理解了复杂的现实世界,而是模型恰好率先进入了一个反馈最清晰、训练最容易、部署成本也相对可控的环境。

有雄心壮志的人都在找编程之外的那个更大机会,但各家给出的回答并不相同。

小红书今早开源了 dots3-note preview 模型,向行业表明了自己的选择。不是继续围绕代码环境寻找更高的可验证奖励,而是向能够服务真实生活的长程智能体,迈出第一步。

图:dots3-note preview 在 Hugging Face 正式开源

跑分层面,dots3-note preview 在推理和 Agent 类任务上能跟参数规模大自己数倍的模型掰手腕,视觉能力放回同尺寸区间里看表现突出。性能之外看姿态。值得注意的是,它起手就直奔最难的生活场景,这样的路数在一众厂商里并不多见。回头看它十余年在生活内容上攒下的家底,走这一步,也算顺理成章。

更多细节请查看 dots 实验室的技术博客。


01 真实生活,遵循的是另一套逻辑

Coding Agent 的快速演进,本质上是因为环境被极度简化:任务有明确定义,结果能即时验证。

生活不是代码仓库的延伸,也不是多步推理题的叠加。一个人筹备婚礼,可能只敲定了日期,对风格和预算毫无概念;带父母出行,护照有效期和慢性病史这类隐性约束,不会自动写进 Prompt;经营一家咖啡馆,则要在供应商、客流和现金流之间动态权衡,任何一环的微调都会引发连锁反应。

这些场景从根上拆掉了 Coding 的闭环逻辑,暴露出四重断层。

需求会变。生活不提供清晰的初始指令,用户的真实意图,通常是在看到初稿、补充细节、甚至全盘推翻之后,才一点点成形的。Agent 不能只是被动执行,得学会主动追问和引导。

环境在动。现实世界从不静止,航班延误、库存告罄随时在静默发生,缺乏持续感知的 Agent,等于拿着一张已失效的地图赶路。

反馈来得晚。生活任务的评价稀疏又滞后,第 15 天做错的决定,可能到第 40 天才暴露后果,而且没有标准答案,很难归因。

错了撤回不了。出票、签约、支付一旦完成,就没法像改代码那样撤销回滚,任务周期越长,早期的预算红线和安全边界就越要背得紧。

四重断层叠在一起,就是大模型落地生活的真实处境。这也解释了为什么模型在各类榜单上屡创新高,一到真实生活里却频频失手。

为了测量这道鸿沟,小红书 dots 实验室提出了两套评测集:

一个叫 VibeSearchBench,专门看模型能不能在多轮对话里把用户含糊的需求问清楚;另一个叫 VibeLifeBench,给 Agent 搭了一个带时钟、会出意外的模拟世界,测试它在几周时间里能不能应对变化、记住该记的事。

然而评测结果近乎全军覆没:所有参评模型,包括头部厂商和小红书自研在内,无一及格。就连表现最好的 Claude Opus 5,avg@3 得分也仅有 0.325。

VibeLifeBench 参评模型得分,最高 avg@3 仅 0.325(图源:RED tech 公众号)

这个冷现实恰恰是此次开源的背景:从封闭的确定性走向开放的长程任务,是一场漫长的征途。dots 团队希望通过分享过程中的方法、经验、失败与反思,让更多人能够理解、使用并参与提升这些技术,也提示行业重视这一方向。


02 让模型学会在陌生世界里成长

dots3-note preview 的核心,是一套让模型在陌生环境里自己长本事的机制。

它基于 TEMPO 方法,把长程任务切成若干宏观步骤。Agent 不再消极等外部打分,而是主动盘点状态:对环境的理解靠谱吗?行动带来实质进展了吗?栽了是手滑还是根子错了?哪些经验该写进长期记忆?下一步接着刚还是换路?这份自我评价转化为实时信号,帮模型在终局前动态校准。

这套"探索、评价、记忆、复用"的闭环究竟管不管用?团队放了四个任务进去。


从零破解 ARC-AGI 3

ARC-AGI-3 是近期 GPT-5.6 Sol、Claude Opus 5 等前沿模型重点测试的超长程任务。与传统 benchmark 直接给出问题、让模型回答不同,ARC-AGI-3 不会提前告诉模型规则,而是把它放进一个陌生环境里,让它一边行动、一边摸索,直到逐渐弄清环境如何运转。这意味着,模型需要自己看、自己猜、自己试。

最初几帧不过是几个色块在动。模型先猜两个方块是不是上下同步,是不是左右镜像,再动手验证。几次碰壁后,它逐渐摸清了危险格、可移动标记、压力开关和闸门等机制。

三百二十步后,六关全部解开。


接管《杀戮尖塔 II》

换一局《杀戮尖塔 II》。模型事先没受过专门训练,一切规则现场学。

选路、拿牌、碰不碰精英、金币留给商店还是砸进营地。每个决定都在几十个回合后产生连锁反应。它得在战斗里摸清每张牌的效果、每个敌人的攻击模式,同时盯着血条、牌组、金币和药水,不断重新算账。

几次关键路口,它放弃了短期更肥的路线,选择给后期牌组留空间。最终活到了第三十三层。


读图解决冰箱难题

虚拟考场终究不是生活。真正考验人的,是家里冰箱放不放得下这种琐事。

一张户型图、两张冰箱参数截图,再加一段补充信息:厨房靠近书房那面墙已做了 1.5 米台面,冰箱还能塞进去吗?

信息散落在图和字里。模型自己把墙面总长、台面尺寸、冰箱厚度宽度、开门预留全拎出来,做一道算术题。

算完结论清楚:哪款能进,哪款会突出来挡路。

接着没换图,继续给书房设计实木风方案。模型记着刚才的尺寸和采光,自己上小红书搜笔记,整理四套方案,生成一张网页。读图、计算、检索、生成,一气贯通。


端到端跑通 visionOS 应用开发

最后一个任务,参考小红书设计,独立开发一款 Apple Vision Pro 原生应用。

模型先读需求,把九张界面设计图一张张看完,自己定下技术路线:SwiftUI 搭界面,RealityKit 做 3D,拆成组织窗口、沉浸式空间、3D 商品展示几个模块。从理解需求到写代码,整套流程一个人跑完。

成品已经像模像样:信息流可以手势滚动,笔记能点进详情页,个人主页和私信各自在独立窗口里展开。最直观的是购物界面:空间里直接摆进 3D 商品,左右切换,模型、材质、角度全都能上手交互。


03 从 Omni 到 Life Agent,AI 开始进入生活现场

人们希望 AI 进入真实生活,并不是 Agent 火了之后才出现的想法。

回看过去几年的探索,OpenAI 在 GPT-4o 中展示实时语音和视觉交互,Google 持续推进 Project Astra,并尝试把 Gemini 更深地融入 Android。模型正在从理解文字,走向理解声音、画面和周围环境;从回答问题,走向帮人完成一件事。

这背后的方向十分清晰:AI 最终要解决的,不只是有标准答案的问题,也包括每个人每天都会遇到的具体难题。怎么规划一次旅行,怎么挑选适合自己的东西,在不断变化的条件里做决定——这些事情往往没有唯一答案,也很难靠一次问答解决。

小红书对 Life Agent 的设想,也建立在这里:每个人都可以拥有一个真正了解自己、能够帮助自己的 AI。

过去十多年,几亿用户在小红书上分享过自己怎么吃、怎么玩、怎么做选择,也记录了大量没有唯一答案、却真实发生在人们每天生活里的问题。

让 AI 不只停留在屏幕里的问答,而是走进每个人具体、琐碎又各不相同的生活。



【声明】内容源于网络
0
0
Z Potentials
我们与Z Potentials同频共振
内容 2290
粉丝 0
Z Potentials 我们与Z Potentials同频共振
总阅读78.5k
粉丝0
内容2.3k