Sonnet 3.7 发布后,大模型能力已不再是智能体发展的瓶颈。
“当前智能体产品已达 80 分水平,从 80 分迈向 90 分的关键,不再是大模型能力或工具链(Harness),而是上下文的质量。”
前网易副总裁汪源,在网易任职近 18 年,曾参与孵化云音乐、严选、网易数帆等核心产品。2024 年离职创立久痕科技,推出定位为“以个人数据为中心的通用办公助理”的产品 remio。
在 2026 奇点智能产品大会上,汪源指出智能体行业普遍忽视了一个底层关键问题——上下文。他认为,模型能力已非瓶颈,工具链也在快速完善,目前最薄弱且投入不足的环节,在于信息如何被高效采集、转化为模型可消费的格式以及实现精准检索。
演讲中展示的 PPT 即为 remio 产品的实测演示:利用该产品对大会模板进行批量风格迁移,仅需数分钟即可完成。

以下为汪源演讲实录:
智能体系统已是百万行代码级的复杂软件
智能体已演变为高度复杂的软件系统。以开源项目 OpenClaw(龙虾)为例,今年年初其源代码量已达 73 万行,其中 90% 由创始人 Peter 借助 AI 编程独立完成。此外,泄露的 Claude Code 源代码也超过 50 万行,且未包含测试与评估代码。
成熟的智能体软件代码量已达百万级,复杂度堪比多年积累的开源数据库。系统内部模块众多,涵盖输入输出、环境感知、推理规划、工具调用及安全评估控制等。
从宏观架构来看,智能体系统核心可拆解为三个层面:
- 上下文工程:决定大模型的输入质量;
- 大模型本身:决定基于输入产生的输出内容;
- Harness(驾驭工程):决定输出能否转化为实际业务结果,包括安全校验与工具执行。
三者职责明确:上下文决定输入,模型决定输出,Harness 决定最终结果。若缺乏相应工具或安全机制,即便模型生成正确指令也无法落地。
瓶颈正在发生转移,现在卡在上下文
智能体系统的瓶颈正经历显著转移。
2023 年,行业主要受限于模型能力。当时的 AutoGPT 虽获大量关注,但因模型能力不足几无可用性;早期 Cursor 也因模型限制表现不佳。在 AI 编程领域,Sonnet 3.7 是分水岭:此前 Agent 仅能辅助代码补全,此后才能真正承接完整需求并交付测试结果。
2025 年,随着 Anthropic 推出 MCP 和 Skill 规范,行业重点转向优化 Harness 层,解决工具调用标准化与场景执行说明书的问题。
然而当前,制约智能体表现的核心因素已转变为上下文质量。许多任务失败并非因为缺工具或模型弱,而是输入信息不全、格式不对或质量低下。目前行业投资在大模型和工具链上过度集中,而在上下文层面的投入严重不足,仅有少量 To B 公司在专注探索。
上下文是一个独立的系统和基础设施
从产品实践看,上下文建设面临两大典型案例:
一是自动化填表场景。用户需填写三页 Word 报名表,remio 在三分钟内自动提取并填充 90% 的信息。难点不在于编辑工具或模型能力,而在于如何精准获取并整合分散在系统中的个人数据。
二是资深用户的上下文管理。用户通过录音、浏览器插件、文档实时解析等方式,将所有工作资料汇聚至 remio 体系,形成完整的个人知识库,再按需调度给其他智能体处理。这表明,上下文本质上是一套独立的基础设施系统。

构建高质量的上下文基础设施需解决三大核心问题:
第一,解决“信息有没有”的问题
核心理念是实时记录用户接触的所有信息。单纯录屏(如 Rewind、Recall)效率低下,难以还原文档内容;仅靠录音则遗漏了占比重大的视觉信息。正确做法是多模态采集:浏览器插件抓取在线资料,本地文件实时索引解析,会议录音转写,以及 Notion、飞书等平台的数据同步。
第二,把信息转成大模型能稳定消费的输入
原始文件直接喂给模型往往效果不佳。例如,PPT 中的 WMF 矢量图格式解析困难,复杂布局转为 Markdown 后会丢失逻辑关系。为此,团队研发了KRL 语言,将页面布局转化为精简且高保真的表达形式,使初级模型也能准确理解。对于 Excel 等非规范表单,也需深度分析区块结构以避免问答错误。
第三,解决“怎么找得快、找得准”的问题
面对数十万份个人资料,简单的文件系统检索(如 grep)召回率仅为 70%,且需多次循环。而建立完善的向量化语义索引和倒排索引后,一次性召回率可超 90%。行业不应迷信“不建索引”的极简模式,办公场景必须依赖高质量索引。
新的时代需要新的内容格式
构建高保真、高效率的内容表达形态
Markdown 在 AI 时代表达能力受限。团队自研的KRL 语言(基于 JSON 特殊设计)兼具高 Token 效率、高可编辑性与高保真度。实测显示,KRL 保真度达 99.7%,用于内容理解时体积仅为原始的 1.2%,问答质量评分高达 9 分(Markdown 仅 3.5 分)。

在内容生产上,基于 KRL 生成和编辑 PPT 的速度比传统方案快 2-3 倍,成本降至 1/4。局部编辑与模板迁移亦更加流畅。
基于端侧智能算力的推理加速
海量数据处理应优先利用本地算力,既降低成本又保障隐私。策略上,利用低功耗 NPU 进行常态化预处理(如建索引、向量化),利用高性能 GPU 处理即时任务(如 OCR、版面分析)。
实测数据显示:端侧 GPU 使 OCR 速度提升 3 倍以上,版面分析提升 5 倍;本地语音转写速度提升近 40 倍;NPU 向量化计算提速近 20 倍。这使得会议纪要等场景的成本降至云端方案的 1/5,大幅提升了服务免费额度。

“毋在浮沙筑高台”。当前智能体系统底座尚不稳固,上下文基础设施是制约其表现的关键。未来需做到:信息全量留存、输入格式高质量转化(如 KRL)、摒弃简单检索建立专业索引、充分利用端侧算力。
Q&A 问答环节
提问:KRL 格式是否开源开放?
汪源:KRL 格式本身是开源开放的,文档简洁易懂,模型易于学习。但将该格式直接渲染生成 PPT 的功能属于产品核心能力,暂不开放。用户可通过命令行工具(CLI)接入使用。
提问:定义 KRL schema 的初衷是什么?如何保证迭代后的效果提升?
汪源:初衷是解决 Markdown 表达能力不足及直接解析原生文件格式 Bug 多的问题,旨在创造一种体积小、信息全、精度高的中间语言。关于效果保障,我们建立了严格的评测体系。例如 99.7% 的保真度数据,是通过数百个文档逐页像素对比得出的。在智能体开发中,评测代码的量往往超过功能代码,大部分精力都投入在确保质量的评测工作上。

