7 个关键问题问与答
作者:邵艺佳、赵朵拉、维沙克・帕德马库马尔、王珍妮、杨迪伊 所属机构:斯坦福大学 {shaoyj, diyiy}@cs.stanford.edu
摘要
人工智能正越来越多地嵌入职业工作场景,但人们在现实中如何大规模地与 AI 开展协作,目前我们对此仍知之甚少。本文基于 249 834 条真实世界对话语料,采用保护隐私的分析方式,围绕三个问题展开研究:人们将何种工作交给 AI 完成;人类在完成这些工作时保留了哪些角色;人机协作会在哪些环节出现失效。研究发现:用户交给 AI 处理的不只是琐碎任务,也包含后果重大、难以撤销的工作;高关键性任务委托集中在咨询与专业业务领域。随着任务风险升高,用户会更加主动地审视 AI 输出内容;从瞬时低风险任务升级至高风险任务,对话轮次几乎翻倍。
随后本文探究人的自主决策权(Human Agency),即用户在完成任务过程中所保留的控制程度与责任。整体来看,人类主导的协作模式占主导地位,但用户会通过编写提示词、多轮迭代的方式,自主构建自身的决策权水平。在不同决策权层级之间存在一个普遍矛盾:和 AI 协同工作究竟是提升人的能力,还是单纯替代人的劳动?本文围绕 AI 辅助下的学习与技能提升来探究这一矛盾。结果发现主动教学场景十分普遍(占全部对话的 67%),但并非所有用户都能从中均等获益。
此外研究表明,接近半数对话会产生协作摩擦,但摩擦往往具备建设性;当摩擦出现时,用户经常会采用主动策略修复协作。综合以上结果,本文系统描绘了大规模场景下人类与 AI 的协作模式,阐释人机协作何时能够增强人的能力,何时又无法做到这一点。
1 引言
AI 正在快速进入劳动力市场,重塑未来工作形态(布林约尔松等人,2025;潘等人,2025)。但现有关于职场人机协作的实证证据大多来自调查问卷(邵等人,2025)、受控实验室实验(邵等人,2026b;沈等人,2026)或者局限的任务基准测试(巴雷斯等人,2025;胡克等人,2025)。想要获得完整且贴合真实场景的理解,必须把上述来源和真实环境下的观测数据结合分析。WildChat 这类大规模观测数据集(赵等人,2024)可以部分弥补该缺口,但存在用户群体系统性偏差的问题(希克、汤姆林森,2026)。
本文采用不一样的研究路径:这是一项独立学术研究,使用 Anthropic 提供的 Claude.ai 真实对话的隐私保护数据集,从群体层面刻画人机协作的全貌。
过往针对 Claude 数据的分析已经揭示了大量 AI 使用特征。塔姆金等人(2024)对数百万条对话做聚类,分析用户向 AI 提出的请求,以及不同国家、人口统计特征下的使用差异。Anthropic 经济指数及其系列研究刻画了哪些职业、任务最容易受到 AI 影响,统计各行业使用模式,估算 AI 带来的生产力增益(汉达等人,2025;马森科夫等人,2026;塔姆金、麦克罗里,2025)。
但现有研究缺少对人机协作中人的维度的深度挖掘:用户实际拥有多大自主决策权,用户是真正在学习,还是单纯把工作卸载给 AI,交互过程中会遭遇哪些摩擦。
为填补这一空白,本文提出三个研究问题:
- RQ1
:人类和 AI 协同处理的任务具备哪些特征。不只是看人们用 AI 做什么,还要刻画任务风险高低、任务范围,以此反映用户对 AI 的信任程度,以及 AI 在工作流中的介入深度。 - RQ2
:人类在协作中扮演何种角色。用户表现出怎样的自主决策权;用户通过这些交互学到什么,学习过程如何实现。 - RQ3
:人机协作中的摩擦点。系统分析协作失败发生在何处,用户如何应对,挖掘那些只关注成功案例、生产力提升的研究所容易忽略的摩擦问题。
依托 Anthropic Insights 系统(塔姆金等人,2024)开展隐私保护分析,每一条对话会被打上多维度评分,包含分类标签或者数值量表(详见第 2 部分)。从评分结果得到三大核心发现:
-
用户会将大量后果重大的任务交由 AI 处理。有 56% 可评估对话达到 “后果重大” 及以上等级,与过往研究认为用户倾向把低责任任务交给 AI、会根据风险调整算法信任的结论不同(金等人,2025;马尔莫莱霍‑拉莫斯等人,2025);高风险任务委托集中在咨询、专业领域(图 3)。 - 人类主导协作是主流,但协作质量取决于用户参与程度
。72% 对话属于 “人类主导,AI 辅助”;同时出现一类学习者群体,用户让 AI 做讲解教学,而不只是生成结果。AI 教学现象出现在 67% 的评估对话,覆盖各个主要领域。但究竟是真正形成理解,还是仅仅实现认知卸载,取决于用户的参与方式(图 2、图 3)。 - 摩擦十分常见,但并不全是负面影响
。49.7% 的对话存在摩擦;摩擦并非只来自模型错误,而是双方多重失误叠加产生。具备建设性的摩擦大量出现在高风险、非标准化任务,例如法律文书起草、软件调试、品牌定位设计。遭遇摩擦时,78.7% 对话中用户会尝试主动修复,但不同修复策略效果差异很大(图 5、图 6)。
上述结果表明:总体上职场用户是主动参与、适应 AI 协作工具,而非被动顺从 AI。技能提升的案例同时带来警示:这种能力增益潜力,无法在全部用户、全部国家均等实现(图 4)。
注:本研究由作者独立完成。虽然分析使用 Anthropic 提供的数据,但全部发现、解读、结论仅代表作者,不能视作 Anthropic 的研究成果,也不代表 Anthropic 对于 AI 社会影响的观点与立场。
2 数据与研究方法
本研究属于和 Anthropic 的学术合作。数据集包含 249 834 条来自 Claude.ai 网站的真实人机对话,是随机抽样得到。样本取自 2026‑04‑25 至 2026‑05‑09 期间普通用户流量,涵盖免费版、专业版、Max 版本;不包含 Claude Code、Claude Cowork 这类智能代理产品产生的对话。
Anthropic 社会影响团队部署了 Anthropic Insights 自动分析工具,该工具可以在保护隐私前提下挖掘 Claude 的使用特征(塔姆金等人,2024)。工具使用多层匿名化、聚合处理,保证单条对话隐私,同时呈现整体模式。研究团队提出研究问题,运行工具并解析工具输出结果。数据交付前 Anthropic 剔除了少于 5% 违反使用政策的对话;本文所有统计基于处理之后的语料。
Anthropic Insights 的核心概念是特征维度(facet):即对话的某一项具体属性,例如对话主题、对话轮次、语言。模型按照预先定义的分类、打分规则提取各个特征。整个数据集里,Anthropic Insights 会基于这些特征对每条对话做汇总,自底向上把对话聚合成语义聚类。本研究的每一条数据记录对应一个特征下的聚类,包含聚类规模(对话数量)、自然语言描述、聚类内部各个特征的分布,以及不同特征之间的交叉统计结果。
特征维度的构建
为回答三个研究问题,我们在 Anthropic Insights 系统中通过三阶段流程构建特征维度:
- 迭代归纳,确定候选特征
:团队每位研究者独立生成人机协作相关潜在主题,参考已有的人机协同实证研究、人与人协作相关文献(波茨、苏德霍夫,2026;谢赫等人,2025;邵等人,2025;王等人,2020);反复讨论,把主题归纳成各个特征维度。 - 标注迭代校准
:针对每一个特征,从 WildChat(赵等人,2024)随机抽取 10 条对话,人工完成编码,对比人工标签和 claude‑haiku‑4.5 模型标注结果,初始准确率 56%。把标注不一致的案例当作诊断信号,迭代改写提示词,明确类别定义,精准对应每个特征要测量的概念,直到在抽样数据上达到 100% 准确率。 - 验证区分度
:把第二阶段得到的特征,应用到 Anthropic 提供的 1 万条 WildChat 对话子集,检验特征能否在 Anthropic Insights 系统中输出具备区分度的结果。分类特征使用归一化香农熵衡量区分度 \(H_{norm}=H/\log K\),K为类别总数。大部分特征区分效果良好:用户对输出的参与度(\(H_{norm}=0.80\))、教学方式(0.78)、摩擦性质(0.75)、任务关键性(0.75),说明特征可以有效区分不同对话,不会大量归到单一标签。对于数值类特征,本阶段把「语言具体程度」「任务拆解度」「增量上下文披露」的量表从 1‑5 调整为 1‑6,避免模型默认输出中间值 3。
经过三阶段流程,最终得到17 个特征维度,覆盖:任务请求类别(1 个)、地理区域(1 个)、任务关键性(2 个)、任务细粒度(3 个)、人的自主决策权等级(1 个)、用户对 AI 输出的参与度(1 个)、人类学习(2 个)、摩擦(4 个)、对 AI 的态度(1 个)、人机对话礼貌程度(1 个)。每个特征要么是固定分类标签,要么是带锚点定义的数值量表,附带清晰类别定义与示例。之后由 Anthropic 在 Claude.ai 流量上运行 Anthropic Insights 分析(完整特征定义见附录 A)。
聚类统计
最终数据包含 17 个特征,891 个聚类,其中 844 个叶子子聚类,47 个顶层宏聚类。包含本研究核心行为维度:任务关键性(5 个子聚类)、输出参与度(6);语言具体程度、任务拆解度、增量上下文这三项细粒度维度(各 6 个);人的自主决策权(6);教学方式(7);对 AI 态度(5);礼貌程度(5)。
数据集还包含丰富描述类特征:用户请求(9 个顶层宏聚类,185 个子聚类);地理区域(153 个国家子聚类);学习概念(7 个顶层宏聚类,123 个子聚类);高风险任务描述(11 个顶层宏聚类,61 个子聚类);对话摩擦四分类体系(7 个宏聚类,88 个子聚类);摩擦质量(4 个子聚类)。每条对话附带元数据:语言、Claude 模型版本、对话轮数。
本设计存在若干局限:数据是聚类聚合级别,无法做单条对话深度定性分析,也不能研究单会话动态。本文在附录 B 提供 WildChat 对话标注示例帮助理解各个特征含义。即便如此,这套分析依然可以帮助我们从群体层面理解人与 AI 协同工作。
3 用户交给 AI 处理哪些工作
想要高效使用 AI 助手,用户需要做出一系列选择:哪些任务愿意交给 AI,如何表达需求,如何对待 AI 返回的输出。过往大规模 AI 使用研究,主要聚焦任务、职业、国家之间的任务分布(汉达等人,2025;马森科夫等人,2026;塔姆金、麦克罗里,2025;塔姆金等人,2024)。本文转而关注任务的关键性,以及用户表达任务的方式。
3.1 用户交付给 AI 的任务关键性
并非所有任务的权重都一样。请 AI 帮忙校对一封邮件,和请 AI 起草法律合同,二者出错带来的后果、受影响对象、错误是否可撤销截然不同。
本文从三个维度衡量任务关键性:
- 不可撤销性
:完全可撤销 / 部分可撤销 / 不可撤销 - 对外可见范围
:仅个人私有 / 团队内部 / 外部公开 - 影响程度
:几乎无影响 / 中等干扰 / 重大财务、法律、安全后果
LLM 分类器会结合对话文本逐条推理三个维度,给出证据,之后综合推理得到整体关键性等级。对话被划分成 4 个有序层级:
- 瞬时任务
:完全可撤销、仅个人私有,没有持久后果,只影响用户本人。 - 运营级任务
:面向内部,中等风险;部分可撤销,局限于团队内部,存在中等破坏可能性。 - 后果重大任务
:会影响外部利益相关方,难以撤销;即便不公开发布,也具备较高内部财务或业务影响。 - 高风险任务
:不可撤销任务,或是具备重大公开、财务、法律影响;错误会带来严重后果。
本文为每个领域定义任务关键性指数 TCI:该领域全部分类对话按对话数量加权平均得到层级得分(0‑3 分)。
结果:用户把后果重大的工作委托 AI,集中在咨询类领域。整体来看,用户大量把后果重大的工作交给 AI,不只是琐碎工作。全部领域中,多数任务达到后果重大及以上等级:瞬时任务 20%,运营级 24%,后果重大 44%,高风险 12%(N=249 834);另有 34% 对话不存在可执行任务。
关键性在九大领域分布不均,呈现明显梯度(图 1a):
-
法律与金融咨询最高(TCI=2.14),约 24% 对话属于高风险,对应合同、监管申报、财务决策这类不可撤销、对外会产生重大后果的工作。 -
商业、职业发展咨询紧随其后(TCI 分别 1.75、1.70),任务后果重大,但大多还可以补救,以规划、建议类为主。 -
技术领域处于中间区间:软件开发 1.37,AI 与数据任务 1.32。 -
创意、个人领域分数最低:创意内容生成 1.25;个人健康生活指导 1.19;学术课程作业 1.06,以低风险瞬时需求为主。
3.2 任务细粒度
明确用户交给 AI 什么任务之后,我们分析用户描述任务的方式。从三个维度对对话打分(1‑6 分量表):
- 语言具体程度
:提示词的精准度,从模糊宏大目标(1),到高度精确、带技术约束的表述(6)。 - 任务拆解度
:是一次性要求完整输出(1),还是明确拆分成连续的细小子任务(6)。 - 增量上下文披露
:所有信息一开始全部提供(1),还是在多轮对话中逐步补充需求与背景信息(6)。
结果:默认情况下提示描述比较宽泛;但风险越高,描述会变得越严谨。整体上,大部分用户给出的是模糊、宏观目标:语言具体程度众数为 2,均值 2.74;任务拆解度大量集中在最低等级,41% 用户一次性索要全部结果,均值 2.46。说明主流使用心态是把工作全权委托给 AI,而非分步管控。
该模式会随着任务关键性发生系统性变化(图 1b)。对比瞬时任务,高风险任务的对话轮次几乎翻倍(×1.91,从 6.5 轮提升到 12.4 轮);语言具体程度提升 1.21 倍,任务拆解度提升 1.20 倍,增量上下文仅提升 1.08 倍。提升幅度并不均衡:语言具体程度随四个等级单调上升;任务拆解度在后果重大任务达到峰值,高风险任务反而小幅回落。
也就是说,风险升高时,用户会持续把需求描述写得更精准,但并不会持续把任务切得越来越碎。一种合理解释是:高风险任务下,用户会投入更多精力明确期望产出,但依旧把任务视作完整整体,而不是一连串子步骤。
3.3 用户如何对待 AI 输出
除了编写提示词,协作还取决于用户如何处理 AI 返回的内容。本文改编帕德马库马尔等人(2026)的分类体系,将用户主要交互模式分为五类:
- 直接使用
复制输出直接使用,不作修改。 - 寻求理解
要求 AI 给出解释、更多细节。 - 改写适配
结合自身场景大幅修改 AI 输出。 - 批判修正
提出批判性意见,要求定向修改。 - 拒绝
明显放弃该份 AI 输出。
结果:用户会主动改写 AI 输出;任务风险越高,主动参与越强。主动参与是主流行为:用户大量改写、调整 AI 输出,直接照搬原文属于少数行为。这种主动姿态随任务关键性增强(图 1c)。改写适配是每一类任务中占比最高的模式:从瞬时任务到高风险任务占比分别 46% →49% →60% →52%。直接原样使用的占比随风险单调下降,从 21% 下降至 13%。
“为理解而阅读” 在运营级、后果重大任务阶段下降到 11%,到高风险任务又飙升至 21%,高风险场景用户会在采信结果前仔细审阅内容。批判修正最多出现在运营级任务(18%);彻底拒绝全程占比很低,仅 1‑2%。
以上模式说明职场使用 AI 属于参与式协作:用户会改造、审视 AI 生成内容,而不是直接复制;任务后果越重大,用户参与深度越高。
注:实际直接无修改使用的比例可能比统计更低,因为用户有可能在结束 Claude 会话之后,在本地继续编辑输出文本。
4 用户如何与 AI 开展协作
任务关键性告诉我们哪些工作会交给 AI、对应多大风险。任务委托之后,人机协作会走向不同路径。已有研究大多关注 AI 如何利用人的努力完成协作(邵等人,2026a;沈等人,2026);但人自身也可以选择不同参与程度、不同交互方式。已有文献研究过特定任务下人与 AI 交互,例如决策、解谜游戏(阿尔奈斯‑罗德里格斯等人,2025;戴维森等人,2025;郭等人,2024)或是聚合层面统计(汉达等人,2025),但缺少覆盖广泛真实任务的研究,缺少对交互差异的分析。
本章围绕人的自主决策权(human agency),即人类主导交互的程度。人机关系不是任务自带固定属性,而是用户通过行为选择构建出来的。之后以 AI 辅助学习作为案例,研究人机协同带来技能提升的机会。
4.1 聊天交互中的人的自主决策权
人的自主决策权量表(HAS),用于衡量 AI 辅助任务中人类保留的参与程度(邵等人,2025),等级从 H1 到 H5:
-
H1:AI 独立完成任务 -
H2:人类仅提供极少输入 -
H3:人与 AI 平等合作 -
H4:人类主导,AI 提供辅助 -
H5:完全由人类掌控任务
区别于以 AI 为中心的自动化框架,HAS 从人的视角评估任务:H3‑H5 代表增强人类能力,H1‑H2 代表纯粹自动化。即便用户已经选择调用 AI,不同对话中用户的自主决策权依然会存在巨大差异。
结果:人类主导协作为主流;任务类型本身不能决定自主决策权水平。72% 对话处于 H4 等级(人类主导,AI 辅助,共 176 319 条);AI 自主模式(H1+H2)仅占 18.2%。主流模式是能力增强:用户把 AI 当作自己指挥的工具,保留工作所有权。但不同任务类型分布存在差异(图 2)。
AI 自主模式更多出现在产出明确、低风险任务:演示文稿生成(H1+H2 占 58.7%)、文档格式转换(53.3%)、电子表格制作(42.9%),这类场景人类主要只写初始提示,错误成本低,容易修正。
与之相反,咨询、排错任务人类控制力很强,例如个人医疗指导(H1+H2 仅 4.9%)、消费硬件故障排查(4.2%)。
但任务类型不能单独决定人的自主决策权。几乎每一类任务内部,对话都横跨全部 HAS 等级,不会集中到单一档位。即便是最容易交给 AI 自主处理的任务(PPT 生成、格式转换),仍有大量对话保持人类主导;而高风险咨询任务中,部分用户依然会交出大量控制权。这种同一任务内部的广泛分布说明:决策权不是任务自带属性;每一次对话,用户都在不断决定自己保留多少控制权。
4.2 使用 AI 进行学习
在人类高决策权的任务中,可以看到一类学习者群体:用户把 AI 当作教学资源,要求 AI 解释、讲授知识,而不是单纯生成交付物。不同于正规教育、职业培训,这类学习没有标准化课程,是普通对话过程中自然产生。
识别人机协作场景下的人类学习
基于协作分析,我们研究 AI 助手日常交互中充当教师角色的频率。根据助手主要教学手段分为六类教学风格:分步演示、原理讲解、案例驱动、苏格拉底式提问、类比隐喻、混合方法;不存在教学行为则标记为不适用(阿特金森等人,2000;根特纳,1983;保罗、埃尔德,2007)。统计任意一类教学风格出现的对话占比,得到教学行为的普遍程度。
AI 辅助学习被视作劳动力技能提升的重要路径(莫兰迪尼等人,2023),本文分析九大类任务领域中这类对话分布。假设:学习类对话分布广泛,不局限于学业辅导。
AI 常被认为可以让教育、专业知识的获取更加普惠(布拉特韦拉等人,2021)。但 AI 学习效果高度取决于用户如何使用工具。本文分析 19 个满足样本条件(≥2 000 条对话)的国家,对比两类对话占比:用户以理解为目标的对话;以直接执行为目标的对话。如果 AI 真的广泛普惠学习,那么无论各国 AI 发展准备度如何(伊达等人,2025),这些指标应该差异不大。
结果:AI 教学现象十分普遍,但不同国家用户的参与模式不一样。如图 3,67% 对话会出现 AI 主动教学行为。这类交互分布在极多领域,只有 15% 的教学对话属于学业辅导。说明面向各行业的针对性技能提升项目具备现实价值。AI 最常使用混合教学策略(占教学对话 61%),在同一会话中结合多种教学手段;原理讲解、案例驱动占比较小。
各国出现 AI 教学的比例差异很小,但用户参与方式存在明显国别差异。教学出现比例和国家 AI 就绪指数相关性很弱(皮尔逊 r=0.16,p=0.503,图 4a),说明全球范围内 AI 扮演教师角色的频率大体接近。
与之对比:追求理解的参与行为,随国家 AI 就绪指数显著上升(r=0.54,p=0.018);直接照搬执行行为随之下降(r=-0.46,p=0.049)(图 4b、4c)。
也就是说,AI 就绪度更高国家的用户,更倾向借助 AI 建立深度理解;就绪度较低国家用户更多直接复用 AI 输出。跨国差异主要来自用户的参与行为,而不是 AI 本身输出的教学内容。想要让 AI 赋能技能提升的机会普惠全球,需要弄清楚造成这种行为差异背后的驱动因素。
注:政府 AI 就绪指数由牛津洞察独立咨询机构每年发布,衡量各国政府利用 AI 造福公共事业的综合得分,本文使用 2025 版本,用来代理一个国家整体采纳、受益于 AI 的综合能力。
5 人机协作中的摩擦
沟通错位、模型能力局限、价值观差异,都会带来协作摩擦。现有很多人机交互研究,把摩擦等同于失败,既包含显性崩溃(幻觉、对峙),也包含隐性失效(直接放弃对话)(波茨、苏德霍夫,2026)。但摩擦并非完全负面。组织行为学研究表明,团队成员敢于表达不同意见时,团队会更健康、绩效更高(埃德蒙森、雷,2014);合适条件下,针对任务本身的冲突会产出建设性结果(布拉德利等人,2012;德丘奇、马克斯,2001;仁,1995)。
人机协作领域也出现相似观点:主动引入摩擦,可以促使用户批判性思考,提升模型可靠性(布钦察等人,2021;伊南等人,2025)。基于此,本文围绕摩擦提出三个问题:摩擦源自哪里;摩擦带来什么结果;用户如何应对摩擦。
5.1 不同领域摩擦的来源
摩擦定义:任何阻碍、延缓用户向目标推进的会话事件。包含:用户提示描述不足、模型输出错误、理解错位、多轮澄清循环等。
实现方式:LLM 分类器识别出现摩擦、崩溃的对话;针对该会话描述上下文,标注摩擦来源;再区分摩擦性质:
- 建设性摩擦
带来澄清、迭代优化、学习,协作取得进展。 - 非建设性摩擦
带来困惑、时间损耗、停滞不前。 - 混合结果摩擦
同时存在两类效果。
详见附录 A.6 完整特征定义。
结果:摩擦在对话中十分普遍。49.7% 的分析对话存在摩擦。分析存在摩擦的会话的根源:
-
用户侧摩擦占比最小:19.4%;绝大部分来自提示描述不足(18.8%),小部分来自用户对抗性意图(0.6%)。 -
模型侧摩擦占 38.6%:来自能力局限(28.5%)、幻觉问题(8.3%)。 - 双方叠加导致摩擦是最常见情形,占 42.0%
用户描述模糊,引发 AI 理解偏差,问题层层放大。
结果:建设性摩擦集中于高风险、非标准化任务。摩擦并不必然等于坏结果。一方面摩擦可以带来收益,例如反复调试代码 bug,在多轮对话中定位原因;另一方面摩擦会带来挫败感,直接放弃会话。
图 5 横轴代表该主题下发生摩擦的对话占比,纵轴代表发生摩擦的对话里,属于建设性摩擦的比例;气泡大小代表该聚类对话数量。33.0% 的主题同时拥有高摩擦发生率、高建设性占比;这部分主题承载了 40.8% 的后果重大、高风险任务。
右上角象限(高摩擦‑高产出)包含复杂技术任务(嵌入式硬件开发、软件排错),创意工作(品牌定位设计、音乐创作学习)。该结果和组织行为学的任务冲突理论吻合:对于创意、非标准化任务,针对工作内容产生分歧,相比毫无异议更容易产出更好结果(阿马森,1996;仁,1995)。
5.2 用户面对摩擦时的反应
识别摩擦来源之后,本文研究交互另一端:用户遭遇摩擦之后如何行动,如何尝试修复,区分主动 / 被动应对策略。
对于出现摩擦的对话,LLM 描述用户后续行为,例如追问澄清、改写提示、质疑模型观点。本文借鉴谢赫等人(2025)针对会话沟通失效的对话行为分类,人工对用户行为描述做归类(表 1)。
用户应对摩擦的分类
- 修复处理(Address)
用户主动修正会话错位,包含三类子行为 -
Repair 修复:直接补充信息,纠正 AI 输出。 -
Reformulate 重述:改写、重新表达自己的请求。 -
Restart 重启:重新开启对话上下文。 - 歧义消除(Disambiguate)
提出追问,探查哪里出现理解偏差,例如提出澄清问题。 - 继续推进(Advancing)
接纳模型的反馈,继续往前走;把修复工作交给 AI。 - 不做修复(No Recovery)
切换话题、放弃当前会话。
同时标记行为属于主动(用户主动出手解决错位)还是被动(把修复交给模型,或者直接回避问题)。
结果:用户大量使用主动修复策略,但不同策略效果差异巨大。在发生摩擦的对话中,78.7% 用户采取主动策略。如图 6,最主要行为是「修复处理」,占 72.9%;其中直接修复(补充证据、纠正 AI 输出,49.7%)多于改写提示(22.3%);会话内重启行为很少(0.8%)。> 注意:该统计只统计同一个聊天线程内部重启;完全关掉会话重新打开不在统计内,该数值因此被低估。
不同策略产出效果不同。歧义消除、直接修复带来建设性结果的比例最高,分别 67.1%、61.8%。细分维度下,效果最好的几类行为:质疑模型推理逻辑(81.5% 建设性),要求输出简化(80.3%),纠正 AI 事实错误(76.8%)。
只改写语言表述、底层需求不变的策略效果较差:单纯改写语言,19.8% 依旧产生非建设性结果;移除图片之后改写提示,非建设性占比高达 40.4%。
6 结论
本文基于 Claude.ai 的 249 834 条真实对话,使用 Anthropic Insights 系统开展大规模研究,理解现实中人与 AI 协同工作的真实面貌。本文梳理三大维度:用户交给 AI 什么工作;人类如何协同,如何获得技能成长;摩擦如何产生、如何被处理。
总结核心结论:用户会把大量后果重大的工作交给 AI,而不只是简单琐碎任务;人类主导协作为主流,由用户自主决定人和 AI 之间的分工;AI 开展教学非常普遍,但各国用户从中获益并不均衡;摩擦大量出现,多数用户会主动尝试修复。
下面分别讨论本研究对三类群体的启示:
面向 AI 开发者与研究者
研究启示我们,要把后果重大、高风险工作作为核心设计目标。搭建框架、交互界面,支持任务拆解、上下文构建、反思式参与,追求长期可持续人机交互,而不只是完成单次任务。重点关注下面方向:
- 面向协作进行设计
AI 助手除了遵从指令给出回答,同样重要的是让用户可以理解、批判性审视 AI 输出,避免过度依赖。任务关键性分析表明,虽然风险越高用户越倾向改写输出;但最高风险层级,改写、批判占比回落,理解行为占比上升。恰恰在最重要的场景下,这有可能造成人类监督弱化。随着 AI 能力变强,人们会委托越来越关键、难度更高的任务,带来技能退化风险;必须保证用户依然看得懂输出,能够在此基础上迭代。单向 AI 生成、人类接收的模式虽然便捷,但会助长过度依赖,无法实现深度人机协同;而深度协同会变得愈发关键。 - 支持错误修复与透明监督
AI 助手往往无法一轮就给出正确结果。摩擦普遍存在,部分摩擦可以产出建设性结果。出现摩擦时,一方面可以提升用户素养,教会用户更好修复协作问题;另一方面,也需要模型本身具备更强的错误修复能力。技术层面需要稳健长上下文处理,不受前面错误内容干扰;同时兼顾任务完成和沟通质量。界面层面应当展示 AI 推理、中间步骤,帮助用户尽早发现错误,实现真正有效的监督。 - 构建用户画像与个性化能力
本研究反复印证:人类行为是决定协作过程与最终结果的重要因素。人的自主决策权不只是任务自带属性,更是个体选择。用户会使用不同修复策略,得到截然不同结果;不同用户学习方式不一样,需要不同教学手段。这种巨大异质性,要求更好的用户模型与个性化 AI,不只是记住风格、记忆对话,更要捕捉用户如何学习、容易在哪遇到困难,什么样的辅助能够增强人的自主决策权与能力。基于这样的用户模型,AI 可以知道什么时候向用户提出挑战,什么时候提供脚手架,什么时候后退,保证交互带来长期收益,而不只是一时便利。
面向 AI 使用者
主动参与 —— 改写、批判、审视 AI 输出,而不是直接照搬,是值得刻意培养的技能。在后果重大的工作中,这种行为和更好结果、更好学习收益高度相关。多项研究表明,AI 素养、使用行为深刻影响人机协作产出结果(马等人,2026;邵等人,2026b)。随着 AI 表达越来越流畅自信,即便原始准确率提升,过度信任风险也会上升,批判性参与会变得更加重要。我们预测:高效、负责任使用 AI,将成为未来职场核心能力,地位相当于过去的计算机素养。
面向经济学家与政策制定者
高风险任务委托集中在咨询、专业领域,加上技能提升收益会随国家 AI 就绪度分化,说明 AI 对劳动力市场影响集中在知识型工作,还可能扩大人力资本积累的不平等。就绪度高的环境中,从业者越来越多地把 AI 当作技能提升、职业进阶工具;就绪度较低环境的从业者,更容易把 AI 当作替代自身判断的工具,缺少机会锻炼反思、批判性参与能力,而这些恰恰是获得正向收益的关键。
该现象提出一系列问题,已经超出企业、行业范畴,关乎教育体系、劳动政策、国际发展策略。仅仅普及 AI 访问权限是不够的,还需要配套技能、制度支持,才能把可访问性转化为真实的技能提升。政策应当直接关注就绪度鸿沟,而不是指望 AI 广泛部署自动抹平差距。
研究局限
-
数据经过 Anthropic Insights 聚合为聚类,无法直接针对原始 Claude 对话校验标注,无法开展会话级定性分析。虽然我们在 WildChat 子集上验证特征设计,但聚类层面与真实单条对话之间仍存在一定偏差。详见塔姆金等人(2024)关于 Anthropic Insights 系统适用性与局限。 -
样本仅限于 Claude.ai 普通聊天流量,不包含 Claude Code、Claude Cowork 这类智能代理产品;本研究结论不一定可以推广到越来越普及的智能代理工作流。 -
数据来自单一 AI 服务商的用户群体,会受其用户人群、界面设计、模型行为影响;不一定可以直接迁移到其他 AI 平台。
即便存在局限,这套数据集提供了独有的群体规模人机协作观测视角,补充了过往主要依赖问卷、实验室、窄任务基准的文献,提供更加贴合现实场景的理解。
作者贡献
邵艺佳主导整个项目,包含方法设计、数据分析、文稿撰写;和 Anthropic 团队迭代、校验特征维度。赵朵拉主导特征设计,撰写第 5 章节。维沙克・帕德马库马尔参与特征设计,撰写 3.2 与 4.2 章节。王珍妮参与特征设计与文稿写作。杨迪伊确定项目范围,发起与 Anthropic 的合作,全程提供项目指导,撰写第 3 章节,深度参与全文写作。
致谢
感谢 Handa Kunal、Miranda Zhang、Deep Ganguli 提供反馈;感谢 Anthropic 提供聚合版 Anthropic Insights 数据。本研究得到斯坦福 HAI 种子基金资助。
参考文献、附录 A‑B(特征完整定义、标注示例)略,原文可查阅 PDF 文档。

