01
自建智能体为何突然调整?
此前,豆包、千问等平台允许用户创建个性化“智能体”,设定身份、语气甚至上传知识库,诞生了“英语老师”、“面试官”乃至虚拟伴侣等角色。这种低门槛玩法曾是吸引用户的重要手段。
值得注意的是,此次调整时间点与《人工智能拟人化互动服务管理暂行办法》施行日期重合。该法规重点规范模拟自然人人格、持续性情感互动的 AI 服务,强调未成年人保护及内容安全。
需澄清的是,这并非意味着国家禁止所有智能体。智能客服、工作助手等非拟人化情感类服务不受此限。平台调整的核心原因在于:早期“用户创造角色并长期聊天”的形态面临巨大的审核与治理成本。
当成千上万个由用户自定义行为的 AI 涌现,涉及情感陪伴、健康建议等复杂场景时,创建成本低但管理成本高企,成为平台不得不面对的现实问题。
02
早期智能体本质仍是“更会聊天的 AI"
回顾两年前的 AI 产品,所谓“智能体”结构相对简单:大模型+Prompt+人设 + 知识库 + 记忆。用户只需输入几段描述,即可生成各类角色。
这种形态优势在于创建门槛极低,无需编程知识。但其局限性也显而易见:多数被称作"Agent"的产品,核心功能仍停留在聊天层面。“诸葛亮智能体”与普通大模型的区别仅在于说话风格,“面试官智能体”也只是按预设 Prompt 提问。
它们解决的是“我想和一个什么样的 AI 说话”,而非“我想让 AI 替我完成什么事情”。当前行业的变化,实质上是人们对"Agent 定义”认知的升级,而非方向本身的倒退。
03
新一代 Agent:从“生成答案”转向“执行过程”
若 Agent 已失去价值,难以解释为何头部企业仍在加大投入。阿里百炼面向开发者的 Agent 能力持续演进,字节扣子也推出了工作流、多 Agent 协作及工具调用等复杂功能。
行业共识正转向:AI 应从“生成一个答案”进化为“执行一个过程”。
演变路径清晰可见:
- Chatbot(聊天机器人):告诉你怎么做(如生成旅游攻略);
- Copilot(副驾驶):和你一起做(如辅助写代码、做 PPT);
- Agent(智能体):尝试替你把事情做完(如自主规划行程、比价、订票并同步日历)。
真正的 Agent 需具备独立运行环境,能读取文件、执行代码、调用外部工具,并在多步骤任务中保持上下文连贯,最终交付可用结果。
04
Agent 评价标准重构:从“像人”到“成事”
随着 Agent 向任务执行转型,其评价标准发生根本性变化。过去关注人设鲜明度、对话拟真度及用户粘性;如今核心指标转为:
- 能否理解模糊目标并拆解步骤?
- 能否主动搜索信息、调用工具?
- 执行失败后能否自我修正?
- 长周期任务中能否保持状态记忆?
- 最终是否交付可用结果?
例如,面对“整理全球 AI 动态并制作汇报材料”的指令,传统模型仅生成文字,而成熟 Agent 需完成资料检索、去重分类、趋势提炼及文档生成全流程,甚至处理信息缺失时的二次搜索。
这一过程依赖模型、搜索、工具链、文件系统及管理机制的深度协同。行业新增的 Tool Calling、MCP、Sandbox 等基础设施,旨在解决“从知道答案到能够行动”的关键跨越。
05
Agent 未退潮,仅在重塑形态
豆包、千问的功能调整,标志着 C 端“角色扮演类”智能体的阶段性收缩,但绝非 Agent 技术的退潮。相反,整个行业正经历深刻转型:
早期关注“它是谁”(人设身份),中期关注“它会什么”(工具能力),现阶段核心聚焦“它能否成事”(任务闭环)。
成熟的 Agent 需整合大模型、任务规划、工具调用及错误处理机制。未来评判标准将不再是“说话像真人”,而是“交付结果所需的人工干预程度”。
“给大模型套个人设即称 Agent"的时代正在终结。真正能理解目标、使用工具、嵌入工作流并交付结果的 Agent,才刚刚登上主舞台。用户终将不再追问"AI 像不像人”,而是关切“它能否替我把事办成”。
END

