能否将一项工作从头到尾闭环完成,才是 Agent 落地的真正分水岭。若最后 10% 仍需人工接手,它便可能成为流程瓶颈,大幅削弱自动化带来的效率红利。
8 月 3 日,在新加坡 AGI Playground 2026 舞台上,四位面向企业提供 Agent 服务的创业者展开深度对谈:WIZ.AI 董事长兼联合创始人陆剑锋、Ateve 创始人兼 CEO Eileen Weng、易点天下 zMaticoo Demand VP Bill Cao,以及 Airwallex 空中云汇全球首席营收官吴恺。他们基于真实业务场景,探讨了 Agent 落地面临的具体难题。本次对谈由 Stealth Startup 创始人胡少阳客串主持。
四家公司切入场景各异:WIZ.AI 以语音 Agent 服务大型企业;Ateve 为 Agent 构建专用搜索引擎;易点天下利用 Agent 重构数字营销工作流;Airwallex 则致力于将 AI 接入全球支付与资金管理。
但他们的判断指向同一核心:Agent 的下一阶段,不再取决于其看起来有多聪明,关键在于能否在企业环境中持续、可靠且低成本地交付结果。
以下为对谈实录,经 Founder Park 编辑整理。
整理|朱俊熹
编辑|万户
⬆️关注 Founder Park,获取及时干货的创业分享
我们将通过「AI 产品市集」、内容报道、社群分发等方式,助力团队触达早期用户、获取真实反馈并建立关键连接。
如果您正在从事 AI 相关领域,欢迎与我们交流。
01
从财务到客服,
Agent 正在进入真实工作流
Founder Park:从各位的视角来看,Agent 领域发生的最重大变化是什么?
吴恺(Airwallex):作为 AI 原生的全球金融平台,我们帮助企业端到端管理支付、资金和支出。目前观察到两项关键趋势,并据此推出了两款产品。
首先是"T0",定位为创业者的 AI 财务总监。初创企业往往难以招募到优秀的财务负责人,而 T0 能协助处理记账、财务报告、税务申报、资金管理、企业信用卡及薪资发放等全套金融运营。我们期望在团队规模较小时,AI 财务总监能支持创始人将团队从一两人扩展至二三十人,并随公司成长深度嵌入财务工作流。
其次是"Agentic Commerce"。虽然目前体量尚小,但具备爆发潜力。为此我们推出了"Airi",一种面向消费者的 Agent 银行服务,支持消费者钱包及由 Agent 驱动的交易流程。
未来,当消费者通过 ChatGPT 或其他 AI 工具购物时,我们可以将支付方式嵌入其中,让 Agent 代表用户完成支付。起点是一键结账,未来可能进化为零键结账,完全由 Agent 操作(需用户事先授权)。
Bill Cao(易点天下):我从营销角度补充。我们为营销人员提供全栈解决方案,尤其聚焦中国出海的数字营销市场。程序化广告本质是硬核工程问题,需应对高并发、超低延迟及海量数据整合。我们正在用 Agent 改造整个营销工作流。
回顾六七年前的大数据时代,数字营销重度依赖数据,但缺乏统一接入点整合多渠道数据。约一年半前 AI 刚引入时,企业主要将其用于单项任务(如数据检索、格式化、分析或创意生成),功能分散且互不连接。
如今,我们将这些功能组合成一套 Agent 工作流。AI 贯穿从数据检索、分析到智能决策及结果优化的全流程。过去 12 到 18 个月,行业正朝着越来越复杂的端到端工作流演进。
Eileen Weng(Ateve):我们正在为 Agent 设计一款搜索引擎,目标是从底层为 AI 而非人类打造,因为两者存在根本区别。
首先是搜索频次。人类搜索通常是一次性的,而 Agent 搜索是迭代推理过程,会根据上一次查询结果生成下一个查询,因此极不稳定。
人类搜索易形成可识别的趋势,但 Agent 的查询常出现在中间推理或假设验证过程中,脱离具体任务后往往无意义。这改变了搜索优化目标:不再仅是匹配人与结果,而是判断检索信息能否帮助 AI 完成任务。
其次,Agent 的需求不同于人类。除了相关性和时效性,Agent 更需要结构化输出、低延迟、可控成本和高 Token 效率。基于此,Agent 搜索正从简单产品演变为持续运行的认知基础设施。
陆剑锋(WIZ.AI):我们为大型企业提供语音 Agent,主要用于客户服务和互动,客户遍布东南亚、拉美及全球其他地区。
今年以来,无论东南亚还是其他市场,语音 Agent 公司显著增多,得益于开源技术和大模型能力的提升。但做出 Demo 容易,打造企业级应用却很难。
对我们而言,首要问题是可靠性。可靠的对话意味着 AI Agent 能像熟悉业务的专家一样解决问题。效率和成本固然重要,但必须排在可靠性之后。
首先需控制响应时间:用户停止说话后,Agent 能否在两秒内开始回应(而非说完)?这对通过公共交换电话网或企业电话系统传输的语音流量至关重要,延迟过长会导致用户直接挂断。
企业还高度关注首次呼叫解决率。若 AI Agent 无法在客户满意度和问题解决率上与人工坐席竞争,多数企业不会采用。这也是我们今年初推出多 Agent 语音系统的原因——可靠性是第一优先级。
Founder Park:最近 OpenAI 推出了新的 GPT-live 语音实时模式,令人意外。它仅是 Demo 还是已具备实用性?语音会成为人与 Agent 交互的主要方式吗?
陆剑锋(WIZ.AI):我们也在与 OpenAI 合作测试。使用语音到语音模型做 Demo 不难,但我们为客户提供的是包含配套评测系统的完整方案。
切换模型时,我们会用真实对话进行测试:任务完成率、问题解决率及意图识别准确率如何?通过此类 A/B 测试,才能判断模型是否具备上线条件。
这个问题没有简单的“是”或“否”,取决于如何约束和驾驭整个 Agent,以及需要哪些辅助技术。可靠性归根结底是把事情做成。客户不关心用了哪种技术,只关心结果。
02
Agent 进入复杂业务,
需要不断进化的工程能力
Founder Park:机会越大,工程挑战也越大。Bill,你们的营销 Agent 要实现闭环,同时处理高流量和大量操作,这样的工作流是如何搭建的?
Bill Cao(易点天下):核心在于整合所有分散的工具和数据源,这是我们面临并解决的最大问题之一。
在易点天下,我们通过 MCP 对运营工作流中几乎所有工具和数据源进行了标准化。这使得 Facebook、Google、内部工具及数据看板等不同来源的数据能汇集一处,为 Agent 提供更丰富的上下文以辅助决策。
其次,Agentic 工作流存在成本,特别是 LLM 和 Token 成本。我们的解决方案是对所有 SOP 进行分类:需要深度推理的复杂场景使用高能力模型;高频、常规的场景(如数据检索和分析)则使用更便宜的模型,从而在智能决策与成本之间取得平衡,确保系统经济可持续。
Founder Park:能描绘一下未来营销人员与 Agent 团队协作的场景吗?
Bill Cao(易点天下):我设想,数字营销将演变成一个"Agent 对 Agent"的网络。
目前,每家公司的 Agent 工作流多在各自系统内部运行。但未来一两年,行业将逐步走向 Agent 间的直接互联。正如今天的程序化广告依赖 OpenRTB 等协议,未来部分交互可能不再需要僵化的固定协议,一家公司的 Agent 可直接与另一家公司的 Agent 沟通(例如 SSP 的 Agent 直接与 DSP 的 Agent 对话)。数字营销的转型将在此发生。
Founder Park:Eileen,你们在研究「自我进化」这一前沿方向,在产品中如何实现?
Eileen Weng(Ateve):自我进化可发生在 Agent 层、Harness 层或模型层。我们之所以研究它,是因为传统搜索优化方法并不适合 Agent。
Agent 发出的查询可能是中间步骤,也可能是为了验证抽象假设。在这个过程中,可能完全没有人的信号(如点击或直接反馈),只有最初的 Prompt 和最终的任务成败结果。
这种情况下,我们无法独立优化排序器、检索模型等组件,它们必须整体一起进化。搜索引擎也不能独立演化,必须与 Agent 共同演进。
Founder Park:基础模型的自我演化很可能是大公司的事情。对于产品创业公司,应从何时开始考虑 Harness 的自我演化?
Eileen Weng(Ateve):产品开发初期,需找到模型公司或大平台(如 Meta、Anthropic、OpenAI)不愿深入做的事情,并选择一个能持续深耕的领域。目前仍有许多困难且专业的工作是大模型公司无暇顾及的,尤其是具体行业的 Know-how。
例如,我们服务的医疗公司需要搜索论文而非通用问答,其需求与通用搜索截然不同。创业公司应深入此类垂直行业,填补大模型公司留下的空白。
03
Agent 自主权越大,
责任边界越要清楚
Founder Park:Agent 开始执行任务后,信任和权限成为关键。何时需要"human in the loop",何时"human on the loop"即可?吴恺,您的业务直接涉及资金,如何在 Agent 能力和权限间取得平衡?
吴恺(Airwallex):这是所有 Agent 公司都要面对的问题,对金融服务尤为关键。我们的方法基于两点。
第一,重要决策的控制权仍属于用户。对于不可逆操作(如发工资、向供应商转账),一旦资金转出便无法简单撤回,这类决策必须要求 Agent 获得人工授权(可批量提交审批,但控制权始终在用户手中)。
另一些决策是可撤销的。在这些场景中,我们尽量减少对人的打扰。例如 Agent 进行记账工作时,无需让人介入每一次添加分录的操作,否则工作流效率会大幅降低。
第二是可追溯性。Agent 执行的每项操作都应可追溯,用户能查看其做了什么、改了什么,并通过工具撤回。我们还在建立操作反馈闭环,让 Agent 从错误中学习,避免重犯。
消费者交易更为复杂。若 Agent 代表消费者购物,出现退款争议或欺诈时由谁负责?目前答案仍是用户,因为用户是持卡人和授权者。我们正与卡组织及其他支付提供商合作,研究 Agentic Commerce 场景中的拒付和授权争议处理机制。
Founder Park:未来,交易会不会主要通过对话完成?比如告诉 ChatGPT 向某人转账,它就能直接执行?
吴恺(Airwallex):技术上现已能很好地实现。在 Airwallex 网页应用中,用户可以告诉 Kai Agent 发起转账,它在后台创建转账,用户确认后款项即发出。
更有意思的问题是:究竟该给 Agent 多大自主权?是仅负责创建转账,还是收到指令后直接放款?我们对完全自主仍持谨慎态度,目前采取相对保守的方式:Agent 在后台创建转账,但执行前用户必须点击确认。
从技术上说,实现完全自主并不难,真正的问题是责任归属。
Founder Park:剑锋,你们面对的是实时语音对话。Agent 说出口的话无法撤回,怎样控制它的边界?
陆剑锋(WIZ.AI):智能的本质是解决问题。人类智能也会犯错,因此,信任来自你能多好地控制和减少错误。
AI 与人各有优势。例如,有些客户一小时需处理超百万通电话,AI 能稳定避免违规回应(无论是监管禁止的话术还是激怒客户的措辞)。这种一致性,AI 比人更容易做到。
但 AI 仍有薄弱点。我们需要设置护栏,阻止 Agent 回答职责范围外的问题。针对试图通过语音进行的 Prompt 越狱攻击,系统必须先识别并过滤,让 Agent 忽略这些指令。与普通人工工作流相比,AI 系统需要更多保护层。
我职业生涯前 15 年都在做网络安全,攻防是一场持续的较量。针对 AI 系统的威胁已经出现,但我们也不能为了所有假设中的威胁过度建设,否则防御机制会推高延迟和成本。
我们的做法是持续监控新威胁,针对真正出现的问题建立防御。信任因此包含两个层面:一是在现有方案中控制已知风险,二是在新威胁出现时开发新的应对技术。否则,整个业务都可能陷入危险。
04
做到什么程度,
企业才愿意把人的工作交给 Agent
Founder Park:对公司而言,怎样判断一个 Agent 真的有效?客户为什么会使用它?
吴恺(Airwallex):我会用一个 2×2 矩阵来理解 Agent 的成功:一个维度是执行能否形成闭环,另一个维度是智能是否构成瓶颈。
最理想的情况是执行能够闭环,同时智能是主要瓶颈。AI Coding 是最典型的例子,系统可完成整个执行闭环并交付代码,效果主要取决于智能水平。全世界都在寻找下一个像 AI Coding 一样有吸引力的用例,但目前仍在探索中。
第二类场景也是包括 Airwallex 在内的很多公司正在做的:智能并非瓶颈,但执行可以形成闭环。我称之为自动化。例如对账或代表客户完成财务操作,未必需要最前沿的智能,但 Agent 可以完成工作,把整个流程自动化。Agentic Commerce 往往属于这一类。
衡量这类 Agent 的关键,是它能不能端到端完成工作流。90% 和 100% 之间存在巨大差距。如果 Agent 能完成 100% 的流程,采用速度会快得多。Agent 化改造必须渗透到每一个环节。如果最后一公里仍然由人完成,这一步就可能成为整个流程的瓶颈,大幅降低自动化效率。
我还经常思考另一个问题:让 AI 关注那些过去被人忽略的决策,工作流真的会变得更好吗?比如,一个过去每月只复盘一次的决策,现在 AI 可以每天甚至每小时复盘,能否带来实际改善?
最后一类是执行无法闭环,同时智能又是瓶颈。在金融领域,很多操作都是如此,因为我们不希望 AI 对不可逆的操作做出确定性决策。这类产品通常被称为 AI 助手或 Copilot。人仍然要完成一部分步骤,AI 负责协助操作或思考。它们同样有价值,但不会像 AI Coding 那种闭环场景一样具有颠覆性。
Founder Park:Bill,你用什么指标判断客户成功?
Bill Cao(易点天下):行业变化太快,不同阶段对成功的定义也不一样,六个月后可能就会完全变化。
目前,我们的目标是构建一个从识别、诊断、执行到评估的完整闭环。现在的瓶颈是评估,因为必须考虑风险。我们虽然不是金融科技公司,但如果 Agent 超支了广告主的预算,同样会造成严重问题。
评估环节目前仍然需要人提供输入,为 Agent 补充上下文。所以,我现阶段对成功的定义,是从识别到评估形成完整闭环,同时把评估阶段所需的人工输入降到最低。
另一个维度是行业层面的价值。随着越来越多企业开始采用 Agent 和 Agentic 工作流,怎样推动我前面提到的"Agent 对 Agent"网络的形成,是整个行业需要面对的问题。我们希望把自己在 AI Agent 上的实践经验带给行业,成为这个方向的先行者——这也是我定义成功的一部分。
Eileen Weng(Ateve):我们服务很多 B 端企业客户,会通过几项标准判断一个 Agent 是否真正完成部署。
第一,Agent 是否在真实业务流程中运行,而不只是一个 Demo,必须在生产环境中解决真实问题。
第二,Agent 是否能访问真实数据,包括 CRM、邮件等内部系统,而不只是网上的公开信息,这样才能真正进入业务闭环。
第三,Agent 是否可靠到不需要有人盯着看?如果需要全程监控,就不算真正部署。
满足这些条件,才算真正部署。它的成本还必须低于所要替代的流程。Token 目前仍然昂贵,如果 Agent 比人工更贵,它在经济上就无法成立,也不可能规模化。
陆剑锋(WIZ.AI):我们的 AI Agent 以 100% 自动化为目标,通常采用 human on the loop,而不是 human in the loop。对客户成功的定义有两层。
第一层,是像人一样把事情做好。首先,AI 不能犯不可接受的错误。例如,在促销活动中,不能向客户作出公司没有授权的承诺。其次,它要取得与人工团队大致相同的结果。达到这条线,就意味着它能够像人一样完成工作。
第二层,是利用 AI 的能力把工作做得比人更好。但第一层是基础。如果 AI 连基本要求都达不到,即使拥有更先进的能力,企业客户也不会接受。
以外呼营销为例,一家银行可能希望向现有客户介绍另一款产品。客户会先安排五到十名人工坐席,我们测量他们的转化率,再让 AI Agent 在随机 A/B 测试中完成同样的任务,比较最终结果。
如果 AI 的结果不够好,我们会判断它的对话是否达到了人工团队的水平,以及怎样让它不只是像一个人,更像一名优秀的电话销售。对于先买后付的还款提醒,我们会比较 AI 与人工团队的最终回款率。
AI 目前还不能在所有场景中与人竞争,但已经能够处理大多数对话。下一步要问的是,AI 能不能做得更多?比如,它在提供服务时,能否从对话中提取客户洞察?运行一周之后,能不能告诉企业,某款产品或服务可能出了问题?
人工客服团队很难汇总这类洞察,尤其是过去大多数语音对话没有被数字化和分析。AI 可以在这件事上做得更好。不过,我们目前仍然专注于解决第一层的问题,这也是为什么 WIZ.AI 今年的关键词是「可靠性」。
05
模型变强、成本下降,
企业离 AI 原生还有多远
Founder Park:Agent 的未来让人期待,但为什么还有这么多企业没有真正用起来?瓶颈是 Token 成本、部署人才,还是企业很难转向 AI 原生?
吴恺(Airwallex):有两件事让我对未来保持根本性的兴奋。
第一,模型仍在不断进步。今天许多无法解决的问题,本质上仍然受限于模型智能。如果智能继续提高,很多当前无法完成的任务,就可能进入我前面提到的第一类,执行能够完全闭环。如果我们不再需要如此担心幻觉、越狱和类似风险,这件事就有可能发生。
第二,我相信 AI 会继续在企业内部扩散。Airwallex 自身也才刚刚开始采用许多 AI 能力。过去 12 个月,外界对 AI 的预期被拉得非常高,所有人都担心错过机会,希望快速投入。我们甚至要求公司每一名员工都使用 AI。
但很多技术和应用可能还没有准备好,应用层也存在过度投资。基础模型层面的持续投入有充分理由,因为智能还有很大的提升空间。
如果看未来 18 到 24 个月,我非常积极和乐观。但接下来三到六个月,很多公司会重新审视,自己的 AI 支出是否真的带来了预期回报?
Bill Cao(易点天下):六个月后,数字营销领域的每家公司都会在某种程度上使用 AI。但在整个 AI 原生转型过程中,我认为企业组织架构才是真正的瓶颈,而不是技术或模型。
每个人都说「我们要拥抱 AI」,但这究竟意味着什么?这是一句很抽象的话。像我刚才提到的,通过 MCP 对工具和数据库进行标准化,是其中一种方法,但真正这样做的公司并不多。我认为这才是 Agent 未来发展的真正瓶颈。
如果企业能让自己的系统变得更加 AI 原生,就能在不久的将来真正采用 AI 和 Agent。至少在数字营销领域,我不认为 Token 成本是主要瓶颈,因为能力更强、价格更低的模型还会不断出现。这个领域的企业不应该害怕尝试,先试一试,看看是否有效。如果没有效果,就换一个方向。这种愿意实验的态度,也是 AI 原生思维的重要部分。
Eileen Weng(Ateve):关于 Token 成本,我有一点不同看法。目前它仍然是 Agent 落地的重要障碍。但日前发布的 DeepSeek v4 等模型非常明显地显示,Token 的成本正在逐日递减,并且基本的 Token 消耗是可以预测的。在多 Agent 任务中,Token 消耗可能很大,而且很难预测。未来 Token 或许会变得非常便宜,但今天最昂贵的是「错误的 Token」。
所谓错误的 Token,是指 Agent 探索了错误路径,以错误方式执行任务,或犯错后需要返工。之后,人还要审查它的工作,解决由此产生的问题。成本并不只是第一次推理调用。
企业仍然存在几道鸿沟。第一是信任鸿沟,人们不信任 Agent 去处理核心工作,也很难清晰划分 Agent 与人的工作边界。
第二是数据鸿沟,Agent 往往没有权限访问企业的核心数据,因此无法真正完成有意义的工作。
第三是组织鸿沟。传统企业的层级结构并不是为 Agent 设计的。每个人都有明确权限,但 Agent 未必能够理解这套结构。很多公司甚至无法定义自己究竟希望 Agent 做什么。
在这种情况下,单纯的模型能力并不是决定因素。你可以做出一个很强的模型,但 Agent 能否在企业落地,可能取决于前沿部署工程师。他们需要把业务语言转换成 Agent 能够理解的形式,包括企业的上下文、历史和流程。
陆剑锋(WIZ.AI):我预计,可靠性问题会在未来六个月得到大幅改善。届时,大家的关注点会从单纯把事情做成,转向获得更好的成本结构。人们会开始区分,哪个是最好的推理模型,哪个模型响应最快,哪个最具成本效益。
现在大部分方案都只调用最好的模型。未来我们会像组建人才团队一样组建 Agent 团队,接待工作要招聘适合做接待的人,战略岗位则可能从新加坡国立大学、南洋理工大学、斯坦福或麻省理工寻找人才。不同岗位需要不同水平、不同类型的能力。
这种转变已经开始。今年年初以来,我们看到许多「Token 工厂」公司的收入增长得非常快。
我同意 Eileen 的判断,现有的组织基础设施是为人类设计的。最困难的任务,是把它改造成适合 AI Agent 的形态。即使是我们相对独立的客服场景,融入企业业务流程仍然困难重重。今天是让 Agent 去适应为人设计的组织,未来则可能需要重新设计组织基础设施,让它适应 AI。这种改变需要更多时间。

对话刘靖康:镜头之外的「智能」和「审美」,才是 Camera Agent 的主战场
对话景鲲:AI 产品的 All in One,是上下文的 All in One
Genspark 发布 GenOffice:AI 时代的 Office,免费、开源,抢占办公人群的第一工作入口
1300 万月活、近 6000 万美元 ARR:OpenCode 如何在 Claude Code、Codex 夹缝中长出来?

