大数跨境

AI 智能体可靠性赛道升温:Raindrop 完成 CRV 领投 A 轮融资,累计融资达 5000 万美元

AI 智能体可靠性赛道升温:Raindrop 完成 CRV 领投 A 轮融资,累计融资达 5000 万美元 Saasverse
2026-09-18
7
导读:Raindrop 近日宣布完成由 CRV 领投的 5000万美元A 轮融资,现有投资方 Lightspeed Venture Partners 与 Y Combinator 跟投,来自 OpenAI、
旧金山 AI 基础设施初创公司Raindrop正在成为 AI 智能体可靠性赛道中最受关注的新玩家之一。
Raindrop 本周宣布完成CRV领投的 A 轮融资,现有投资方Lightspeed Venture PartnersY Combinator跟投,来自OpenAI、Anthropic 及 Thinking Machines的顶级研究员和高管也作为天使投资人参投。至此,Raindrop 累计融资总额达到5000 万美元
根据其官网信息,Raindrop 当前每月处理数十亿条 Trace 记录,客户包括多家Fortune 100企业,并已通过SOC 2 Type II合规认证。平台定位十分明确:帮助企业在生产环境中发现 AI 智能体的静默失败,并在问题真正影响用户之前,将其提前阻断。
其官网标语直指产品核心

Detect agent issues. Prevent them from happening.

发现智能体问题,并防止它们发生。

这笔融资也意味着,AI 智能体基础设施正在从早期的开发调试工具走向企业级可靠性、合规与风险控制体系。

从聊天机器人到自主系统:智能体可靠性成为新刚需

过去两年,企业 AI 应用的主流形态仍以 Chatbot、RAG 问答、Copilot 为主。这类系统的核心风险通常是回答不准确、检索错误或上下文遗漏。
但随着 AI Agent 进入真实业务场景,问题性质正在发生根本变化。
智能体不再只是生成文本,而是能够:
  • 自主拆解任务;
  • 调用外部工具;
  • 执行代码;
  • 操作浏览器;
  • 查询数据库;
  • 修改配置;
  • 触发退款、订单、审批、客服、销售等真实业务流程;
  • 与其他智能体或子任务协同工作。
这意味着,一旦智能体发生故障,后果不再只是“回答错了”,而可能直接影响资金、用户数据、企业流程和线上系统稳定性。
研究机构METR的数据显示,智能体能够独立完成的任务时长大约每七个月翻倍。如今,单次智能体运行时间已经可能长达数小时甚至数天,并涉及数千次工具调用。
Raindrop CEOZubin Koticha对此表示:

“智能体现在可以运行数小时、调用数千个工具,并处理真实的资金、健康数据与用户。一旦智能体出现故障,它会在大规模场景下持续做出错误行为,且往往令人难以察觉,直到有人碰巧发现为止。Raindrop 能在生产环境中捕捉这些故障,而 Simulations 则能在变更上线之前就将问题扼杀。这笔融资将帮助我们把顶尖前沿实验室用于自身模型测试的完整流程,带给每一个正在构建智能体的团队。”

这正是 Raindrop 所切入的核心痛点:AI 智能体的失败往往是“静默的”
传统监控工具可以捕捉 HTTP 500、数据库异常、服务超时或系统崩溃,但很难判断一个智能体是否“看似正常、实际错误”。例如,它可能给出听起来合理但实际错误的答案,可能陷入重复执行循环,也可能在工具调用成功后因为响应超时再次执行同一动作。
这类问题发生在语义层、行为层和任务轨迹层,传统 APM 和日志系统很难有效覆盖。

Raindrop 的定位:AI 智能体领域的 Sentry

Raindrop 将自身定位为“AI 智能体领域的 Sentry”
Sentry 解决的是传统软件错误监控问题:当应用崩溃、接口报错、前端异常发生时,工程团队可以快速定位错误、聚合相似问题并追踪修复。
而 Raindrop 想解决的是 AI Agent 时代的新型故障:智能体没有明显报错,但行为已经偏离预期。
其核心思路是将安全监控与异常检测的方法引入智能体系统,通过实时读取智能体执行轨迹,即 agent trajectories,自动检测:
  • 语义异常;
  • 工具滥用;
  • 重复执行;
  • 用户受挫信号;
  • 任务失败模式;
  • 行为回归;
  • 高风险操作异常。
Raindrop 的方案包括在客户环境中部署小型定制化模型,实时分析生产环境中的智能体流量。一旦行为发生偏移,工程团队可以立即看到变化的具体内容、起始时间、受影响用户范围,以及对应的真实 Trace 证据。
这让 Raindrop 不只是一个 Trace Viewer,而更像是一套面向智能体行为的可靠性操作系统。

产品闭环:从 Trace 到 Simulate,再到 Verify

Raindrop 的产品体系围绕一个完整闭环展开:

Trace → Detect → Investigate → Simulate → Verify

也就是从生产环境追踪,到问题检测、根因分析、上线前模拟,再到真实流量验证。

1. Tracing:追踪每一次运行、工具调用与决策路径

Raindrop 可以记录智能体每一次运行中的消息、工具调用、子智能体、输入输出、耗时、成本和决策路径。开发者能够看到一次 agent run 中到底发生了什么,以及问题最早出现在什么环节。
官网展示的界面中,Raindrop 可以完整还原一个编程智能体的任务执行过程,包括读取文件、搜索配置、修改代码、运行命令、构建失败、再次重试等步骤。
这对智能体系统尤为重要,因为很多问题并不出现在最终回答,而是隐藏在中间的工具调用链路里。

2. Issue Detection:从分散 Trace 中识别重复性失败

Raindrop 不只是展示单条 Trace,而是会跨大量运行识别重复出现的失败模式,并将它们聚合成结构化 Issue。
例如,一个智能体在 100 多次运行中因为同一个错误模板反复失败,如果只看日志,工程团队可能看到的是一堆分散的构建失败;但 Raindrop 会将其归并为同一个问题,并标注影响用户、事件数量、严重程度、首次发现时间和置信度。

3. Triage Agent:自动分诊与根因分析

Raindrop 内置Triage Agent可以在 Slack、Web 和 MCP 环境中自动调查故障
当生产环境出现异常时,Triage Agent 可以读取相关 Trace,搜索相似案例,总结根因,并给出修复建议。
例如官网案例中,当用户在 Slack 中询问“为什么智能体总是重试同一个失败构建”时,Triage Agent 自动检查已知问题、搜索过去 7 天事件、阅读 12 段相关对话,并最终指出:

智能体正在重新应用一个过时的 Webpack 模板。

每次重试都会复现同样的错误。Webpack 5 需要 module.rules,但智能体持续写入 module.loaders。

这类能力将智能体可观测从“人工翻日志”推进到“自动调查与分诊”。

4. Signals & Experiments:用自定义信号衡量行为变化

Raindrop 支持团队定义自定义分类器,用来追踪真正重要的行为信号,例如用户抱怨、任务失败、循环调用、工具异常、成本异常、慢调用等。
同时,平台还支持实验功能。团队可以通过 feature flag 将新版本与 baseline 进行对照,观察真实生产环境中的行为变化。
这意味着智能体优化不再只依赖主观判断,而可以用数据回答:
新 prompt 是否减少了失败?
新工具策略是否降低了重试?
新记忆机制是否引入了更多误判?
新版本是否真的改善了用户体验?

5. Simulations:在合并前用真实流量发现回归

Raindrop 伴随 A 轮融资同步推出新产品Simulations,目前处于研究预览阶段。
传统 eval 依赖预先编写的静态测试用例,只能覆盖团队已经预料到的失败场景。但真实生产环境中的用户输入、任务路径、工具状态和上下文组合远比测试集复杂。
Simulations 的核心变化在于:它可以将真实历史生产流量与现有测试用例一起回放到智能体的变更版本中,再结合 Raindrop 的异常检测模型分析结果。
换句话说,工程师可以在变更上线前提前看到:

这次改动究竟会改变什么?

这让智能体测试从“静态 eval”走向“基于真实流量的行为仿真”。
CRV 普通合伙人Reid Christian表示:

“我在面向开发者的关键基础设施领域深耕了整整十年。智能体与传统软件有着本质区别——它们高度自主、能力强大且结果不确定。Raindrop 像安全公司处理威胁检测一样来对待智能体故障,而 Simulations 则打通了从生产到开发的完整闭环。我们非常荣幸能够领投本轮融资。”

真实案例一:Webpack 配置死循环

Raindrop 官网展示的第一个典型案例,是一个编程智能体在修复构建失败时陷入循环。
用户让智能体修复 Webpack 构建问题。智能体读取package.json、webpack.config.js和tsconfig.json后,尝试修改配置并运行npm run build。
但构建报错显示:

Invalid configuration object.

configuration.module has an unknown property 'loaders'.

These properties are valid: rules, defaultRules, ...

问题在于,Webpack 5 已不再支持module.loaders,正确写法应为module.rules。
但智能体并没有真正修正根因,而是在失败后持续重新生成同样过时的配置模板,反复使用module.loaders,导致构建一再失败。
Raindrop 将该问题识别为:

Build loop from deprecated Webpack config

由于过时 Webpack 配置导致的构建循环。

该 Issue 覆盖:
  • 128 个事件
  • 42 名用户
  • 97% 置信度
  • 严重程度:High
  • 首次检测:8 天前
  • 最近出现:4 分钟前
Raindrop 的 Agent Analysis 指出:

所有 12 条相关 Trace 都复用了同一份模板。应将 module.loaders 替换为 module.rules。

这个案例非常典型。表面上看,它只是一次构建失败;本质上却是智能体在错误模板和失败反馈之间形成了错误闭环。如果没有跨 Trace 的问题检测,工程团队可能只会看到一堆孤立失败,而无法快速识别背后的系统性原因。

真实案例二:退款重试导致重复退款

第二个案例更能说明智能体进入真实业务流程后的风险。
一名开发者提交 PR,希望在工具调用发生超时时自动重试,避免用户再次发起请求。听起来这是一个合理优化。
但 Raindrop 的模拟测试发现,在一个 120 美元退款场景中,退款动作其实已经成功执行,只是响应发生超时。新逻辑触发自动重试后,系统再次执行退款,导致同一订单被退款两次。
模拟对比结果显示:
  • 主分支:退款 120 美元;
  • 当前 PR:退款 240 美元;
  • 智能体仍然回复用户:“我已将 120 美元退回到你的卡上。”
  • 也就是说,系统内部已经产生了重复退款,但用户和客服看到的仍是一次退款。
  • Raindrop 在 Pull Request 阶段直接标记该变更存在回归:
  • 发现 1 个 regression;
  • 11 个测试通过;
  • 可查看失败回放。
这个案例揭示了 AI Agent 的核心挑战:当智能体可以调用真实业务工具时,错误不再只是“回答不准确”,而可能直接造成资金损失、权限误操作或数据风险。
因此,生产级 Agent 必须具备上线前模拟、幂等性检查、操作审计和失败回放能力。

实验验证:Config Template v2 显著降低负向信号

Raindrop 官网还展示了一个实验模块案例:Config Template v2 vs. baseline
团队通过属性config_version = v2划分实验组,将最近 7 天真实流量与 baseline 进行对比。结果显示,Config Template v2 显著降低了多项负向行为指标:
指标
实验组 v2
对照组 baseline
改善幅度
用户负向信号率
3.40%
11.20%
下降 7.8 pp
构建失败率
2.1%
9.8%
下降 79%
智能体重试循环率
0.8%
6.4%
下降 88%
配置语法错误率
1.2%
4.8%
下降 75%
这类能力对于 AgentOps 非常关键。因为智能体系统的优化通常不是单一代码修复,而涉及 prompt、工具调用策略、模板、记忆机制、检索逻辑和模型选择的组合变化。
没有实验系统,团队很难判断一次改动到底是在真实环境中改善了行为,还是只是通过了少量测试样例。

Simulations 的战略意义:把前沿实验室方法带给普通团队

Raindrop 对 Simulations 的强调,背后反映的是 AI Agent 测试方法的代际变化。
传统软件测试通常基于确定性输入输出;传统 LLM eval 则依赖预设样本和打分标准。但 AI Agent 是非确定性的、自主的、多步骤的,并且会持续与工具和环境交互。
这意味着,未来 Agent 测试必须更接近“仿真环境”而不是“静态题库”。
OpenAI 近期发布了关于部署仿真的研究成果,通过对去标识化的生产对话重新生成响应,在发布前预测候选模型的异常行为率;Anthropic 则构建合成宇宙,用于训练和压力测试其智能体。
Raindrop 的野心,是将这类原本属于前沿 AI 实验室的测试流程,产品化给每一个正在构建智能体的团队。
这也是为什么 Simulations 不只是一个新功能,而是 Raindrop 从“监控平台”走向“智能体质量保障基础设施”的关键一步。

从被动监控走向自愈系统

Raindrop 的产品路线图正在从被动监控走向主动闭环。
其 2.0 版本引入了Self-Healing能力:平台不仅能够检测失败、定位根因,还能自动驱动 coding 智能体修复 bug,并编写回归测试,将一部分修复流程从人工介入转向机器自动化。
Raindrop 官网也展示了类似的 MCP 自动修复流程:

trace → patch → verify

replaying failed trace → fix verified

这意味着,未来 Raindrop 不只是告诉工程团队“哪里坏了”,而可能进一步自动生成修复、回放验证并推动合并流程。
在智能体时代,这种“用智能体修复智能体”的闭环将成为基础设施的重要方向。

客户与团队:来自 Apple、Robinhood、Square 与安全工程背景的人才组合

Raindrop 由Zubin Koticha、Ben Hylak 和 Alexis Gauba联合创立。
其中,CTOBen Hylak曾供职于 Apple 人机界面团队,是 visionOS 的核心开发者之一;Zubin Koticha 与 Alexis Gauba 此前联合创立 DeFi 平台Opyn,后被 Coinbase 收购。
公司目前仍保持精英小团队规模,约 10 至 15 名员工。核心工程师和设计师来自 Apple、Segment、Semgrep、Socket、Robinhood、Square、Airtable、DoorDash 和 PlanetScale 等公司。
这一人才组合很有意思:既有消费级产品设计背景,也有安全、异常检测、欺诈检测、基础设施和开发者工具经验。
Raindrop 团队还包括:
  • 曾在 Robinhood 发明欺诈检测 Transformer 模型的工程师;
  • 曾在 Square 开创恶意异常检测的先驱;
  • 来自 Segment、Semgrep 和 Socket.dev 的资深安全工程师;
  • 曾在 Apple、Airtable、DoorDash 主导工程团队的工程师;
  • 来自 Apple 和 PlanetScale 的顶尖设计师。
这种背景也解释了 Raindrop 的产品气质:它不是单纯做 LLM 日志,而是将安全检测、异常识别、开发者体验和企业级基础设施结合起来。
目前,Raindrop 已获得Vercel、Framer、Clay等高增速 AI 原生公司的采用,也服务多家 Fortune 100 和 Fortune 500 企业。语言学习平台Speak将 Raindrop 部署于其面向约1500 万用户的智能体可靠性监控体系中。
Vercel AI 工程师Bani Singh表示:

“如果我们遇到构建失败或智能体陷入死循环等问题,Raindrop 会立即在 Slack 推送告警,附上受影响用户数量以及可深入查阅的对话记录。最重要的是,Raindrop 让我们对最严重的问题有了前所未有的可见性。”

Lightspeed 合伙人Bucky Moore也表示:

“随着智能体被部署到日常产品乃至国防等高风险领域,‘异常行为’的后果将愈发严重。我们在种子轮便投资了这支团队,因为他们展现出卓越的产品远见与直觉,并将其转化为在同等阶段极为罕见的用户口碑。一年后,《财富》100 强企业已在使用 Raindrop 监控其智能体流量。Lightspeed 为能持续加注 Raindrop 这一新品类的领导者而深感自豪。”

融资历程:从 Pre-Seed 到 A 轮的快速跃升

Raindrop 的融资速度也体现出资本市场对 Agent Reliability 赛道的关注。
公司融资历程包括:
  • Pre-Seed 轮,2025 年初:公司成立初期获得约 50 万美元天使融资;
  • Seed 轮,2025 年 12 月:由 Lightspeed Venture Partners 领投,完成 1500 万美元种子轮融资,参投方包括 Figma、Vercel、Replit、Cognition 和 Notion 的创始人;
  • A 轮,2026 年 9 月:由 CRV 领投,Lightspeed Venture Partners、Y Combinator 跟投,并获得 OpenAI、Anthropic、Thinking Machines 等相关人士支持。
以估值看,本轮融资规模位居美国企业软件史上 A 轮融资的前 5%,隐含估值预计在 1 亿至 1.5 亿美元以上。
从投资人结构看,Raindrop 同时获得了顶级企业软件基金、AI 前沿实验室相关人士,以及 AI 原生应用公司的支持。这说明 Agent Reliability 已不再是小众开发工具需求,而是被视为下一代 AI 基础设施的重要组成部分。

竞争格局:AgentOps 与 LLMOps 正在分化

Raindrop 所处的 AI 智能体可观测性与可靠性市场正在快速扩张。
AI 可观测性市场规模预计将从 2025 年的12.4 亿美元增长至 2032 年的127.5 亿美元,年复合增长率约 40%。
目前该赛道已出现多个方向的玩家:
  • Braintrust:2026 年 2 月完成 8000 万美元 B 轮融资,由 Iconiq 领投,估值达 8 亿美元,专注 LLM 评测与 CI/CD 部署门控;
  • Galileo:2026 年 4 月被 Cisco 收购,并整合进 Splunk,以 “Splunk Agent Observability” 形式推向企业市场;
  • Arize AI:该领域估值较高的玩家之一,约 9.15 亿美元,提供开源 Phoenix 与企业级 AX 解决方案;
  • AgentOps:专注多框架智能体调试与会话追踪;
  • Langfuse 与 Arize Phoenix:流行的开源自托管追踪方案;
  • Maxim AI:侧重部署前的智能体仿真测试。
在这一竞争格局中,Raindrop 的差异化在于,它不是从传统 LLM eval 切入,也不是只做开源 tracing,而是以“安全检测”的方式处理智能体失效,并将生产流量直接接入测试与修复闭环。
官网中一位 Fortune 100 客户评价称:

“我们选择 Raindrop,而不是 Braintrust、LangSmith 和 Arize。大多数工具面向的是 LLM 的第一时代:调用/响应、确定性 eval、边缘案例测试。Raindrop 正在为下一个时代构建,主动发现问题,并驱动自动化改进闭环。”

这句话很好地概括了 Raindrop 的市场定位:它不只是 LLMOps,而是更接近 Agent Reliability Operations。

为什么 Raindrop 值得关注?

Raindrop 的出现,说明 AI 基础设施正在进入一个新的阶段。
第一阶段是模型调用基础设施,包括 API、推理服务、Prompt 管理和基础日志。
第二阶段是 LLMOps,包括评测、监控、成本管理、RAG 调优和实验管理。
第三阶段则是 AgentOps 或 Agent Reliability:当智能体开始自主执行任务、调用工具并影响真实业务时,企业需要的不只是“看见调用记录”,而是能够持续保障智能体行为可靠。
Raindrop 正是第三阶段的代表公司之一。
它的价值不在于单点功能,而在于构建了一个完整闭环:

生产追踪 → 异常检测 → 自动分诊 → 修复建议 → 仿真回放 → 实验验证 → 自动改进

这也是为什么它能够获得 Vercel、Framer、Clay、Speak 以及 Fortune 100 企业的采用,并在早期阶段拿到 5000 万美元累计融资。
Saasverse Insights
Raindrop 的融资标志着 AI 智能体可观测性与可靠性赛道正在进入高速增长期。
过去,很多团队将可观测性视为工程辅助工具,是上线后的“日志与监控”。但在 AI Agent 时代,可观测性正在成为产品商业化的前置条件。
原因很简单:当智能体开始处理真实资金、健康数据、企业工作流、客户支持、代码仓库和业务系统时,可靠性不再是加分项,而是准入门槛。
Raindrop 的关键启示在于:智能体可观测性的终局不是 Dashboard,而是自动化改进闭环。
只展示 Trace 不能解决根本问题。企业真正需要的是:
  • 能否自动发现静默失败;
  • 能否聚合同类问题;
  • 能否定位根因;
  • 能否在 Slack 或工作流中自动分诊;
  • 能否在 PR 合并前用真实流量回放发现回归;
  • 能否在上线后用实验数据证明行为改善;
  • 最终能否走向自动修复与自愈。
这也是 Raindrop 相比传统 LLMOps 工具更值得关注的地方。它不是在优化“开发体验”的边角,而是在重构 AI Agent 的质量保障体系。
对于中国市场,Raindrop 的案例至少带来三点启示:
第一,Agent Reliability 会成为企业 AI 落地的必备基础设施。
国内企业正在快速探索客服智能体、销售智能体、代码智能体、数据分析智能体、办公自动化智能体和行业智能体。一旦这些系统进入生产环境,静默失败、重复执行、工具滥用、权限误操作等问题都会集中爆发。
第二,本土化 AgentOps 仍有巨大窗口。
中国企业对私有化部署、数据安全、权限审计、中文语义异常检测、本地模型兼容、信创环境适配都有强需求。国际产品很难完全覆盖这些场景,这为本土创业者提供了机会。
第三,未来的 LLMOps 会从“模型评测”走向“行为治理”。
单轮问答评测只能覆盖有限问题。真正的 Agent 系统需要围绕任务轨迹、工具调用、业务结果和用户反馈构建持续治理能力。
从 Galileo 被 Cisco/Splunk 收购,到 Braintrust 估值冲击 8 亿美元,再到 Raindrop 完成 CRV 领投 A 轮,AI 智能体可靠性已经从早期开发者工具市场,升级为大型平台和企业软件投资人共同关注的战略赛道。
如果说上一代软件基础设施的核心问题是“系统是否宕机”,那么 AI Agent 时代的新问题将是:

智能体是否在没有报错的情况下,悄悄做错了事?

Raindrop 抓住的,正是这个新问题背后的基础设施机会。

#Raindrop#AI智能体可靠性#智能体可观测性#AgentOps#LLMOps#AI基础设施#企业AI#大模型监控#SaaS融资#智能体运维

End

【声明】内容源于网络
0
0
Saasverse
Saasverse 是全球最大Saas社区之一,聚集Saas行业的创业者,高管,从业者,VC投资者等;我们提供高质量的Saas行业专业内容以及行业资源链接,赋能社区中每一个Sassverserian,实现从ARR从0到1亿的增长。
内容 458
粉丝 0
Saasverse Saasverse 是全球最大Saas社区之一,聚集Saas行业的创业者,高管,从业者,VC投资者等;我们提供高质量的Saas行业专业内容以及行业资源链接,赋能社区中每一个Sassverserian,实现从ARR从0到1亿的增长。
总阅读7.2k
粉丝0
内容458