Cisco 最近发了一份报告,名字叫 《AI Impact on Wide Area Networks Report 2026》,专门看 AI 推理和 AI Agent 会怎样影响广域网流量。
这不是一份单纯讲数据中心内部训练网络的报告。
它看的,是用户设备、企业应用、Agent、模型服务之间那些会跨过 WAN 的推理流量。报告里用了 Cisco 自己的真实网络流量分析、第三方行业数据,也做了 AI Agent 的实验测试。
Cisco 这份报告里更有意思的地方,不在于它说流量会变大。
它真正戳我的点,是它把一个更麻烦的问题摆到了台面上:
-
AI 时代的网络,不只是要扛更多流量。 -
它要面对一种性格不一样的流量。
这个差别,可能比单纯的流量增长更要命。
一次 Agent 任务,背后是一张小网
Cisco 在报告里做了一个很具体的测试。
它用了 LangChain 的 Open Deep Research agent,让这个 Agent 去完成一个公开信息收集任务。
任务内容大概是,帮 Cisco 收集公开的投资者关系材料、社交媒体、新闻、合作伙伴、管理层资料、组织信息、公告和竞争信息。
如果一个人来做这件事,大概就是开浏览器,搜资料,点网页,复制一点信息,整理一下,再慢慢写。
人是很慢的。
慢到什么程度呢,一个人看网页要停下来读,要判断哪些信息有用,要来回切换窗口,要摸鱼,要喝水,要发呆。
但 Agent 不是这么工作的。
Cisco 的测试里,这个 Agent 查了 44 个网页来源。它自己跟网页工具通信,跟模型通信,再把中间状态不断塞回去,让模型继续判断下一步该做什么。
然后流量就变成了一张小网。
Agent 自己是一端,网页代理是一端,OpenAI 模型是一端,中间来回跑的不是一次普通网页请求,而是一串由任务驱动的网络调用。
Cisco 给出的结果是,在这个测试任务里,Agent 触发的网络流量比人手动完成同类任务多了 450%。而且新增流量里,大约 70% 是 LLM inference,也就是模型推理相关流量。
看到这里,我其实愣了一下。。。

图1,Agent 任务触发网络调用的结构示意,数据来自 Cisco 2026 年 AI Impact on Wide Area Networks 报告
这张图背后的意思挺直白。
AI Agent 不只是一个会聊天的软件。
它更像一个跑在网络上的自动办事员。它会查资料,会调用工具,会把上下文交给模型,会拿着模型的结果再去找下一步。
你让它做一件事,它背后可能已经跑了几十次网络交互。
这就是 Cisco 报告里那个很形象的说法,Agent 和模型之间的连接,会变成 Agent 的 spinal cord。
中文讲,就是脊髓。
图2:Cisco 将 Agent 与 LLM 之间的连接称为 Agent’s Spinal Cord,也就是 Agent 执行任务时的新关键路径。
这个比喻有点狠,但我觉得它说到了点子上。过去我们说网络体验,很多时候是在讲网页能不能打开,视频卡不卡,会议掉不掉线。到了 Agent 这里,模型链路一抖,任务可能就直接变傻,变慢,甚至断掉。
不是页面加载慢一点那么简单。
它可能是一个自动流程的判断能力被掐住了。
麻烦不只是流量变大
很多朋友可能会说,流量变大这件事,网络行业不是一直在处理吗。
从门户网站,到在线视频,到短视频,到直播,到云游戏,每一代应用都会把网络再往前推一截。运营商扩容,企业买更大的专线,数据中心上更高速率的交换机,听起来都是老问题。
我也理解这个反应。
如果只是多一点带宽,那它确实是一个熟悉的问题。贵一点,慢一点,规划周期长一点,但路径大体清楚。
可 Cisco 这份报告里提到的 AI inference 流量,有几个特征不太一样。
它现在的总量还小。
报告说得很清楚,相比视频流媒体这些大头,AI inference traffic 目前仍然可以说很小,短期内相对占比也可能继续很低。
这句话很重要,因为它避免了一种很常见的夸张写法,仿佛明天早上 AI 就要把互联网打爆。
至少从 Cisco 这份材料看,还不是。
但另一个事实也摆在那里,它增长速度很快。
Cisco 引用了 OpenRouter 的 token consumption 数据,接近 10 倍的年增长。它还提到,在部分服务提供商的实际测量里,AI inference 流量在 8 个月里大约增长了 4 倍。
所以更准确的说法应该是,AI inference 流量今天还小,但它正在变成一个需要被认真建模的新流量类型。
过去的网络,习惯服务人
你想想看,过去二十年互联网最核心的流量体验是什么。
很大一部分是人类消费内容。
网页也好,图片也好,视频也好,直播也好,短视频也好,说到底都是人点一下,然后网络把内容送下来。
当然,这里面也有上传,发朋友圈、传视频、开直播、打视频会议,都会产生上行流量。但从大盘子看,很多网络规划的直觉还是偏下行的。
人看得多,下载得多,刷得多。
而且人的操作天然有节奏。
你看一个网页,点一下,停一会儿。你刷一条视频,看几秒,再滑下一条。你跟一个 App 交互,中间有大量人类的犹豫、阅读和等待。
网络在很长时间里,已经适应了这种人类速度。
Cisco 报告里有句话很关键,它说 Agent 是 network power users。
这个词很有意思。
AI Agent 不是按照人的速度使用网络,它按照软件的速度使用网络。
人类的慢,过去其实是网络的缓冲垫; Agent 把这层缓冲垫拿掉了。
AI 推理的流量,像一根细水管
Cisco 把 AI inference flow 和普通 Web transaction 做了对比。
结果不是那种很直觉的,大水管猛灌;它更像一根持续出水的细水管。
报告里的数据是,AI inference flow 的持续时间大约是普通 Web transaction 的 2 倍。原因也不复杂,大模型生成内容是一个 token 一个 token 往外吐的。
普通网页内容很多时候可以从缓存、服务器或者 CDN 里快速拉下来,峰值速率会比较高。
但 AI 回答不是这么来的。
模型要先处理 prompt,再开始吐第一个 token,然后按输出长度继续生成。
这个过程天然更长,更平滑,也更不像传统网页那种一下子爆发的下载。
Cisco 的测量里,普通 Web transaction 的中位 flow rate 大约是 AI inference flow 的 10 倍。
这听起来有点反直觉。
AI 不是更重吗,怎么速率反而更低。
原因就在这里,AI inference 的重,不一定表现为瞬时带宽很高,而是表现为连接持续更久,状态保存更久,路径更关键。
图3,AI inference flow 和普通 Web transaction 的关键差异
这一点对网络设备和安全设备很要命。
因为很多系统不只是转发包,它还要记住 flow 的状态。防火墙、入侵检测、DPI、各种 flow-aware 的系统,都要维护表项。
如果未来 AI inference flow 数量持续增长,而且每条 flow 持续时间更长,那压力不只在链路带宽上,也会落在状态管理上。
坦率的讲,这个角度比单纯喊带宽增长更有信息量。
因为它提醒你,AI 流量可能不是传统视频流量的放大版。
它是另一种动物。
上行开始变得没那么边缘
还有一个变化,我觉得特别值得拿出来讲。
上行流量。
过去很多人聊家庭宽带、移动网络、企业分支网络,直觉上都会更关心下行。下载快不快,视频卡不卡,文件拉得动不动。
AI 会让这个直觉变得没那么稳。
原因也简单。
你给模型的 prompt,不再只是几个字。
它越来越像一个上下文包。里面可能有历史对话,有文件摘要,有网页内容,有工具调用结果,有用户偏好,有任务状态。
Agent 更是如此。
Agent 做任务的时候,不是只问模型一句话。它会把过程里的状态不断带回去,让模型判断下一步。状态越多,上行越重。
Cisco 的样本里,AI inference flows 中有大约 9% 的 flow 是上行超过下行。而普通 HTTP transaction 里,这个比例大约只有 0.5%。
9% 看起来不大;但和 0.5% 放在一起,它就不是小数点里的噪声了。
这背后其实是一个网络时代的习惯正在松动。
过去互联网很像一个巨大的内容分发系统,人主要从云上拿东西。AI Agent 普及以后,很多设备、很多应用、很多企业系统会不断把上下文推回模型,让模型继续工作。
这会让上行容量、无线侧规划、企业出口和安全策略都变得更复杂。
我说复杂,不是说马上就要推倒重来。
而是过去那些默认假设,可能要重新拿出来看一遍。
延迟现在还不是主战场
聊 AI 和网络,很容易绕到边缘推理。
这个话题很有诱惑力。
模型离用户越近,延迟越低,体验越好,听起来非常顺。
但 Cisco 在这份报告里的判断其实更谨慎。
它说目前 AI inference 的端到端延迟,主要还是由模型处理时间决定。网络延迟在现在这个阶段,通常只是比较小的一部分。
报告里给了一个简单的延迟表达方式,LLM latency 由 Time To First Token,加上每个输出 token 的生成时间乘以输出 token 数量构成。
也就是说,一个回答有多慢,很大程度上取决于模型多久开始吐第一个 token,以及它要吐多少 token。
这就解释了为什么今天很多 AI 应用慢,不一定是你的网慢。
很多时候是模型还在算。
不过这句话后面还有半句。
当推理硬件继续变快,模型处理时间下降,网络延迟在整体体验里的比例就会变高。
这就是说,网络现在可能还不是主瓶颈,但它会越来越接近主战场。
这个判断比较克制,也更可信。
2035 年的数字,要当成提醒看
Cisco 报告里最容易被拿来做标题的,其实是 2035 年预测。
比如 Cisco 模型预计,到 2035 年 AI inference 可能占总网络流量的 25%。
消费网络这边,如果不考虑 AI 和 Agentic AI 的影响,2025 到 2035 年网络流量预计增长 4 倍。如果考虑 AI 和 Agentic AI,预计增长 6.6 倍,相比非 AI 情景多出约 63%。
企业网络这边,报告给出的模型也很激进:
-
如果不考虑 Agentic AI,2026 到 2035 年企业流量预计增长约 250%。 -
考虑 Agentic AI 以后,企业网络流量可能被推到 9 倍增长。
图4,Cisco 模型对 2035 年网络流量增长的预测,长期预测需要保守理解
这些数字都很抓眼球。
但我建议读的时候别把它们当成已经写好的未来。
2035 年太远了。
AI 应用形态会变,模型架构会变,推理成本会变,本地模型和云端模型的比例也会变。
更何况,Cisco 自己在报告里也说,长期建模天然有不确定性,未来会随着更多数据继续修正。
所以这些数字最好的用法,不是拿来喊口号。
它们更像一个规划信号。
信号在说,如果 Agent 真的从演示、试点、少数工作流,进入企业软件和消费应用的日常,那么网络的增长曲线会被抬高。
更重要的是,被抬高的不只是流量总量,还有网络对上行、状态、可观测性和关键路径保障的要求。
这个提醒,比 25% 这个单一数字更有价值。
真正的新麻烦,是网络要理解 Agent
我自己看完这份报告以后,脑子里一直绕着一个问题。
未来的网络要不要理解 Agent?
过去网络很多时候不需要理解应用到底在做什么。只要把包转过去,质量差不多,安全策略过得去,就可以了。
但 Agent 的麻烦在于,它把一次用户意图拆成了很多机器动作。
一个简单请求背后,可能有搜索、抓取、摘要、模型推理、工具调用、数据库读写、再推理、再调用。
这些动作对用户来说是一件事,对网络来说,却是一堆 flow。
更麻烦的是,这堆 flow 的重要性不一样:
-
Agent 和模型之间的推理路径,可能比普通网页抓取更关键。 -
工具调用失败可以重试,某个网页慢一点也许还能换来源,但模型路径如果长期不稳定,Agent 的判断链条就会变得很脆。
这就是 Cisco 报告说 AI inference paths 会成为 strategic network assets 的原因。
这句话如果翻成人话,大概就是,以后企业和运营商不能只问网络有没有通,还要问关键 AI 路径是不是稳定、可观测、可保障。
这会带来一串具体问题:
哪些流量是 AI inference?
哪些路径服务于关键 Agent 任务?
这些流量能不能被识别?
QUIC 加密以后,DPI 怎么做?
QoS 要不要对 AI inference 做差异化处理?
企业的安全设备、分支出口、SD-WAN、SASE、无线网络,上游带宽和状态表要不要重新规划?
上面这些问题其实是一堆旧问题,只是被 Agent 重新排列了一遍。
互联网从服务人,走向服务任务
我觉得 Cisco 这份报告真正值得写的地方,就在这里。
它不是在告诉我们,AI 会多吃多少流量。
它在提醒我们,互联网正在从服务人的点击,走向服务任务的执行。
人类点击网页的时候,网络服务的是一次次人的动作。
Agent 执行任务的时候,网络服务的是一条条机器之间的判断链。
这两件事的节奏不一样,流量不一样,关键路径也不一样。
过去我们觉得互联网是信息高速公路,这个比喻用了很多年。人开车上路,去一个网站,看一段视频,拿一份文件。
但 Agent 出现以后,这条路上开始跑很多自动化的小车。它们不是偶尔上路兜一圈,而是带着任务目标,自己找路,自己调用工具,自己把结果交给模型,再继续往前走。
这时候网络就不只是路。
它有点像任务的神经系统。
当 AI 开始替人执行任务,网络要承受的就不只是人的注意力,它开始承受软件速度下的行动。
这才是 Cisco 这份报告里,真正藏着的新麻烦。
阅读更多:
要不要这么卷,Meta MTIA300竟然也内置网卡啦
SemiAnalysis:Agent 时代,CUDA 护城河换了一种打法
Scale In, NVIDIA 是否旧瓶装新酒?
MetaRoCE,Meta 想让 AI 网络不再假装自己不会丢包
【低时延】Cerebras 这次真正升级的,不是芯片,是机柜
资料来源
Cisco,AI Impact on Wide Area Networks Report 2026。
Cisco,The Race to Agentic AI,Why Infrastructure Will Make or Break Workforce Integration。

