你输入一句话,内容被送到云端服务器,AI算完以后再把结果传回来。只要网络稳定,这套方式很好用。
端侧智能换了一个思路:让一部分AI直接在手机、电脑、汽车、摄像头或工厂设备上运行。数据在哪里产生,AI就尽量在哪里处理。NIST对边缘相关计算的描述,也强调把应用和数据分析放到更靠近终端的位置。
端侧智能已经进了真实产品。Apple公开过约30亿参数的端侧模型,复杂任务再交给更大的服务器模型;微软推出的Copilot+ PC,则用本地NPU运行新的AI功能。在工业现场,西门子也提供了运行在Industrial Edge上的AI推理工具。
AI不再只等人打开聊天框提问,它开始跟着设备一起工作。
为什么要把AI放到设备里
工厂摄像头发现产品缺陷,需要马上让设备停下来。如果画面先上传云端,等AI判断后再返回,网络波动就可能影响生产。放在现场处理,反应会更直接。
同样的道理也适用于客户语音、内部文件和设备数据。企业不一定愿意把所有原始数据传到外部。端侧处理可以减少上传的数据量,在弱网或断网时也能保留部分能力。
如果任务每天重复成千上万次,本地处理还可能减少云端调用费。不过,端侧智能也要花钱。
模型会占用内存和存储,持续运行会耗电、发热,旧设备也未必带得动。TensorFlow的模型优化文档把模型大小、计算效率、时延、内存和功耗都列为边缘部署需要面对的问题。
更常见的方案是两边分工。现场设备处理高频、实时和敏感任务,云端负责复杂推理、统一管理和模型更新。
企业该不该做
如果一个任务晚一秒就会影响体验或生产,原始数据不适合外传,现场网络又不稳定,或者云端调用量大到费用明显上升,就值得评估端侧方案。
普通写作、资料查询和低频客服,没有必要为了“端侧”两个字重新购买一批设备。成熟的云端工具往往更省事。
端侧项目难在后续。模型要接入摄像头、传感器和业务软件,还要处理设备差异、版本更新、权限和故障。FDE要做的,就是进入现场把模型、硬件、数据和流程接起来。
对企业来说,设备里的AI能不能接上流程、长期稳定运行,比它能演示多少新功能更重要。做到这一步,端侧智能才算真正落地。

