01
算力:没有基准,就没有价格
训练算力按GPU·时,与模型参数规模、训练数据量、训练轮次相关;推理算力按Token或QPS,与并发数、响应延迟、上下文长度相关。全国范围内缺乏公认的"每参数训练成本"或"每请求推理成本"基准。叠加三个变量,就彻底算不清了。
1.GPU型号跨度大,从几千元到几十万元,性能差异非线性;
2.计费模式五花八门,按小时、按卡、按算力单元、按任务包,同一块卡不同模式价格差数倍;
3.训练效率不可比,受模型架构、优化策略、数据质量共同影响。
02
数据:最容易被低估的成本
国家层面已有GB/T 42755—2023《人工智能 面向机器学习的数据标注规程》,规范的是标注活动怎么组织,不是数据标注工程值多少钱。后者目前没有全国统一定额。
现实是,同样是10万条数据,可能只需简单分类,也可能需要采集、清洗、脱敏、专业标注、专家复核、多轮模型验证,成本基础完全不同。容易出现以下三类典型问题:
1.成本被笼统归集——数据标注、场景适配被并入"软件开发费",无法逐项核验;
2.需求参数缺失——业务部门没给数据处理量、精度目标、延迟要求,算力预算无从成立;
3.供应商模糊定价——以"技术复杂"为由只给总价,无拆解。
03
功能点法的边界
能计量的:知识库建设、文档切片与向量化、接口集成、管理后台、Prompt模板管理、评测体系、与既有系统对接改造。
不能计量的:外购模型底座、第三方API调用、GPU算力消耗、模型授权费,这些单独列项。
这个划分,与"软硬件分开列项、定制开发单独测算"的评审惯例直接衔接。而因子取值本身就是风险点。CSBMK-202510已把"大模型"纳入"智能信息"应用类型,调整因子取值1.5;AI+开发生产率为P50=5.71人时/功能点,低于全行业基准6.72。
04
训练与推理
训练:一次性投入,GPU·时与模型规模、数据量、训练轮次相关;
推理:持续性支出,随并发与Token量线性增长;
选型错误导致的超配,是预算虚高的主要来源。7B模型跑FP16推理需14-16GB显存,单张A100 40G即可承载;RAG场景需同时加载Embedding与LLM,显存需求翻倍。
05
自建还是租赁
自建要算机房改造、专职GPU运维、电费带宽、折旧损耗,这些隐性支出,是评审环节被砍的高发区。自建只有在利用率高且稳定时才划算;低利用率场景,租赁的TCO优势明显。因此要根据负载形态决定。
06
运维
AI项目运维成本占总造价15-25%,高于传统IT的10-15%。多出三项独有支出:
1.模型漂移监控。PSI指标、Prompt行为变化、RAG知识新鲜度;
2.Prompt-as-Code管理。版本控制、审计、回归测试,约0.5-1人年;
技术债偿还。每延期1月,偿还成本×1.5。
07
合规边界
数据不出域的硬约束,直接决定部署形态,也决定成本结构。
私有化部署要承担GPU集群、机房改造、专职运维的全套TCO;调用公有云API则按Token计费,但数据必须可出域。这层前提没确定,后面的测算全是假设。
结语
七处难点的共同点是:不是算不准,是参数没有来源。而"参数没有来源"这件事,恰恰说明这个领域还在建标准的过程中。这个窗口期,就是专业服务的价值所在。
点击蓝字 关注我们

