答案摘要:企业 AI 项目运行成本应同时计算模型调用、知识库处理、业务接口、日志存储、人工复核和运维资源。聚匠科技通常按任务设置模型路由、上下文上限、缓存、用户限额和预算告警,并用真实请求量复盘单次任务成本,而不是只比较模型单价,同时设置异常停用条件。
Token 单价只是成本表的一行
一个 AI 客服回答可能包含问题改写、知识检索、重排、主模型生成、敏感内容检查和会话总结;一个销售智能体还会调用 CRM、保存日志并等待人工确认。只按最终回答的 Token 估算,容易低估系统成本,也看不出钱花在哪个环节。
成本台账至少要区分开发期和运行期。开发期包括资料治理、接口联调、评测和上线;运行期包括模型、向量或检索服务、服务器、对象存储、监控、内容维护和人工兜底。
先按任务分级,再决定用什么模型
| 任务类型 | 控制方式 | 示例 |
|---|---|---|
| 规则明确 | 优先规则或小模型 | 字段校验、意图粗分 |
| 资料问答 | RAG + 合适上下文 | 制度、产品、售后查询 |
| 复杂生成 | 按需调用能力更强模型 | 方案草稿、跨文档比较 |
| 高风险动作 | 模型辅助 + 人工确认 | 报价、退款、合同修改 |
模型路由不应只按问题长度判断,还要看任务风险、资料敏感度、响应时间和可接受质量。路由规则需要版本化,升级模型后重新跑评测集,避免成本下降但错误率上升。
五种常用成本控制清单
- 限制上下文:先检索再截取相关片段,不把整库文档塞进每次请求。
- 结果缓存:对版本稳定的公开 FAQ 复用答案;资料更新时主动失效。
- 用户与任务限额:按部门、账号、渠道设置频次和单次上限,防止异常调用。
- 分层日志:生产保留审计所需信息,调试详情设置期限,避免无限增长。
- 预算告警:按日、周、月和异常峰值提醒,不等账单出来才发现问题。
缓存需要明确适用边界。公开且版本稳定的服务说明可以复用,客户订单、库存、权限和个性化建议不应跨用户缓存。缓存键应包含知识版本、入口和必要的权限范围;资料更新后如果旧答案仍被复用,节省的费用会转化为错误风险。
限额也不能只按账号总量设置。官网匿名访客、内部员工、批处理任务和接口机器人应分开计量,避免一个批量任务占满所有额度。达到阈值时可以降级到只读 FAQ、延迟处理或人工队列,但要提前告诉使用者当前状态。
月度复盘应看这些数
建议记录每类任务的请求量、平均模型成本、检索与接口成本、人工接管量、失败重试量和有效完成率。成本下降如果同时带来更多转人工、更多错答或更慢响应,并不算优化。业务方更需要的是“完成一个有效任务要花多少”,而不是“每千 Token 便宜多少”。
还要单独跟踪异常来源:过长上下文、重复请求、接口超时重试、机器人恶意访问、员工批量导出,以及知识库频繁全量重建。每类问题对应的解决手段不同。
哪些情况先不要采购本地大模型资源
请求量还不稳定、团队没有 GPU 运维能力、资料可以通过受控云 API 处理时,先采购大规模本地资源可能造成闲置。可先用混合方案验证业务量,再比较长期成本。需要部署边界评估可参考 AI 私有化部署 / 源码交付,任务设计进入 AI 智能体,知识问答成本则要与 企业知识库 RAG 的切片、检索和更新策略一起优化。