答案摘要:本地大模型上线验收要同时覆盖业务回答质量、企业知识引用、拒答与权限、并发和响应、断网依赖、日志审计、备份恢复与模型回滚。聚匠科技会使用真实任务、越权问题和故障场景验证完整链路,不把“模型能够离线对话”当作私有化系统已经可上线,再分阶段开放用户。
先确定验收对象:模型还是完整系统
模型验收关注理解、生成、上下文、速度和资源;系统验收还包括登录、知识库、业务接口、工作流、日志、管理后台和运维。合同若只写“本地大模型部署完成”,双方可能对是否包含 RAG、应用源码、监控和后续升级产生不同理解。
验收表应列出模型服务、应用、知识库、工具、权限与基础设施六类对象,并给每项指定样本、通过条件、责任人和失败处理。无法量化的“回答自然、系统智能”不作为唯一标准。
六类验收项怎么拆
| 验收类 | 主要检查 | 关键边界 |
|---|---|---|
| 回答质量 | 真实问题、结构化输出、拒答 | 不把通用常识当企业事实 |
| 知识 RAG | 召回、引用、版本、无答案 | 过期与无权限资料不能命中 |
| 权限工具 | 角色、字段、确认、幂等 | 高风险动作不自动执行 |
| 性能容量 | 首字、总耗时、并发、队列 | 使用真实长度而非单一短问题 |
| 离线安全 | 断网、外连、脱敏、审计 | 隐藏外部依赖要明确 |
| 运维恢复 | 监控、告警、备份、灰度、回滚 | 新旧版本可追踪 |
性能指标应按交互问答、长文档摘要和批处理分别定义。一个模型在短问答里响应稳定,不代表长上下文或高并发可用;同样,吞吐达标也不代表回答引用和权限正确。
验收环境应尽量接近生产的硬件、网络、权限和数据规模。若只能在缩小环境测试,要把差异和生产复验条件写入记录,不能直接推断峰值容量与高可用已经通过。
上线前故障演练清单
- 断开公网,验证模型、认证、知识库和内网工具是否按约定工作。
- 停止一个模型实例,检查排队、切换、告警和用户提示。
- 导入错误版本文档,确认待复核内容不会进入正式回答。
- 使用无权限账号查询敏感资料和调用写入工具。
- 重复提交同一任务,验证不会创建重复工单或记录。
- 恢复备份并回滚模型、应用或知识索引到指定版本。
故障演练应保留时间、操作人、系统版本、日志和恢复结果。只口头说明“支持回滚”不够,真正执行一次才能发现镜像、模型文件、数据库迁移和配置是否齐全。
交付后建立持续复验机制
模型、提示词、知识库、工具接口和业务规则都会变化。每次升级后,应复跑核心问题、权限、接口与性能样本;新增部门或知识范围时,检查是否出现权限串读;硬件和推理参数调整后,重新观察延迟、资源和失败率。
复验结果进入版本记录:哪些问题改善、哪些退化、是否需要回滚、由谁确认上线。这样私有化部署才能从一次安装变成可维护的生产系统。
哪些情况不能判定已经上线
只完成模型启动、没有真实问题评测、权限未验证、断网后关键功能失效、缺少监控或无法回滚时,都不能判定完整上线。企业可按 AI 私有化部署 明确交付范围,把 企业知识库 RAG 和 AI 智能体 分项验收,再决定是否开放更多用户和业务动作。