01

项目背景与边界

客户希望在自有机房内建立可控的大模型推理能力,核心模型、调用链路和运行日志均留在企业网络中。现场环境不依赖互联网,模型权重、Python 依赖、系统安装包和容器镜像均需提前准备并完成离线迁移。

为保护客户隐私,本案例不公开企业名称、业务域名、人员信息、服务器地址和内部安全配置。本文只呈现经脱敏的架构、实施方法和测试结论。

02

交付难点

双节点通信

16张H200分布在两台推理节点,需要核验IB/RoCE链路并降低跨节点通信对推理的影响。

严格离线实施

权重、依赖和镜像必须在外部准备,经离线介质进入客户内网,并保留完整性校验证据。

超大模型调度

可用显存无法同时承载全部目标模型,需要设计单模型在线、按需切换和显存回收机制。

可运维交付

不仅要把模型跑起来,还需提供统一接口、进程守护、启动恢复和可重复验证的测试工具。

03

落地架构

企业应用与开发工具OpenAI 兼容接口
统一模型网关LiteLLM · 路由与切换
推理服务vLLM · Ray 跨节点调度
算力基础2节点 · 16×NVIDIA H200 · IB/RoCE
  • vLLM 直接运行在宿主机,减少额外封装对推理性能的影响。
  • Ray 负责两台服务器之间的分布式调度,承载 GLM-5.2-FP8。
  • LiteLLM 对上提供统一的 OpenAI 兼容入口,屏蔽底层模型切换差异。
  • Hermes Agent 采用集中部署和多用户工作空间,为研发人员提供受控调用环境。
04

离线实施与可运维设计

01

硬件与网络核验

核对GPU、驱动、PCIe拓扑及IB/RoCE链路,完成跨节点带宽检查。

02

权重完整性

模型权重在传输前后分别计算SHA256,确保离线迁移过程未发生损坏。

03

服务守护

通过systemd实现Ray与vLLM开机自启、异常重启及标准化启停。

04

交付文档

沉淀部署架构、启动配置、功能测试证据及现场操作说明。

05

功能验证结果

项目已执行的六项基础功能测试全部通过,未出现失败项;授权故障注入项目因默认禁用而未纳入本轮结论。

6 / 6已执行用例全部通过
0失败用例
4路并发SSE流验证通过
0串扰独立会话保持隔离
  • 模型列表接口可正常返回目标模型。
  • 非流式对话内容和结束状态正常。
  • SSE事件完整、顺序正确并正常结束。
  • 多轮上下文保持一致,独立会话未发生上下文串扰。
  • 四路并发流均完整,请求标识未发生混淆。
结论边界

上述数据属于基础功能验证,不等同于最终性能验收。性能基准、长上下文、并发调优与客户UAT以验收阶段正式报告为准。

PLAN YOUR PRIVATE AI

正在规划多机多卡大模型集群?

我们可以根据模型规模、上下文、并发量、网络和安全边界,提供容量测算、现场实施与验收方案。

邮件咨询 +86 139 2521 1225