專案背景與邊界
客戶希望在自有機房建立可控的大模型推理能力,核心模型、調用鏈路和運行日誌均留在企業網絡。現場環境不依賴互聯網,模型權重、Python 依賴、系統安裝包及容器映像均需提前準備並完成離線遷移。
為保護客戶私隱,本案例不公開企業名稱、業務網域、人物資料、伺服器位址及內部安全配置,只呈現經脫敏的架構、實施方法和測試結論。
交付難點
16張H200分佈在兩台推理節點,需要核驗IB/RoCE鏈路並控制跨節點通訊對推理的影響。
權重、依賴和映像必須在外部準備,經離線介質進入客戶內網,並保留完整性校驗證據。
可用顯存無法同時承載全部目標模型,需要設計單模型在線、按需切換和顯存回收機制。
不只要啟動模型,還需提供統一介面、進程守護、啟動恢復及可重複驗證的測試工具。
落地架構
企業應用與開發工具OpenAI 相容介面
↓統一模型閘道LiteLLM · 路由與切換
↓推理服務vLLM · Ray 跨節點調度
↓算力基礎2節點 · 16×NVIDIA H200 · IB/RoCE
- vLLM 直接運行於宿主機,減少額外封裝對推理效能的影響。
- Ray 負責兩台伺服器之間的分佈式調度,承載 GLM-5.2-FP8。
- LiteLLM 向上提供統一的 OpenAI 相容入口,屏蔽底層模型切換差異。
- Hermes Agent 採用集中部署和多用戶工作空間,提供受控調用環境。
離線實施與可維運設計
01
硬件與網絡核驗
核對GPU、驅動、PCIe拓撲及IB/RoCE鏈路,完成跨節點頻寬檢查。
02
權重完整性
模型權重在傳輸前後分別計算SHA256,確認離線遷移過程無損。
03
服務守護
透過systemd實現Ray與vLLM開機自啟、異常重啟及標準化啟停。
04
交付文件
沉澱部署架構、啟動配置、功能測試證據及現場操作說明。
功能驗證結果
專案已執行的六項基礎功能測試全部通過,未出現失敗項;授權故障注入項目因預設停用而未納入本輪結論。
6 / 6已執行用例全部通過
0失敗用例
4路並發SSE串流驗證通過
0串擾獨立會話保持隔離
- 模型列表介面可正常返回目標模型。
- 非串流對話內容和結束狀態正常。
- SSE事件完整、順序正確並正常結束。
- 多輪上下文保持一致,獨立會話未發生上下文串擾。
- 四路並發串流均完整,請求標識未發生混淆。
結論邊界
上述數據屬於基礎功能驗證,不等同最終效能驗收。效能基準、長上下文、並發調優及客戶UAT以驗收階段正式報告為準。
正在規劃多機多卡大模型叢集?
我們可以根據模型規模、上下文、並發量、網絡及安全邊界,提供容量測算、現場實施與驗收方案。