01

專案背景與邊界

客戶希望在自有機房建立可控的大模型推理能力,核心模型、調用鏈路和運行日誌均留在企業網絡。現場環境不依賴互聯網,模型權重、Python 依賴、系統安裝包及容器映像均需提前準備並完成離線遷移。

為保護客戶私隱,本案例不公開企業名稱、業務網域、人物資料、伺服器位址及內部安全配置,只呈現經脫敏的架構、實施方法和測試結論。

02

交付難點

雙節點通訊

16張H200分佈在兩台推理節點,需要核驗IB/RoCE鏈路並控制跨節點通訊對推理的影響。

嚴格離線實施

權重、依賴和映像必須在外部準備,經離線介質進入客戶內網,並保留完整性校驗證據。

超大模型調度

可用顯存無法同時承載全部目標模型,需要設計單模型在線、按需切換和顯存回收機制。

可維運交付

不只要啟動模型,還需提供統一介面、進程守護、啟動恢復及可重複驗證的測試工具。

03

落地架構

企業應用與開發工具OpenAI 相容介面
統一模型閘道LiteLLM · 路由與切換
推理服務vLLM · Ray 跨節點調度
算力基礎2節點 · 16×NVIDIA H200 · IB/RoCE
  • vLLM 直接運行於宿主機,減少額外封裝對推理效能的影響。
  • Ray 負責兩台伺服器之間的分佈式調度,承載 GLM-5.2-FP8。
  • LiteLLM 向上提供統一的 OpenAI 相容入口,屏蔽底層模型切換差異。
  • Hermes Agent 採用集中部署和多用戶工作空間,提供受控調用環境。
04

離線實施與可維運設計

01

硬件與網絡核驗

核對GPU、驅動、PCIe拓撲及IB/RoCE鏈路,完成跨節點頻寬檢查。

02

權重完整性

模型權重在傳輸前後分別計算SHA256,確認離線遷移過程無損。

03

服務守護

透過systemd實現Ray與vLLM開機自啟、異常重啟及標準化啟停。

04

交付文件

沉澱部署架構、啟動配置、功能測試證據及現場操作說明。

05

功能驗證結果

專案已執行的六項基礎功能測試全部通過,未出現失敗項;授權故障注入項目因預設停用而未納入本輪結論。

6 / 6已執行用例全部通過
0失敗用例
4路並發SSE串流驗證通過
0串擾獨立會話保持隔離
  • 模型列表介面可正常返回目標模型。
  • 非串流對話內容和結束狀態正常。
  • SSE事件完整、順序正確並正常結束。
  • 多輪上下文保持一致,獨立會話未發生上下文串擾。
  • 四路並發串流均完整,請求標識未發生混淆。
結論邊界

上述數據屬於基礎功能驗證,不等同最終效能驗收。效能基準、長上下文、並發調優及客戶UAT以驗收階段正式報告為準。

PLAN YOUR PRIVATE AI

正在規劃多機多卡大模型叢集?

我們可以根據模型規模、上下文、並發量、網絡及安全邊界,提供容量測算、現場實施與驗收方案。

電郵諮詢 +86 139 2521 1225