集群设计重点
GPU数量不是唯一指标,网络拓扑、模型构建、上下文和调度方式共同决定可用性能。
确认权重精度、KV缓存、并发和上下文预算。
核验IB/RoCE链路、拓扑和实际通信带宽。
选择张量、流水线或数据并行策略。
提供鉴权、限流、路由、日志和模型切换。
生产交付要求
把故障和恢复纳入验收,而不是只测试正常请求。
支持开机恢复、异常重启和标准化启停。
覆盖GPU、网络、进程、请求与容量趋势。
测量首字延迟、输出速率、并发和长上下文。
保留版本、配置、测试证据、备份与回滚。
先确认业务目标,再决定模型和算力
告诉我们目标模型、用户规模、数据边界和现有环境,我们将梳理容量边界、实施路线与验收标准。