方案适用场景
本方案为某连锁门店运营企业(客户名称保密)设计:管理层通过受控入口查询经营数据、生成日报、安排门店任务,门店人员继续使用原有协同工具接收和反馈任务。客户名称、人员、门店、业务金额和平台账号均不在公开页面披露。
模型服务部署在企业受控网络,权威业务数据保存在客户NAS。
钉钉、管理端和模型服务不直接连接生产数据库,统一通过业务API校验权限。
营业额、排名、工资和分账由SQL或规则程序计算,模型只负责理解、调用和解释。
模型或OCR暂时不可用时,固定报表、任务台账和人工流程仍可运行。
双 DGX Spark 与模型部署基线
两台 DGX Spark 通过 NVIDIA 认可的高速连接线共同承载一个 DeepSeek V4 Flash 模型服务。目标版本为正式版(0731);最终以客户提供的模型文件、许可证、模型卡和哈希校验为准。
不能把普通办公网线当成模型并行链路,需先验证高速互联、驱动、运行时和双节点通信。
优先验证官方模型包标注的 FP4/FP8 混合精度,不预先承诺未经实测的显存、速度或并发。
生产建议从16K或32K起步,长文档采用分段、检索和摘要,具体上限以实测为准。
优先测试模型卡支持的 SGLang 或 vLLM;其它运行时只有在架构兼容性验证通过后才纳入方案。
参考业务架构
模型不是业务账本。业务主机负责任务流程、数据导入、OCR调度、权限和审计;NAS保存数据库、截图、报表、任务记录和日志;双 Spark 只提供内网模型API。
门店和店长继续通过钉钉接收任务、确认、反馈和提醒。
管理层通过受控的WPS/Comate或约定管理端发起查询和任务操作。
模型调度器、业务API、权限校验、消息队列和审计日志集中在业务服务层。
协同平台只传递完成协作所需的最少字段,权威数据持久化在客户NAS。
典型数字员工流程
把自然语言交互限制在可审计的工具调用范围内,不让模型直接修改正式数据。
识别门店、任务、数量和截止时间,经权限校验后发送任务并记录确认、催办、完成或撤销。
通过固定SQL和规则程序计算日报、排名、同比和环比,再由模型用自然语言解释。
识别美团、抖音等截图后先进入复核队列,工作人员确认后才写入正式数据。
日报先由负责人审阅,不设置无人工确认的股东群发。
验收与故障边界
双 Spark 是共同承载主模型的双节点,不是主备容灾。任一节点或高速互联故障时,模型服务可能暂停,但业务账本和不依赖模型的固定流程应保持可用。
验证连续运行、模型加载、内存占用和双节点通信,不以“能启动”作为唯一标准。
冻结首字等待时间、完整回答时间、生成速度、最大生产上下文和小规模并发实测结果。
模型只访问受控工具,不直接执行任意SQL,不持有钉钉或WPS密钥,不对公网开放。
验证节点重启、服务恢复、备份恢复、模型回滚和人工降级流程。
范围与保密客户名称、人员、门店、业务数据、账号、地址和内部配置已脱敏。本文是部署方案,不构成对特定模型版本性能、合规结论或采购价格的保证;最终以客户确认的模型包、数据流、测试条件和验收标准为准。
想在本地运行正式版 DeepSeek V4 Flash?
提供目标模型包、业务入口、数据边界和并发要求,我们先完成双 Spark 技术验证,再确定实施与验收口径。