01

方案适用场景

本方案为某连锁门店运营企业(客户名称保密)设计:管理层通过受控入口查询经营数据、生成日报、安排门店任务,门店人员继续使用原有协同工具接收和反馈任务。客户名称、人员、门店、业务金额和平台账号均不在公开页面披露。

本地模型

模型服务部署在企业受控网络,权威业务数据保存在客户NAS。

统一后台

钉钉、管理端和模型服务不直接连接生产数据库,统一通过业务API校验权限。

规则优先

营业额、排名、工资和分账由SQL或规则程序计算,模型只负责理解、调用和解释。

可降级

模型或OCR暂时不可用时,固定报表、任务台账和人工流程仍可运行。

02

双 DGX Spark 与模型部署基线

两台 DGX Spark 通过 NVIDIA 认可的高速连接线共同承载一个 DeepSeek V4 Flash 模型服务。目标版本为正式版(0731);最终以客户提供的模型文件、许可证、模型卡和哈希校验为准。

双节点互联

不能把普通办公网线当成模型并行链路,需先验证高速互联、驱动、运行时和双节点通信。

模型精度

优先验证官方模型包标注的 FP4/FP8 混合精度,不预先承诺未经实测的显存、速度或并发。

上下文策略

生产建议从16K或32K起步,长文档采用分段、检索和摘要,具体上限以实测为准。

运行时

优先测试模型卡支持的 SGLang 或 vLLM;其它运行时只有在架构兼容性验证通过后才纳入方案。

03

参考业务架构

模型不是业务账本。业务主机负责任务流程、数据导入、OCR调度、权限和审计;NAS保存数据库、截图、报表、任务记录和日志;双 Spark 只提供内网模型API。

门店入口

门店和店长继续通过钉钉接收任务、确认、反馈和提醒。

管理入口

管理层通过受控的WPS/Comate或约定管理端发起查询和任务操作。

统一服务

模型调度器、业务API、权限校验、消息队列和审计日志集中在业务服务层。

数据边界

协同平台只传递完成协作所需的最少字段,权威数据持久化在客户NAS。

04

典型数字员工流程

把自然语言交互限制在可审计的工具调用范围内,不让模型直接修改正式数据。

任务闭环

识别门店、任务、数量和截止时间,经权限校验后发送任务并记录确认、催办、完成或撤销。

经营查询

通过固定SQL和规则程序计算日报、排名、同比和环比,再由模型用自然语言解释。

截图入账

识别美团、抖音等截图后先进入复核队列,工作人员确认后才写入正式数据。

报表分发

日报先由负责人审阅,不设置无人工确认的股东群发。

05

验收与故障边界

双 Spark 是共同承载主模型的双节点,不是主备容灾。任一节点或高速互联故障时,模型服务可能暂停,但业务账本和不依赖模型的固定流程应保持可用。

稳定性

验证连续运行、模型加载、内存占用和双节点通信,不以“能启动”作为唯一标准。

性能

冻结首字等待时间、完整回答时间、生成速度、最大生产上下文和小规模并发实测结果。

安全

模型只访问受控工具,不直接执行任意SQL,不持有钉钉或WPS密钥,不对公网开放。

恢复

验证节点重启、服务恢复、备份恢复、模型回滚和人工降级流程。

范围与保密客户名称、人员、门店、业务数据、账号、地址和内部配置已脱敏。本文是部署方案,不构成对特定模型版本性能、合规结论或采购价格的保证;最终以客户确认的模型包、数据流、测试条件和验收标准为准。

VALIDATE BEFORE DELIVERY

想在本地运行正式版 DeepSeek V4 Flash?

提供目标模型包、业务入口、数据边界和并发要求,我们先完成双 Spark 技术验证,再确定实施与验收口径。

邮件咨询 +86 139 2521 1225