26 / 08 / 17

Kimi K3 与 DeepSeek-V4-Flash 自部署方案及成本对比

综合多个部署方案,如下为个人意见:

  • Kimi K3 暂时不买硬件进行自部署(费用至少人民币600万起步)

  • DeepSeek-V4-Flash 花 ¥8 万–¥12 万本地部署

  • 可以考虑在有长时间需要运行的任务:采用“DeepSeek 本地运行 + Kimi 按量付费”方案


1. Kimi K3:8×GB300 自部署成本

1.1 模型与最低硬件要求

官方模型名为 kimi-k3。“Kimi K3 Max”通常是将请求设为 reasoning_effort="max" 的最高推理强度,不是另一个独立 checkpoint;K3 默认即采用 max1

K3 是 2.8T 总参数的开放权重多模态 MoE 模型,支持 100 万 token 上下文。官方 vLLM 配方要求 NVIDIA 路径至少使用 8×GB300,真实生产流量建议使用多节点配置;AMD 路径至少需要 8×MI355X/MI350X。3 4

设备或路径能否运行 K3判断
2×DGX Spark不能合计 256GB 统一内存,远低于 K3 的 TB 级权重和运行需求。
4×RTX PRO 6000 96GB不能合计 384GB 显存,不满足 K3 官方最低硬件要求。
8×RTX PRO 6000 96GB不建议不是 8×GB300 的等效替代,缺少对应官方 K3 生产配方和 GB300 NVLink 互连。
8×GB300可以K3 官方 NVIDIA 部署配方的最低起点。
Kimi 官方 API可以无需自建 GPU,直接调用 kimi-k3 并设置 reasoning_effort=max

1.2 8×GB300 的正确交付形态

“8×GB300”应理解为 8 GPU 的计算规模,而不是 NVIDIA 标准目录中的单台 8 卡 GB300 SKU。 标准 GB300 NVL72 是包含 72 GPU 的液冷机柜;单个 GB300 计算托盘包含 4 张 Blackwell Ultra GPU 和 2 颗 Grace CPU。因此,最低 8 GPU 配置通常由同一 NVLink 域内的 2 个 4-GPU 计算托盘组成,也可以由集成商按 8 GPU 定制交付,或由云厂商提供等效配额。6 7 11

供应商若仅提供两台互相独立、没有 NVLink 或 800Gbps RDMA 的 4 卡实例,不应直接按“等效 8×GB300”验收。报价必须写明 8 张 GPU 是否处于同一 NVLink 域,以及跨节点通信方式。

报价口径确认: 本报告先按你提供的“每张 GB300 加速器 ¥75 万”计算,即 8×¥75 万=¥600 万。采购合同仍需明确“一个 GB300”究竟指单张 Blackwell Ultra GPU、一个 Grace Blackwell Superchip,还是一个 4-GPU 计算托盘;三种口径的实际 GPU 数量完全不同。

1.3 推荐的 8 GPU 配置

部件推荐配置8 GPU 合计/验收要求
计算单元GB300 NVL72 计算托盘 ×2每托盘 4 GPU,合计 8×Blackwell Ultra。
GPU 显存288GB HBM3e/GPU物理规格合计 2.304TB HBM3e;云控制台可见容量可能略低,必须在报价中写明。
CPU每托盘 2×NVIDIA Grace CPU合计 4×Grace;每托盘最高约 144 个 Arm Neoverse V2 核。
CPU 内存每托盘约 960GB–1TB LPDDR5x ECC合计约 1.92TB–2TB
系统盘每托盘 1×2TB M.2 NVMe安装 Ubuntu、驱动、容器和回滚环境。
模型缓存盘每托盘 8×4TB E1.S NVMe,或云厂商等效高速盘参考配置合计 64TB;权重应预热到本地 NVMe,避免每次启动重新下载。
GPU 互连优先同一 GB300 NVL72 NVLink v5 域NVLink 路径使用 flashinfer_nvlink_one_sided
跨节点网络每托盘 4×ConnectX-8 800Gbps;另有 BlueField-3 DPURDMA 路径使用 deepep_v2,并验证 GPUDirect RDMA。
管理与持久化独立管理网 + 共享对象/文件存储模型版本、日志和输出结果应独立于临时计算实例保存。
软件栈R580+ 驱动、CUDA 13、K3 专用 vLLM 镜像使用 vllm/vllm-openai:kimi-k3,至少 vLLM 0.27.1。3
供电与散热由 NVL72 液冷机柜或云厂商承担不能把 GB300 计算托盘当作普通风冷服务器部署。

1.4 云上自管理部署的价格

下面是 8 张 GPU 同时计费的预算。存储、公网流量、技术支持、税费和冷启动时间可能另计。

计费口径单 GPU 参考价8 GPU 集群小时价20–40 小时/月730 小时/月适用方式
Spot 市场中位数$4.31/GPU·h¥233/h¥0.47 万–¥0.93 万¥16.98 万仅适合可中断批处理;TB 级模型重启代价高。
Verda 按需公开价$8.62/GPU·h¥465/h¥0.93 万–¥1.86 万¥33.96 万适合 K3 POC 和短期保密任务。
按需市场中位数$13.31/GPU·h¥718/h¥1.44 万–¥2.87 万¥52.43 万用作立项价格波动缓冲。
OCI 公开目录价$18.00/GPU·h¥971/h¥1.94 万–¥3.89 万¥70.91 万大型云厂商的保守预算上限。

Verda 公布的 GB300 NVL72 按需价为 $8.62/GPU·h;2026-08-16 的跨云统计中,GB300 的 Spot、长期预留和按需中位数分别约为 $4.31、$8.32 和 $13.31/GPU·h。8 9 OCI 的公开目录价为 $18/GPU·h。10

按 Verda 公开价计算:

  • 20 小时 POC:约 ¥0.93 万

  • 40 小时 POC:约 ¥1.86 万

  • 全天常驻一个月:约 ¥33.96 万

  • 全天常驻 36 个月:纯 GPU 租金约 ¥1,222 万

1.5 本地自购的成本边界

自购成本项计算口径预算说明
8×GB300 加速器¥75 万/张 × 8¥600 万采用供应商提供的单价;这是核心计算硬件成本,不等于完整可运行系统。
CPU、内存、NVLink/RDMA、NVMe、机箱、电源和液冷集成商专项报价暂按 ¥50 万–¥200 万预留必须确认 ¥75 万单价中已经包含哪些部件,避免重复计算。
8 GPU 完整交付立项预算核心硬件 + 配套集成约 ¥650 万–¥800 万这是采购预留区间,不是厂商公开定价;应以含税、三年维保的 BOM 报价替换。
36 个月硬件摊销¥650 万–¥800 万 ÷ 36约 ¥18.06 万–¥22.22 万/月不含资金成本、维保、机房和停机风险。
满负载示意电费约 10–12kW IT 负载、30% 设施附加约 ¥0.95 万–¥1.14 万/月按 730 小时/月、¥1/kWh 粗略估算,最终以整机功耗为准。
购买完整 GB300 NVL72标准 72 GPU 液冷机柜行业公开估算约 $600 万–$650 万,即 ¥4,047 万–¥4,385 万未计机房改造、配电、CDU/水冷、网络和维保。12

按 Verda ¥33.96 万/月的按需租赁基准进行简单比较,¥650 万–¥800 万的自购硬件约需 19–24 个月满负载使用才能覆盖同等 GPU 租金;这还没有计入维保、机房、融资成本和利用率不足。若无法保证持续高利用率,云租赁或 API 仍更经济。

完整 NVL72 约为百千瓦级负载,除设备采购外还需要高压配电、液冷系统、机柜网络、备件和专业运维。仅需要 8 GPU 时,应优先向集成商索取“两托盘/8 GPU 定制交付”BOM,不应直接采购完整 72 GPU 机柜。

1.6 与 Kimi 官方 API 的成本关系

K3 使用路径价格适用场景
Kimi 官方 API缓存命中输入 ¥2/百万 token;未命中输入 ¥20/百万 token;输出 ¥100/百万 token5 人团队的日常高难任务。
云上自管理 8×GB300参考约 ¥465/集群小时数据必须留在自有云账户、需要检查开放权重或定制运行栈。
本地定制 8×GB300GPU 为 ¥600 万;完整交付暂按 ¥650 万–¥800 万能保证约两年以上高利用率,且数据必须完全留在本地。
本地完整 NVL72设备约 ¥4,047 万–¥4,385 万起大规模、长期、高利用率的 AI 基础设施,不适合本项目。

API 是按 token 付费,自部署是按 GPU 时间付费。低利用率团队不能仅比较单次调用价格;还需要计入集群空闲、模型冷启动、存储、监控、升级和故障恢复成本。2

1.7 K3 部署验收要求

验收项目最低要求
GPU 与显存8×GB300;记录每卡实际可见 HBM 和 ECC 状态。
互连明确同一 NVLink 域或 800Gbps RDMA;不得以普通以太网替代。
软件R580+ 驱动、CUDA 13、K3 专用 vLLM 镜像,保留完整版本清单。
模型加载权重从本地 NVMe 加载;记录冷启动与热启动时间。
长上下文至少测试 32K、256K 上下文;1M context 另做专项测试。
工具调用进行 schema 校验和自动重试,记录格式错误率。
稳定性连续运行 24–72 小时,记录 OOM、服务退出、网络错误和重启次数。

K3 偶尔可能输出其解析器无法识别的工具调用格式,因此网关必须进行 schema 校验与重试。3

1.8 K3 许可证边界

K3 使用 Kimi K3 License,不是 MIT。纯内部使用不触发其面向 Model-as-a-Service 的营收门槛;如果向第三方开放 K3 推理或微调 API,且公司及关联方连续 12 个月总收入超过 2,000 万美元,则需与 Moonshot AI 另行签约。5


2. DeepSeek-V4-Flash:自部署成本

Flash 的硬件投入远低于 K3。这里比较两条路径:适合 5 人团队的双 DGX Spark,以及面向更高并发和企业运维的 4×RTX PRO 6000 服务器。20

2.1 方案 A:2×NVIDIA DGX Spark

配置

部件推荐配置说明
主机NVIDIA DGX Spark(GB10)×2单台 128GB coherent unified memory、4TB NVMe、ConnectX-7。14
计算互连200Gbps QSFP56/RoCE 直连线Flash 按官方配方以双节点 TP=2 运行。
管理网络10GbE 交换机或现有公司网络用于用户访问、管理、日志和备份;不能替代 200G 计算互连。
电源2 路独立 UPS/插座单台峰值系统功耗约 240W。
存储现有 NAS 或对象存储保存模型备份、日志、知识库和生成文件。
软件Spark 专用 eugr/spark-vllm-b12x 容器、TP=2按官方配方设置 IFACE_NAMEIB_IFHEAD_IP13

成本

成本项预算范围说明
2×DGX Spark 主机¥6.3 万–¥8.6 万按公开海外单价 $4,699–$6,400/台换算。
200G 直连线、UPS、部署附件¥0.2 万–¥0.6 万取决于线缆长度、UPS 和管理网络。
基础设备预算¥6.5 万–¥9.2 万不含国内税费、渠道服务和售后溢价。
建议国内含税询价目标¥8 万–¥12 万应包含双机、200G 直连、预装和至少三年服务。
36 个月硬件摊销约 ¥0.18 万–¥0.26 万/月仅按硬件预算平均摊销。
满负载示意电费约 ¥456/月两台各 240W、30% 设施附加、730 小时/月、¥1/kWh。

单台 Spark 只有 128GB 统一内存,不能作为 Flash 的正式单机方案。采购验收必须包含双机 TP=2 和 ConnectX-7 200Gbps RoCE 直连;普通千兆或 10GbE 网络不能替代计算互连。13 15

2.2 方案 B:4×RTX PRO 6000 企业服务器

配置

部件推荐配置说明
服务器平台2U/4U 企业级 4 GPU 服务器使用 OEM/集成商认证整机,带 BMC、冗余风扇和兼容矩阵。
GPURTX PRO 6000 Blackwell Server Edition 96GB ×4总显存 384GB;必须采用被动散热 Server Edition。
CPUIntel Xeon 6 6500P/6700P ×2每颗至少 24 个 P-core,保证 PCIe 通道完整。
内存512GB DDR5 ECC RDIMM双 CPU 对称安装。
系统盘960GB 企业 NVMe M.2 ×2,RAID1保存系统、容器和配置。
模型盘3.84TB 企业 U.2/E3.S NVMe ×2,RAID1保存模型、缓存、日志和回滚版本。
网络双口 25GbE + 独立 BMC 管理口内部访问、备份和远程维护。
电源3200W Titanium 冗余 PSU ×2支撑多 GPU 满载和单电源故障保护。
服务三年上门/备件服务GPU、内存、硬盘、电源和风扇纳入 SLA。

成本

成本项预算范围说明
4×RTX PRO 6000 GPU¥30.7 万–¥35.8 万按公开卡价 $11,360–$13,250/卡换算。18
服务器、CPU、ECC、NVMe、网卡、PSU¥12 万–¥18 万必须使用支持被动散热 4 GPU 的认证平台。
建议含税立项预算¥45 万–¥60 万包含集成、三年服务和交付缓冲。
36 个月硬件摊销¥1.18 万–¥1.49 万/月仅硬件资本摊销。
满负载示意电费约 ¥2,847/月按约 3.0kW IT 负载、30% 设施附加估算。

不要采购主动散热工作站版 GPU,也不要将散卡安装到普通机箱。应采购 RTX PRO 6000 Blackwell Server Edition 和具有官方兼容矩阵的服务器。该卡提供 96GB ECC GDDR7、PCIe Gen5;认证平台可采用约 450W/卡的功耗策略支持 4 卡部署。16 17

2.3 双 Spark 与 4×RTX PRO 6000 的区别

性能与部署维度2×DGX Spark4×RTX PRO 6000采购判断
可用模型内存2×128GB,TP=2 分片4×96GB,合计 384GBRTX 的显存和 KV cache 余量更大。
名义 AI 算力双机最高约 2 PFLOPS FP44 卡合计最高约 16 PFLOPS FP4不能线性换算为实际 token/s。
单设备内存带宽273GB/s LPDDR5x1,597GB/s GDDR7/卡RTX 更适合提高并发和减少排队。
模型互连双机 200Gbps RoCE同机 PCIe Gen5,无 NVLinkSpark 依赖正确 RoCE 配置;RTX 依赖 PCIe 拓扑。
Flash 软件路径官方验证双 Spark、TP=2公开验证更接近 8 卡路径;4 卡属于工程方案4 卡方案必须以真实负载完成 POC。
机房条件办公设备间可部署机柜、独立供电、制冷和噪声隔离小团队部署 Spark 更轻量。
目标用户规模约 5 人、低到中并发约 10–30 人或更高并发并发和 SLA 是选择 RTX 的主要理由。

第三方双 Spark 工程测试曾报告 Flash 的 decode 速度约 41 tok/s,但测试结果受到模型版本、量化、上下文、并发、reasoning 设置和运行时影响,不能写成采购 SLA。19

2.4 Flash 的统一性能 POC

测试项目统一条件记录指标
日常对话8K 输入、512 token 输出、1 并发、reasoning_effort=lowTTFT、decode tok/s、端到端时延。
Agent 任务32K 输入、工具调用、2 并发、reasoning_effort=high成功率、工具格式正确率、平均时延。
长上下文256K 输入、512 token 输出、1 并发TTFT、峰值内存、KV cache 稳定性。
团队压力8K 输入、512 token 输出、5 并发、持续 30 分钟总吞吐、P95 时延、OOM 和错误数。
稳定性连续 72 小时循环负载GPU/内存错误、节点失联、服务重启、温度和功耗告警。

双 Spark 应重点验收 TP=2 和 200Gbps RoCE 稳定性;4×RTX PRO 6000 应重点验收 PCIe 拓扑、功耗限制、散热和所选 4 卡运行栈。两套方案必须使用相同模型版本、量化格式、上下文、推理强度和并发,不能用峰值算力替代实际测试。


3. 两个模型的自部署成本总表

模型与路径初始投入持续成本5 人团队判断
K3 官方 API无硬件投入按 token 计费K3 的默认使用方式。
K3:按需 8×GB300无硬件投入参考 ¥465/小时;20–40 小时约 ¥0.93 万–¥1.86 万/月仅在数据必须留在自有云账户或进行自托管 POC 时使用。
K3:8×GB300 全天租用无硬件投入参考约 ¥33.96 万/月;市场区间可能更高利用率不足时成本极高。
K3:8×GB300 定制自购GPU ¥600 万;完整交付暂按 ¥650 万–¥800 万摊销约 ¥18.06 万–¥22.22 万/月;电费约 ¥0.95 万–¥1.14 万/月只有持续高利用率和严格本地数据要求同时成立时才考虑。
K3:完整 GB300 NVL72 自购约 ¥4,047 万–¥4,385 万起百千瓦级机房、液冷、网络和运维不适合 5 人团队。
Flash:2×DGX Spark建议含税预算 ¥8 万–¥12 万电费约 ¥456/月;36 个月摊销约 ¥0.18 万–¥0.26 万/月Flash 首选方案
Flash:4×RTX PRO 6000建议含税预算 ¥45 万–¥60 万电费约 ¥2,847/月;36 个月摊销约 ¥1.18 万–¥1.49 万/月仅在更高并发、扩展和企业 SLA 明确时采用。

成本数量级非常清楚:K3 的最低自托管硬件已经进入数据中心级基础设施,Flash 则可以用桌面级双机或单台企业服务器常驻。两者不应采购同一套硬件,也不应为了偶发 K3 任务放弃 Flash 的低成本常驻方案。


4. 参考资料


5. 最终结论

Kimi K3

K3 的最低自部署起点是 8×GB300。按你提供的供应商单价 ¥75 万/张计算,8 张加速器为 ¥600 万;加上 CPU、内存、NVLink/RDMA、存储、电源、液冷、集成和维保,完整 8 GPU 交付建议暂按 ¥650 万–¥800 万立项,并以供应商正式 BOM 修正。公开按需租赁参考价约 ¥465/小时,20–40 小时 POC 约 ¥0.93 万–¥1.86 万,全天常驻约 ¥33.96 万/月

简单按硬件与云租金比较,自购约需 19–24 个月满负载才能接近回本,实际还要承担机房、维保和利用率风险。因此,K3 仍应优先使用官方 API;数据不能离开自有云账户时先按需租用 8×GB300。只有已证明能够长期高利用率运行、并且数据必须完全留在本地时,才进入 ¥650 万–¥800 万的定制采购流程。

DeepSeek-V4-Flash

Flash 建议采购 2×DGX Spark + 200Gbps 直连,国内含税预算控制在 ¥8 万–¥12 万。这套方案足以作为 5 人团队的内网常驻模型,设备投入和持续成本都显著低于 K3。

只有已经确认需要更高并发、未来扩展到约 10–30 人、或必须具备企业级 BMC、冗余电源和上门 SLA 时,才选择 4×RTX PRO 6000,含税立项预算约 ¥45 万–¥60 万;下单前必须完成真实 Flash POC。

建议的最终架构

任务类型推荐运行位置
日常聊天、代码、内部知识库、固定 AgentDeepSeek-V4-Flash,双 DGX Spark 内网常驻
高价值长程编码、复杂知识工作、视觉理解Kimi K3 官方 API,reasoning_effort=max
数据不能离开自有云账户的特殊 K3 任务临时租用 8×GB300,按任务启动并及时释放
未来团队扩展且 Flash 并发不足先完成 POC,再将 Flash 升级为 4×RTX PRO 6000 服务器

最终采购建议:购买双 DGX Spark 运行 Flash;K3 默认采用官方 API,并为特殊保密任务保留按需 8×GB300 通道。若后续实测证明 K3 能连续保持约两年以上高利用率,再按“8 张 GPU ¥600 万、完整交付 ¥650 万–¥800 万”的口径启动正式采购询价。


附录:模型能力、价格与响应性能对比

模型上下文窗口创建者智能指数单任务成本(美元)中位生成速度(tokens/s)首块延迟(秒)端到端响应时间(秒)
Claude Opus 5(max)1MAnthropic63$2.345352.5461.96
Claude Opus 5(xhigh)1MAnthropic63$1.805438.9348.15
Claude Fable 5(with fallback)1MAnthropic62$3.1469122.83130.13
Claude Opus 5(high)1MAnthropic61$1.235321.4830.86
GPT-5.6 Sol(max)1MOpenAI61$1.2371137.55144.61
Grok 4.6(high)500kSpaceXAI61$0.845850.0258.60
Kimi K3(max)1.05MKimi60$0.84392.8367.59
GPT-5.6 Sol(xhigh)1MOpenAI59$0.816754.8662.33
Claude Opus 5(medium)1MAnthropic59$0.725411.4920.80
Qwen3.8 Max1MAlibaba58$1.13452.6758.27
Qwen3.8 2.4T A95B984kAlibaba58$1.09462.6056.58
GPT-5.6 Sol(high)1MOpenAI57$0.556814.7322.12
Muse Spark 1.2(xhigh)1.05MMeta57$0.40
GPT-5.6 Terra(max)1MOpenAI57$0.51121156.55160.68
Gemini 3.7 Flash(high)1MGoogle56$0.40
Grok 4.5(high)500kSpaceXAI56$0.365310.8520.28
GPT-5.6 Sol(medium)1MOpenAI56$0.37664.8112.43
Claude Sonnet 5(max)1MAnthropic55$1.7281182.26188.45
Gemini 3.7 Flash(medium)1MGoogle53$0.26
DeepSeek V4 Pro 0813(max)1MDeepSeek53$0.25801.6832.84