26 / 08 / 17
Kimi K3 暂时不买硬件进行自部署(费用至少人民币600万起步)
DeepSeek-V4-Flash 花 ¥8 万–¥12 万本地部署
可以考虑在有长时间需要运行的任务:采用“DeepSeek 本地运行 + Kimi 按量付费”方案
官方模型名为 kimi-k3。“Kimi K3 Max”通常是将请求设为 reasoning_effort="max" 的最高推理强度,不是另一个独立 checkpoint;K3 默认即采用 max。1
K3 是 2.8T 总参数的开放权重多模态 MoE 模型,支持 100 万 token 上下文。官方 vLLM 配方要求 NVIDIA 路径至少使用 8×GB300,真实生产流量建议使用多节点配置;AMD 路径至少需要 8×MI355X/MI350X。3 4
| 设备或路径 | 能否运行 K3 | 判断 |
|---|---|---|
| 2×DGX Spark | 不能 | 合计 256GB 统一内存,远低于 K3 的 TB 级权重和运行需求。 |
| 4×RTX PRO 6000 96GB | 不能 | 合计 384GB 显存,不满足 K3 官方最低硬件要求。 |
| 8×RTX PRO 6000 96GB | 不建议 | 不是 8×GB300 的等效替代,缺少对应官方 K3 生产配方和 GB300 NVLink 互连。 |
| 8×GB300 | 可以 | K3 官方 NVIDIA 部署配方的最低起点。 |
| Kimi 官方 API | 可以 | 无需自建 GPU,直接调用 kimi-k3 并设置 reasoning_effort=max。 |
“8×GB300”应理解为 8 GPU 的计算规模,而不是 NVIDIA 标准目录中的单台 8 卡 GB300 SKU。 标准 GB300 NVL72 是包含 72 GPU 的液冷机柜;单个 GB300 计算托盘包含 4 张 Blackwell Ultra GPU 和 2 颗 Grace CPU。因此,最低 8 GPU 配置通常由同一 NVLink 域内的 2 个 4-GPU 计算托盘组成,也可以由集成商按 8 GPU 定制交付,或由云厂商提供等效配额。6 7 11
供应商若仅提供两台互相独立、没有 NVLink 或 800Gbps RDMA 的 4 卡实例,不应直接按“等效 8×GB300”验收。报价必须写明 8 张 GPU 是否处于同一 NVLink 域,以及跨节点通信方式。
报价口径确认: 本报告先按你提供的“每张 GB300 加速器 ¥75 万”计算,即 8×¥75 万=¥600 万。采购合同仍需明确“一个 GB300”究竟指单张 Blackwell Ultra GPU、一个 Grace Blackwell Superchip,还是一个 4-GPU 计算托盘;三种口径的实际 GPU 数量完全不同。
| 部件 | 推荐配置 | 8 GPU 合计/验收要求 |
|---|---|---|
| 计算单元 | GB300 NVL72 计算托盘 ×2 | 每托盘 4 GPU,合计 8×Blackwell Ultra。 |
| GPU 显存 | 288GB HBM3e/GPU | 物理规格合计 2.304TB HBM3e;云控制台可见容量可能略低,必须在报价中写明。 |
| CPU | 每托盘 2×NVIDIA Grace CPU | 合计 4×Grace;每托盘最高约 144 个 Arm Neoverse V2 核。 |
| CPU 内存 | 每托盘约 960GB–1TB LPDDR5x ECC | 合计约 1.92TB–2TB。 |
| 系统盘 | 每托盘 1×2TB M.2 NVMe | 安装 Ubuntu、驱动、容器和回滚环境。 |
| 模型缓存盘 | 每托盘 8×4TB E1.S NVMe,或云厂商等效高速盘 | 参考配置合计 64TB;权重应预热到本地 NVMe,避免每次启动重新下载。 |
| GPU 互连 | 优先同一 GB300 NVL72 NVLink v5 域 | NVLink 路径使用 flashinfer_nvlink_one_sided。 |
| 跨节点网络 | 每托盘 4×ConnectX-8 800Gbps;另有 BlueField-3 DPU | RDMA 路径使用 deepep_v2,并验证 GPUDirect RDMA。 |
| 管理与持久化 | 独立管理网 + 共享对象/文件存储 | 模型版本、日志和输出结果应独立于临时计算实例保存。 |
| 软件栈 | R580+ 驱动、CUDA 13、K3 专用 vLLM 镜像 | 使用 vllm/vllm-openai:kimi-k3,至少 vLLM 0.27.1。3 |
| 供电与散热 | 由 NVL72 液冷机柜或云厂商承担 | 不能把 GB300 计算托盘当作普通风冷服务器部署。 |
下面是 8 张 GPU 同时计费的预算。存储、公网流量、技术支持、税费和冷启动时间可能另计。
| 计费口径 | 单 GPU 参考价 | 8 GPU 集群小时价 | 20–40 小时/月 | 730 小时/月 | 适用方式 |
|---|---|---|---|---|---|
| Spot 市场中位数 | $4.31/GPU·h | 约 ¥233/h | 约 ¥0.47 万–¥0.93 万 | 约 ¥16.98 万 | 仅适合可中断批处理;TB 级模型重启代价高。 |
| Verda 按需公开价 | $8.62/GPU·h | 约 ¥465/h | 约 ¥0.93 万–¥1.86 万 | 约 ¥33.96 万 | 适合 K3 POC 和短期保密任务。 |
| 按需市场中位数 | $13.31/GPU·h | 约 ¥718/h | 约 ¥1.44 万–¥2.87 万 | 约 ¥52.43 万 | 用作立项价格波动缓冲。 |
| OCI 公开目录价 | $18.00/GPU·h | 约 ¥971/h | 约 ¥1.94 万–¥3.89 万 | 约 ¥70.91 万 | 大型云厂商的保守预算上限。 |
Verda 公布的 GB300 NVL72 按需价为 $8.62/GPU·h;2026-08-16 的跨云统计中,GB300 的 Spot、长期预留和按需中位数分别约为 $4.31、$8.32 和 $13.31/GPU·h。8 9 OCI 的公开目录价为 $18/GPU·h。10
按 Verda 公开价计算:
20 小时 POC:约 ¥0.93 万;
40 小时 POC:约 ¥1.86 万;
全天常驻一个月:约 ¥33.96 万;
全天常驻 36 个月:纯 GPU 租金约 ¥1,222 万。
| 自购成本项 | 计算口径 | 预算 | 说明 |
|---|---|---|---|
| 8×GB300 加速器 | ¥75 万/张 × 8 | ¥600 万 | 采用供应商提供的单价;这是核心计算硬件成本,不等于完整可运行系统。 |
| CPU、内存、NVLink/RDMA、NVMe、机箱、电源和液冷 | 集成商专项报价 | 暂按 ¥50 万–¥200 万预留 | 必须确认 ¥75 万单价中已经包含哪些部件,避免重复计算。 |
| 8 GPU 完整交付立项预算 | 核心硬件 + 配套集成 | 约 ¥650 万–¥800 万 | 这是采购预留区间,不是厂商公开定价;应以含税、三年维保的 BOM 报价替换。 |
| 36 个月硬件摊销 | ¥650 万–¥800 万 ÷ 36 | 约 ¥18.06 万–¥22.22 万/月 | 不含资金成本、维保、机房和停机风险。 |
| 满负载示意电费 | 约 10–12kW IT 负载、30% 设施附加 | 约 ¥0.95 万–¥1.14 万/月 | 按 730 小时/月、¥1/kWh 粗略估算,最终以整机功耗为准。 |
| 购买完整 GB300 NVL72 | 标准 72 GPU 液冷机柜 | 行业公开估算约 $600 万–$650 万,即 ¥4,047 万–¥4,385 万 | 未计机房改造、配电、CDU/水冷、网络和维保。12 |
按 Verda ¥33.96 万/月的按需租赁基准进行简单比较,¥650 万–¥800 万的自购硬件约需 19–24 个月满负载使用才能覆盖同等 GPU 租金;这还没有计入维保、机房、融资成本和利用率不足。若无法保证持续高利用率,云租赁或 API 仍更经济。
完整 NVL72 约为百千瓦级负载,除设备采购外还需要高压配电、液冷系统、机柜网络、备件和专业运维。仅需要 8 GPU 时,应优先向集成商索取“两托盘/8 GPU 定制交付”BOM,不应直接采购完整 72 GPU 机柜。
| K3 使用路径 | 价格 | 适用场景 |
|---|---|---|
| Kimi 官方 API | 缓存命中输入 ¥2/百万 token;未命中输入 ¥20/百万 token;输出 ¥100/百万 token | 5 人团队的日常高难任务。 |
| 云上自管理 8×GB300 | 参考约 ¥465/集群小时 | 数据必须留在自有云账户、需要检查开放权重或定制运行栈。 |
| 本地定制 8×GB300 | GPU 为 ¥600 万;完整交付暂按 ¥650 万–¥800 万 | 能保证约两年以上高利用率,且数据必须完全留在本地。 |
| 本地完整 NVL72 | 设备约 ¥4,047 万–¥4,385 万起 | 大规模、长期、高利用率的 AI 基础设施,不适合本项目。 |
API 是按 token 付费,自部署是按 GPU 时间付费。低利用率团队不能仅比较单次调用价格;还需要计入集群空闲、模型冷启动、存储、监控、升级和故障恢复成本。2
| 验收项目 | 最低要求 |
|---|---|
| GPU 与显存 | 8×GB300;记录每卡实际可见 HBM 和 ECC 状态。 |
| 互连 | 明确同一 NVLink 域或 800Gbps RDMA;不得以普通以太网替代。 |
| 软件 | R580+ 驱动、CUDA 13、K3 专用 vLLM 镜像,保留完整版本清单。 |
| 模型加载 | 权重从本地 NVMe 加载;记录冷启动与热启动时间。 |
| 长上下文 | 至少测试 32K、256K 上下文;1M context 另做专项测试。 |
| 工具调用 | 进行 schema 校验和自动重试,记录格式错误率。 |
| 稳定性 | 连续运行 24–72 小时,记录 OOM、服务退出、网络错误和重启次数。 |
K3 偶尔可能输出其解析器无法识别的工具调用格式,因此网关必须进行 schema 校验与重试。3
K3 使用 Kimi K3 License,不是 MIT。纯内部使用不触发其面向 Model-as-a-Service 的营收门槛;如果向第三方开放 K3 推理或微调 API,且公司及关联方连续 12 个月总收入超过 2,000 万美元,则需与 Moonshot AI 另行签约。5
Flash 的硬件投入远低于 K3。这里比较两条路径:适合 5 人团队的双 DGX Spark,以及面向更高并发和企业运维的 4×RTX PRO 6000 服务器。20
| 部件 | 推荐配置 | 说明 |
|---|---|---|
| 主机 | NVIDIA DGX Spark(GB10)×2 | 单台 128GB coherent unified memory、4TB NVMe、ConnectX-7。14 |
| 计算互连 | 200Gbps QSFP56/RoCE 直连线 | Flash 按官方配方以双节点 TP=2 运行。 |
| 管理网络 | 10GbE 交换机或现有公司网络 | 用于用户访问、管理、日志和备份;不能替代 200G 计算互连。 |
| 电源 | 2 路独立 UPS/插座 | 单台峰值系统功耗约 240W。 |
| 存储 | 现有 NAS 或对象存储 | 保存模型备份、日志、知识库和生成文件。 |
| 软件 | Spark 专用 eugr/spark-vllm-b12x 容器、TP=2 | 按官方配方设置 IFACE_NAME、IB_IF 和 HEAD_IP。13 |
| 成本项 | 预算范围 | 说明 |
|---|---|---|
| 2×DGX Spark 主机 | ¥6.3 万–¥8.6 万 | 按公开海外单价 $4,699–$6,400/台换算。 |
| 200G 直连线、UPS、部署附件 | ¥0.2 万–¥0.6 万 | 取决于线缆长度、UPS 和管理网络。 |
| 基础设备预算 | ¥6.5 万–¥9.2 万 | 不含国内税费、渠道服务和售后溢价。 |
| 建议国内含税询价目标 | ¥8 万–¥12 万 | 应包含双机、200G 直连、预装和至少三年服务。 |
| 36 个月硬件摊销 | 约 ¥0.18 万–¥0.26 万/月 | 仅按硬件预算平均摊销。 |
| 满负载示意电费 | 约 ¥456/月 | 两台各 240W、30% 设施附加、730 小时/月、¥1/kWh。 |
单台 Spark 只有 128GB 统一内存,不能作为 Flash 的正式单机方案。采购验收必须包含双机 TP=2 和 ConnectX-7 200Gbps RoCE 直连;普通千兆或 10GbE 网络不能替代计算互连。13 15
| 部件 | 推荐配置 | 说明 |
|---|---|---|
| 服务器平台 | 2U/4U 企业级 4 GPU 服务器 | 使用 OEM/集成商认证整机,带 BMC、冗余风扇和兼容矩阵。 |
| GPU | RTX PRO 6000 Blackwell Server Edition 96GB ×4 | 总显存 384GB;必须采用被动散热 Server Edition。 |
| CPU | Intel Xeon 6 6500P/6700P ×2 | 每颗至少 24 个 P-core,保证 PCIe 通道完整。 |
| 内存 | 512GB DDR5 ECC RDIMM | 双 CPU 对称安装。 |
| 系统盘 | 960GB 企业 NVMe M.2 ×2,RAID1 | 保存系统、容器和配置。 |
| 模型盘 | 3.84TB 企业 U.2/E3.S NVMe ×2,RAID1 | 保存模型、缓存、日志和回滚版本。 |
| 网络 | 双口 25GbE + 独立 BMC 管理口 | 内部访问、备份和远程维护。 |
| 电源 | 3200W Titanium 冗余 PSU ×2 | 支撑多 GPU 满载和单电源故障保护。 |
| 服务 | 三年上门/备件服务 | GPU、内存、硬盘、电源和风扇纳入 SLA。 |
| 成本项 | 预算范围 | 说明 |
|---|---|---|
| 4×RTX PRO 6000 GPU | ¥30.7 万–¥35.8 万 | 按公开卡价 $11,360–$13,250/卡换算。18 |
| 服务器、CPU、ECC、NVMe、网卡、PSU | ¥12 万–¥18 万 | 必须使用支持被动散热 4 GPU 的认证平台。 |
| 建议含税立项预算 | ¥45 万–¥60 万 | 包含集成、三年服务和交付缓冲。 |
| 36 个月硬件摊销 | ¥1.18 万–¥1.49 万/月 | 仅硬件资本摊销。 |
| 满负载示意电费 | 约 ¥2,847/月 | 按约 3.0kW IT 负载、30% 设施附加估算。 |
不要采购主动散热工作站版 GPU,也不要将散卡安装到普通机箱。应采购 RTX PRO 6000 Blackwell Server Edition 和具有官方兼容矩阵的服务器。该卡提供 96GB ECC GDDR7、PCIe Gen5;认证平台可采用约 450W/卡的功耗策略支持 4 卡部署。16 17
| 性能与部署维度 | 2×DGX Spark | 4×RTX PRO 6000 | 采购判断 |
|---|---|---|---|
| 可用模型内存 | 2×128GB,TP=2 分片 | 4×96GB,合计 384GB | RTX 的显存和 KV cache 余量更大。 |
| 名义 AI 算力 | 双机最高约 2 PFLOPS FP4 | 4 卡合计最高约 16 PFLOPS FP4 | 不能线性换算为实际 token/s。 |
| 单设备内存带宽 | 273GB/s LPDDR5x | 1,597GB/s GDDR7/卡 | RTX 更适合提高并发和减少排队。 |
| 模型互连 | 双机 200Gbps RoCE | 同机 PCIe Gen5,无 NVLink | Spark 依赖正确 RoCE 配置;RTX 依赖 PCIe 拓扑。 |
| Flash 软件路径 | 官方验证双 Spark、TP=2 | 公开验证更接近 8 卡路径;4 卡属于工程方案 | 4 卡方案必须以真实负载完成 POC。 |
| 机房条件 | 办公设备间可部署 | 机柜、独立供电、制冷和噪声隔离 | 小团队部署 Spark 更轻量。 |
| 目标用户规模 | 约 5 人、低到中并发 | 约 10–30 人或更高并发 | 并发和 SLA 是选择 RTX 的主要理由。 |
第三方双 Spark 工程测试曾报告 Flash 的 decode 速度约 41 tok/s,但测试结果受到模型版本、量化、上下文、并发、reasoning 设置和运行时影响,不能写成采购 SLA。19
| 测试项目 | 统一条件 | 记录指标 |
|---|---|---|
| 日常对话 | 8K 输入、512 token 输出、1 并发、reasoning_effort=low | TTFT、decode tok/s、端到端时延。 |
| Agent 任务 | 32K 输入、工具调用、2 并发、reasoning_effort=high | 成功率、工具格式正确率、平均时延。 |
| 长上下文 | 256K 输入、512 token 输出、1 并发 | TTFT、峰值内存、KV cache 稳定性。 |
| 团队压力 | 8K 输入、512 token 输出、5 并发、持续 30 分钟 | 总吞吐、P95 时延、OOM 和错误数。 |
| 稳定性 | 连续 72 小时循环负载 | GPU/内存错误、节点失联、服务重启、温度和功耗告警。 |
双 Spark 应重点验收 TP=2 和 200Gbps RoCE 稳定性;4×RTX PRO 6000 应重点验收 PCIe 拓扑、功耗限制、散热和所选 4 卡运行栈。两套方案必须使用相同模型版本、量化格式、上下文、推理强度和并发,不能用峰值算力替代实际测试。
| 模型与路径 | 初始投入 | 持续成本 | 5 人团队判断 |
|---|---|---|---|
| K3 官方 API | 无硬件投入 | 按 token 计费 | K3 的默认使用方式。 |
| K3:按需 8×GB300 | 无硬件投入 | 参考 ¥465/小时;20–40 小时约 ¥0.93 万–¥1.86 万/月 | 仅在数据必须留在自有云账户或进行自托管 POC 时使用。 |
| K3:8×GB300 全天租用 | 无硬件投入 | 参考约 ¥33.96 万/月;市场区间可能更高 | 利用率不足时成本极高。 |
| K3:8×GB300 定制自购 | GPU ¥600 万;完整交付暂按 ¥650 万–¥800 万 | 摊销约 ¥18.06 万–¥22.22 万/月;电费约 ¥0.95 万–¥1.14 万/月 | 只有持续高利用率和严格本地数据要求同时成立时才考虑。 |
| K3:完整 GB300 NVL72 自购 | 约 ¥4,047 万–¥4,385 万起 | 百千瓦级机房、液冷、网络和运维 | 不适合 5 人团队。 |
| Flash:2×DGX Spark | 建议含税预算 ¥8 万–¥12 万 | 电费约 ¥456/月;36 个月摊销约 ¥0.18 万–¥0.26 万/月 | Flash 首选方案。 |
| Flash:4×RTX PRO 6000 | 建议含税预算 ¥45 万–¥60 万 | 电费约 ¥2,847/月;36 个月摊销约 ¥1.18 万–¥1.49 万/月 | 仅在更高并发、扩展和企业 SLA 明确时采用。 |
成本数量级非常清楚:K3 的最低自托管硬件已经进入数据中心级基础设施,Flash 则可以用桌面级双机或单台企业服务器常驻。两者不应采购同一套硬件,也不应为了偶发 K3 任务放弃 Flash 的低成本常驻方案。
K3 的最低自部署起点是 8×GB300。按你提供的供应商单价 ¥75 万/张计算,8 张加速器为 ¥600 万;加上 CPU、内存、NVLink/RDMA、存储、电源、液冷、集成和维保,完整 8 GPU 交付建议暂按 ¥650 万–¥800 万立项,并以供应商正式 BOM 修正。公开按需租赁参考价约 ¥465/小时,20–40 小时 POC 约 ¥0.93 万–¥1.86 万,全天常驻约 ¥33.96 万/月。
简单按硬件与云租金比较,自购约需 19–24 个月满负载才能接近回本,实际还要承担机房、维保和利用率风险。因此,K3 仍应优先使用官方 API;数据不能离开自有云账户时先按需租用 8×GB300。只有已证明能够长期高利用率运行、并且数据必须完全留在本地时,才进入 ¥650 万–¥800 万的定制采购流程。
Flash 建议采购 2×DGX Spark + 200Gbps 直连,国内含税预算控制在 ¥8 万–¥12 万。这套方案足以作为 5 人团队的内网常驻模型,设备投入和持续成本都显著低于 K3。
只有已经确认需要更高并发、未来扩展到约 10–30 人、或必须具备企业级 BMC、冗余电源和上门 SLA 时,才选择 4×RTX PRO 6000,含税立项预算约 ¥45 万–¥60 万;下单前必须完成真实 Flash POC。
| 任务类型 | 推荐运行位置 |
|---|---|
| 日常聊天、代码、内部知识库、固定 Agent | DeepSeek-V4-Flash,双 DGX Spark 内网常驻 |
| 高价值长程编码、复杂知识工作、视觉理解 | Kimi K3 官方 API,reasoning_effort=max |
| 数据不能离开自有云账户的特殊 K3 任务 | 临时租用 8×GB300,按任务启动并及时释放 |
| 未来团队扩展且 Flash 并发不足 | 先完成 POC,再将 Flash 升级为 4×RTX PRO 6000 服务器 |
最终采购建议:购买双 DGX Spark 运行 Flash;K3 默认采用官方 API,并为特殊保密任务保留按需 8×GB300 通道。若后续实测证明 K3 能连续保持约两年以上高利用率,再按“8 张 GPU ¥600 万、完整交付 ¥650 万–¥800 万”的口径启动正式采购询价。
| 模型 | 上下文窗口 | 创建者 | 智能指数 | 单任务成本(美元) | 中位生成速度(tokens/s) | 首块延迟(秒) | 端到端响应时间(秒) |
|---|---|---|---|---|---|---|---|
| Claude Opus 5(max) | 1M | Anthropic | 63 | $2.34 | 53 | 52.54 | 61.96 |
| Claude Opus 5(xhigh) | 1M | Anthropic | 63 | $1.80 | 54 | 38.93 | 48.15 |
| Claude Fable 5(with fallback) | 1M | Anthropic | 62 | $3.14 | 69 | 122.83 | 130.13 |
| Claude Opus 5(high) | 1M | Anthropic | 61 | $1.23 | 53 | 21.48 | 30.86 |
| GPT-5.6 Sol(max) | 1M | OpenAI | 61 | $1.23 | 71 | 137.55 | 144.61 |
| Grok 4.6(high) | 500k | SpaceXAI | 61 | $0.84 | 58 | 50.02 | 58.60 |
| Kimi K3(max) | 1.05M | Kimi | 60 | $0.84 | 39 | 2.83 | 67.59 |
| GPT-5.6 Sol(xhigh) | 1M | OpenAI | 59 | $0.81 | 67 | 54.86 | 62.33 |
| Claude Opus 5(medium) | 1M | Anthropic | 59 | $0.72 | 54 | 11.49 | 20.80 |
| Qwen3.8 Max | 1M | Alibaba | 58 | $1.13 | 45 | 2.67 | 58.27 |
| Qwen3.8 2.4T A95B | 984k | Alibaba | 58 | $1.09 | 46 | 2.60 | 56.58 |
| GPT-5.6 Sol(high) | 1M | OpenAI | 57 | $0.55 | 68 | 14.73 | 22.12 |
| Muse Spark 1.2(xhigh) | 1.05M | Meta | 57 | $0.40 | — | — | — |
| GPT-5.6 Terra(max) | 1M | OpenAI | 57 | $0.51 | 121 | 156.55 | 160.68 |
| Gemini 3.7 Flash(high) | 1M | 56 | $0.40 | — | — | — | |
| Grok 4.5(high) | 500k | SpaceXAI | 56 | $0.36 | 53 | 10.85 | 20.28 |
| GPT-5.6 Sol(medium) | 1M | OpenAI | 56 | $0.37 | 66 | 4.81 | 12.43 |
| Claude Sonnet 5(max) | 1M | Anthropic | 55 | $1.72 | 81 | 182.26 | 188.45 |
| Gemini 3.7 Flash(medium) | 1M | 53 | $0.26 | — | — | — | |
| DeepSeek V4 Pro 0813(max) | 1M | DeepSeek | 53 | $0.25 | 80 | 1.68 | 32.84 |