TCO Analysis →
为何 MDCX · 我们的方法

闲置 GPU 是沉没资本。
我们优化出厂周期

MDCX 以工厂预制的液冷与浸没液冷模块建造模块化 AI 数据中心。你已经看过经济性测算。这里是支撑它的架构——以及每一个设计取舍为何都在守护那份回报。

计算单元 + BESS + 混合冷机
01
整体方案

AI 工厂需要三样东西。我们把每一样都做成了模块。

算力、电力、冷却——每一项都以工厂集成模块交付。现场只需接入电、冷、网,无需现场系统调试。

算力
Compute module

计算单元

算力引擎——按负载选择液冷路线,或让两者共用一条 28–35 °C 回路。

  • 液冷 — 冷板式训练与高性能推理(L1240C45)
  • 浸没液冷 — PCIe 推理,机械结构简单,OpEx 低(I400C45 / I400C40)
+
电力
Power and BESS

BESS

并网电力资产——不只是备电。标准 120 分钟穿越能力,兼顾削峰填谷与需求响应。

  • 电能质量:电压 / 谐波 / 无功
  • 支持弃电消纳的反向馈电
  • 预留 DC-Attach,面向未来直流母线
+
冷却
Cooling systems

混合冷机

气候允许时全程自然冷却,不允许时才启动机械补冷——适配各类气候。

  • 浸没液冷 PUE ≈ 1.05 · 液冷 PUE ≈ 1.15–1.20
×
软件
CIOS · 运营层
= 可创收的 AI 工厂 · 标准电力 / 冷却 / 网络接口
02
范式转变

算力的瓶颈已是电力,而非土建

AI 机柜功率已达 80–150 kW 并持续上升;GPU 每 1–2 年换代。12–24 个月的土建模式跟不上节奏。真正的约束不再是建得多快,而是通电多快、以及与电网协同得多好。

传统超大规模模式
交付模式定制土建项目
上线周期12–24 个月
机柜密度5–15 kW
扩容方式一次性全部预建
冗余全系统 2N(Tier IV)
备用电源柴油发电机
电网角色被动负荷
MDCX — AI 工厂
交付模式制造化产品
上线周期90 天出厂 · 扩容 90 天 EXW
机柜密度80–150 kW+
扩容方式按需线性增加模块
冗余分级冗余,匹配负载
备用电源BESS 优先
电网角色柔性、与电网协同的资产
03
为何 · 电力

把电力从最大成本变成最大优势

能在哪里建,由电力决定。MDCX 被设计成与电网协同的负荷——因此并网审批更快,并能靠别人用不上的电赚钱。

欧洲 · 并网
柔性、零排放的负荷通过电网审批更快——还能释放更多容量。
美国 · 弃电
作为可中断负荷运行——把被弃掉的近乎免费的电,变成你最便宜的算力。

以 BESS 供电,而非柴发 —

更低 OpEx 运输更简单 预留 DC-Attach 审批更顺畅

常见误解:柴发并不更快——两种方案都由 UPS 承担切换间隙。因此 BESS 在成本、物流与审批上均占优。

所以:默认选 BESS。需要论证的是柴发,而不是反过来。
04
为何 · 可靠性

Tier III 不是衡量 AI 工厂的正确标尺

AI 工厂的规模约为企业数据中心的 10 倍。在如此大的基数上做全 2N / Tier III,会让基础设施 CapEx 翻倍——直接冲击你刚测算出的 IRR。

而且 AI 训练不是金融交易类负载。它有检查点、可重启、在节点级做故障切换——不存在按秒计的 SLA 罚则。为它购买企业级冗余,是花钱防一个本来不会让你损失的风险。

冗余的意义是支撑在线维护——不是用来掩盖低可靠性。

因此,冗余按各部件的可更换性与故障影响范围来匹配:

系统策略逻辑
母线 / 铜排单路径、高完整性无法现场更换——冗余路径只会增加连接点与故障模式。
冷却泵 / CDU2N支持在线维护——更换无需停止算力。
风机 / 压缩机N+1故障时降级运行而非立即停机。
计算节点节点级故障切换故障就地隔离——不会在集群内扩散。
控制平面冗余配置不存在能拖垮整个系统的单点控制。
所以:不必追逐 Tier 认证徽章。让可靠性匹配负载——把省下的资本投入能创收的算力。
05
为何 · 速度

模块化且快——变现速度就是护城河

MDCX 是制造出来的产品,不是工程项目:在工厂完成全部集成与测试。首次交付自首付款起 90 天出厂(产线排满时最长 120 天)。扩容模块:90 天出厂。运输与清关由买方安排——我们不估算。

首次交付 · 90 天出厂
90
天出厂
工厂制造与测试
自首付款至 EXW 出厂。产线排满时最长 120 天。
买方
运输与清关
由买方安排。我们不给估算。
2–4
现场安装调试
机组到场后的安装与调试。
扩容模块
扩容模块:自首付款起 90 天出厂(EXW)。
90天出厂
线性扩容——1 → 4 → 16 → 64 个模块——新增容量不影响已在运行的部分。
省下的每一个月,都是再也拿不回来的一个月 GPU 收入。速度不是功能——它就是回报。
06
为何 · 运营

没有操作系统的硬件只是一堆金属。

CIOS 随每套模块交付:看见每一个传感器,把每一条告警变成工单,计量每一度电与每一个 GPU 小时。

Visibility

看得见

路径寻址遥测: sgp01.pod002.cdu000.fws.supply.flow

Control

控得住

告警 → 工单 → SLA,设定点受策略约束。

Monetize

变得现

用量计量、容量余量、运维报表。

CIOS 如何运作 →

07
为长期运行而造

一流部件,完整认证

快速部署与精简冗余不等于偷工减料。每套模块都采用一线工业级硬件,并按公认标准取得认证。

Quality

只用一流部件

部件不做妥协。每套模块均由经过验证的一线工业级硬件装配而成。

Compliance

部件认证

所有部件符合 UL / CE / CSA 及适用的地区标准。

ULCECSA
Full-system certification

整机系统认证

端到端系统级认证目标于 2027 年完成。

我们的系统供应商
EATON VERTIV SIEMENS ABB SCHNEIDER SHELL CASTROL
08
选择你的路线

数字已经算过了。现在选你的 GPU。

两种集装箱配置——取决于你要跑的 GPU 与你要做的生意。基于 Blackwell 的前沿训练,或规模化的精简推理业务。

运行上述任一方案 → CIOS · 已包含 →

数字和你的计划对不上?
在做决定前,调整假设并重新运行 TCO。