TCO Analysis →
软件 · 运维操作系统 · CIOS

AI 工厂的
操作系统。

CIOS 是每一座 MDCX 数据中心的算力基础设施操作系统。传统 DCIM 看的是 UPS、制冷与机柜;CIOS 看的是能挣钱的指标:利用率、PUE、成本与收入。

遥测 告警 → 工单 运维流程 用量计量
● 已开放
1 box
起步规模
≥7 days
离线自治
Modbus + SNMP
已交付驱动
Open-core
Apache-2.0
01
CIOS 是什么

看得见 → 控得住 → 变得现

每一座 MDCX 数据中心都随附自己的操作系统。硬件模块交付容量;CIOS 把容量变成可运营、可计量、可创收的基础设施。

CIOS 面向模块化数据中心的概念构建——液舱、CDU、浸没、Pod——而非通用楼宇 BMS。资产按路径寻址,每个传感器与设定点都有稳定身份:

sgp01.pod002.cdu000.fws.supply.flow

产品阶梯是有意为之:先让站点可读,再让它在策略约束下可操作,最后让用量与容量可导出以支撑商业决策。无人值守自治运行属于路线图——并未宣称已交付。

许可采用开放内核模式:Apache-2.0 内核加商业化模块。站点上只写一行,细节另行提供。

02
看得见

与机房实际构造相匹配的遥测

插件式驱动将现场协议接入网关数据流与时序库。资产模型使用模块化数据中心的语言,而不是笼统的「机柜」。

驱动

已交付 Modbus TCP 与 SNMP v2c。路径寻址的点位映射进站点资产树。

资产模型

Pod、CDU、浸没液舱与回路都是一等对象——不是一堆扁平点位。

数字孪生线

Pod 的 3D 场景映射是实验室流水线的能力——不作 Omniverse 相关承诺。

03
控得住 · MDCX Care+

告警自动转工单。设定点始终受策略约束。

运维流程把机房状态转化为可跟踪、可考核 SLA、可闭环的工作——而不是放开的远程控制。

告警 → 工单

告警引擎自动开单,具备生命周期、SLA 扫描与通知(webhook / 邮件)。

预防性维护

计划、巡检、备件与检修窗口;计划内作业期间自动抑制告警。

策略约束的控制

命令行 cios query / cios set 带风险分级——不是开放写权限。

04
变得现

用量记录、容量余量、运维报表

CIOS 计量机房的消耗与产出,供商务团队决策。它不做开票。

用量计量

面向 kWh 与 GPU 小时类用量的记录、汇总与导出——用于对账与客户门户。

容量余量

在下一套模块落地前,看清站点还有多少余量。

门户

运维门户面向运维人员;客户门户提供状态、SLA 与用量。不涉及计费或 ERP 承诺。

05
架构

站点平面已交付。机队平面标注为路线图。

边缘优先:单台设备即可离线运行站点平面 ≥7 天。多站点聚合明确标注为路线图。

站点平面 · 已交付

单站点,完整闭环

  • 驱动 → 网关 → 数据流 → 时序库
  • 资产模型与路径寻址
  • 告警、工单、预防性维护、检修窗口
  • 用量记录与本地门户
  • 受策略约束的命令行
机队平面 · 路线图

多站点 路线图

  • 跨站点汇总 / NOC 视图
  • 策略集中下发
  • 机队容量规划
06
路线图

我们只公布已交付的能力。以下尚未交付。

如实陈列——不是承诺时间表。

路线图

GPU 级遥测

在设施路径寻址之上,接入 DCGM 与单卡级指标。

路线图

多站点机队平面

跨站点的 NOC 式聚合。

路线图

AI 运维

预测性维护与容量预测助手。

07
运行于

随每一套 MDCX 模块交付

没有操作系统的硬件只是一堆金属。选定模块,CIOS 随之交付。

每一座 MDCX 数据中心都随附 CIOS。

用 TCO 测算经济性,或浏览硬件模块。