序构ORCHESTRUM
REFERENCE ARCHITECTURE V1.0 · 2026.07
DATA CENTER PRIVATE MAAS

数据中心私有化 MaaS
完整技术架构

以自研运营控制面掌握客户、资产、计量与交付;以 KServe、AIBrix、BentoML 和多类推理引擎组成可替换的执行面。

架构原则 01 控制面与数据面解耦

客户请求不经过中央运营控制面;中央平台只处理元数据、部署指令、脱敏指标和计量事件。

高亮视图
序构自研 开源底座 可选 / 后置
01

平台分层总图

一套中央运营平台,连接三类客户入口、多个数据中心与三种服务资源池。

CONTROL PLANE REFERENCE STATE
01 · DEMAND

企业客户

金融、制造、能源、政务及集团企业

02 · SUPPLY

算力资产方

国企智算中心、上市公司、IDC 与园区

03 · ECOSYSTEM

生态伙伴

模型商、集成商、行业软件与交付伙伴

04 · OPERATIONS

联合运营团队

商务、交付、SRE、模型工程与客户成功

L1接入与体验层EXPERIENCE

运营控制台

资产、客户、合同、运营驾驶舱

企业门户

模型申请、部署、API Key、用量与 SLA

伙伴门户

模型上架、联合方案、项目协作与交付

统一 API / SDK

OpenAI 兼容、多模态、异步任务与管理 API

L2商业运营控制面ORCHESTRUM CORE · SELF-BUILT
A

客户与租户

组织、项目、角色、环境、合作伙伴

B

服务目录

模型商品、资源规格、共享/专属套餐

C

合同与 SLA

额度、折扣、期限、承诺、验收与续费

D

资产商品化

服务器、GPU、机房、资源池与可售库存

E

部署编排

运行时选择、Placement、发布、升级与回滚

F

计量与权益

Token、GPU 秒、音视频、存储及限额

G

运营与工单

巡检、告警、事件、变更、交付和客户成功

H

经营驾驶舱

利用率、收入能力、单位成本、SLA 与预测

L3平台公共服务SHARED SERVICES

API Gateway

Envoy Gateway · WAF · 限流 · 路由

身份与密钥

Keycloak · OIDC/SAML · Vault/KMS

模型供应链

许可证扫描 · 安全扫描 · Registry · 模板

事件与数据

Kafka/NATS · PostgreSQL · Redis

用量聚合

原始计量流水 · OpenMeter · 对账

可观测性

Prometheus · OTel · Loki · Langfuse

L4多集群与安全域FLEET MANAGEMENT

中央 Fleet Hub

集群库存、Placement、策略、版本和容量视图

Cluster Agent

部署执行、心跳、脱敏遥测、离线升级

OCM

集群注册、治理、策略和工作负载放置

Karmada · 后置

跨集群双活、灾备和多云资源传播

安全边界 中央控制面不保存 Prompt、文档、图片、音视频和模型推理结果;完全隔离区只回传资源指标与签名用量事件。
POOL A共享 LLM MaaS 池高利用率 · 按量服务
AIBrixGateway · Cache-aware Routing · Autoscaling · LoRA
vLLM默认引擎
SGLang复杂模型
TRT-LLM高性能固定模型

标准大模型、Embedding 与高并发 API;请求经本地网关直达模型副本。

POOL B企业专属 / 多模态池隔离部署 · 统一生命周期
KServeDeploy · Scale · Canary · Health · Runtime
BentoML任意 HF 模型
Triton图片/语音/视觉
TEI / ASR / TTS专用运行时

专属 LLM、图片、视频、语音、OCR、Embedding 与客户自定义模型。

POOL C训练与批处理池排队调度 · 项目配额
Volcano + KueueQueue · Priority · Fair Share · Gang Scheduling
Ray / KubeRay分布式计算
MLflow实验与版本
Batch Inference离线任务

微调、评测、批量推理、数据处理及复杂多模型 Pipeline。

L5集群基础设施PER CLUSTER

Kubernetes

Namespace · RBAC · NetworkPolicy · CNI

GPU / NPU 管理

GPU Operator · DCGM · 厂商 Device Plugin

异构资源共享

HAMi · MIG · vGPU · 拓扑感知调度

数据与供应链

S3 对象存储 · 镜像仓库 · 模型缓存 · PVC

安全与审计

镜像签名 · Secret · 审计日志 · 准入策略

L6异构算力与部署位置PHYSICAL INFRASTRUCTURE
ACCELERATORNVIDIA

H100 / H200 / B 系列 / L 系列

ACCELERATOR国产 GPU / NPU

昇腾、海光、寒武纪、摩尔线程等

LOCATION合作智算中心

共享池、专属区、跨机房容灾

LOCATION客户本地机房

离线、强隔离、数据不出域

LOCATION海外区域

当地合规、数据驻留与伙伴交付

02

在线请求与计量闭环

推理热路径与商业控制路径分离,避免中央平台成为性能与数据安全瓶颈。

01

认证与权益

API Gateway 校验 Key、租户、模型权限、额度和请求策略。

SYNC · HOT PATH
02

模型路由

根据服务类型进入 AIBrix、KServe 或异步任务系统。

SYNC · HOT PATH
03

模型执行

请求在目标安全域内完成,原始数据不离开服务集群。

SYNC · DATA PLANE
04

结果返回

同步返回文本/音频;图片和视频通过任务状态与对象地址返回。

SYNC / ASYNC
05

用量事件

网关、运行时和 GPU 指标生成签名事件,异步进入计量与对账流水。

ASYNC · BUSINESS EVENT
03

三种交付与隔离模式

同一控制面支持不同客户风险等级,不用为每个项目重建一套产品。

A
STANDARD

共享 MaaS

企业之间逻辑隔离,共享模型副本和 GPU 资源池,适合标准模型 API。

隔离
租户 / Key / 配额
计费
Token / 次数 / 时长
底座
AIBrix
B
DEDICATED

企业专属区

独立 Namespace、GPU Node Pool、存储与密钥,可提供固定容量及 SLA。

隔离
专属资源池
计费
实例 / GPU 小时
底座
KServe
C
SOVEREIGN

完全隔离集群

客户独立 Kubernetes、网络、服务器及存储;中央 Agent 仅交换控制与脱敏遥测。

隔离
物理 / 集群级
计费
许可 + 运维
底座
Agent + KServe
04

自研边界与开源边界

开源执行面可替换;商业数据模型和客户关系不可替换。

必须自研并掌握
  • 客户、租户、项目和生态伙伴数据模型
  • 资产目录、可售库存与资源商品化
  • 服务目录、合同、套餐、权益和 SLA
  • 部署决策、运行时适配与多集群编排
  • 原始计量流水、对账和经营驾驶舱
  • 交付、巡检、工单、续费和客户成功
标准化接入的开源底座
  • KServe、AIBrix、BentoML
  • vLLM、SGLang、Triton、TEI
  • Kubernetes、HAMi、Volcano、Kueue
  • OCM、Prometheus、OpenTelemetry
  • Keycloak、OpenMeter、MLflow、Ray
  • PostgreSQL、Redis、对象存储与事件总线
05

关键技术决策

首版克制范围,确保形成可销售、可运营、可持续升级的产品。

领域首版决策原因
模型封装BentoML

最适合任意 Hugging Face 和自定义 Python Pipeline。

企业部署KServe

统一生命周期、自定义 Runtime、扩缩与灰度发布。

共享 LLMAIBrix

推理感知路由、Cache、LoRA 与 LLM 专用扩缩。

多集群Cluster Agent → OCM

先适应离线与复杂网络,再演进为标准集群治理。

计量自研流水 + OpenMeter

商业账本必须掌握,开源组件仅承担聚合与查询。

跨集群双活Karmada 后置

首版避免引入实时跨集群调度的额外复杂度。

ARCHITECTURE AS CODE

可持续更新的架构资产

页面适合商务演示与内部评审;Mermaid 源文件适合版本控制和后续重构。