AI Infras 中台

构建覆盖全国的端—边—云 AI 运行与算力控制平面

项目背景

从分散加载走向全国统一运行

随着 AI 业务扩展至 31省及下属 N 个地市,模型需要同时运行在摄像机等端侧设备、区域边缘节点和集团云侧算力中心。不同地区的设备规模、网络质量、资源供给和数据合规要求并不相同。

底层并存简云、息壤、星河等多套操作平台,以及 NVIDIA A10/A100/T4、华为 Atlas 300 系列和沐曦等异构芯片资源。模型能否运行,不仅取决于是否有空闲算力,还取决于芯片适配、运行框架、资源规格和业务权限。

AI Infras 因此不是另一套资源后台,而是向上承接模型合作平台与 AI MaaS、向下统一编排端边云算力的 AI 运行中枢。

Model ecosystem模型合作平台

外部模型提交、验证与上架

Model productionAI MaaS

数据、训练、测评与工程适配

Runtime controlAI Infras

实例、任务、路由、容灾与回流

核心问题

  1. 算力资源割裂:多套操作平台采用不同资源模型和接口,全局容量与运行状态不可见。
  2. 模型与芯片无法直接匹配:核心模型可适配多种芯片,省份自研与客制化算法则多依赖 NVIDIA 环境。
  3. 端边云缺少统一决策:低时延、低带宽成本与云侧稳定兜底之间缺少可配置的策略。
  4. 任务链路难追踪:抽帧、视频分析、AI 分析和抓拍 1400 任务跨越设备、视频流、实例与算力节点。
  5. 运行与迭代割裂:现场误报、漏报和低置信度样本无法规范地反馈至模型生产链路。

思考与决策

1. 建立统一的 AI 运行与算力控制平面
  • 将简云、息壤、星河的容量、实例、服务和故障信息转换为统一资源模型。
  • 业务只需定义运行模型、服务设备和 SLA,无需感知底层平台。
  • 以 AI 实例作为标准运行单元,统一加载、扩缩容、灰度与回滚。
2. 采用端边优先、云侧授权兜底的分级调度
  • 端侧可运行时优先端侧,否则选择同区域边缘节点。
  • 端边不可用时,只有通过租户权限和数据合规校验才可使用云侧兜底。
  • 同时管理时延、服务半径、业务优先级、成本额度与故障回切。
3. 将异构适配沉淀为模型运行画像
  • 模型版本同时记录芯片型号、格式、推理框架、镜像、资源规格与性能基线。
  • 标准核心模型维护多芯片适配版本,省份自研与客制化模型优先匹配 NVIDIA 资源。
  • 仅将任务路由到通过验证的“模型—芯片—运行环境”组合。
4. 建立运行、告警、反馈与数据回流闭环
  • 系统质量关注设备、实例、资源、任务和调用链路是否稳定。
  • 业务质量通过告警反馈、误漏报与低置信度样本衡量模型效果。
  • 问题样本在授权和脱敏后回流 AI MaaS,进入新一轮训练、测评与灰度发布。

平台架构

生态入口面向模型与算法生态
模型合作平台AI MaaS 平台

模型引入、训练、测评、适配与发布

业务接入面向集团业务与行业客户
省公司地市平台IPC / 无人机行业应用

提交场景、设备范围、任务规则与 SLA

AI INFRAS CORE

AI 中台核心能力

统一承接模型供给与业务需求,完成资源、任务、编排和运营闭环。

01AI 模型管理

模型、版本、镜像、能力标签、发布范围与运行画像

02算力管理

异构芯片、端边云调度、实例管理、容灾与底层适配

03任务管理

抽帧、视频分析、AI 分析、抓拍 1400 与运行轨迹

04业务编排

模型编排、大模型研判、结果过滤、业务路由与回调

05任务日志与工单

全链路日志、异常定位、运维工单、处置反馈与审计

算力中心对接
简云息壤星河
标准适配层
NVIDIAAtlas沐曦其他主流芯片

对下统一资源、实例、服务、监控与故障接口

核心能力地图

能力域关键功能解决的问题
AI 模型管理模型/镜像版本、能力标签、芯片兼容矩阵、发布范围把模型文件转化为可验证、可调度的运行资产
算力管理异构适配、端边云调度、AI 实例、弹性、容灾、底层平台对接统一管理容量、负载、芯片差异、服务范围与资源缺口
任务管理抽帧、视频分析、AI 分析、抓拍 1400、全链路轨迹统一追踪设备、视频流、实例、节点和回调状态
业务编排模型编排、大模型研判、结果过滤、路由与业务回调把单模型推理升级为可配置、可运营的场景化 AI 流程
任务日志与工单全链路日志、异常定位、自动工单、处置反馈与审计将任务异常转化为可跟踪、可协同、可闭环的运营流程

核心机制

01 / Placement

端边云分级调度

先校验权限与硬性运行条件,再在可用位置中平衡时延、负载、成本与稳定性。

01权限与合规租户·地域·数据
02端侧优先兼容·在线·有余量
03同区域边缘时延·容量·健康
04云侧授权兜底授权后扩容或路由
05排队 / 降级记录决策与轨迹
02 / Compatibility

异构算力匹配

两阶段策略避免将“有空闲卡”错认为“可运行模型”。

Hard constraints硬约束过滤
  • 芯片与算子兼容
  • 镜像与推理框架
  • 显存与资源规格
  • 权限、地域与健康状态
Soft scoring软约束评分
  • 网络时延与启动时间
  • 资源负载与推理性能
  • 资源成本与业务优先级
  • 历史稳定性
03 / Resilience

多级服务容灾

从单实例到算力中心逐级隔离故障,回切策略避免任务在节点间反复震荡。

  1. 实例故障切换健康副本
  2. 节点故障同资源池重建
  3. 区域故障同省或云侧授权兜底
  4. 版本故障回滚最近稳定版本
  5. 平台故障转移至兼容算力中心

项目成果

算力节点65节点

覆盖31省,62分布式节点 + 3核心节点。

异构算力覆盖3000+推理卡

涵盖纳管六款主流推理芯片,统一适配与调度。

模型资源712

沉淀标准、行业、省份自研与客制化模型。

日推理次数300M+

支撑全国多类视频与 AI 分析任务稳定运行。

01统一建设

各省业务无需重复对接底层算力平台和自建调度系统。

02统一治理

打通模型、实例、任务、告警、反馈与回流全链路。

03稳定运行

以端边优先、云侧授权兜底和多级容灾支撑业务连续性。

04持续迭代

将现场问题样本安全反馈至 MaaS,形成模型迭代闭环。

项目展示

AI Infras 算力网络总览概念界面
算力网络总览
AI Infras 模型与异构算力管理概念界面
模型与异构算力管理
AI中台应急消防隐患排查实例自由编排界面
应急消防隐患排查工作流编排
AI中台应急消防隐患排查实例在线调试界面
推理工作流在线调试与结果研判
AI Infras 推理日志与告警工单概念界面
推理日志、调度轨迹与告警工单