SOFTC 服务体系

03 / OBSERVABILITY & AIOPS09 项服务能力

可观测和 AIOps 体系

连接统一观测数据、服务语义、事件流程与智能分析,建立从发现问题到验证恢复的稳定性运行体系。

统一观测语义关联事件闭环AIOps 分析智能运维 AgentSLO 与 FinOps

客户挑战

从分散信号中恢复完整的系统运行上下文

01

观测盲区

信号覆盖不完整,问题往往先由用户发现。

02

数据与工具割裂

指标、日志、链路、变更和工单缺少共同语义。

03

告警噪声过高

大量重复与衍生告警掩盖真正需要处理的事件。

04

分析依赖经验

影响判断与根因定位依赖少数专家手工拼接证据。

能力链

统一数据、理解关系并推动可靠处置

  1. 01采集

    统一接入指标、日志、链路、剖析与流量数据。

  2. 02标准化

    通过标签、对象模型和数据质量规则形成统一语言。

  3. 03关联

    连接服务、资源、变更、责任与业务关系。

  4. 04分析

    用规则、小模型和拓扑算法识别异常与根因候选。

  5. 05决策

    结合影响范围、SLO 和处置知识生成可审核建议。

  6. 06闭环

    连接事件、工单、处置、复盘与持续改进。

服务内容

九项服务覆盖可观测、稳定性治理与智能运维

01

可观测性体系规划与数据模型设计

设计观测目标、分层模型、标签标准、工具边界和路线。

形成从数据到运营的可执行建设蓝图。
02

指标、日志、链路、剖析和流量统一采集

建设采集、处理、路由、存储、保留和数据质量机制。

形成一致、可追溯的可观测数据底座。
03

应用性能与业务可观测

建设 APM、真实用户、业务交易、SLO 与服务健康视图。

用业务语义衡量应用健康与影响。
04

基础设施、云原生和中间件可观测

统一主机、网络、存储、Kubernetes、数据库和中间件观测。

建立从资源到服务的统一运行视图。
05

语义关联、调用拓扑与业务地图

建设调用拓扑、资源关系、业务地图和语义模型。

将分散信号组织为可查证的运行上下文。
06

告警、事件与故障管理体系

建设事件聚合、分级、路由、协同处置、升级和复盘闭环。

形成从信号到复盘的标准化故障管理。
07

AIOps 异常检测、关联分析与根因定位

建设异常检测、事件关联、拓扑影响分析和根因候选证据。

提供可解释、可审核的异常与根因分析。
08

容量、性能与 FinOps 分析优化

建设需求预测、性能基线、归集分摊、成本分析和优化闭环。

在服务目标约束下持续优化容量、性能与成本。
09

大模型能力增强与智能运维 Agent 建设

建设运维知识检索、工具调用、任务编排、评测、权限与审计。

在可控边界内提升运维信息获取和协作效率。

观测范围

覆盖从基础资源到 AI 智能体的完整运行对象

01

基础设施

主机、网络、存储与云资源

  • 容量与利用率
  • 网络与存储性能
  • 资源健康
02

云原生平台

Kubernetes、容器、集群与平台组件

  • 集群与节点
  • 工作负载
  • 控制面组件
03

中间件

数据库、消息、缓存与 API 网关

  • 连接与吞吐
  • 依赖与调用
  • 服务质量
04

应用与业务

APM、真实用户、交易与 SLO

  • 用户体验
  • 业务交易
  • 服务目标
05

数据与 AI 平台

数据链路、模型服务、GPU 与推理

  • 数据任务
  • 推理性能
  • 资源成本
06

智能体系统

模型调用、知识检索、工具调用与任务链路

  • 模型与 Token
  • 检索质量
  • 工具执行

语义关联中心

把分散遥测转化为可查证的服务与业务关系

  1. 01 数据源层

    连接观测信号、CMDB、变更、工单和业务数据。

  2. 02 处理与质量层

    完成采集、清洗、规范化、时间对齐和质量治理。

  3. 03 语义模型层

    建立应用、服务、资源、业务、人员与变更对象模型。

  4. 04 关联分析层

    通过图关系、调用拓扑、规则和算法构建可查证证据链。

  5. 05 场景服务层

    支撑故障、变更、容量、成本、SLO 和智能运维场景。

事件与稳定性闭环

从异常发现到复盘改进的标准过程

  1. 01
    发现

    动态基线与 SLO 识别异常

  2. 02
    收敛

    去重、抑制与聚类形成事件

  3. 03
    关联

    补全拓扑、变更和业务上下文

  4. 04
    定位

    输出根因候选、影响与证据

  5. 05
    处置

    连接责任人、工单与 Runbook

  6. 06
    复盘

    沉淀知识并优化规则和模型

AIOps

用算法和拓扑证据提升分析速度与一致性

01

异常检测

识别静态阈值难以发现的偏离、趋势和组合异常。

02

告警降噪

将重复、衍生和同源告警收敛为可处理事件。

03

根因候选

结合依赖拓扑、时间关系和变更证据生成候选排序。

04

影响分析

沿业务和服务关系判断影响范围与处置优先级。

05

变更风险

对照运行基线、历史事件和依赖关系评估发布风险。

06

容量与 FinOps

在服务目标约束下分析容量、性能、利用率与成本。

大模型增强

让运维证据更易理解和协作

大模型不替代异常检测与根因判断。规则、小模型和拓扑算法提供技术判断及证据,大模型负责检索、解释、摘要、协作与受控执行。

故障分析 Agent

汇总事件、根因候选、影响范围和证据链接。

运维问答 Agent

基于权限检索指标、日志、拓扑、知识和历史事件。

变更风险 Agent

解释变更关联、风险信号和建议的验证步骤。

运营报告 Agent

生成日报、周报、故障简报和复盘草稿并保留引用。

目标体系

五层能力连接数据、分析、场景与运营治理

  1. 01统一运维入口

    角色工作台、服务健康、事件协同与智能交互

  2. 02场景应用层

    应用观测、故障管理、变更风险、容量与 FinOps

  3. 03智能分析层

    异常检测、事件关联、拓扑分析与根因候选

  4. 04语义与数据层

    观测对象模型、服务拓扑、业务地图与统一数据

  5. 05治理与集成层

    数据质量、算法评测、知识、权限、审计与开放集成

实施路径

从现状评估到持续运营的五阶段建设路径

  1. 01现状评估

    盘点工具、数据、流程、组织与关键场景。

  2. 02标准与采集

    统一观测对象、标签、数据质量和采集架构。

  3. 03事件与语义

    建设事件模型、服务拓扑、业务地图和处置闭环。

  4. 04AIOps 试点

    选取高价值场景验证算法、证据和运营指标。

  5. 05智能体与运营

    在权限、评测和审计边界内扩展智能协作。

交付成果

交付体系蓝图,也交付可落地的标准、流程与场景

01总体规划与路线图

目标、能力地图、技术路线、分期建设与投资边界。

02数据标准与采集架构

观测对象、标签规范、信号接入、质量和成本策略。

03语义模型与业务地图

服务、资源、变更、责任与业务关系模型。

04事件与故障管理体系

分级、路由、协同、升级、Runbook 与复盘机制。

05AIOps 场景与评测报告

算法选择、证据设计、场景验证与效果基线。

06智能运维 Agent 方案

知识、工具、权限、评测、审计和受控执行设计。