可观测和智能运维平台

产品方向 · 内部孵化

以统一可观测数据、语义关联和智能运维 Agent 为基础,探索可理解、可推理、可行动的运行体系。

产品正在内部孵化:当前页面表达的是 SOFTC 的产品理念、能力边界与演进方向。

01
为什么需要

把分散信号转化为可解释、可治理的运行上下文

指标、日志、链路、剖析、流量、事件和变更往往散落在不同工具中。平台通过统一对象模型、标签标准、动态拓扑和证据链,让技术信号与应用、业务、变更和责任关系发生联系,为稳定性治理与智能分析提供可追溯基础。

核心价值

从“看见数据”走向“理解系统并协同行动”

01

统一可观测

对齐指标、日志、链路、剖析、流量和事件。

02

关联可解释

以服务拓扑和业务语义组织故障证据。

03

智能有边界

规则、小模型和拓扑算法负责技术判断;大模型负责解释、检索、交互和决策辅助。

产品能力

围绕可观测、稳定性治理与智能协同构建九项能力

01

可观测体系与数据模型

规划观测对象、指标口径、标签体系、埋点规范、质量门禁和分角色视图。

让不同团队的数据说同一种语言。
02

全域数据统一采集

统一采集指标、日志、链路、剖析、流量、事件和变更,并治理传输、存储与生命周期。

形成全域、可靠、可扩展的数据底座。
03

应用性能与业务可观测

关联应用性能、调用链、错误、版本、交易与关键业务指标。

从系统健康走向体验与业务健康。
04

基础设施、云原生与中间件观测

视觉化主机、网络、云资源、Kubernetes、数据库和中间件的性能、容量与异常。

在同一健康视图中定位跨层瓶颈。
05

语义关联、调用拓扑与业务地图

连接服务、资源、调用、变更、环境、组织和业务关系,构建动态拓扑与影响传播链路。

把孤立记录转化为可推理的运行关系网络。
06

告警、事件与稳定性治理

统一告警归集、去重抑制、时间窗聚合、分级路由、SLO 与错误预算,衔接 ITSM 与复盘。

把大量告警收敛为少量可处理事件。
07

AIOps 异常、关联与根因分析

构建动态基线、多指标异常、日志聚类、拓扑传播、变更关联、根因候选和影响面分析。

从“人工排查”走向“根因候选与证据排序”。
08

容量、性能与 FinOps 优化

分析容量趋势、资源利用率、性能退化、SLO 风险、成本变化与扩缩容时机。

从事后扩容走向前瞻性风险与成本治理。
09

大模型能力增强与智能运维 Agent

提供可引用证据的运维问答、故障分析、发布风险、报告生成、知识检索和受控自动化。

让技术判断变得可理解、可审阅、可协作。

产品架构

从统一数据到认知增强的五层运行体系

  1. 01

    统一运维与智能交互层

    面向开发、运维和管理角色提供健康、事件、分析与协同入口。

    • 角色工作台
    • 服务健康
    • 事件协同
    • 运维 Agent
  2. 02

    AIOps 与认知增强层

    以异常检测、关联分析、根因候选、预测模型和大模型解释支撑决策。

    • 动态异常
    • 根因候选
    • 容量与风险预测
    • 知识与 RAG
  3. 03

    语义关联与稳定性治理层

    将观测对象、拓扑、事件、变更、SLO、业务影响和责任上下文组织为证据网络。

    • 统一对象模型
    • 动态服务拓扑
    • 事件与 SLO
    • 变更与业务上下文
  4. 04

    全域可观测数据层

    对多模态运行数据进行采集、清洗、对齐、标准化、传输和分层存储。

    • 指标与日志
    • 链路与剖析
    • 流量与事件
    • 变更与配置
  5. 05

    运行对象与开放集成层

    连接业务应用、云原生、基础设施、数据库、中间件以及企业运维工具链。

    • 应用与业务
    • Kubernetes 与云
    • 基础设施与中间件
    • DevOps / CMDB / ITSM

稳定性闭环

从异常发现到知识沉淀的持续演进路径

  1. 01Detect

    发现

    从动态基线、SLO 和多模态数据中识别异常。

  2. 02Converge

    收敛

    对告警去重、抑制和聚合,形成可处理事件。

  3. 03Correlate

    关联

    连接服务拓扑、变更、环境、责任和业务上下文。

  4. 04Diagnose

    定位

    用规则、模型和拓扑算法生成根因候选与证据排序。

  5. 05Respond

    处置

    推荐 Runbook 和决策选项,在权限、审批和审计下协同执行。

  6. 06Learn

    演进

    沉淀事件、复盘、知识和反馈,持续优化规则与模型。

典型场景

从应用、平台到事件与容量的四类运行场景

01

应用性能与业务健康

结合应用指标、调用链、版本和业务指标,解释性能退化对用户体验和关键业务的影响。

02

云原生与中间件运行观测

统一观察集群、容器、网络、数据库和中间件,沿服务拓扑追踪跨层瓶颈。

03

事件收敛、根因候选与协同处置

将多源告警收敛为可处理事件,关联拓扑、变更和历史经验,生成有证据的候选原因与处置建议。

04

容量、SLO 风险与 FinOps 优化

利用趋势预测、资源效率和错误预算识别容量、稳定性与成本风险,支持规划与优化。

大模型增强

让已有判断更可理解、可复用、可决策

大模型不绕过 AIOps 的技术判断链路,不直接猜测异常与根因;它基于规则、模型、拓扑和证据结果进行解释、检索、协作和受控执行。

运维问答

引用指标、日志、拓扑和历史事件回答运行问题。

故障分析 Agent

解释根因候选、影响范围和证据链,不自行猜测根因。

发布风险 Agent

对照历史变更、运行基线和依赖拓扑辅助评估发布风险。

运维报告 Agent

将运行数据转化为可追溯的日报、周报、故障简报和复盘。

知识与 Runbook

在当前事件上下文中检索可版本化的处置经验和操作手册。

受控自动化

将建议转化为可审批、可回滚、可审计的半自动执行流程。

演进路径

以应用为中心、以场景为导向逐步建设

  1. 01统一数据

    建立可观测数据与事件模型。

  2. 02建立关联

    补充服务拓扑、业务语义和变更上下文。

  3. 03增强分析

    引入规则、小模型和拓扑算法进行技术判断。

  4. 04稳定性治理

    统一事件、SLO、变更和协同处置闭环。

  5. 05认知增强

    通过 LLM 和 Agent 辅助解释、检索、交互、决策与受控执行。