统一可观测
对齐指标、日志、链路、剖析、流量和事件。
产品方向 · 内部孵化
以统一可观测数据、语义关联和智能运维 Agent 为基础,探索可理解、可推理、可行动的运行体系。
产品正在内部孵化:当前页面表达的是 SOFTC 的产品理念、能力边界与演进方向。
01
为什么需要
指标、日志、链路、剖析、流量、事件和变更往往散落在不同工具中。平台通过统一对象模型、标签标准、动态拓扑和证据链,让技术信号与应用、业务、变更和责任关系发生联系,为稳定性治理与智能分析提供可追溯基础。
核心价值
对齐指标、日志、链路、剖析、流量和事件。
以服务拓扑和业务语义组织故障证据。
规则、小模型和拓扑算法负责技术判断;大模型负责解释、检索、交互和决策辅助。
产品能力
规划观测对象、指标口径、标签体系、埋点规范、质量门禁和分角色视图。
让不同团队的数据说同一种语言。统一采集指标、日志、链路、剖析、流量、事件和变更,并治理传输、存储与生命周期。
形成全域、可靠、可扩展的数据底座。关联应用性能、调用链、错误、版本、交易与关键业务指标。
从系统健康走向体验与业务健康。视觉化主机、网络、云资源、Kubernetes、数据库和中间件的性能、容量与异常。
在同一健康视图中定位跨层瓶颈。连接服务、资源、调用、变更、环境、组织和业务关系,构建动态拓扑与影响传播链路。
把孤立记录转化为可推理的运行关系网络。统一告警归集、去重抑制、时间窗聚合、分级路由、SLO 与错误预算,衔接 ITSM 与复盘。
把大量告警收敛为少量可处理事件。构建动态基线、多指标异常、日志聚类、拓扑传播、变更关联、根因候选和影响面分析。
从“人工排查”走向“根因候选与证据排序”。分析容量趋势、资源利用率、性能退化、SLO 风险、成本变化与扩缩容时机。
从事后扩容走向前瞻性风险与成本治理。提供可引用证据的运维问答、故障分析、发布风险、报告生成、知识检索和受控自动化。
让技术判断变得可理解、可审阅、可协作。产品架构
面向开发、运维和管理角色提供健康、事件、分析与协同入口。
以异常检测、关联分析、根因候选、预测模型和大模型解释支撑决策。
将观测对象、拓扑、事件、变更、SLO、业务影响和责任上下文组织为证据网络。
对多模态运行数据进行采集、清洗、对齐、标准化、传输和分层存储。
连接业务应用、云原生、基础设施、数据库、中间件以及企业运维工具链。
稳定性闭环
从动态基线、SLO 和多模态数据中识别异常。
对告警去重、抑制和聚合,形成可处理事件。
连接服务拓扑、变更、环境、责任和业务上下文。
用规则、模型和拓扑算法生成根因候选与证据排序。
推荐 Runbook 和决策选项,在权限、审批和审计下协同执行。
沉淀事件、复盘、知识和反馈,持续优化规则与模型。
典型场景
结合应用指标、调用链、版本和业务指标,解释性能退化对用户体验和关键业务的影响。
统一观察集群、容器、网络、数据库和中间件,沿服务拓扑追踪跨层瓶颈。
将多源告警收敛为可处理事件,关联拓扑、变更和历史经验,生成有证据的候选原因与处置建议。
利用趋势预测、资源效率和错误预算识别容量、稳定性与成本风险,支持规划与优化。
大模型增强
大模型不绕过 AIOps 的技术判断链路,不直接猜测异常与根因;它基于规则、模型、拓扑和证据结果进行解释、检索、协作和受控执行。
引用指标、日志、拓扑和历史事件回答运行问题。
解释根因候选、影响范围和证据链,不自行猜测根因。
对照历史变更、运行基线和依赖拓扑辅助评估发布风险。
将运行数据转化为可追溯的日报、周报、故障简报和复盘。
在当前事件上下文中检索可版本化的处置经验和操作手册。
将建议转化为可审批、可回滚、可审计的半自动执行流程。
演进路径
建立可观测数据与事件模型。
补充服务拓扑、业务语义和变更上下文。
引入规则、小模型和拓扑算法进行技术判断。
统一事件、SLO、变更和协同处置闭环。
通过 LLM 和 Agent 辅助解释、检索、交互、决策与受控执行。