Atlassian提出一种基于多源遥测关联的自动化根因分析方法,用于应对大规模云原生事故。该方法通过跨指标、日志、分布式追踪和服务拓扑的关联分析,生成关于故障起源位置及传播路径的排序假设。这项成果发布于云原生计算基金会,旨在解决事故响应中最耗时的环节之一:运维人员需要在不同仪表盘和工具之间切换,把零散的遥测信号串联成完整故障解释。
该系统将根因分析视为跨信号类型、时间和拓扑的多信号关联问题。平台不再要求值班工程师手动识别异常、搜索日志和追踪记录再重建依赖链,而是独立检测每种信号中的异常,将它们对齐到统一时间线上,并通过服务依赖图进行追踪,最终输出一组排序后的假设,指出可能的故障起点、传播路径及支撑证据。
Atlassian的方案首先缩小搜索空间:系统不会分析大型生产环境中的所有服务,而是利用基于OpenTelemetry的服务地图识别出与受影响用户路径相关的服务子集。该依赖图根据真实生产流量构建,利用追踪跨度之间的父子关系展示服务间的实际通信方式,而非依赖静态架构文档。系统对指标、追踪和日志采用不同的检测方法:指标检测关注速率、错误和时延变化;追踪分析关注异常、时延和结构性变化;日志则被分组处理,用于识别新增或异常的错误模式,随后转换为统一的异常格式用于关联分析。
在时间上相近的异常可被归组为潜在的故障序列,例如数据库问题之后出现的应用超时和前端错误可能被判定为同一起事故的不同表现,系统还使用序列指纹技术对重复故障模式去重。但仅靠时间关联无法确立因果关系,系统还会考虑服务依赖关系和异常出现的先后顺序,从受影响的服务向上游追踪以定位故障源头,最终输出总结疑似原因、受影响服务及支撑性遥测数据的结果,供工程师审查证据、验证诊断后再采取修复措施。
2026年CNCF社区调查显示,许多组织仍在同时运行多个可观测性平台,工程师不得不手动跨工具桥接指标、日志和追踪数据。Atlassian的架构试图通过统一异常模型与具备依赖感知能力的推理引擎替代人工关联。Grafana Cloud和Dynatrace也在朝相似目标发展,而Atlassian方案的不同之处在于专注模块化的信号归一化流水线,单个异常检测器可独立演进,同一关联层对所有证据进行分析。Atlassian表示正在探索利用基于LLM的编排实现排查过程迭代化,让智能体主动请求额外遥测数据、检验竞争假设并动态调整排查方向,但这类系统需要围绕速率限制、执行环境和证据来源设置相应管控机制。