OPLG 挑战 虽然 OPLG 体系具有多种优势但是企业自建也会面临多重挑战特别是在深度使用的过程中许多规模化运维、性能、成本等非功能性问题将逐渐凸显组件规模化升级与配置客户端探针的规模化管理几乎是运维团队的“梦魇”探针异常引发的各种故障也是屡见不鲜。此外动态配置下推与功能降级这类“保命大招”通常也需要企业自建配置中心自行开发与管理。Traces 全量采集与存储成本中大型企业生产系统的日均调用量可以达到上亿级别调用链全量上报和存储的成本是个不小的开销对哪些链路进行采样成本最优链路采样导致的指标监控与告警不准问题又该如何解决Metrics 大体量查询性能一次查询扫描的指标数越多查询性能越差。当查询时间范围超过一周或者一个月时经常会遇到查询卡顿甚至于无法查询出结果。此外APM Metrics 还会经常遇到 URL / SQL 发散导致的指标线过多打爆存储与查询层海量告警调度时延与性能每一条告警规则都代表着一个定期轮询任务当告警规则超过千级别甚至万级别时经常会遇到告警延迟发送甚至无法发送的情况错失了故障排查的最佳时机组件容灾能力弱多地域/可用区容灾是保障服务高可用的重要手段。但是由于容灾能力建设需要技术与资源的双重投入很多企业自建系统都不具备容灾能力企业自建可观测体系过程中会遇到的经典问题这些由于规模带来的性能及可用性问题需要投入大量研发和时间进行沉淀大幅增加了企业运维成本