APM 的四个信号
APM 测量四个核心信号:时延(逐端点、逐分位的响应时间)、错误(失败率、异常与其背后的堆栈)、吞吐(每秒请求数与负载下的饱和度)、追踪(请求跨服务的完整路径,逐跳计时)。
追踪止步于硬件开始之处
APM 极擅长回答"哪个服务慢了?",却无法回答当原因位于操作系统之下时的"这台主机为什么慢?"。劣化的 RAID 阵列拉长 I/O、过热降频的 CPU、存储路径上抖动的光链路——追踪显示数据库调用花了 900 毫秒,它显示不了背后那块正在故障的磁盘。这正是 APM 与基础设施运维的交接点。云新 iDCOS 不是 APM 工具——它是其下的那一层:硬件健康、存储路径、网络链路、供电与热态,并映射到其上运行的服务。与 APM 配合,那条追踪将终结于一个具名部件,而不是一声叹息。
常见问题
APM 是 Application Performance Monitoring/Management(应用性能监控/管理)的缩写,跟踪应用在用户侧表现的工具:响应时间、错误率、吞吐,以及解释慢请求的链路追踪。APM 与基础设施监控的区别在于:APM 自代码向下看:事务、追踪、错误;基础设施监控自硬件向上看:服务器、网络、存储、供电。完整可见性两者都要——多数故障恰恰在两者之间的缝隙里被分诊。知名 APM 工具包括 Datadog、Dynatrace、New Relic,以及 Grafana + OpenTelemetry 等开源组合。
