监控指标
更新时间:2026-07-24
TSDB 专享版提供业务监控和节点监控。您可以在集群详情页的“监控”中查看图表。监控指标每 60 秒采集一次,业务指标按集群汇聚,节点指标可以按节点筛选。
业务监控
业务指标按集群聚合,通过 ClusterId 标识集群:
| 指标 | 含义 | 单位 |
|---|---|---|
| 写入请求 QPS | 每秒进入写入处理的请求数 | 次/s |
| 写入速率 | 每秒成功写入的数据行数 | 行/s |
| 写入吞吐 | 每秒成功写入的数据量 | Bytes/s,页面按量级换算 |
| 写入失败率 | 拒绝写入行数占全部写入行数的比例 | % |
| 写入批大小 | 平均每个请求成功写入的行数 | 行/请求 |
| 查询 QPS | 每秒进入查询执行的请求数,包含 HTTP 和 Flight SQL | 次/s |
| 查询延迟 | 查询端到端的窗口平均耗时 | ms |
| 查询扫描文件数 | 单次查询窗口平均扫描的数据文件数 | 个 |
查询延迟指标当前仅提供平均值,不提供 P95 或 P99 分位数。
节点监控
节点指标通过 ClusterId 和 NodeId 标识资源,可以按节点筛选:
- CPU 与内存:CPU 使用率、内存使用率、系统负载。
- 网络:网卡流入/流出速率、网卡包速率、TCP 连接数。
- 磁盘:磁盘使用率、磁盘读写吞吐、磁盘 IOPS。
其中:
ClusterId:TSDB 专享版集群 ID,例如tsdb-cl-*。NodeId:集群详情页节点列表中显示的节点 ID(非 BCC 实例 ID),格式为tsdb-cl-i-*。
节点指标会同时携带 ClusterId 和 NodeId。筛选节点时应使用集群详情返回的当前 NodeId,不要使用云服务器实例 ID。
使用建议
- 结合写入 QPS、写入速率和写入批大小判断客户端批量策略。
- 写入失败率升高时,同时检查客户端 HTTP 状态码和部分写入错误。
- 查询延迟升高时,结合查询 QPS、扫描文件数和节点资源指标分析。
- 节点间指标差异明显时,检查时间范围和节点筛选条件。
计数器速率和窗口增量需要前一轮样本,因此集群或节点刚开始采集时,首个周期可能没有数据。个别周期采集失败时不会补录数据;短时空点不等于集群故障,应结合后续周期、集群状态和客户端错误判断。
评价此篇文章
