Telemetry 与 iMaster NCE

Telemetry(遥测)将传统”拉取式”监控改为”推送式”数据采集,配合 AI 分析实现智能运维。

传统监控 vs Telemetry

维度SNMP PollingTelemetry
方式网管周期性拉取设备主动周期/事件推送
频率秒级(开销大)毫秒级
数据量有限 MIB全量模型化数据
扩展性差好(YANG 模型)

Telemetry 架构

设备(采集器)→ gRPC/Netconf 流 → 采集器(Kafka)→ 分析平台(大数据/AI)→ 告警/自动化
  • gRPC:Google RPC,基于 HTTP/2,主流传输通道
  • 模型:YANG 定义采集项(接口流量、CPU、丢包、延迟等)
  • 订阅:周期性订阅、事件触发订阅
  • 采集项:接口统计、QoS 统计、丢包、微突发等

华为配置 Telemetry(示意)

[Huawei] telemetry
[Huawei-telemetry] telemetry server 10.0.0.10
[Huawei-telemetry] telemetry password cipher Huawei@123
[Huawei-telemetry] subscription 1
[Huawei-telemetry-subscription-1] sensor-group s1
[Huawei-telemetry-subscription-1] collector-group c1

具体命令随版本差异较大,以产品文档为准。

iMaster NCE 智能运维

三大核心能力

  1. 统一纳管:自动发现设备,集中配置管理(Netconf 下发)
  2. 可视运维:全网拓扑、流量地图、故障根因定位
  3. 智能分析:Telemetry 数据 + AI 预测(容量、故障、体验)

典型场景

场景能力
网络巡检批量采集状态,生成体检报告
故障定位分钟级定位链路/设备问题
容量预测分析趋势,提前扩容
策略随行用户接入自动下发 QoS/安全策略
配置合规基线比对,发现漂移

开源组件参考

组件用途
Prometheus + Grafana指标采集与可视化
Kafka数据总线
Elasticsearch日志/遥测存储检索
Python 脚本北向 API 定制

最佳实践

  1. 先确定监控指标(KPI),再设计采集模型
  2. 采集频率按需设置,避免过度消耗设备
  3. 数据接入统一平台,避免烟囱式
  4. 建立基线,异常检测才有意义
  5. 告警要分级、去重、可回溯

🔗 相关笔记:06.02_Netconf与YANG 05.03_SDN与NFV