
简介面向初入传输网管领域的技术人员这份PPT以中兴设备为背景系统梳理了传输网管入门所需的核心内容TMN基础、SDH网管概述、信产部对EMS的技术规范以及E300网管实例。教程从电信管理网的引入背景、特点与三层结构讲起逐一说明操作系统功能、网元功能、Q接口适配功能、工作站功能等模块的协作关系并解释q、f、x参考点与数据通信功能还介绍了管理信息模型和九类功能元件涵盖管理应用功能、信息转换功能、工作站支持功能等。随后内容延伸到SDH网络的监控、配置、性能与故障管理思路以及EMS系统在功能、接口、安全性方面需要满足的规范要求。E300网管实例部分结合具体配置与操作流程帮助读者把抽象概念落到现网维护场景中加深对中兴传输网管的实际理解。资源为单份PPT演示文稿共1个文件约741KB结构完整、重点突出适合作为快速建立传输网管知识框架的入门材料。已有606人浏览学习。1. 中兴传输网管是什么先搞清楚它在整个运维体系里的位置刚接手传输网络运维的人打开中兴传输网管客户端的第一反应往往是懵告警窗口上百条记录滚动不知道哪些是根因、哪些是衍生拓扑、配置、性能监视几个模块又不敢乱点。中兴传输网管就是这么一套东西它不是简单的告警弹窗工具而是传输设备的统一运维入口——网元状态、业务配置、性能数据、故障定位全都在里面完成。这篇笔记面向刚开始接触中兴传输设备的新网管员、负责开通和维护的一线工程人员也适合想弄清楚传输网管和数通网管有什么不同的后台运维。我先讲清楚网管体系是怎么组织的再讲怎么把一台网元接入系统、怎么跑通一条业务最后把经常翻车的几个场景和排查思路放在一起说。入门阶段不需要把每个菜单都摸熟先建立一张从网管到网元再到业务的认知地图后面遇到问题就知道从哪个模块下手。2. 网管体系与部署选型先分清EMS、网元和连接通道2.1 管理分三层设备层、网管层、运维层各管什么中兴传输网管管理的是SDH/MSTP和OTN两大类传输设备。设备侧每一台传输设备叫网元NE比如常见的ZXMP系列和ZXONE系列。网元上有主控板负责管理能力业务单板承载客户业务。平时说的“管传输”实际管的就是这一层设备的配置和运行状态。网管层是EMS服务器负责把分散的网元组织成一个统一视图。EMS收集网元的告警、性能和配置把十几台、上百台设备变成一张拓扑图和一个告警面板。数据库就放在网管服务器上这也是为什么后面专门要把备份拿出来讲。运维层就是你每天操作的客户端它只是EMS的一个窗口多人同时在线时权限和操作日志都由服务器统一控制。为什么要分这么多层核心原因是规模。一个本地网可能有几百个网元如果每台设备都单独登录查看割接和故障定位的效率完全没有办法看。分层之后操作集中、日志可审计、配置可批量下发。另一个好处是职责分离——维护人员只需要客户端不用直接接触每一台设备的命令行。2.2 部署形态选型单机版、C/S、多服务器怎么选中兴传输网管的部署形态常见有三种选择依据是网元数量、维护人数和地域分布。我接触过的现网环境里开局调试、小型汇聚点和大规模本地网的部署方式差别很大先看下面这张对比表。部署形态适用规模部署成本关键限制单机版服务器与客户端同机几十个网元以内开局调试最低一台工作站搞定并发能力弱多人同时操作会明显卡顿标准C/S服务器多个客户端几十到几百个网元需要一台专用服务器和配套网络环境客户端与服务器之间依赖DCN通道数据库要定期维护多服务器/分布式跨地市、跨多个本地网高需要多台服务器做数据同步要提前规划区域划分和上级下级网管互连版本对齐成本高选型的时候我一般先看两个数网元数量和维护人数。少于30个网元、只有一两个人维护单机版完全够用磁盘够大、内存加到32G以上就很舒服。超过50个网元或者超过三个人同时在线老老实实上C/S架构。要是跨越多个地市每个地市一套采集服务器统一汇到中心EMS。别一上来就上多服务器同步机制和版本对齐的维护成本会占掉你大量时间。2.3 管理通道怎么连ECC、DCN、带外管理网管服务器和网元之间的管理通道常见有三种连法。第一种是ECC网元之间通过设备间管理开销通道互联不依赖外部IP网络开局阶段经常用。缺点也很明显——带宽很小管理通道跟着业务拓扑走跨地域基本没法用。第二种是DCN每个网元的管理口接入IP承载网EMS通过DCN路由访问网元。这是当前最主流的接入方式平面化、易扩展只要IP通就能纳管。第三种是带外管理每台网元单独拉维护网线或者起独立管理VLAN和业务通道完全物理隔离。这种方式最可靠但投资也最高通常只给核心网元用。管理通道有一条规定值得从一开始就定死管理IP单独规划一个网段比如10.100.0.0/24严禁和业务网段混用。混用的后果是查问题的时候全是黑匣子——你不知道是DCN路由坏了还是业务流量挤占带宽。另外要明确管理边界光猫、家庭网关这类接入层设备不在传输网管的直接管理范围内传输网管管的是承载它上行的传输设备这个边界先立住排查问题才不会跑偏。3. 从零接入一台网元管理IP、添加流程与第一条业务下发3.1 规划管理IP与DCN网段先定规矩再动设备动手接入网元之前的第一件事不是打开网管客户端而是确认这台网元的管理IP、子网掩码和网关。常见做法是管理IP占一个独立网段每个网元的主控板和备用主控板各配一个IP全部登记在规划表里。之后做配置备份、告警关联、割接核查都要依赖这张表不要靠脑子记。网管服务器这边也要确认DCN路由可达。如果网管服务器和DCN交换机不在同一个广播域需要加静态路由或者启用路由协议。从网管工作站先ping一把目标管理IP这是最直接的连通性验证。ping -c 4 10.100.0.11 # 10.100.0.11 是规划好的网元管理IP # 通了管理通道正常可以继续添加网元 # 超时先看网元主控板RUN指示灯是否正常再查DCN交换机端口和VLAN # 报Destination Unreachable网关或路由问题先查本地路由表参数说明-c 4指发4个ICMP包然后结束适合在Linux工作站上做一次性的连通性检查。如果你在Windows工作站上操作去掉-c 4直接ping -t 10.100.0.11持续观察稳定情况。很多初学者上来就添加网元添加失败才回头ping绕了一圈才发现是VLAN没放行。先ping再操作能省掉大半无效劳动。3.2 在EMS中添加网元手工添加与自动发现打通网络之后进入网管客户端的网元管理模块。中兴的网管界面在不同产品线略有差异但核心步骤一致在“网元管理”里选“增加网元”填写网元名称、网元类型、管理IP、子网信息。网元类型一定要和设备实际的硬件型号核对清楚选错了会导致配置上载失败或者告警解析异常。自动发现是另一个入口按网段扫描之后网管会把响应的设备列出来。这个功能适合批量开局但自动发现的设备仍然需要手工确认网元类型和归属子网不能全选直接添加。原因在于自动发现只能确认“有设备在响应”确认不了“这个设备是不是你想要的型号、配置是否完整”。添加完成之后网管会触发一次配置上载把设备上的实际配置同步到EMS数据库。这一步很关键部分版本里面叫“上载配置”或“同步网元”。上载完成后要核对一下网元名称、单板数量、软件版本是否和现场记录一致。提示如果这台网元已经在另一套网管里被纳管先通知对端网管释放纳管权限再执行添加。强行添加会触发网元侧的访问控制弄不好两边都登不上。3.3 跑通一条2M业务时隙规划与路径下发接入网元只是第一步真正让网管产生价值的是业务配置下发。拿最常见的2M业务举例也就是VC12业务完整流程分五步。第一步查看源端和宿端两侧的单板资源确认有可用的E1端口第二步在网管里新建业务选择源网元、源单板、源端口第三步选择宿网元、宿单板、宿端口第四步分配VC12时隙网管会自动生成经过沿途网元的路径第五步下发配置并验证。先解释一个入门必懂的参数关系一条VC12承载一个2M业务一个VC4包含63个VC12。很多同学不理解为什么2M通道叫VC12原因就在这里——SDH容器体系里面VC12是承载2M的最低阶通道。时隙可以不连续分配但建议按顺序分配方便后续排查。关键参数说明E1端口是物理接口VC12是逻辑通道业务配置里要把两者绑定。常见的翻车现场是业务配置成功、网管上无告警但用户侧2M端口没有信号一查才发现源端绑定的物理端口和现场跳纤端口对不上。所以配置下发之前我一般会先在网元侧确认源宿端口的光功率和物理连接再做业务下发。批量下发几十条业务时分批次下发不要一口气点全选。网元和网管在批量下发过程中的CPU和数据库压力都会显著上升一旦出现半写入状态后面清理起来非常麻烦。每下发一批看一会儿告警窗口确认没有异常再继续下一批。4. 日常运维必会的五类操作告警、性能、配置、报表、巡检4.1 告警查询与处理先分轻重缓急再找根因打开当前告警窗口第一件事不是逐条读而是按告警级别过滤。传输网管的告警级别一般分为紧急、主要、次要、警告不同版本叫法略有差异。先看紧急和主要级别的告警这些直接关联业务中断次要和警告级别可以放到第二步处理。一条告警信息要读全告警网元、告警单板槽位、告警代码和描述、发生时间、是否已经恢复。举个例子RLOS表示接收侧信号丢失RLOF表示接收侧帧丢失TU-LOP表示低阶通道指针丢失TU-AIS表示低阶通道告警指示。刚接触这些代码时会觉得像天书但记住一条规律能省很多事——AIS这类告警是下游设备上报的根因往往在上游。比如下游网元报TU-AIS优先看上游网元有没有LOS或者单板故障。处理完故障之后需要在网管里确认并清除告警保留恢复时间。这一步很多人会漏掉导致月底做故障统计的时候数据对不上。告警清除不是删记录是标记处理状态历史数据仍然保留在报表里。4.2 性能监视光功率、误码、单板温度这三个指标必须盯性能监视是日常巡检的核心进入“性能监视”模块之后添加性能对象选单板或者光口。三个必看指标光功率、误码、单板温度。光功率反映光纤链路质量误码反映链路是否存在比特差错温度反映设备运行环境是否正常。光功率这块要特别注意阈值设置。网管自带的默认阈值不一定适合你的现网不同速率的模块接收灵敏度差异很大。经验做法是先观察一个月把正常范围记录下来再按正常值上下留出告警余量设置阈值。比如某个10G光模块接收光功率正常是-8dBm告警阈值可以设在-18dBm留出10dB余量而不是直接用设备的极限灵敏度值。监视对象常见指标关注点光口收光功率 / 发光功率靠近灵敏度底噪时就要预警不要等真正中断SDH开销B1 / B2 / B3 误码秒偶发误码看趋势持续增长要查链路单板温度 / 电压温度过高先查风扇和机房环境电压异常优先怀疑电源板误码是最容易误判的指标。偶发几个误码秒不一定影响业务关键看趋势——同一块板的误码计数是不是持续增长。持续增长说明光纤链路在劣化可能是法兰松动、跳纤弯曲半径过大也可能是光模块老化。建议每周拉一次性能趋势和上周对比变化超过正常波动范围就要现场处理。4.3 配置备份与恢复给网络留一份后悔药配置备份是传输网管里的一个核心操作路径一般在“配置管理-配置备份”选择全量备份。可以备份单台网元配置也可以备份整个网管数据。我个人的习惯是每周自动备份一次全量配置每次割接、版本升级、批量业务变更之前手动再备份一次。恢复配置的时候踩坑最多。很多人以为备份文件恢复到网元就能回到之前的正常状态忽略了版本一致性问题。如果当前网元软件版本和备份时不一致恢复完成之后会出现部分单板配置不生效甚至产生大量未知告警。所以恢复之前先核对当前软件版本和备份文件记录是否一致恢复过程中不要在网管上再对其他网元做任何操作恢复完成后逐板核对配置。提示备份文件不要存在网管服务器本地。配置FTP服务器或者网络共享目录网管生成备份后自动同步一份过去。服务器硬盘损坏时备份和网管一起没了的教训见过太多次。4.4 报表与巡检让“看起来正常”变成“可验证的正常”网管自带报表功能可以导出告警统计、性能日报、资源利用率表。日报看告警数量趋势月报看业务增量和资源占用。报表不只是用来交差的它能帮我们发现潜在线索——比如某个网元每周固定时间出现几次次要告警很可能和上游定时任务或业务拨测有关。巡检清单建议固定成模板否则容易漏项。我一般按这个顺序走设备指示灯、风扇噪音、单板温度、光功率与上周基线偏差、有无新增不明告警、网管数据库剩余空间、最近一次备份是否成功。每项都留一个正常标准不满足标准的直接进整改流程。巡检项正常标准异常处理设备指示灯所有单板RUN灯正常闪烁红灯或熄灭时先看网管告警再现场查单板温度在设备技术手册标称范围内偏高优先查风扇和机柜通风光功率与基线偏差不超过3dB偏大偏小都查法兰、跳纤必要时用OTDR测试配置备份最近一次备份成功失败立即重备并检查FTP目录空间这套巡检模板适合中小规模网络网元数量上百之后建议引入自动采集把光功率、温度、误码这些数据定期批量导出靠人来点鼠标的方式在新迪拜就撑不住了。5. 传输网管避坑与排查五条血泪经验5.1 客户端连不上服务器先分清楚是哪一层不通现象打开客户端提示“连接服务器失败”或者一直转圈。很多人第一反应是服务器挂了直接重启服务结果把正在跑业务的网管搞得更糟。原因这个问题可能出在三个层面——客户端到服务器的网络不通、网管服务没启动、后台数据库异常。解决先在客户端上ping服务器IP不通就查网络通了再在服务器上看网管进程是否在监听端口比如用netstat -an | grep 端口号看一下监听状态如果进程正常但客户端还是进不去查数据库连接。遇到这个问题先ping、再看进程、最后碰数据库顺序别反过来。5.2 网元添加失败自动发现能看到手工添加却报错现象自动发现在列表里能扫到这台设备但手工添加时提示连接失败或认证失败。原因自动发现只是收到了网元的响应报文并不代表EMS可以通过管理通道正式注册到网元。常见原因有三个——DCN路由不通、网元侧管理访问限制、或者这台设备已经在其他EMS被纳管。解决先ping管理IP确认DCN路由再确认网元没有被另一套网管锁定最后检查网元侧管理白名单。开局阶段还有一个常见坑管理VLAN在交换机上只放行了一部分端口网管服务器挂着的那台交换机没放行。5.3 告警风暴把网管刷死先收敛再定位根因现象某条光缆中断后下游几十台网元同时上报大量告警网管客户端操作极其卡顿点一个菜单要等好几秒。原因每台网元对同一个故障会从不同协议层上报告警。一条光缆断了上游网元报RLOS下游网元报TU-AIS、TU-LOP各层级衍生告警叠加起来就是几百上千条。解决网管里开启告警收敛和抑制策略把同根因衍生告警合并显示排查时按网元过滤只看根因网元。恢复之后再统一清理历史告警。这里有一条红线告警风暴期间不要在网管上做配置变更数据库处于高负载状态操作容易半写入。5.4 配置恢复后业务异常版本一致才是后悔药的前提现象从备份恢复配置后一部分端口没有生效网元还冒出来一堆不认识的告警。原因备份文件生成时的网管版本、网元软件版本和当前不一致。单板类型或槽位发生变化时旧配置映射不到新的硬件位置上。解决恢复前先核对版本版本不同的情况下先升级或者降级到一致状态再恢复。恢复后逐板核对配置哪里不对补哪里不要整个网元再灌一遍。第二次灌不一定能解决问题反而可能把正常单板的配置也覆盖掉。5.5 性能曲线毛刺与光功率误告警现象网管上周期性弹出光功率低告警但现场业务测试正常设备也没有LOS。原因法兰盘松动、跳纤弯曲半径过大、光模块处于灵敏度临界状态。这类问题属于物理层隐性劣化业务暂时不受影响但已经在临界点附近。解决先看24小时性能趋势区分瞬时抖动和持续劣化现场紧固法兰、整理跳纤弯曲复位光模块之后继续观察。同时修正网管里的告警阈值避免误告警长期刷屏掩盖真正的问题。处理完记录一个基线值下次再出现类似毛刺直接对比基线判断是偶发还是真故障。6. 进阶技巧一条telnet和一段脚本把网管工作做薄6.1 telnet登录网元绕过网管界面直接看设备网管界面异常但现场急等定位时一条telnet就能直达网元。操作方式是在网管工作站或者维护终端上执行telnet 10.100.0.11 # 进入网元命令行输入维护账号和密码 # 不同产品线指令集有差异但开局都从这两步开始 # 第一步看单板状态确认主控板和业务单板都在位 # 第二步看光口收发光功率判断物理链路质量telnet是明文协议生产网元上不要使用弱口令能走SSH或者网管通道时优先走加密方式。我个人的习惯是telnet只在网管系统本身出问题时作为应急手段使用平时操作还是走网管客户端用telnet做快速确认不做配置变更。6.2 定时备份与归档脚本让网管会自己照顾自己网管自带的备份功能一般都能设置定时任务但如果你的环境需要在备份完成后额外做归档和清理一段简单的bash脚本就能补上这个环节。#!/bin/bash # 每周日凌晨2点执行按日期归档配置备份文件 DATE$(date %Y%m%d) BACKUP_DIR/trans_backup/$DATE mkdir -p $BACKUP_DIR # 从网管FTP目录拉取备份IP替换为你的网管服务器地址 ftp -n 10.100.1.100 EOF user backup_user backup_pass bin lcd $BACKUP_DIR mget *full* bye EOF # 保留最近30天备份过期自动清理 find /trans_backup -maxdepth 1 -type d -mtime 30 -exec rm -rf {} \;参数说明FTP账号密码在网管服务器上单独开一个专用只读账号不要用维护账号。mget *full*里的通配符要匹配网管实际生成的备份文件名模式不同版本命名规则有差异先手动执行一次ls看清楚再固化到脚本里。配合crontab使用0 2 * * 0 /opt/trans_backup.sh每周日凌晨两点自动执行。如果网管提供了北向接口告警数据优先从北向接口采集走标准化协议最省心。没有北向接口时用数据库只读账号取告警表也可以但不要在业务高峰时段跑复杂查询避免影响网管自身性能。我这边的做法是每日凌晨脚本抓取前一天的告警和性能数据生成一份CSV发到内部邮箱早上到岗打开邮件就能知道夜间有没有异常。传输网管入门这件事真正难的从来不是界面操作而是把网元IP规划表、备份脚本、业务端口对照表这些家底搞清楚。你不需要记住所有菜单但一定要知道配置去哪找、备份去哪拿、告警从哪看关键时刻才不会对着满屏告警发呆。希望这些经验能帮你少走几段弯路。本文还有配套的精品资源点击获取