
简介中科曙光服务器基础培训讲解PPT2018版面向服务器初学者、IT运维人员及售前技术支持围绕“服务器基础知识”主题系统讲解计算机与服务器的概念区别、服务器与PC机/工作站/小型机的差异以及服务器性能评价标准等基础内容。教程从塔式、机架式、刀片式等外形分类单路/双路/多路CPU数分类指令集架构分类和服务规模分类等多个维度梳理服务器形态与适用场景并进一步介绍服务器硬件部件与软件体系帮助读者建立完整的服务器认知框架。压缩包内为1个PPTX演示文稿整体大小42.47MB图文结构清晰适合培训演讲或自学阅读。该资源已有600人学习/下载可用于企业新员工培训、技术科普和院校服务器基础课程实用价值较高。对于需要快速整理服务器基础培训素材的技术团队这套演示文稿能够直观呈现关键知识点节省从零梳理内容的时间。1. 中科曙光服务器基础知识到底该讲什么很多内训课件把“服务器基础知识”做成了名词解释什么是CPU、什么是内存、什么是RAID一页一页翻下去学员记住了概念进了机房还是不知道从哪儿下手。中科曙光服务器的培训教程之所以有价值不在于罗列这些名词而在于把硬件、带外管理、存储配置和系统落地串成一条可操作的路径。比如你拿到一台曙光工作站或机架式服务器第一件事不是装系统而是看面板指示灯、进BMC、查RAID卡型号。这些动作背后才是服务器运维真正的基础能识别硬件状态能远程带外管理能在系统装好后验证一切正常。这篇教程面向刚接手数据中心硬件的新人也适合给团队做内训前先梳理一遍自己的知识框架。2. 看懂中科曙光服务器的硬件组成与部件选型2.1 从机箱前置面板学会看盘位和指示灯中科曙光常见的机架式服务器比如I620-G30系列前置面板通常有12个或24个2.5英寸盘位或者8个3.5英寸盘位。盘位编号从左上角开始与背板上的SAS/SATA口映射关系在服务器手册里有明确说明但更快的办法是看硬盘托架上的LED灯。每个托架上有两个指示灯电源/活动灯和故障灯。正常状态下电源灯常亮或闪烁故障灯不亮如果故障灯亮起橙色说明这块盘已经被RAID控制器标记为异常。第一次上手时我一般会用纸条把盘位的物理位置和对应系统里的盘符对应起来避免误拔。方法很简单在系统里执行以下命令然后逐个点亮硬盘灯。# 对sgX设备点亮定位灯需要root权限/dev/sg2换成实际设备 echo 1 /sys/block/sda/device/delete 2/dev/null || true # 更安全的做法用ledctl命令 ledctl locate/dev/sda逻辑说明ledctl来自ledmon软件包locate参数让硬盘托架上的定位灯亮起方便在机柜里找到物理位置。参数说明/dev/sda是系统识别的第一块磁盘具体名称用lsblk确认没有ledctl时可以用lsscsi配合SAS地址在背板上找位置但不推荐直接操作/sys/block下的设备属性。2.2 CPU、内存和PCIe槽位的布局与扩容规则中科曙光服务器多数采用双路主板CPU0和CPU1各对应一组内存通道。内存插槽颜色和标识直接写在主板上比如白色槽位给CPU0蓝色槽位给CPU1。扩容时最容易被忽略的是内存通道的平衡性不能只插一根32GB内存而是让每个CPU的每个通道都平均分配。以I620-G30为例每个CPU支持6个内存通道每通道2个插槽双路满配是24根DIMM。具体选型时可以先看当前配置。# 查看CPU数量和型号 lscpu | grep Model name # 查看内存条数量、容量和频率 dmidecode -t memory | grep -E Size:|Speed:|Locator: # 查看空闲内存插槽数 dmidecode -t memory | grep Number Of Devices逻辑说明lscpu提供逻辑CPU信息dmidecode -t memory直接从DMI表读取物理内存信息Number Of Devices表示单个主板支持的最大内存条数量。参数说明如果输出里Size: No Module Installed说明该插槽为空Speed: 2933 MT/s表示当前运行频率实际频率受CPU内存控制器和内存条自身标称共同约束。PCIe槽位也需要先看扩展卡位置。曙光服务器的PCIe槽位通常分布在CPU0和CPU1两侧靠近GPU或NVMe盘的槽位走直连CPU通道IO延迟更低。插拔扩展卡前必须确认槽位对应的CPU是否在线否则即使插上卡也无法识别。2.3 电源与散热模块冗余设计不是摆设服务器电源模块常见的是11冗余或者22冗余。所谓11就是两个电源模块同时工作其中一个失效时另一个自动承担全部负载实现无缝切换。曙光服务器的电源状态指示灯在电源模块后侧绿灯表示正常红灯表示故障不亮表示没有输入。散热方面机架式服务器背面有4到6个风扇模块。中科曙光服务器的风扇是热插拔的但拔风扇前必须确认系统负载不高、温度在安全范围否则直接触发过热保护关机。日常巡检可以用BMC看到风扇转速也可以在系统里看。# 查看风扇转速和温度传感器使用lm-sensors sensors逻辑说明sensors命令读取内核中的硬件监控芯片数据输出包括每个风扇转速、CPU温度、主板温度等。如果输出为空先运行sudo sensors-detect生成模块配置再加载coretemp和ipmi相关驱动。下表是常见的电源与风扇状态参考指示灯颜色状态含义处理动作绿色常亮电源输入输出正常无需处理绿色闪烁电源满载或负载波动观察日志检查用电器红色常亮电源故障更换电源模块不亮无输入或电源损坏检查电源线和PDU散热模块的温度阈值建议在BMC里设置为CPU温度超过85℃报警主板温度超过70℃报警。超过这个值先看机房空调或机柜风道不要急着加风扇转速。3. 通过BMC/IPMI完成带外管理与状态巡检3.1 登录BMC管理口的第一步配置中科曙光服务器的BMC管理口通常是独立的RJ45接口标识为Mgmt或者iBMC。默认IP一般是192.168.1.2或通过前面板液晶屏获取。拿到新机器后先把管理网口接到独立网段不要和业务网混在一起。用浏览器访问HTTPS端口443首次登录会提示修改默认密码。如果服务器的BMC地址丢失可以在系统里用ipmitool查询。# 查看BMC的LAN配置 ipmitool lan print 1 # 如果ipmitool不支持先安装apt install ipmitool 或 yum install OpenIPMI-tools逻辑说明ipmitool lan print 1打印通道1的IP、子网掩码、默认网关和MAC地址。参数说明通道编号一般1对应专用管理口lan print 2有时用于共享口。如果返回Unable to send RAW command说明内核没有加载ipmi_si模块先执行modprobe ipmi_si。BMC的账号权限一般分管理员、操作员、只读用户。日常巡检用只读账号足够避免误操作导致重启。生产环境建议关闭HTTP明文只开HTTPS并限制管理网段来源IP。3.2 用ipmitool检查传感器状态登录BMC后最常用的功能是看传感器。命令行下用ipmitool可以批量获取温度、电压、风扇转速和电源状态。# 列出所有传感器的当前值 ipmitool sdr list # 只看温度类传感器 ipmitool sdr type temperature # 查看电源和系统总功耗 ipmitool sensor get System Power逻辑说明sdr list输出所有传感器的名称、状态和读数。参数说明传感器名称因服务器型号而异比如System Power是整机功耗瓦FAN1到FAN6是风扇转速RPM。如果某个传感器状态显示nrnot readable说明该传感器数据不可读需要检查BMC固件或传感器硬件。除了传感器还有几个常用的带外操作命令需要背下来# 查看主机电源状态 ipmitool power status # 强制重启主机慎用 ipmitool power cycle # 设置下一次启动为PXE ipmitool chassis bootdev pxe逻辑说明ipmitool power cycle会对服务器做冷重启过程约1到2分钟生产环境执行前必须确认业务已切换。参数说明bootdev pxe只对下一次启动有效不会修改系统内的启动顺序设置。3.3 远程控制台与虚拟介质挂载3.3.1 通过网页启动远程KVM中科曙光服务器的BMC Web界面里通常有“远程控制”或“KVM”菜单。点击启动远程控制台后浏览器会下载一个Java Web Start文件或HTML5客户端。新的BMC固件一般支持HTML5不需要装Java。如果启动时黑屏检查浏览器是否拦截了窗口或换用Chrome的兼容模式。远程KVM最实用的场景是系统进不了桌面、网络配置错误导致SSH断开、或者装系统时GRUB卡住。KVM底部的虚拟介质按钮可以挂载本地ISO镜像机器重启后从光驱启动。3.3.2 挂载ISO安装操作系统在KVM界面里选择“虚拟介质”或“Media”把本地的CentOS、Ubuntu或Kylin ISO挂到服务器的虚拟光驱上。挂载后重启服务器启动时按F11选择启动项选择虚拟光驱通常显示为Virtual CDROM即可进入安装界面。注意曙光BIOS里启动模式分Legacy和UEFI老系统用Legacy新版系统建议UEFI。装系统前先确认RAID卡驱动是否在镜像内否则会找不到磁盘。如果镜像内没有驱动可以在启动参数里加载驱动盘或者选择使用“兼容模式”安装。4. 磁盘阵列与RAID配置实操4.1 RAID级别怎么选以中科曙光服务器典型场景为例RAID卡是服务器存储的起点。中科曙光服务器常用的RAID卡有LSI/Avago或博通系列比如9361-8i、9460-8i。RAID级别选择没有绝对标准但可以按角色套用模板场景RAID级别可用容量说明操作系统盘2块SSDRAID 150%冗余要求高性能适中数据盘4块HDDRAID 5(N-1)/N读性能好写性能一般高并发日志盘4块SSDRAID 1050%冗余和性能均衡纯备份存储8块HDDRAID 6(N-2)/N允许坏2块盘RAID 5在2TB以上大容量磁盘上重建失败率偏高因为重建过程会长时间高负载读取其他盘。如果磁盘容量超过4TB我通常建议上RAID 6或者RAID 10。虚拟化和数据库场景RAID 10写在多块盘上并发性能接近单盘写入速度的倍数但代价是只能使用一半容量。4.2 进入RAID卡配置界面并创建阵列服务器开机自检时按CtrlH进入RAID卡配置界面LSI/Avago卡或者按CtrlR进入部分老型号的WebBIOS。进入后先确认所有硬盘都显示在Drives列表里没有被标记为Foreign或Offline。如果显示Foreign先执行Clear Foreign Config但该操作会丢数据必须确认旧配置不再需要。创建阵列的路径通常是Configuration Wizard-Add Configuration-Manual手动选择硬盘指定RAID级别、条带大小和初始化方式。RAID级别RAID 10 条带大小256KB 读取策略Read Ahead 写入策略Write Back with Battery Backup 磁盘缓存策略Enable Disk Cache参数说明条带大小推荐256KB或1MB数据库顺序写入场景用1MB更好Write Back依赖RAID卡电容或电池保护没有BBU时不要开启否则掉电会丢数据。创建完成后必须执行初始化可以选择Fast Init但新盘建议做Full Init避免坏道在后期才暴露。4.3 用命令行工具确认RAID健康状态系统装好后用RAID厂商命令行工具检查状态。LSI/Avago卡通常用storcli或MegaCli。# 查看所有RAID控制器信息 storcli /c0 show # 查看逻辑盘状态 storcli /c0/v0 show # 查看物理盘状态 storcli /c0/e0/s0 show逻辑说明/c0表示控制器0/v0表示第一个虚拟盘逻辑盘/e0/s0表示第一个背板上的第一块物理盘。参数说明输出里State Optimal表示逻辑盘状态正常S.M.A.R.T. Notify如果有黄色告警说明盘有隐患。如果状态为Degraded说明有一块盘离线需要尽快更换。另外RAID卡的BBU状态也要常看storcli /c0/bbu show输出里Battery State: Charged、Gas Gauge: 100%是健康状态。如果显示Fully Discharged赶紧联系备件否则下次掉电后写缓存策略会强制切换到Write Through性能骤降。5. 装完系统后的基础校验与排错技巧5.1 核对CPU/内存/磁盘信息的常用命令系统装完第一件事不是跑业务而是确认硬件是否被完整识别。用lscpu看CPU用free -h看内存但这两条命令只能看使用量看不到插槽和型号。更接近硬件事实的命令如下。# 显示CPU逻辑核数和物理核数 lscpu | grep -E ^CPU\(s\)|Core|Socket # 显示每根内存条的容量和频率 dmidecode -t memory | grep -E Size:|Speed:|Configured # 显示所有磁盘设备 lsblk -o NAME,SIZE,TYPE,MODEL逻辑说明dmidecode读取SMBios数据lsblk -o指定输出列TYPE为disk的是物理盘part是分区lvm是逻辑卷。参数说明如果服务器配置了RAIDlsblk里看到的是一块虚拟盘型号显示为RAID卡名称比如AVAGO MR9361-8i这是正常现象如果你看到多块物理盘直接出现在lsblk里说明磁盘没有做RAID而是以直通模式挂在系统上。5.2 检查固件和驱动版本避免隐性故障曙光服务器的BMC固件、BIOS固件、RAID卡固件、网卡固件都有版本要求。特别要注意网卡和RAID卡驱动因为内核版本升级后旧驱动可能引起丢盘或断网。# 查看RAID卡固件版本以storcli为例 storcli /c0 show | grep -i Firmware Package # 查看网卡固件版本 ethtool -i eth0 | grep firmware # 查看系统日志中是否有硬件告警 dmesg | grep -i error | tail -20逻辑说明ethtool -i里的firmware-version字段由网卡驱动提供不一定准确但可以对比驱动版本和内核模块参数。参数说明dmesg中PCIe Bus Error或AER错误通常说明PCIe链路由问题先重插卡再检查槽位。如果日志持续报nvme超时检查NVMe盘的Pcie电源管理策略。5.3 一条命令验证服务器时区与时间同步服务器基础运维里时间同步是常被忽略的坑。业务日志时间不对排错时所有并序都乱了。中科曙光服务器默认BMC会同步系统时间但系统自身要配置NTP客户端。# 检查当前时间和时区 timedatectl # 设置时区为Asia/Shanghai timedatectl set-timezone Asia/Shanghai # 强制同步一次NTP时间 ntpdate -u ntp.aliyun.com 2/dev/null || chronyc makestep逻辑说明timedatectl输出System clock synchronized: yes代表时间已同步。参数说明ntpdate在老系统上可用新版系统用chronyc makestep立即校准。如果系统显示NTP service: inactive需要启用chronyd服务并添加NTP服务器到/etc/chrony.conf。最后再分享一个排查服务器重启原因的实用技巧先看BMC日志再看系统日志。BMC日志里会记录重启原因比如Power Cycle、Watchdog或者Thermal Shutdown。系统日志里检查journalctl --list-boots查看发现每次重启是不是在同一个内核模块加载阶段崩溃。如果每次都挂在RAID驱动上优先升级RAID卡固件而不是换硬盘。这个动作对刚接触中科曙光服务器的人来说比记一堆概念实在得多。本文还有配套的精品资源点击获取