ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

深信服aStor-EDS 3.0.5分布式存储部署与运维实战指南

深信服aStor-EDS 3.0.5分布式存储部署与运维实战指南 简介《深信服企业级分布式存储 aStor-EDS 用户手册 V3.0.5》是一份官方发布的产品技术文档面向技术服务工程师与运维人员围绕 aStor-EDS 分布式存储系统的架构、特性、安装、使用与运维管理展开说明。资源包为单个 PDF 文件体积 10.05MB内容包含前言、符号约定、修订记录、产品架构、安装配置、使用指南及运维管理等多个章节结构完整。目前已有 352 人浏览学习。读者可通过该手册了解多节点分布式存储的高可用、高性能与高安全设计思路明确存储节点与元数据服务器的部署方法掌握系统监控、故障处理及软件升级等日常运维操作同时手册还提供官方支持邮箱、服务热线和意见反馈路径便于在项目实施与维护中快速获取帮助适合作为企业存储规划、上线及后续管理的实用参考。1. 拆解深信服 aStor-EDS 用户手册3.0.5 到底能解决什么问题做过存储交付的人都有体会分布式存储最怕的不是性能不够而是开局就翻车。深信服 aStor-EDS 3.0.5 用户手册把从组网规划、IP 分配、第三方服务器选型到存储池创建、NFS/CIFS/FTP 共享、iSCSI 块设备和对象 Bucket 管理再到快照恢复和多数据中心切换的完整链路都写清楚了。对技术服务工程师和运维人员来说这套手册最大的价值不是教会你某一个按钮在哪而是把每一步的先决条件和参数含义讲明白。适合刚要上手 EDS 的交付新人也适合已经踩过坑、想系统核对一遍配置习惯的运维老人。2. 安装部署前的硬规划组网模式、IP 规划与服务器选型2.1 组网模式怎么选管理、存储、业务流量先分开手册把组网放在安装部署的第一节不是没有道理的。EDS 集群运行时有三类流量节点间数据同步和客户端 IO 走存储网络集群管理、Web 登录走管理网络对外业务接入走业务网络。这三类流量如果混在一起一次大规模数据重建就可能把管理面堵死到时候想登录控制台排障都进不去。我一般会按节点至少三张网卡来规划管理口接千兆交换机用于登录集群和调用 aDeploy 检测工具存储口接万兆交换机承载节点间数据复制和前端存储 IO这个口是性能瓶颈所在不要省业务口接客户业务网供 NFS、CIFS、iSCSI 等前端协议接入。手册里专门有一节讲 EDS 与 HCI 组网最佳实践场景是 EDS 作为超融合 HCI 的共享存储后端这时候存储网络要优先保证低时延建议存储口与 HCI 的计算节点之间二层直连不要跨三层路由。实际项目里最常见的翻车是只有两张网卡把管理和业务合并了存储口独享万兆。这种做法在中小项目里能用但合并口上跑着 NFS 和 CIFS 客户端访问一旦有人做批量文件拷贝控制台操作就会明显卡顿。如果你只能两张网卡至少要保证存储内网独立管理口和业务口合并后打开流控和 QoS。2.2 IP 地址规划一张表排清所有角色手册对 IP 地址规划给了明确要求每个节点至少规划管理 IP、存储 IP、业务 IP 三类地址存储内网建议静态分配不能用 DHCP节点间存储通信依赖固定地址做集群心跳和数据复制。以一套三节点集群为例我一般会这样排节点角色管理网段存储内网业务网段节点 1192.168.10.1110.10.1.11172.16.1.11节点 2192.168.10.1210.10.1.12172.16.1.12节点 3192.168.10.1310.10.1.13172.16.1.13虚拟 IP 池--172.16.1.20-172.16.1.30三个网段要能够在主机侧隔离包括交换机 VLAN 隔离避免存储内网的广播报文干扰管理面。还有一点容易被忽略虚拟 IP 池要单独预留一段连续地址文件存储和对象存储都会用到虚拟 IP客户端访问的是 VIP 而不是某个节点 IP节点故障时 VIP 自动漂移客户端不断连。这段地址务必要和物理节点 IP 错开并且提前在交换机上确认没有冲突占用。2.3 硬件配置与第三方服务器选型注意点如果买的是 EDS 一体机硬件兼容性厂商已经替你验证过省事。但很多项目是客户已有第三方服务器这时候就必须严格按手册的第三方设备选型指导走。手册里对第三方硬件服务器及配件选型、第三方服务器安装 EDS 的配置要求用了两节篇幅来写重点说的是网卡型号和固件兼容性、硬盘型号和 RAID 卡模式。我的经验是三条硬规矩第一数据盘必须直通模式RAID 卡不要做阵列分布式存储自己管理副本硬件 RAID 反而会掩盖磁盘故障第二系统盘和数据盘分离系统盘用 SATA SSD 或企业盘即可数据盘按介质类型分开规划SATA SSD、NVMe SSD、机械盘不要混在同一个存储池里否则 NVMe 会被机械盘拖到同一性能水平第三网卡选型以手册兼容性列表为准尤其是万兆网卡部分廉价网卡在大流量下会出现丢包重传存储内网的数据一致性校验会非常吃性能。不同的场景介质选择差别很大可以先用这张表定方向场景推荐介质网卡要求备注备份归档、文件共享大容量机械盘千兆起步容量型存储池优先虚拟化、数据库NVMe SSD双万兆高性能块存储池混合负载SSD 分层双万兆容量和性能兼顾需确认页面回收策略选型阶段多花半天核对兼容性比进场后因为网卡固件不兼容导致集群初始化失败要划算得多。厂商一般不给第三方硬件做承诺手册里列了配置要求照着选就不会出现装上系统后硬盘识别不全的问题。3. 集群初始化和存储池创建从节点到可用存储的关键路径3.1 组建集群与授权激活aDeploy 检测别跳过EDS 系统安装在每台服务器上之后下一步不是直接用而是把多台节点组建成一个集群。一体机开机后会进入初始化界面第三方服务器则是通过 ISO 安装 EDS 系统然后登录初始化页面填写管理 IP再让各节点互相发现并组建集群。这里要特别提一下 aDeploy 工具。手册在集群初始化之后专门安排了一节使用 aDeploy 工具进行检测这个工具的作用是在正式启用前对集群环境做一次体检。有的交付同事觉得这一步浪费时间跳过直接建池后面节点间网络时延异常、时钟不同步的问题慢慢才暴露出来。我每次都会在初始化后跑一遍# 在管理端执行 aDeploy 检测--cluster 指定集群管理 IP--user 指定管理员账号 ./adeploy check --cluster 192.168.10.11 --user admin这个命令会检查节点间连通性、存储网络延迟、磁盘健康状态、时钟同步情况输出 warn 和 fail 两类结果。fail 项必须处理完再继续比如存储口网线没插好、时钟偏差超过阈值这些都是后续存储池性能异常和数据一致性隐患的来源。warn 项可以记录跟踪比如某个磁盘健康状态预警不影响初始化但需要后续关注。集群组建完成后进入授权激活环节。授权文件与集群的节点数和序列号绑定激活时在控制台上传 License 文件。常见的问题是授权文件拿错比如客户买了 4 节点授权集群却加了 5 个节点激活会直接失败。遇到这种情况先核对授权范围再检查控制台显示的序列号是否与官网生成授权时填写的一致。3.2 创建容量型通用存储池副本数怎么选存储池是 EDS 分配空间的基础单元所有文件存储、块存储、对象存储都从存储池里划分。手册把存储池分成容量型通用存储池和高性能块存储池两类创建路径为[存储管理/存储池/创建]。容量型通用存储池用于文件存储和对象存储介质选择大容量机械盘或 SATA SSD。创建时最关键的两个参数是冗余策略和故障域。冗余策略决定数据副本数默认有 2 副本和 3 副本可选。3 节点小集群我一般建议直接上 3 副本虽然有效容量少一些但任何一个节点宕机都不影响数据完整性不用等重建完成才敢继续写。故障域选项分为节点级和机架级。同一个机架内的多台服务器如果共享一个电源或接入交换机应该选择机架级故障域副本会分布到不同机架避免单机架断电导致所有副本同时离线。创建存储池时还有一个经常被忽略的选项热备容量。热备容量会在磁盘故障时自动用于数据重建类似传统 RAID 的热备盘。建议预留一块磁盘或至少一个节点容量的空间作为热备否则磁盘故障后要等人工加盘才能开始重建这段时间数据处于降级状态风险较高。3.3 创建高性能块存储池给 iSCSI 和虚拟化用高性能块存储池和容量型存储池在创建流程上类似但介质和用途完全不同。它通常选择 NVMe SSD 或高性能 SAS SSD用于承载 iSCSI 块存储供虚拟机磁盘、数据库数据文件这类对 IOPS 和时延敏感的业务使用。块存储池创建完成后后续的 iSCSI 服务端、服务器、LUN 都建立在这个池之上。和容量型相比块存储池的性能表现不仅取决于磁盘介质还取决于存储网络的链路质量。使用双万兆网卡时建议做链路聚合或至少保证两张网卡都接入避免单链路故障导致块设备 IO 中断。容量型和性能型的选择可以这样判断对比项容量型通用存储池高性能块存储池适用协议NFS、CIFS、FTP、对象iSCSI 块存储推荐介质机械盘、SATA SSDNVMe、高性能 SSD典型场景文件共享、备份归档虚拟化、数据库冗余策略2 副本或 3 副本必须 3 副本以上性能重心容量利用率IOPS 和时延不要试图用一个池同时满足所有需求。文件共享业务量大时占满 IO数据库的时延就会被拉高这类问题在交付后极难排查因为从存储池角度看不出异常。4. 文件存储与块存储实操NFS、CIFS、FTP 和 iSCSI 的创建与接入4.1 NFS/CIFS/FTP 共享创建的完整流程文件存储是 EDS 最常用的功能。手册的流程是先在存储池上配置文件存储目录权限再创建具体协议的共享。创建 NFS 共享时需要填写共享路径、允许访问的客户端网段、读写权限rw 或 ro以及 root squash 配置。CIFS 共享面向 Windows 客户端要配置工作组或域环境、共享用户权限。FTP 共享则用于需要标准 FTP 工具访问的场景。以 NFS 为例共享创建完成后Linux 客户端挂载命令如下# 推荐使用虚拟 IP 挂载避免单节点故障导致客户端断连 mount -t nfs 172.16.1.20:/nfs_share /mnt/eds # 172.16.1.20 为文件存储虚拟 IP 池中的地址 # /nfs_share 为共享路径/mnt/eds 为本地挂载点强调一点挂载地址尽量用虚拟 IP不要直接用某个节点的业务 IP。虚拟 IP 漂移机制会在节点故障时把服务自动切到健康节点客户端 TCP 连接不中断对业务的影响几乎为零。如果直接挂节点 IP节点宕机后就要手动改挂载点。CIFS 共享创建后在 Windows 客户端访问 \172.16.1.20\共享名用配置好的账号登录即可。FTP 共享创建时会设置端口默认 21也可以改为非标准端口规避扫描。三种协议的权限体系是独立的同一个共享目录如果通过不同协议访问身份认证需要靠用户映射来解决这个放到下一节讲。4.2 虚拟 IP 池、AD 域认证与多协议共享多协议共享是 EDS 文件存储的一个亮点也是新手最容易绕晕的地方。NFS 客户端用 UID/GID 做身份标识CIFS 客户端用 Windows SIDFTP 客户端用账号密码三者天然不互通。手册用了一整节讲用户映射目的就是解决同一份文件在不同协议下权限不一致的问题。实际配置时启用多协议共享的前提是 AD 域认证。把 EDS 文件存储加入 AD 域后域用户通过 CIFS 访问时拿到的是域账号身份通过 NFS 访问时需要做 UID 映射。一般做法是在 AD 域中给用户或用户组设置统一的 UID 属性然后手动在存储侧完成映射。配置不当会出现典型的权限问题Windows 上能写、Linux 上只读反过来也有。虚拟 IP 池在多协议共享中作用很大。文件存储的虚拟 IP 池独立于存储池创建共享时把虚拟 IP 池绑定到共享上客户端无论通过哪个协议访问入口 IP 都是同一个。配置虚拟 IP 池时要注意池内 IP 必须和客户端处于同一二层网络跨三层访问需要额外配置路由虚拟 IP 漂移功能在三层环境下会受限。4.3 iSCSI 块存储LUN 创建和 Linux/Windows 客户端接入块存储走 iSCSI 协议流程比文件存储多一步先在存储侧配置 iSCSI 服务端再创建服务器条目记录客户端的 initiator IQN最后创建虚拟卷LUN并映射给指定服务器。这样做的目的是做接入认证只有登记过的 initiator 才能发现和登录 LUN。Linux 客户端接入的完整命令序列如下# 安装 iscsi-initiator-utils 后先发现目标端 iscsiadm --mode discovery --type sendtargets --portal 172.16.1.21 # 172.16.1.21 为块存储虚拟 IP # 登录发现到的 target iscsiadm --mode node --targetname iqn名称 --portal 172.16.1.21 --login # 查看新增磁盘确认 /dev/sdX 后格式化并挂载 mkfs.xfs /dev/sdb mount /dev/sdb /mnt/data参数说明discovery 阶段拿到的是 target 名称login 时 --targetname 要和 discovery 结果一致如果配置了 CHAP 认证还要在 /etc/iscsi/iscsid.conf 里填写用户名和密码再重启 iscsid 服务。登录后可以用multipath -ll查看多路径状态双网卡环境下建议启用 multipath 避免单链路故障导致 IO 中断。Windows 客户端不需要命令行在iSCSI 发起程序里填入存储侧虚拟 IP点击快速连接登录后到磁盘管理里初始化磁盘即可。VMware 环境则是在主机存储适配器里添加软件 iSCSI 适配器填写存储 IP 和 CHAP 认证信息然后扫描存储方式类似但要注意 VMware 的 LUN 路径策略一般选最近使用或固定。5. 常见问题避坑V3.0.5 部署运维中 6 个真实翻车点5.1 集群组建时节点互相发现不了现象初始化时两个节点输入对方 IP 后界面一直显示等待中节点列表为空。原因最常见是管理网 VLAN 隔离导致三层不可达或者防火墙拦截了节点间通信端口。还有一部分是安装时管理 IP 掩码填错节点虽然在同一交换机但不在同一网段。解决先在本机 ping 对端管理 IP 确认二层连通再检查交换机端口 VLAN。确认物理通后对比两台节点管理网掩码和网关是否一致。如果还不行检查防火墙是否放通管理口之间的通信交付环境经常有安全设备串在管理网里。5.2 授权激活提示 License 不匹配现象上传授权文件后控制台提示授权信息错误或与设备序列号不符。原因授权文件与集群序列号、节点数绑定。要么是序列号填错导致生成出来的 License 不对要么是激活时集群节点数和购买授权数不一致。解决回到深信服官网授权管理页面核对申请授权时填写的序列号与控制台页面显示的是否一致。一致的情况下检查授权节点数授权 4 节点集群不能加第 5 个节点。注意临时扩容节点时也需要提前申请新授权不能抱侥幸心理。5.3 存储池创建后有效容量远小于预期现象采购时按裸容量算了 100TB建成后可用空间只有 40TB 左右业务方质疑容量缩水。原因分布式存储有效容量 裸容量 ÷ 副本数再减去热备容量和系统预留。3 副本时理论利用率只有 33%2 副本是 50%热备和系统预留还会再吃掉一部分。解决建池前先按公式算清楚并让业务方在立项阶段就确认冗余策略。如果业务能接受一定风险2 副本配合快照可以换取更多可用空间无法接受风险就明确告诉业务方 3 副本的容量代价别等建完池再解释。5.4 NFS 访问偶发性卡顿写入大文件时断连现象日常读写正常大批量拷贝文件时 NFS 客户端长时间无响应甚至报 Input/output error。原因客户端和存储端 MTU 不一致。存储内网配置了 9000 巨帧但客户端业务网还是 1500大包传输时触发分片交换机无法处理导致丢包重传表现就是卡顿和断连。解决把客户端挂载所用网卡的 MTU 调整到和存储端一致再用 ping 带 DF 标志验证。命令是ping -M do -s 8972 虚拟IP能通说明巨帧链路正常。两端统一 MTU 后再做一次大文件写入测试问题一般就消失。5.5 快照恢复后数据不是期望状态现象从快照恢复某个文件或 LUN恢复完成业务启动后数据比预期时间点晚了几分钟或者出现部分文件缺失。原因快照恢复通常只能恢复到快照创建时刻如果快照创建后还有新数据持续写入原地恢复会覆盖这些增量数据。部分文件缺失则可能是恢复时业务系统没停文件仍处于写状态恢复出来的数据不完整。解决恢复前先确认快照时间点和业务数据一致性要求数据库类业务优先用一致性组快照保证多个 LUN 在同一时间点。恢复操作在业务停写后进行恢复后立即做数据校验。要保留恢复点之后的改动优先用快照克隆而不是原地恢复。5.6 回收站配置不生效删掉的目录找不到现象在存储上启用了回收站客户端删除文件后回收站里是空的。原因回收站是按共享级别启用的不是全局参数。NFS 共享启用回收站后客户端挂载参数也有要求有的版本默认挂载不带回收站映射参数删除的文件不会进回收站。解决确认具体共享的回收站开关是开着的再看协议对应的挂载方式。NFS 共享要确认客户端是否通过回收站专用路径访问CIFS 共享则在 Windows 客户端的回收站目录里查找。配置修改后需要重新挂载共享才生效。6. 对象存储与数据保护Bucket 生命周期和快照恢复的进阶用法对象存储在 EDS 里的使用路径很清晰先创建对象存储用户再创建 Bucket把 Bucket 授权给用户然后通过 S3 兼容接口接入。手册里讲到的整体上传、分段上传、下载和删除 Object对应的就是日常备份和归档场景。分段上传适合大文件超过单个 PUT 上限时用分段上传可以断点续传失败只需重试失败段不用整文件重传。验证对象存储是否通我用 S3 兼容工具跑一轮最直接# 创建测试桶--host 指向对象存储虚拟 IP 和端口 s3cmd mb s3://test-backup --host 172.16.1.30 --host-bucket 172.16.1.30 # 上传一份备份文件验证读写链路 s3cmd put /data/app_backup.tar.gz s3://test-backup/ --host 172.16.1.30 --host-bucket 172.16.1.30 # 列出桶内对象确认上传完成 s3cmd ls s3://test-backup --host 172.16.1.30 --host-bucket 172.16.1.30参数说明--host-bucket指定桶的访问模式如果用的是路径风格访问这个参数要和--host保持一致端口默认 80 或 443如果控制台上改过端口记得补--port。上传完成后我会再执行一次下载对比校验确认对象内容和源文件一致。数据保护方面快照策略和一致性组快照是 EDS 数据保护的根基。文件存储和块存储都可以创建快照策略按天或按周定时执行快照本身不占满空间采用写时复制机制但要注意快照不要保留太多份每个快照占用的空间会随数据变化持续增长。多数据中心场景下的站点切换建议每季度做一次计划内切换演练切换前确认容灾站点状态和链路带宽别等真正故障时才发现半年没演练配置早就和现网脱节了。我从第一次交付 EDS 到现在一直保持一个习惯不管实施进度多紧存储池建完后一定强制走一遍完整验证——挂载 NFS 写入测试文件、用 s3cmd 跑一次上传下载、创建快照并恢复到临时目录核对数据。这套动作总共花不到半小时但能提前暴露出接入层八成的问题。某次就是因为少做了一次 iSCSI 登录验证业务上线当天才发现 LUN 没映射对。从那以后每次移交前我都会把这几步当成硬性流程走完希望帮到你。本文还有配套的精品资源点击获取
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进