当三副本池挂了4个osd

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

介绍

喜欢ceph的话欢迎关注奋斗的cepher微信公众号阅读更多好文!

是的,故障域为host,当一个3副本池,连续有3个不同host的osd坏掉,未来得及迁移完成的pg就会出问题,经常关注松鼠哥博客、公众号的老铁,对这种故障的处理应该说很熟悉,属于基操了~

本篇松鼠哥在测试环境14版本又遇到这种场景,顺手写一下,基操就基操了,谨防有新手同学搞不清楚。

开始

一个压测的测试集群验证某些问题,使用对象存储,环境告警提示有osd又down了,这次不一般,挂掉的osd达到了4个,如果pg来不及完成backfill,那么必然会有数据风险:

[root@testcluster twj]# ceph osd tree down
-555       116.00000 root default                                    
 -47        12.00000     host testcluster-1                            
 519   hdd   1.00000         osd.519              down        0 1.00000 
 -40        12.00000     host testcluster-2                            
 559   hdd   1.00000         osd.559              down        0 1.00000 
 -48        12.00000     host testcluster-3                            
 571   hdd   1.00000         osd.571              down        0 1.00000 
 -62        12.00000     host testcluster-4                            
 610   hdd   1.00000         osd.610              down        0 1.00000 

这种情况下,3副本的存储池必然是有pg异常,稍微看了一下只有一个pg为down状态,是12.4ea,用ceph pg 12.4ea query看下具体情况:

......
        "probing_osds": [
            "490",
            "532",
            "638"
        ],
        "blocked": "peering is blocked due to down osds",
        "down_osds_we_would_probe": 
Ceph性能测试:纠删码 vs. 三副本?.pdf Ceph 在今天有多火就不⽤多说了吧。正如许多分布式存储那样,三副本的容量利利 用率始终是个问题,特别是对于海量⾮结构化数据和冷存储这些在意性价比的应用来说。相比之下,纠删码(Erasure Code)能够提供接近于本地 RAID 5/6 的有效磁盘空间,代价是牺牲了性能。纠删码在随机写⼊,特别是改写和重构(Rebuild)时产生的 I/O 惩罚较大,对应的集群网络流量比副本保护模式要大。 那么 Ceph 使⽤用纠删码在各种情况下的性能都⽐比三副本要低吗?答案是否定的。如果您 还⼼心存疑问,请看本⽂文分解。 立即下载

相关推荐

分布式数据保护策略——多副本和纠删码怎么选?

例如,如果知道4个数a、b、c、d,就可以通过2个不同的公式算出2个校验数据x和y,把6个数据一起保存起来,那么当a、b、c、d其中1个或2个数据丢失的话,就可以通过剩余的2个值和计算公式,反推出丢失的2个数据。以三副本为例,如上图,我们要保存A这个数据,并不是只保存单独这个数据,而是需要先将A这个数据拷贝成3份,然后分别放到1、3、4上,这个存储是随机的,下一个B数据有可能就放在节点1、2、4上了。双副本下,某个节点的一次数据写入,实际需要两个节点参与(写入两次),写惩罚为 2。

了不起的云计算 2883

CEPH可靠性的计算方法分析

在开始正文之前,首先要感谢UnitedStack工程师朱荣泽对这篇博文的大力帮助和悉心指教。本文主要针对UnitedStack公司在巴黎峰会上对Ceph可靠性的计算方法(https://www.ustack.com/blog/build-block-storage-service/)做了一个更明确的分析和阐述,供对此话题感兴趣的朋友一起来讨论、研究,文章中如果有不当之处,还请各位高人指教。 什么情况下数据会丢失? 这个话题的另外一种提法就是存储的可靠性,所谓存储的可靠性最基本的一点就是数...

2098

Ceph保证数据安全的机制

ceph存储 存储是由一个一个OSD组成的 将对象数据存放在OSD中 纠删码存储 将数据对象划分为K个数据块、M个编码块 然后再存放在OSD存储 写入纠删码存储的过程 纠删编码函数将对象内容划分为3个数据块和2个编码块 然后将这些数据块分别存储在不同的OSD上 假设数据块1ABC存放在OSD5上 数据块2DEF存放在OSD2上 数据块3GHI存放在OSD1上 编码块1YXY存放在OSD3上 编码块2GQC存放在OSD4上 读取对象 从纠删码存储读...

孟凡霄 1159

分布式存储的架构以及存在的问题和解决办法2

今天我们继续来讲讲关于Raid和副本、分布式存储的架构以及存在的问题和解决办法,即下面四至七部分的内容: 一、存储类型 二、文件系统 三、存储介质 四、Raid和副本 五、分布式存储的架构 六、分布式存储存在的问题 七、解决的方法 四、Raid和副本 把磁盘们相同偏移量的一块空间横向进行分割,组成一条逻辑上存储空间。 数据是先写满一条条带,再写下一条条带。一个卷可以有很多条条带组成。条带的划分应该的磁盘配置初级就完成。条带包含扇区(或块)的个数叫条带长度;每个磁盘内包含属于这个...

neo949332116的博客 6464

分布式存储技术:三副本 vs 双重RAID

三副本VS 双重RAID)分布式技术路线对比当下,分布式存储应用非常广泛,主要用于Openstack私有云、各种共有云平台、以及服务器虚拟化、超融合等;按接口划分:分布式存储包含块存储、对象存储、文件存储等。分布式存储正逐渐取代传统磁盘阵列,成为现代存储平台建设的首选。分布式存储的主流厂商有IT大厂华为、新华三、浪潮,也有存储创新企业如道熵、XSKY、SmartX等。主流布式存储厂家以开...

关注微信公众号【开源Linux】,后台回复『10T』,领取10T学习资源大放送,涵盖Linux、虚拟化、容器、云计算、网络、Python、Go等书籍和视频 2939

【灾难级故障】pg log数据损坏导致osd离线,pg数据丢失

pg log引发的故障

system_zhazha的博客 1069

Ceph 三副本 触发recovery

环境配置,三个节点,Ceph三副本 查看Ceph最小副本数 [root@node-1 ~]# ceph osd dump | grep -E " size | min_size " pool 1 '.rgw.root' replicated size 3 min_size 2 crush_rule 0 object_hash rjenkins pg_num 8 pgp_num 8 last_...

dengxiafubi的博客 1756

ceph osd pg upmap

在我们巡检ceph集群、处理故障或者进行迁移等操作时,pg往往是最需要关注项之一。一方面pg的健康状态会直接影响集群能否正常提供业务,另一方面,pg的分布会影响集群osd的容量与负载均衡。ceph根据crush rule,采用分布式哈希算法,也就是以计算代替查表的方式进行数据分布。由于伪随机性和众多因素(pgnum合理性,硬件规格统一性,后期结构调整,ceph),很多时候pg的分布往往达不到我们想要的效果,此时便需要我们手动进行pg的调整。

system_zhazha的博客 1181

Ceph分布式存储系列(五):pool限制大小的方式

Ceph中pool通过调整max_objects和max_bytes值来对大小进行限制

97运维的博客 5463

ceph中:pool、PG、OSD的关系

原文:http://www.cnblogs.com/me115/p/6366374.html Pool是存储对象的逻辑分区,它规定了数据冗余的类型和对应的副本分布策略;支持两种类型:副本(replicated)和 纠删码( Erasure Code);目前我们公司内部使用的Pool都是副本类型(3副本); PG( placement group)是一个放置策略组,它是对象的集合,该集合里的所有对象...

weixin_34113237的博客 2113

纠删码 EC4+2:1 实战解析:3节点6硬盘配置,空间利用率66.7% vs 三副本

本文深入解析纠删码EC4+2:1在3节点6硬盘配置下的实战应用,对比三副本策略的空间利用率与成本效益。EC4+2:1通过数学算法将数据分片并生成校验块,实现66.7%的空间利用率,是传统三副本的两倍,同时保持较高的容错能力。文章详细介绍了技术原理、部署方案及性能对比,适用于大容量温冷数据存储场景。

weixin_33146151的博客 270

rook-cephosd块存储权重数据迁移脚本

osd属于osd的存储pool概念管理下,储存默认三副本对应三个osd。在开始前查看osd的某个pg所在存储osd,执行脚本之后重新查看验证结果。最后也可以通过命令看看osd下是否真的没有pg了,例如查看osd.0。例如想把osd.0的盘下线,在有4osd的基础上执行结果。具体执行时只需要输入osd的ID号即可。

平庸 528

ceph第三篇: 存储,纠删码概念和配置

将每个对象存储为 N=K+M 个块(chunk),其中 K 为数据块数量,M 为编码块数量。比较常用的配置是 8+4(即 K 为 8,M 为 4),总共 12 个数据块中有 8 个数据块保存数据,有 4 个实现数据冗余。这样的话,1/3 的磁盘空间用于数据冗余,相比于副本的三倍冗余更节省空间,但不能出现大于一定数目的块故障。数据分布:实际存储需要4OSD(k+m=4),允许最多2个OSD故障不丢数据。[2,4,1,7]:数据块分布的OSD编号(对应D1,D2,C1,C2)。

weixin_43743301的博客 304

手把手图解:当硬盘了,Ceph里的4+2纠删码是怎么把数据救回来的?

本文详细解析了Ceph分布式存储系统中4+2纠删码(EC)在硬盘故障时的数据恢复机制。通过对比多副本方案,深入讲解EC如何通过数学冗余实现高效存储和快速恢复,包括故障检测、降级读处理和后台自动修复流程,并提供了性能优化和监控配置的实用技巧。

weixin_30781433的博客 380

别再死记硬背了!用一张图帮你理清华为FusionStorage的核心组件与数据流向

本文通过可视化拆解华为FusionStorage的核心架构与数据流转,详细解析了VBS、OSD、MDC等核心组件的功能与协作机制。文章提供了一张核心架构图,帮助读者快速理解数据流向与设计哲学,并分享了故障处理、性能优化等实战经验,助力提升存储系统管理效率。

weixin_32612263的博客 514

深入华为FusionStorage核心:手把手拆解VBS、OSD、MDC,搞懂数据到底怎么存

本文深入解析华为FusionStorage分布式存储系统的核心组件VBS、OSD和MDC,揭示数据存储的完整流程。通过详细拆解数据写入生命周期、元数据管理机制及性能调优策略,帮助读者掌握华为分布式存储的技术精髓,提升企业级存储解决方案的部署与优化能力。

weixin_30632883的博客 498

第四章 存储的基石—OSD

OSD(对象存储设备)是Ceph的核心组件,将物理存储设备抽象为智能存储单元,具备资源控制、自主管理和高性能服务能力。Ceph采用双网络平面设计:公共网络处理客户端请求,集群网络专用于OSD间通信,避免流量干扰。OSD故障检测通过自主上报、投票机制和看门狗三种方式实现,Monitor根据故障时长将OSD标记为Down或Out状态,触发数据恢复流程。当Primary OSD故障时,系统通过心跳检测、状态上报和OSDMap更新实现快速切换,确保服务连续性。这种设计实现了高可靠、自管理的分布式存储架构。

lss0516的博客 548

ceph 解决 pg一直处于 active+undersized+degraded 状态问题

解决 ceph pg 一直处于 active+undersized+degraded 状态无法恢复为 3 副本故障

Terry Tsang 578

ceph存储集群发生scrub error后PG验证和repair的方法

1、问题现象:ceph -s查看集群健康状态如下,25个pg发生数据不一致2、ceph health detail查看如下图,这25个PG中的24个共同特点是都包含osd.24,首先处理pg 2.636,以这个为例,验证一下是否数据真的发生了不一致,如果只是遗留的warning,直接repaie就可以3、登陆osd26所在存储节点(可以使用ceph osd find 26查看osd26在哪个存储节...

哈哈哈的博客 4512
上一篇: 在windows上用docker编译ceph
下一篇: ceph对接juicefs
奋斗的松鼠
博客等级 码龄2年 344粉丝 · 25原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

奋斗的松鼠

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值