语雀这路子太野了

2023 年 10 月 25 日
 nekoharuya
https://mp.weixin.qq.com/s/WFLLU8R4bmiqv6OGa-QMcw
他们的公告的链接
考虑到 v 友的水平,我抛砖引玉分析一下
这帖子的意思大概是说,由于临时工在升级维护工具的时候,工具没有严格测试,直接上生产环境,工具的 bug 导致数据库服务器下线,联系硬件团队,硬件团队说上不了线,摆烂不玩了,你们自己恢复备份吧,然后花了四个小时恢复,俩小时验证数据,成功上线
我和几个朋友讨论了下,觉得非常的,不可思议
这是 2023 年的,语雀这个体量的公司,做出来的事情
正常的架构思维里,所有的服务,就不应该跑在同一台机器上,包括数据库,最次也该是个主从集群,集群下面的机器单例再考虑 raid 之类的东西
在这个设计下,不存在上不了线开不了机这种事情,机房被修卡军团占领了都没事
至于网上传的什么之前的技术负责人跑路了,新人不会操作
就正常的 devops ,后台管理面板里,全自动维护,包括版本控制,回滚,备份,集群,镜像,机器冗余,全部自动化管理
这不该是现在的标配吗
技术负责人跑路,新人不会操作,这句话假定的前提是,这一切都是手工完成的
语雀这么大公司,表现得跟路边三五个人创业的草台班子一样
32873 次点击
所在节点    程序员
183 条回复
nekoharuya
2023 年 10 月 25 日
@pengtikui 机器太老了,上不了线,这个事情本身就是有点不可思议的,你看前几楼的回复,他们都认为是跑在阿里的 ECS 上,而不是自建机房才能通过删除 ECS 实例达成上不了线这个结果,但是看他们公告,他们的说法明显是自建机房,可能我技术很菜吧,我理解不了他这句话是怎么做到的,机器都在自己手里,是下线了又不是删库了,那我只能理解成摆烂不玩了
BUHeF254Lpd1MH06
2023 年 10 月 25 日
反正也越来越不好用了,早就不用很久了
jjx
2023 年 10 月 25 日
这个从备份中恢复我也很好奇

从备份恢复没有丢失数据, 怎么做到的

类似快照之类的应该都有个备份点, 不太可能不丢失数据


除非还依赖实时备份的数据库日志, 从日志中恢复增量部分
sujin190
2023 年 10 月 25 日
@isbase 以前那是支付宝内部 P0 故障,现在支付宝微信这种体量的再出这种直接工信部 P0 故障,你掂量掂量🤪
luoway
2023 年 10 月 25 日
7 小时完成离线新建存储系统,至少是公司内的最快记录了吧
zackzergzeng
2023 年 10 月 25 日
?假面骑士 1 号
nekoharuya
2023 年 10 月 25 日
@Mess1ah 别光喷呀,有何高见
JensenQian
2023 年 10 月 25 日
和最近 cs2 更新一样
各种奇奇怪怪的 bug 满天飞
修好这个又起来那个
han1988
2023 年 10 月 25 日
直接原因是外包或者新手写了有问题的运维工具。和当年携程一模一样。
反正运维在 IT 生态连最底端,根上就没治。
pkoukk
2023 年 10 月 25 日
存储节点怎么会跑在容器里呢?这种服务的存储大概率是用物理机来扛的,虚拟机性能撑不住。所以才有联系硬件团队下线重新上线的流程。
硬件团队不敢动,大概率是这机器用了很久了,和现有大环境的机型都不一样,当初为了做网络储存打通下了很多非标配置,可能没有持久化。这种史前机器,后续接手的人根本没办法短时间恢复,所以建议直接从备份恢复到新机器上一劳永逸。
buchikoma
2023 年 10 月 25 日
来猜下这个过程是什么样的

估计是运维工具 bug 导致华东 region 的一批机器下线,这批机型要么很老那么已经过保还未更换,关机再启动很多服务拉不起来,数据库又没有跨 region 部署,只能重新把本地盘或者云盘挂载到能用的机型或者 ecs 上做数据恢复,要是这样的话,耗时确实会很久
sn0wdr1am
2023 年 10 月 25 日
甩锅外包
nekoharuya
2023 年 10 月 25 日
@pkoukk 是容器还是直接在物理机上,在这个问题上,我认为是无关紧要的,而且这种体量,正常的思维必然是上集群来扩容,不管是加物理机器还是加容器都一样,数据库分布式的存储在不同的机器上,查询的时候也有很多便利的算法可以用,再给每个节点上个从属服务器,自动同步,在这个设计下,机器是新的是旧的,几台机器炸了,或者一两个机房被修卡军团占领了,都无关紧要的
deorth
2023 年 10 月 25 日
所有的团队都是草台班子
pengtdyd
2023 年 10 月 25 日
公告就是安抚用户的,你还真信里面的内容啊,太天真了吧。
nekoharuya
2023 年 10 月 25 日
@pengtdyd 别光喷呀,有何高见
bigdogbigpig
2023 年 10 月 25 日
其实我还是没有很搞懂,为啥运维工具可以直接下线服务器,理论上下线生产服务器这种操作,需要二次的吧
qwerasdf123
2023 年 10 月 25 日
@minami 卧槽 表达真到位!
nekoharuya
2023 年 10 月 25 日
@mazyi 一种我目测最合理的可能,运维工具把那台机器的环境搞炸了,机器又是祖传的,根本恢复不动,服务跑不起来,所以上不了线,备份也不是真的备份,就是原始数据,他们新搭了个机器,在全新的,干净的环境里,起了服务,导入了数据
weiwenhao
2023 年 10 月 25 日
故障恢复文档放在语雀了,死锁了。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/985202

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX