语雀这路子太野了

2023 年 10 月 25 日
 nekoharuya
https://mp.weixin.qq.com/s/WFLLU8R4bmiqv6OGa-QMcw
他们的公告的链接
考虑到 v 友的水平,我抛砖引玉分析一下
这帖子的意思大概是说,由于临时工在升级维护工具的时候,工具没有严格测试,直接上生产环境,工具的 bug 导致数据库服务器下线,联系硬件团队,硬件团队说上不了线,摆烂不玩了,你们自己恢复备份吧,然后花了四个小时恢复,俩小时验证数据,成功上线
我和几个朋友讨论了下,觉得非常的,不可思议
这是 2023 年的,语雀这个体量的公司,做出来的事情
正常的架构思维里,所有的服务,就不应该跑在同一台机器上,包括数据库,最次也该是个主从集群,集群下面的机器单例再考虑 raid 之类的东西
在这个设计下,不存在上不了线开不了机这种事情,机房被修卡军团占领了都没事
至于网上传的什么之前的技术负责人跑路了,新人不会操作
就正常的 devops ,后台管理面板里,全自动维护,包括版本控制,回滚,备份,集群,镜像,机器冗余,全部自动化管理
这不该是现在的标配吗
技术负责人跑路,新人不会操作,这句话假定的前提是,这一切都是手工完成的
语雀这么大公司,表现得跟路边三五个人创业的草台班子一样
32877 次点击
所在节点    程序员
183 条回复
xzysaber
2023 年 10 月 25 日
@hancai 哈哈哈,同样,OP 应该是大厂的,所以这样认为。
reeco
2023 年 10 月 25 日
前端写的系统,稳定性能好到哪里去
CoffeeY
2023 年 10 月 25 日
等下故意的呢?这波 IT 圈到处讨论,各种卖课公众号也是各种讲。
顺便分析一波你们对语雀的依赖情况·🤪
iixy
2023 年 10 月 25 日
看看俄罗斯再看看以色列,世界的本质就是草台班子组成的啊
kingjpa
2023 年 10 月 25 日
@Aliencn 当年有赞还说没有丢数据呢,事实可不是这个样子
akatale
2023 年 10 月 26 日
chaleaochexist
2023 年 10 月 26 日
歪个楼, 那我是不是可以白嫖六个月会员啊??
ysw
2023 年 10 月 26 日
觉得可能是旧机器被删了,新机器盘符映射路径不对,导致数据损坏?
labubu
2023 年 10 月 26 日
@minami #3 下个月加急
gosling
2023 年 10 月 26 日
@aeli 感觉有可能,之前我们团队也是引入了 terraform ,有一个参数没看文档就直接上了,导致集群所有机器都给删除了。重新买了一批启动了半小时。。
ysy950803
2023 年 10 月 26 日
@minami 这句话有道理,特意上来点赞。
yh7gdiaYW
2023 年 10 月 26 日
以语雀的体量,运维肯定不是自己 BU 的人,硬件团队又是另一伙儿,楼主你对大公司的扯皮不熟悉啊
siyang601165858
2023 年 10 月 26 日
@aaronkk 确实 刚领的
Rorysky
2023 年 10 月 26 日
@minami #3 真理,人类就是草台班子
haoyli
2023 年 10 月 26 日
@Aliencn 是这样,工作中很多地方都是,大家都知道有一些东西存在隐患但人没敢优化,无功有过,ROI 低,于是所有人都不管,直到哪天被引爆。这种情况无法避免,因为在高速迭代业务的进程中,业务第一,支持业务才能拿到绩效,至于说排雷,who cares ?
r4aAi04Uk2gYWU89
2023 年 10 月 26 日
服务升级升一半,有环节出问题,上不去下不来,也还算正常吧。

旧 ECS 装不上软件的问题我碰到过,完全是始料未及,你如果有 5000 台机器,30 台旧机器,你甚至都不好验证。停掉服务不一定是服务都不可用,有可能是为了保证严格数据一致性直接下线。

语雀的存储体量和成本预算,能不能支持多活都不好说,有个灾备,恢复数据保证不丢失已经不错了。多活也是针对服务说的,至于存储,数据结构有变化,多活也得一块升级,要不同步就会出问题。

有状态的服务回滚,也容易出问题,这还是以存储为主的服务。reddit 升级 k8s 还宕机过几小时呢,不是说出了问题,一键回滚就可以,尤其在非应用层面。

有时候问题完全是不可知的,可以说它前期验证不严格,但是不可能所有的东西都能验证到。抱着学习的态度可以,说人草台班子就格局太小了,毕竟人家也服务千万级别的用户,何况提供的信息不明确。
kknd22
2023 年 10 月 26 日
这个世界破破烂烂,总是有人修修补补
Light3
2023 年 10 月 26 日
首先楼主恶意造谣
试问哪个员工会领着工资说 上不了线 摆烂了 不玩了?这是人 最基本的职业道德
可能楼主是这样的人把 反正我从来没遇到过 从来没有

其次从一个公司发展时间时间来看 肯定会存在新的机器与旧的机器
升级出现失败 很正常 启不开也很正常
自己买的电脑也会昨天好好的 今天突然打不开
回滚?我也会回滚 问题是打不开了咋办?
所有的系统都是保证 99.99%的可用性

所以我不懂楼主既暴露自己的无知 愚蠢 又抨击他人的做法
tietou
2023 年 10 月 26 日
下午升级 也是够可以的呀
mumubin
2023 年 10 月 26 日
在服务和数据安全的情况下,选择修复数据是正确的选择.

Youtube 还两三年挂个半天一天的,toc
AWS 的某个 region 还经常某个服务挂个七八个小时呢.导致全美小公司的产品半天一天访问不了
这俩服务不比语雀重要的多?

不过可以喷阿里系,天天吹牛,又没做到

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/985202

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX