语雀这路子太野了

2023 年 10 月 25 日
 nekoharuya
https://mp.weixin.qq.com/s/WFLLU8R4bmiqv6OGa-QMcw
他们的公告的链接
考虑到 v 友的水平,我抛砖引玉分析一下
这帖子的意思大概是说,由于临时工在升级维护工具的时候,工具没有严格测试,直接上生产环境,工具的 bug 导致数据库服务器下线,联系硬件团队,硬件团队说上不了线,摆烂不玩了,你们自己恢复备份吧,然后花了四个小时恢复,俩小时验证数据,成功上线
我和几个朋友讨论了下,觉得非常的,不可思议
这是 2023 年的,语雀这个体量的公司,做出来的事情
正常的架构思维里,所有的服务,就不应该跑在同一台机器上,包括数据库,最次也该是个主从集群,集群下面的机器单例再考虑 raid 之类的东西
在这个设计下,不存在上不了线开不了机这种事情,机房被修卡军团占领了都没事
至于网上传的什么之前的技术负责人跑路了,新人不会操作
就正常的 devops ,后台管理面板里,全自动维护,包括版本控制,回滚,备份,集群,镜像,机器冗余,全部自动化管理
这不该是现在的标配吗
技术负责人跑路,新人不会操作,这句话假定的前提是,这一切都是手工完成的
语雀这么大公司,表现得跟路边三五个人创业的草台班子一样
32875 次点击
所在节点    程序员
183 条回复
Rrrrrr
2023 年 10 月 25 日
难道用户就没错吗? 😊
nekoharuya
2023 年 10 月 25 日
@encro @encro 你这理论,微软听了沉默,谷歌看了流泪啊,张一鸣要是早点认识你,搞组织改革的钱都省了,大家把华为的书一扔,再也不搞什么 ipd 了
NCZkevin
2023 年 10 月 25 日
再严格的工具也也挡不住人的操作,前两年在和阿里差不多同级别的公司,碰到不小心把 K8S 集群(千台机器规模)的所有 master 给批量下线的误操作,喊来一堆大佬,搞了一晚上才恢复。啥容灾主从多 region 碰到这种都不好使。
Bologna
2023 年 10 月 25 日
b 站是不是也挂一次,b 站出的说明就比较详细
nekoharuya
2023 年 10 月 25 日
@NCZkevin 我想起之前公司,游戏内测第二天,老板打开谷歌云后台,自己瞎操作,把服务器删了……
nekoharuya
2023 年 10 月 25 日
@NCZkevin 后来公司寄了,这大哥现在在 supercell 上班,希望他别把人服务器也删了
seeu2ex
2023 年 10 月 25 日
@lambdaq 现在不都是半夜发么,加班之后又没有加班费又不让第二天休,硬尬
aper
2023 年 10 月 25 日
@nekoharuya 你开发发布还遵从啥敏捷体系?这玩意我自从大学书上学过后面就再没碰过了,你真是写代码的吗?
NoOneNoBody
2023 年 10 月 25 日
看样子 OP 仍然信任语雀
我觉得此文不是七小时后写的,而是写了七小时
tf2
2023 年 10 月 25 日
@seeu2ex 个人觉得半夜发版这种做法很 toxic 。工作文化不怎么好。

@nekoharuya 语雀这种峰值好像就是上班时间。。。只能在下班时间发版?尴尬
liq65451
2023 年 10 月 25 日
“服务语雀的数据存储运维团队”,所以这数据库运维不是语雀的人,是蚂蚁金服干的?
nekoharuya
2023 年 10 月 25 日
@aper 碰啊,你翻翻我发的第一个帖子,如果能看懂,咱俩加个 v 聊聊 ai 撒,体系这种东西,你不碰,大概率就是别人代偿了,比如游戏公司一般是策划代偿了,我之前一路混到了独角兽公司的架构师岗位,现在在小创业公司做 CTO ,我管理水平也就半桶水,就之前被逼着学一点,主要还是靠写代码的硬实力
Myprajna
2023 年 10 月 25 日
@weiwenhao 笑死,虽然内部肯定用的另一套,本地部署的
hancai
2023 年 10 月 25 日
"就正常的 devops ,后台管理面板里,全自动维护,包括版本控制,回滚,备份,集群,镜像,机器冗余,全部自动化管理
这不该是现在的标配吗"

把我干沉默了, 哪来的标配。能做好这一套的基本都是大厂,但语雀这体量算是大厂了。
nekoharuya
2023 年 10 月 25 日
@lambdaq 语雀上线也不是一天两天了,大家上班也不是每天 24 小时都用什么钉钉飞书,他们后台肯定是有在线数据分析的,我觉得大概是更新的人觉得改动很小,不重视,没当回事,而且又是和用户没有直接关系的运维工具,从我的经验看,包括我自己,大部分人都会有这种蜜汁,然后闹出事故的经历的……不过这就是我瞎猜的了
VB1
2023 年 10 月 25 日
@nekoharuya 你在 21 楼分析的跟我想的差不多,你的帖子里面说“正常的架构思维里,所有的服务,就不应该跑在同一台机器上”。我猜测他们可能不是跑在同一台机器上,而是所有的机器都是祖传的,一升级全升级,然后集群炸了,反正我是不相信他们一台机器上存储这整个华东地区的数据

另外就是他们自己也说了是存储服务器,我的工作经历比较少,但是我觉得大部分公司的存储服务器应该不会跑在容器里吧,所以从这一点上,你说的“就正常的 devops ....”是不成立的,存储服务器炸了只能通过“硬件团队尝试将下线机器重新上线”这种方式

以上观点的都是建立在他们的公告为真的情况下分析
CoderLife
2023 年 10 月 25 日
看来大多数人都是付费用户
bydmm
2023 年 10 月 25 日
谁能告诉我为什么语雀不用阿里云的 RDS
tf2
2023 年 10 月 25 日
@nekoharuya 对。这次明显跟研发团队没关系。就是运维。。。

目测 yaml 写错了导致存储集群下线。
nekoharuya
2023 年 10 月 25 日
@VB1 容器这里是我用词不准确,这里的语境是,不管是虚拟机还是物理机都是容纳数据的容器
当然,产生歧义是我不对
然后,从真实场景上看,你看上面的回复,大多数人认为,他们就是上了套 raid ,具体哪套 raid 不清楚,不过不重要,没有更多的信息,但是应该大差不差
我的观点是,这种不是独立环境的,可以称为一套/一台/一个机器

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/985202

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX