5月19日晚间,热门开发者部署平台 Railway 遭遇重大服务中断,导致全网服务瘫痪。故障期间,用户无法访问 Railway 控制台仪表盘,且托管在平台上的应用服务大规模出现错误,报错信息包括“no healthy upstream”(无健康上游)、“unconditional drop overload”(无条件丢弃过载)以及登录失败等。Railway 官方在事故调查报告中确认,此次灾难性故障的根本原因系 Google Cloud 封禁了 Railway 的账户。这一封禁行为直接切断了 Railway 对其上游云服务商的访问权限,进而导致依赖 Google Cloud 基础设施运行的仪表盘、API 接口及内部网络控制平面全部不可用。尽管 Railway 团队表示已与 Google Cloud 支持团队直接联系并升级处理,成功恢复了部分账户访问权限,但直到次日仍处于基础设施的逐步恢复阶段。此次事件不仅导致大量独立开发者和初创企业的服务离线,也暴露了依赖单一公有云构建 PaaS 服务面临的上游风险。
事件分析
💡 核心观点:云服务商的“上帝之手”再次警示行业:PaaS 的繁荣地基极其脆弱,单一上游的账户级封控足以让下游瞬间归零,多云容灾必须从技术选项上升为生存策略。
原文链接:Hacker News





