Namecheap 断网近16小时,使用其默认解析的网站一同失效

8月13日,域名注册商与虚拟主机服务商 Namecheap 发生大面积服务中断。其位于美国凤凰城(Phoenix)的数据中心因制冷系统失效,连带导致电力与核心数据库不可用,旗下 Namecheap.com 官网、虚拟主机、EasyWP 托管平台、域名系统(DNS)解析与私有邮箱全部停摆。

据多家媒体报道,Namecheap 名下超过 2400 万个注册域名、上百万个托管网站与约 140 万个私有邮箱受到影响。问题最早于美国东部时间 13 日中午前后出现,核心数据库约在下午 5:30 恢复,官网与在线客服于傍晚恢复,全部服务直到 14 日凌晨 3:50(东部时间)才完全恢复,中断时长接近 16 小时。运营该机房的服务商 PhoenixNAP 称,前一夜当地暴风雨损坏了设施,导致机房空间温度异常升高。Namecheap CEO Hillan Klein 在 X(原推特)上全程更新进展,并表示将发布事后复盘。

这次中断最值得域名行业注意的,不是"一家主机商宕机",而是 DNS 把不相干的网站一起拖下了水。域名系统和主机是两层独立的东西:主机运行你的网站程序,权威域名服务器(authoritative name server)负责对外公布"这个域名对应的 IP 在哪"。当用户浏览器输入一个网址,递归解析器(recursive resolver)要先去问权威服务器拿到 IP,才能连上主机。如果权威服务器不回答,而本地缓存又已经过期,浏览器就会报"找不到服务器"——哪怕后台的网页、数据库、Web 服务器都还健康地跑在 AWS 或 Shopify 上。

Namecheap 既是注册商,也是许多域名的默认权威 DNS 提供方。只要一个域名的域名服务器指向 Namecheap 的默认解析(即便网站本身托管在 AWS、Shopify 等外部平台),这次 DNS 中断就会让该域名无法解析,网站照样打不开。媒体报道,ELLE 杂志、AZLyrics、ZeroGPT、Hyundai 美国部分页面等依赖 Namecheap 做域名路由或托管的站点都受到了影响。

根本原因是一个典型的"单点故障"(single point of failure):Namecheap 在全球各地有服务器,但认证用户、处理 API 请求、路由 DNS 流量的中央控制面(control plane)集中在凤凰城这一个主数据中心。机房一旦失去制冷与电力,整个全球网络就"失明"了。工程师为避免硬件被高温烧毁,主动切断服务器电源等待机房降温,再逐集群恢复数据库,进一步拉长了恢复时间。

对普通域名持有者而言,这次事件是一个提醒:选默认解析服务时,注册商的 DNS 和你的网站主机未必在同一套保障里。把域名解析交给与主机分离、且具备多区域任播(anycast)能力的独立 DNS 服务,可以避免"注册商一感冒,全站跟着发烧"。

信息来源:Namecheap 官方状态页公告;TechRadar、PCMag 等媒体报道;PhoenixNAP 声明。