在运维圈流传着一句话:"没有经历过证书过期事故的人生是不完整的。"听起来像玩笑,却戳中一个残酷现实——SSL/TLS证书过期,是线上故障里最容易被忽视、却又最高频的"经典款"。它不挑行业、不挑规模,从个人博客到千万级用户平台,都可能因为一个被遗忘的续期而集体失联。
事故一:一张根证书到期,数亿设备打不开网页
2021 年 9 月 30 日,Let's Encrypt 的 DST Root CA X3 交叉签名根证书正式到期。这一根证书长期以来被用来兼容老旧设备,到期后,大量仍将其作为信任锚的旧版 Android 设备(Android 7.1 及以下)在访问启用了 Let's Encrypt 证书的 HTTPS 站点时,出现大面积的 TLS 握手失败。
影响范围有多大?彼时这类设备存量以亿计。许多 App 与网站在这些终端上"明明网络正常却打不开",而服务端日志一切正常——因为问题出在终端的信任链,而非你的服务器。这次事件让无数运维第一次意识到:证书的问题,不只在证书本身,还在它背后的信任链与有效期。
事故二:一次代码缺陷,300 万张证书被迫紧急吊销
2020 年 3 月,Let's Encrypt 发现其 CAA 记录检查存在缺陷,按照合规要求,必须在 5 天内吊销约 300 万张已签发证书。这意味着,无数站点的证书在毫无预警的情况下"突然失效",运营者不得不紧急重新申请、重新部署,否则浏览器就会向用户弹出刺眼的"不安全"警告。
这类"非过期但被迫重发"的事件,与"到期未续"本质相同:只要续期/换发依赖人工,任何一个环节漏拍,就是一次面向用户的生产事故。
事故三:被遗忘的一张证书,中断从几分钟到几小时
公开报道中,电信运营商核心网、云厂商 API 网关、企业内部系统……多家大型企业都曾因"一张被遗忘续期的证书"导致服务中断,时长从数分钟到数小时不等。当事后复盘,原因往往朴素得令人尴尬:没人记得它快到期了。
为什么"手动管理"几乎必然翻车
证书散落各处:分布在 N 台服务器、多个云厂商、CDN、WAF 与容器平台,没有统一的"总账本"。
有效期越来越短:主流 DV 证书多为 90 天,续期动作频繁,遗忘概率随时间累积。
靠人记忆与日历:人工续期依赖某个人、某个提醒,人员变动或漏看一眼,链路就断。
责任边界模糊:证书与私钥常跨多个团队,谁该续、续完谁部署,往往说不清。
治本之道:把"人"从续期链路里拿掉
证书过期事故的根因,从来不是"人不够细心",而是"把高风险动作交给了会疲劳、会遗忘的人"。真正的解决方式只有一条——让 SSL证书自动申请、自动部署、自动续期,全过程无需人工介入。
简部 JianBu 提供 SSL证书全自动管理能力:支持 DNS-01 / HTTP-01 / CNAME 多种验证方式,100+ 部署插件覆盖主流云与服务器,证书到期前通过企业微信 / 钉钉 / 飞书 / Webhook 多渠道提醒,并持续监控每张证书的剩余有效期,让 SSL证书永不过期。
现在就动手,比事后救火便宜得多
一次证书过期带来的,可能是用户流失、品牌信任受损与一连串的故障复盘。而避免它,只需把续期交给系统来跑。你可以用免费版先跑通第一个工作流,约 3 分钟就能看到一张证书被自动申请、自动部署、自动续期。
别等下一次"集体失联"发生时,才想起那张被遗忘的证书。把续期自动化,今天就是最好的时间。
