Google Cloud提出雲端可靠性事故處理建議,提醒企業不能只依賴雲端業者提供的服務狀態資訊,平時就應建立監控與事故應變機制,以便在雲端服務發生異常時自行排查問題並採取應變措施。
Google Cloud認為,事故應變應從系統設計階段開始準備。企業除了預先考量系統故障情境及應變方式,也需要建立監控與可觀測性機制。事故調查所需的可觀測性資料則應另外複製至與受監控系統分離的備援系統,避免系統發生事故後,調查所需資料也跟著無法存取。此外,企業還應建立事故處理手冊,並定期進行跨團隊模擬事故演練,讓相關人員熟悉處理流程。
實際發生服務異常時,企業可先查看雲端業者公布的服務狀態資訊,但狀態頁沒有事故通報,不代表雲端服務本身沒有問題。Google Cloud建議企業同時檢查自身系統的監控與日誌資料,包括錯誤率、延遲、配額及近期系統變更,以釐清問題究竟出在雲端服務、自身系統環境,還是使用的第三方服務。
判斷事故影響範圍時,企業還需要確認工作負載部署在哪些區域,以及使用的雲端服務是否相依於其他服務,進一步找出實際受到事故影響的工作負載。
採用多區域架構的企業可考慮將流量切換至其他正常運作的區域。不過在進行容錯移轉前,應先確認問題出在雲端基礎架構,而非自身工作負載,並確認備援系統運作正常,以免切換後問題仍未解決。
服務恢復後,企業仍需要進行事後檢討。Google Cloud建議檢討過程採取不究責方式,回顧事故發生及處理過程,找出有效的應變措施與需要改善的環節,再調整事故處理手冊、相關工具及人員訓練,提升後續處理類似事故的能力。
Comments (0)