Google Thiago Guimarães 5 min de leitura

Google revela detalhes técnicos de incidente em data center na Holanda e expõe desafios da infraestrutura em nuvem

O Google publicou uma análise técnica detalhada sobre a interrupção que afetou parte de sua infraestrutura de nuvem em um data center localizado na Holanda. O incidente impactou a zona europe-west4-a do Google Cloud e chamou atenção pela transparência da empresa ao explicar, passo a passo, a sequência de eventos que levou à indisponibilidade dos serviços.

Segundo o relatório oficial, o incidente começou em 15 de julho de 2026, quando ocorreu uma falha no fornecimento de energia elétrica para a instalação. Embora o data center possua diversos níveis de redundância, uma combinação incomum de eventos fez com que o sistema de refrigeração deixasse de operar corretamente, provocando o desligamento controlado de parte da infraestrutura para proteger os equipamentos.

Como tudo aconteceu

De acordo com o Google, o primeiro problema foi um evento transitório de tensão (voltage transient) na rede elétrica que alimentava o data center. Esse tipo de ocorrência consiste em uma variação brusca na tensão da rede, normalmente causada por falhas na concessionária, manobras elétricas ou problemas em equipamentos de distribuição.

O sistema respondeu conforme o esperado e os chillers (equipamentos responsáveis pela produção de água gelada utilizada na climatização do data center) permaneceram energizados.

O problema ocorreu logo em seguida.

Embora os chillers continuassem ligados, as bombas responsáveis por distribuir a água gelada não reiniciaram automaticamente após a perturbação elétrica. Sem circulação de água, o sistema de refrigeração perdeu sua capacidade de remover o calor produzido pelos milhares de servidores instalados na unidade.

Temperatura começou a subir

Os sistemas automáticos de monitoramento detectaram inicialmente a perda de energia na infraestrutura.

Algum tempo depois, a telemetria identificou um aumento contínuo na temperatura dentro dos corredores onde estão instalados os racks de servidores.

Com a refrigeração comprometida, o Google iniciou procedimentos para evitar danos físicos aos equipamentos.

Engenheiros foram acionados imediatamente e iniciaram uma investigação para identificar a causa da falha.

Intervenção manual foi necessária

A análise mostrou que o maior problema não estava nos chillers, mas sim nas bombas hidráulicas do circuito de refrigeração.

Como elas permaneceram em modo automático sem reiniciar, técnicos realizaram uma intervenção manual, alterando o funcionamento das bombas para o modo Hand (Manual).

Após o acionamento manual, o fluxo de água gelada foi restabelecido e a temperatura começou gradualmente a retornar aos níveis normais.

Desligamento preventivo dos servidores

Durante o período sem refrigeração adequada, parte da infraestrutura precisou ser desligada para evitar superaquecimento.

Segundo o Google, o desligamento foi uma medida de proteção dos equipamentos, já que operar servidores em temperaturas elevadas pode causar falhas permanentes em CPUs, memórias, SSDs e componentes de rede.

Esse procedimento afetou workloads hospedados na zona europe-west4-a, causando indisponibilidade de alguns serviços por aproximadamente 14 horas e 55 minutos.

O que o Google vai mudar

Após concluir a investigação, o Google anunciou diversas melhorias para evitar que um problema semelhante volte a ocorrer.

Entre elas estão:

  • Revisão da lógica de reinicialização automática das bombas do sistema de refrigeração.
  • Novos mecanismos para validar o retorno completo da circulação de água após oscilações elétricas.
  • Monitoramento mais rigoroso do fluxo hidráulico, e não apenas da alimentação elétrica dos chillers.
  • Ajustes nos alarmes para reduzir o tempo entre a detecção do problema e a intervenção operacional.
  • Revisão dos procedimentos operacionais para situações envolvendo falhas simultâneas de energia e climatização.

Lições para operadores de data centers

O incidente reforça uma realidade conhecida pelos profissionais de infraestrutura: em um data center moderno, nem sempre a energia é o único ponto crítico.

Mesmo com UPS, geradores, múltiplas alimentações e sistemas redundantes, a perda da capacidade de refrigeração pode tornar a operação inviável em poucos minutos.

O caso também demonstra a importância de monitorar toda a cadeia de climatização, incluindo bombas, válvulas, sensores e fluxo de água, e não apenas o funcionamento dos chillers.

Outro ponto relevante é que sistemas automatizados precisam ser constantemente testados. Uma simples falha de reinicialização automática em um componente auxiliar foi suficiente para provocar quase 15 horas de indisponibilidade em uma região inteira do Google Cloud.

Transparência rara entre hyperscalers

Empresas de computação em nuvem normalmente divulgam apenas informações resumidas sobre interrupções. Neste caso, o Google optou por publicar uma análise técnica detalhada, descrevendo a cronologia dos eventos, a causa raiz da falha e as medidas corretivas adotadas.

Para administradores de data centers, provedores de hospedagem e profissionais de infraestrutura, o relatório serve como um importante estudo de caso sobre resiliência operacional e demonstra que, mesmo em ambientes altamente redundantes, componentes aparentemente secundários podem comprometer toda a operação quando deixam de funcionar conforme o esperado.

Deixe um comentário