Roteador EU KeeperPAM e conexões de gateway
- resolved
As ligações estabelecidas através do Router e Gateway Keeper na região da UE estão a falhar. Detalhes adicionais serão publicados no relatório pós-morte.
- postmortem
# Relatório Pós-Incidente ** 31 de julho de 2026** # # Resumo Em 30 de julho de 2026, às 11:33 PM CT, o serviço de roteamento de conexão KeeperPAM na região da UE começou a lançar erros. Os erros de Router/Gateway duraram aproximadamente 12 horas e 45 minutos, com serviço completo restaurado em aproximadamente 12:18 PM CT em 31 de julho. Durante esta janela, a plataforma principal Keeper EU \(acesso a vault, autenticação e todos os outros serviços Keeper\) permaneceu totalmente operacional durante todo o período. # # O Que Aconteceu Em 22 de julho, uma implantação de rotina para o nosso serviço de roteamento de conexão \(“Keeper Router”\) incluiu uma dependência atualizada que mudou como o serviço recupera sua configuração de inicialização. Uma má configuração no ponto final fez com que a região da UE procurasse por um ponto final FIPS, que não estão disponíveis. Como resultado, quando os contentores de serviço na região da UE foram reiniciados após a implantação, não foram capazes de recuperar a sua configuração de arranque e entraram num estado falhado. Dois fatores permitiram que essa falha não fosse detectada por mais de uma semana. Em primeiro lugar, os contentores existentes continuaram a servir o tráfego enquanto os contentores de substituição silenciosamente não começaram, pelo que não houve impacto imediato do cliente a partir da implantação de 22 de Julho. A QA também passou em todos os testes de verificação da produção. Segundo, a falha de configuração-carga foi registrada no nível INFO em vez de ERROR ou CRITICAL, então nenhum alerta PagerDuty foi gerado. Na noite de 30 de julho, os últimos recipientes saudáveis circularam, o balanceador de carga do serviço tinha zero alvos saudáveis, e o endpoint começou a retornar erros HTTP 503. Monitoramento automático de verificação de saúde detectou a interrupção em segundos e chamou nossa equipe de plantão. # # O que estamos mudando 1. **Alertando em capotagem de container falhada.** Estamos implementando alarmes do CloudWatch em todas as regiões e ambientes que disparam quando tarefas de containers falham repetidamente em iniciar, para detectar falhas de implantação silenciosas. 2. **Severidade do log para falhas de inicialização.** Qualquer falha em carregar a configuração de inicialização necessária irá agora se logar na gravidade ERROR/CRITICAL em vez de INFO que acionar os alertas acionáveis adequados. Pedimos desculpas aos nossos clientes da UE pela interrupção.
Traduzido automaticamente da atualização oficial do incidente.