EU KeeperPAM router and gateway connections
- resolved
Las conexiones establecidas a través del Router y Gateway de la UE están fallando. Los detalles adicionales se publicarán en el informe postmortem.
- postmortem
# Post-Incident Report **31 de julio de 2026** ## Summary El 30 de julio de 2026 a las 11:33 PM CT, el servicio de enrutamiento de conexiones KeeperPAM en la región de la UE comenzó a lanzar errores. Los errores de Router/Gateway duraron aproximadamente 12 horas y 45 minutos, con servicio completo restaurado aproximadamente a las 12:18 PM TC el 31 de julio. Durante esta ventana, la principal plataforma de Keeper EU \(acceso predeterminado, autenticación y todos los demás servicios de Keeper\) permaneció plenamente operativa en todo el mundo. ## What Happened El 22 de julio, un despliegue rutinario a nuestro servicio de enrutamiento de conexiones \(“Keeper Router”\) incluyó una dependencia actualizada que cambió cómo el servicio recupera su configuración de arranque. Una malconfiguración en el punto final hizo que la región de la UE buscara puntos finales de FIPS, que no están disponibles. Como resultado, cuando los contenedores de servicio en la región de la UE se reiniciaron tras el despliegue, no pudieron recuperar su configuración de arranque y entraron en un estado fallido. Dos factores permitieron que este fracaso no fuera detectado durante más de una semana. En primer lugar, los contenedores existentes continuaron sirviendo tráfico mientras que los contenedores de reemplazo silenciosamente no comenzaron, por lo que no hubo ningún impacto inmediato del cliente desde el despliegue del 22 de julio. QA también pasó todas las pruebas de verificación de producción. En segundo lugar, el fallo de configuración-carga se registró a nivel INFO en lugar de ERROR o CRITICAL, por lo que no se generaron alertas de PagerDuty. En la noche del 30 de julio, los últimos contenedores sanos se enrollaron, el balanceador de carga del servicio tenía cero objetivos saludables, y el punto final comenzó a devolver errores HTTP 503. Control de salud automatizado detectó la salida en segundos y llamó a nuestro equipo de llamadas. Lo que estamos cambiando 1. **Alerando en los volcados de contenedores fallidos.** Estamos desplegando alarmas CloudWatch en todas las regiones y entornos que disparan cuando las tareas de los contenedores no comienzan en repetidas ocasiones, para detectar fallos de despliegue silenciosos. 2. **Severidad mínima para las fallas de arranque.** Cualquier falla en cargar la configuración de inicio necesaria se iniciará ahora en la gravedad ERROR/CRITICAL en lugar de INFO que activa las alertas de acción adecuadas. Nos disculpamos con nuestros clientes de la UE por la interrupción.
Traducido automáticamente desde la actualización oficial del incidente.