Маршрутизатор ЕС KeeperPAM и шлюзовые соединения
- resolved
Соединения, установленные через Keeper Router и Gateway в регионе ЕС, выходят из строя. Дополнительная информация будет опубликована в посмертном отчете.
- postmortem
#Пост-инцидентный отчет ** 31 июля 2026 года** ##Резюме 30 июля 2026 года в 11:33 вечера КТ служба маршрутизации соединения KeeperPAM в регионе ЕС начала выбрасывать ошибки. Ошибки Router/Gateway продолжались около 12 часов 45 минут, а полное обслуживание было восстановлено в 12:18 вечера 31 июля. Во время этого окна основная платформа Keeper EU (доступ к виртуальной реальности, аутентификация и все другие услуги Keeper) оставалась полностью работоспособной. ##Что случилось 22 июля в рутинное развертывание нашей службы маршрутизации соединений (Keeper Router) была включена обновленная зависимость, которая изменила способ восстановления конфигурации запуска. Неправильная конфигурация в конечной точке заставила регион ЕС искать конечные точки FIPS, которые недоступны. В результате, когда сервисные контейнеры в регионе ЕС возобновили работу после развертывания, они не смогли восстановить свою конфигурацию запуска и вошли в несостоявшееся состояние. Два фактора позволили этой неудаче остаться незамеченной в течение недели. Во-первых, существующие контейнеры продолжали обслуживать трафик, в то время как замещающие контейнеры молча не запускались, поэтому не было немедленного воздействия на клиентов после развертывания 22 июля. QA также прошла все производственные испытания. Во-вторых, отказ конфигурации был зарегистрирован на уровне INFO, а не ERROR или CRITICAL. В ночь на 30 июля последние здоровые контейнеры вышли из строя, балансировщик нагрузки службы имел нулевые здоровые цели, а конечная точка начала возвращать ошибки HTTP 503. Автоматизированный мониторинг проверки здоровья обнаружил отключение в течение нескольких секунд и вызвал нашу команду по вызову. ## Что мы меняем 1.**Возможность опрокидывания неисправных контейнеров** Мы размещаем сигналы тревоги CloudWatch во всех регионах и средах, которые запускаются, когда задачи контейнера неоднократно не запускаются, чтобы обнаружить бесшумные сбои развертывания. 2. **Степень тяжести неудач стартапа. ** Любая неспособность загрузить требуемую конфигурацию запуска теперь будет отображаться на уровне ERROR/CRITICAL вместо INFO, что вызовет соответствующие предупреждения. Мы приносим извинения нашим клиентам из ЕС за нарушение.
Автоматический перевод официального обновления инцидента.