Отключение сайта и Dashboard
- investigating
В настоящее время мы расследуем проблему, затрагивающую веб-сайт и панель инструментов. Пользователи могут столкнуться с большим количеством ошибок. Наша команда работает над выявлением первопричины, и мы предоставим обновление, как только появится дополнительная информация. Мы приносим извинения за любые неудобства и ценим ваше терпение.
- identified
Наша команда определила причину проблемы, влияющей на веб-сайт и панель инструментов, и активно работает над внедрением постоянного решения. Некоторые пользователи все еще могут испытывать проблемы с подключением в течение этого времени. Мы будем продолжать делиться обновлениями по мере продвижения к полному разрешению. Спасибо вам за ваше терпение.
- identified
Наша команда работает над внедрением постоянного решения. Некоторые пользователи все еще могут испытывать проблемы с подключением в течение этого времени. Мы будем продолжать делиться обновлениями по мере продвижения к полному разрешению.
- resolved
Проблема, затрагивающая веб-сайт и панель управления, была решена по состоянию на 11:30 UTC. Пользователи больше не должны испытывать эту проблему. Наша команда продолжает следить за производительностью, чтобы обеспечить стабильность. Мы приносим извинения за любые нарушения, которые эта проблема могла вызвать, и ценим ваше понимание. Спасибо за ваше терпение и, пожалуйста, обратитесь за поддержкой, если вы заметили что-то необычное.
- postmortem
16 июля 2026 года, между 07:55 UTC и 11:15 UTC \(примерно 3 часа 20 минут\), сайт Uploadcare и клиентский портал были частично недоступны. Во время этого окна затронутые запросы могут выйти из строя в наших дистрибутивах CloudFront с 504 ошибками Gateway Timeout и никогда не попадали в наши бэкэнд-сервисы. Сбой был вызван глобальным отключением Amazon Web Services \(AWS\) CloudFront, влияющим на VPC Origins, тип происхождения, на который мы полагаемся для веб-сайта и клиентского портала. Запросы, направляемые через VPC Origins, потерпели неудачу, в то время как дистрибутивы CloudFront с использованием других типов источников не пострадали. Позже AWS объяснила отключение внутренним ограничением пропускной способности в парке, который управляет соединениями с частными источниками VPC, что привело к неправильному распределению конфигурации маршрутизации для своих сетевых процессоров. Важно отметить, что наши основные сервисы платформы, включая загрузку файлов, хранение, обработку и доставку уже кэшированных файлов, не пострадали от этого инцидента и продолжали нормально работать во всем. Наша последующая работа сосредоточена на сохранении проверенного, готового к развертыванию запасного варианта для этого класса отказов AWS CloudFront. #**Время событий** Все время в UTC 16 июля 2026 года. ***07:55 — ** Метрики CloudFront начинают показывать повышенные показатели ошибок для нашего веб-сайта и дистрибутивов веб-клиентов. **07:59 — ** Наш мониторинг предупреждает о том, что [uploadcare.com] (http://uploadcare.com) недостижим. Наша инженерная команда немедленно начинает расследование. **08:02 — ** Мы подтверждаем 504 ошибки для [uploadcare.com] (http://uploadcare.com) и отмечаем, что запросы не достигают нашего бэкэнда. Другие дистрибутивы CloudFront остаются здоровыми. **08:07 — ** Основываясь на шаблоне ошибки и созданной CloudFront странице ошибки 504, CloudFront становится нашей основной предполагаемой первопричиной. На данный момент AWS еще не опубликовала никаких уведомлений, хотя более широкое сообщество начало сообщать о проблемах CloudFront. **08:28 — ** Мы подтверждаем, что проблема затрагивает наши общедоступные веб-сайты и портал клиентов. **08:42 — ** Метрики CloudFront показывают частоту ошибок около 30%. 08:44 AWS признает глобальное отключение CloudFront, связанное с VPC Origins, примерно через 49 минут после начала нашего воздействия. **09:23 — ** Мы начинаем внедрять запасной вариант: переключение затронутых истоков с VPC Origins на балансировщики нагрузки приложений, ориентированные на Интернет (ALB). ** 10:58 — ** Резервный запас развертывается в нашей среде постановки для проверки. **11:02 — ** Откат проходит проверку на постановку. Мы начинаем вносить те же изменения в производство. 11:15 — AWS устраняет основное отключение. Наши производственные веб-сайты и порталы клиентов полностью восстанавливаются, а уровень ошибок возвращается к нулю. Поскольку AWS восстановилась первой, откат производства не потребовался. Мы объявляем, что инцидент урегулирован. ** Что было хорошо** ** Быстрое выявление и диагностика.** Наш мониторинг выявил сбой в течение нескольких минут, и наша команда сопоставила его с более широкой проблемой AWS и определила вероятную первопричину, прежде чем AWS признал отключение публично. *** Подтвержденное смягчение.** Во время инцидента мы разработали, реализовали и проверили запасной вариант — переключение источников CloudFront с VPC Origins на ALB, ориентированные на Интернет, — на нашу среду постановки. AWS восстановился до того, как нам потребовалось применить его к производству, но теперь это доказанное смягчение последствий будущих инцидентов с VPC Origins. ** Сдержанное воздействие.** Поскольку сбой был ограничен дистрибутивами с использованием VPC Origins, наша основная платформа — загрузка файлов, хранение, обработка и кэшированная доставка — оставалась полностью работоспособной. ** Что пошло не так** *** Общая зависимость от происхождения** Все наши дистрибутивы общедоступных веб-сайтов и порталов клиентов опирались на CloudFront VPC Origins, поэтому один сбой подсистемы AWS не повлиял на них. #**Деятельность** **Сохранить готовый к развертыванию запасной вариант CloudFront.** Мы подготовили и проверили изменения в инфраструктуре для переключения затронутых дистрибутивов с VPC Origins на ALB, ориентированные на Интернет, поэтому это смягчение может быть применено быстро, если подобное отключение AWS повторится. Мы искренне извиняемся за нарушение, вызванное этим инцидентом, и за задержку в сообщении через нашу страницу статуса. В то время как первопричиной было отключение AWS за пределами нашего прямого контроля, мы стремимся уменьшить наше воздействие на этот класс отказов и общаться более быстро и прозрачно в будущем.
Автоматический перевод официального обновления инцидента.