Desvio do site e do painel
- investigating
Estamos a investigar um problema que afecta o Website e o Dashboard. Os usuários podem experimentar um número aumentado de erros. Nossa equipe está trabalhando para identificar a causa raiz, e forneceremos uma atualização assim que mais informações estiverem disponíveis. Pedimos desculpas por qualquer inconveniente e apreciamos sua paciência.
- identified
Nossa equipe identificou a causa do problema impactando Website e Dashboard e está trabalhando ativamente para implementar uma solução permanente. Alguns usuários ainda podem experimentar problemas de conectividade durante este tempo. Continuaremos a partilhar actualizações à medida que avançarmos para uma resolução completa. Obrigado pela vossa paciência.
- identified
Nossa equipe está trabalhando para implementar uma solução permanente. Alguns usuários ainda podem experimentar problemas de conectividade durante este tempo. Continuaremos a partilhar actualizações à medida que avançarmos para uma resolução completa.
- resolved
O problema que afeta o site e Dashboard foi resolvido a partir das 11:30 UTC. Os usuários não devem mais experimentar o problema. Nossa equipe continua monitorando o desempenho para garantir estabilidade. Pedimos desculpa por qualquer perturbação que esta questão possa ter causado e apreciamos a sua compreensão. Obrigado pela sua paciência, e por favor, procure apoio se notar algo incomum.
- postmortem
Em 16 de julho de 2026, entre 07:55 UTC e 11:15 UTC \(aproximadamente 3 horas e 20 minutos\), o site da Uploadcare e o portal do cliente estavam parcialmente indisponível. Durante esta janela, as solicitações afetadas podem falhar em nossas distribuições CloudFront com erros de timeout do Gateway 504 e nunca chegaram aos nossos serviços de infraestrutura. A interrupção foi causada por um Global Amazon Web Services \(AWS\) CloudFront outage afetando VPC Origins, o tipo de origem que contamos para o site e o portal do cliente. As solicitações roteadas através do VPC Origins falharam, enquanto as distribuições CloudFront usando outros tipos de origem não foram afetadas. A AWS mais tarde atribuiu a falha a uma restrição de capacidade interna na frota que gerencia conexões com origens VPC privadas, o que fez com que a configuração de roteamento fosse distribuída incorretamente aos seus processadores de rede. É importante ressaltar que nossos principais serviços de plataforma – incluindo upload de arquivos, armazenamento, processamento e entrega de arquivos já armazenados – não foram afetados por esse incidente e continuaram a operar normalmente durante todo o processo. Nosso trabalho de acompanhamento se concentra em manter uma falha comprovada e pronta para funcionar nesta classe de falha do AWS CloudFront. # **Timeline of events** Todos os tempos estão em UTC em 16 de julho de 2026. * **07:55 -** As métricas CloudFront começam a mostrar taxas de erro elevadas para nosso site e distribuições webclient. * **07:59 -** Nosso monitoramento alerta que [uploadcare.com](http://uploadcare.com) é inacessível. A nossa equipa de engenharia começa a investigar imediatamente. * **08:02 —** Confirmamos 504 erros para [uploadcare.com](http://uploadcare.com) e observamos que as solicitações não estão atingindo nossa infraestrutura. Outras nossas distribuições CloudFront permanecem saudáveis. * **08:07 -** Com base no padrão de erro e na página de erro 504 gerada pelo CloudFront, o CloudFront torna-se nossa principal causa de suspeita de raiz. Neste ponto, a AWS ainda não havia publicado nenhum aviso, embora a comunidade mais ampla tivesse começado a relatar problemas CloudFront. * **08:28 -** Confirmamos que o problema está afetando nossos sites públicos e portal de clientes. * **08:42 -** As métricas CloudFront mostram uma taxa de erro de aproximadamente 30%. * **08:44 —** AWS reconhece uma falha global na CloudFront relacionada com o VPC Origins — aproximadamente 49 minutos após o início do nosso impacto. * **09:23 -** Começamos a implementar um retrocesso: mudando as origens afetadas de VPC Origins para Balanceadores de Carga de Aplicação virados para a internet \(ALBs\). * **10:58 -** O recuo é implantado em nosso ambiente de estadiamento para validação. * **11:02 -** O recuo passa a validação no estadiamento. Começamos a rolar as mesmas mudanças para a produção. * **11:15 -** AWS resolve a falha subjacente. Nossos sites de produção e cliente portall totalmente recuperar e taxas de erro voltar a zero. Uma vez que a AWS recuperou em primeiro lugar, o retorno da produção não foi exigido. Declaramos o incidente resolvido. # O que correu bem # * **Detecção e diagnóstico rápido. Nosso monitoramento detectou a falha em poucos minutos, e nossa equipe correlacionou-a com uma questão mais ampla da AWS e identificou a provável causa raiz antes da AWS reconhecer publicamente a falha. * ** Uma mitigação validada. Durante o incidente, nós projetamos, implementamos e validamos um retrocesso — mudando as origens CloudFront da VPC Origins para ALBs virados para a internet — no nosso ambiente de encenação. AWS recuperado antes de precisarmos aplicá-lo à produção, mas isso agora é uma mitigação comprovada para futuros incidentes VPC Origins. * ** Impacto contínuo. Como a falha foi limitada às distribuições usando o VPC Origins, nossa plataforma principal — uploads de arquivos, armazenamento, processamento e entrega em cache — permaneceu totalmente operacional. O que correu mal * ** Uma dependência de origem compartilhada.** Nossas distribuições de websites públicos e portais de clientes todas dependiam da CloudFront VPC Origins, então uma falha no subsistema AWS os afetou, sem falhas. # ** Itens de ação** * **Mantenha um retorno pronto para o CloudFront.** Nós preparamos e validamos as mudanças de infraestrutura para alternar as distribuições afetadas de VPC Origins para ALBs voltados para a internet, de modo que esta mitigação pode ser aplicada rapidamente se ocorrer uma falha AWS similar. Pedimos sinceras desculpas pela interrupção que este incidente causou, e pelo atraso em comunicá-lo através da nossa página de status. Enquanto a causa raiz foi uma falha do lado AWS fora do nosso controle direto, estamos comprometidos em reduzir nossa exposição a esta classe de falha e em comunicar-se mais rapidamente e transparente no futuro.
Traduzido automaticamente da atualização oficial do incidente.