Issue Discovered - Interrupção de serviços na região norte-americana - Vários serviços
- investigating
xMatters ferramentas de monitoramento identificaram um problema com xMatters On-Demand para alguns clientes localizados na região da América do Norte, limitado a um cluster de banco de dados. Estamos atualmente investigando o problema e vamos atualizar à medida que as informações ficam disponíveis. Se você também estiver enfrentando problemas, ou se não tiver certeza se esse problema impacta seu serviço, entre em contato com xMatters Client Assistance em https://support.xmatters.com/hc/en-us/requests/new - nossos agentes de suporte estão esperando para ajudar.
- monitoring
A equipa de resposta ao incidente xMatters implantou uma solução para o problema. Estamos actualmente a acompanhar a situação para garantir que a implementação seja estável e que todos os serviços sejam restaurados.
- resolved
A questão foi abordada e todos os serviços foram restaurados. Obrigado pela vossa paciência enquanto abordámos este assunto.
- postmortem
O que aconteceu? Em 1o de julho de 2026, alguns clientes reportaram um problema ao suporte ao cliente xMatters, onde estavam encontrando erros de autenticação ao acessar a interface do usuário da web. Por que aconteceu? Essa questão ocorreu porque um cluster de banco de dados alcançou 100% de utilização de recursos, fazendo com que as solicitações de banco de dados passassem do tempo. Um padrão de tráfego excepcional expôs um conjunto de consultas de execução lenta, que aumentaram significativamente a latência da consulta no cluster. À medida que a latência aumentava, houve fome de recursos e degradação da responsividade do cluster, resultando em tempo de espera. Como respondemos? Assim que o Suporte ao Cliente confirmou o problema, eles contrataram as equipes de Engenharia para investigar. Como projetado, o sistema havia se restaurado antes que a Engenharia pudesse implementar qualquer ação de mitigação ou recuperação, mas as equipes ainda eram capazes de identificar e isolar a causa raiz. ** O que estamos fazendo para evitar que isso aconteça novamente?** Para evitar que este problema ocorra novamente, a equipe de engenharia projetou, desenvolveu e testou uma correção. Eles implantaram a correção na manhã de quarta-feira, 8 de julho de 2026, e foi implementado com sucesso para todas as instâncias.
Traduzido automaticamente da atualização oficial do incidente.