Enjeu découvert - Perturbation du service dans la région de l'Amérique du Nord - Services multiples
- investigating
les outils de surveillance de xMatters ont identifié un problème avec xMatters On-Demand pour certains clients situés dans la région de l'Amérique du Nord, limité à un groupe de bases de données. Nous enquêtons actuellement sur cette question et nous procéderons à une mise à jour au fur et à mesure que l'information sera disponible. Si vous rencontrez également des problèmes, ou si vous n'êtes pas sûr que ce problème affecte votre service, veuillez communiquer avec l'aide à la clientèle de xMatters à l'adresse https://support.xmatters.com/hc/en-us/requests/new - nos agents de soutien attendent de vous aider.
- monitoring
L'équipe de réponse aux incidents xMatters a déployé un correctif pour le problème. Nous suivons actuellement la situation pour nous assurer que la mise en œuvre est stable et que tous les services sont rétablis.
- resolved
La question a été abordée et tous les services ont été rétablis. Merci de votre patience pendant que nous abordons cette question.
- postmortem
**Que s'est-il passé?** Le 1er juillet 2026, certains clients ont signalé un problème à xMatters Customer Support où ils rencontraient des erreurs d'authentification lors de l'accès à l'interface utilisateur web. **Pourquoi est-ce arrivé?** Ce problème est survenu parce qu'un groupe de bases de données a atteint 100 % d'utilisation des ressources, ce qui a entraîné l'expiration des demandes de base de données. Un trafic exceptionnel a révélé un ensemble de requêtes lentes, ce qui a considérablement augmenté la latence des requêtes sur le cluster. Au fur et à mesure que la latence augmentait, la pénurie de ressources et la dégradation de la réactivité du cluster ont entraîné des délais. **Comment avons-nous répondu?** Dès que le Service Client a confirmé le problème, ils ont engagé les équipes d'ingénierie pour enquêter. Tel que conçu, le système s'était rétabli avant que Engineering ne puisse mettre en œuvre des mesures d'atténuation ou de rétablissement, mais les équipes étaient encore en mesure d'identifier et d'isoler la cause profonde. **Que faisons-nous pour éviter que cela ne se reproduise?** Pour éviter que ce problème ne se reproduise, l'équipe d'ingénierie a conçu, développé et testé une solution. Ils ont déployé le correctif dans la matinée du mercredi 8 juillet 2026, et il a été mis en œuvre avec succès pour tous les cas.
Traduit automatiquement depuis la mise à jour officielle de l'incident.