Microsoft назвала причиной масштабного сбоя Microsoft 365 ошибку в системе обслуживания сети

· Технологии
Баг в автоматизированной системе обработки заявок на техобслуживание удалил IP-маршруты с большего числа устройств, чем планировалось, нарушив работу Azure и Microsoft 365.

cover.svg

Microsoft объяснила масштабный сбой Microsoft 365, произошедший в четверг, ошибкой в собственной системе автоматической обработки заявок на обслуживание сети. Из-за неё IP-маршруты были удалены с большего числа устройств, чем предполагалось, что нарушило работу сервисов Azure и Microsoft 365.

Сбой начался 23 июля в 10:44 по восточному времени и затронул прежде всего клиентов, обращавшихся к Microsoft 365 через инфраструктуру, связанную с регионом Azure West US. К 11:11 сервис Downdetector зафиксировал 2403 жалобы — при обычном фоне около 29. Больше всего пострадал SharePoint (78% обращений), за ним следовали Excel (11%) и Центр администрирования Microsoft 365 (6%).

Что не работало

Под идентификатором инцидента MO1437424 компания подтвердила перебои сразу в нескольких службах: доступ к OneDrive был прерывистым, SharePoint Online выдавал ошибки «Something went wrong», в Teams деградировал чат и не загружались изображения, не открывались страницы Loop, не запускались потоки Power Automate, а Copilot Chat отвечал с задержками или сбоями. Список пострадавших продуктов включал также Fabric и Power BI, Power Apps, Copilot Studio, Windows 365 и Microsoft Defender.

Как один баг снял лишние маршруты

В предварительном разборе инцидента по Azure Microsoft сообщила, что сбой возник во время планового обслуживания устройств в регионе West US, когда изолировались отдельные сетевые пути. По регламенту система переводит такие заявки в машиночитаемые инструкции и проверяет, что хотя бы один из двух дублирующих путей остаётся исправным, прежде чем начать работы.

Однако ошибка в модуле преобразования заявок пометила как участников обслуживания дополнительные сетевые устройства. В результате IP-маршруты были удалены с большего числа устройств между дата-центром West US и глобальной сетью компании. Это нарушило трафик, входящий в регион и выходящий из него, — при этом трафик, целиком остававшийся внутри региона, не пострадал.

Последствия оказались широкими: сбои соединений, рост задержек и проблемы с доступом к десяткам облачных сервисов, среди которых Azure App Service, Application Gateway, Cosmos DB, Kubernetes Service, ExpressRoute, Microsoft Graph, Sentinel и VPN Gateway.

Восстановление

Изначально Microsoft попыталась смягчить последствия, перенаправив трафик по обходным путям, но многие сервисы продолжали сбоить. Инженеры сначала увидели массовую «пляску маршрутов» в глобальной сети, а затем проследили их удаление до дата-центра в West US и связали с недавним обслуживанием. Откат изменения начался в 13:45, завершился в 14:26 по восточному времени, а полностью все затронутые сервисы восстановились к 15:41.

Теперь компания проводит внутренний разбор, сосредоточенный на проверках безопасности и автоматизированных процессах выполнения заявок на обслуживание. Итоговый отчёт Microsoft обещает опубликовать после расследования — обычно в течение двух недель.


Источник: Bleeping Computer

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.