Лив МакМахонТехнологический репортер и
Лили ДжамалиКорреспондент по технологиям Северной Америки
Гетти ИзображенияAmazon Web Services (AWS) заявила поздно вечером в понедельник, что устранила массовый сбой, из-за которого некоторые крупнейшие в мире веб-сайты были отключены от сети на большую часть дня.
Более 1000 приложений и веб-сайтов, включая платформы социальных сетей, такие как Snapchat, и банки, такие как Lloyds и Halifax, пострадали от проблем, которые, по словам Amazon, лежат в основе операций гиганта облачных вычислений в США.
Компания Downdetector, занимающаяся мониторингом сбоев платформы, сообщила, что во время сбоя в понедельник количество пользовательских сообщений о проблемах во всем мире возросло до более чем 11 миллионов.
Даже после того, как Amazon устранила основную проблему, эксперты заявили, что сбой продемонстрировал опасность того, что так много компаний полагаются на одного доминирующего поставщика.
«Этот эпизод показал, насколько взаимозависима наша инфраструктура», — сказал профессор Алан Вудворд из Университета Суррея.
«Многие онлайн-сервисы полагаются на сторонние поставщики своей физической инфраструктуры, и это показывает, что проблемы могут возникнуть даже у крупнейших из этих сторонних поставщиков.
«Небольшие ошибки, часто совершаемые человеком, могут иметь широкомасштабные и значительные последствия».
Судя по всему, проблемы начались около 07:00 BST в понедельник, когда пользователи начали сообщать о проблемах с доступом к множеству платформ.
Сюда входил широкий спектр различных сайтов и сервисов: от масштабных онлайн-игр, таких как Fortnite, до приложения для изучения языков Duolingo.
Рано утром Downdetector сообщил BBC, что всего за несколько часов он увидел более четырех миллионов отчетов от пользователей на 500 сайтах — более чем вдвое больше, чем за весь обычный будний день.
Позже они достигли пика и превысили 11 миллионов, говорится в сообщении, поскольку все больше сервисов, включая Reddit и Lloyds Bank, пытались восстановиться.
Примерно в 23:00 по московскому времени Amazon сообщила, что все сервисы AWS «вернулись к нормальной работе».
Но не раньше, чем компании пришлось ограничить работу некоторых частей своей системы, чтобы решить основную проблему.
По мнению Майка Чаппла, профессора информационных технологий в Университете Нотр-Дам, после первоначального отключения могла возникнуть новая серия «каскадных сбоев».
«Это похоже на крупномасштабное отключение электроэнергии. Бригады начинают работать, чтобы попытаться вернуть его в работу», – сказал г-н Чаппл. «Питание может мигнуть несколько раз», — объяснил он, но возможно, что Amazon изначально «устранил только симптомы», а не причину.
Что пошло не так?
Amazon еще не предоставил подробной информации о том, что стало причиной сбоя в понедельник, и не опубликовал официального заявления по этому поводу.
В обновлении на веб-странице состояния службы говорится, что проблема «по всей видимости, связана с разрешением DNS конечной точки API DynamoDB в US-EAST-1».
DNS, что означает систему доменных имен, часто сравнивают с телефонной книгой в Интернете.
Он эффективно переводит названия веб-сайтов, которые используют люди (например, bbc.co.uk), в числа, которые могут быть прочитаны и поняты компьютерами.
Этот процесс, по сути, лежит в основе того, как мы используем Интернет, и его сбои могут привести к тому, что веб-браузеры не смогут найти контент, который они ищут.
Мэтью Принс, исполнительный директор Cloudflare, рассказал BBC, что сбой в работе AWS подчеркнул влияние облачных сервисов на работу Интернета.
«У всех был плохой день, сегодня у Amazon был плохой день», — сказал он.
«В облаке есть удивительные вещи: оно позволяет масштабироваться… но если у вас произойдет такой сбой, это может привести к отключению многих сервисов, на которые мы полагаемся».
А Кори Крайдер, глава Института будущего технологий, рассказал Би-би-си, что это «немного похоже на обрушение моста».
«Существенная часть экономики развалилась», – сказала она.
А поскольку большая часть облачных вычислений зависит от Amazon, Microsoft и Google (по оценкам, около 70%), она сказала, что статус-кво является «неустойчивым».
«Если у вас есть концентрированное предложение у горстки поставщиков-монополистов, когда что-то подобное рушится, это уносит с собой огромный процент экономики», – сказала она.
«Нам действительно следует подумать о том, чтобы попытаться купить больше местных услуг, а не полагаться на горстку американских монопольных платформ.
«Это риск для нашей безопасности, нашего суверенитета и нашей экономики, и нам необходимо рассмотреть возможность структурного разделения, чтобы сделать наши рынки более устойчивыми к такого рода потрясениям».
Один эксперт по компьютерным наукам говорит, что часть ответственности лежит на компаниях, использующих AWS.
«Компании, использующие Amazon, не уделяют должного внимания внедрению систем защиты в свои приложения», — говорит Кен Бирман, профессор информатики Корнелльского университета в Нью-Йорке.
Отключения, подобные произошедшему в понедельник, случаются часто, хотя и не всегда в таких масштабах.
Бирман сообщил BBC, что разработчикам приложений следует позаботиться о вложении средств в резервное копирование критически важных приложений, находящихся в облаке.
«Мы знаем, как сделать эти системы сильнее, и мы знаем, как сделать это безопасно», — говорит Бирман.
Вопрос об ответственности вполне может оказаться в суде.
Спустя более года после массового сбоя в работе CrowdStrike, Delta Airlines все еще ведет споры с компанией о возмещении убытков на сумму более 500 миллионов долларов.
Даже после того, как CrowdStrike устранила проблему, авиакомпания заявила, что ей пришлось вручную перезагрузить 40 000 серверов, что привело к серьезным задержкам рейсов на несколько дней.
Дополнительный отчет Эсиллта Карра.

Продолжение темы


