Как развивался сбой
Сбой начался 3 сентября в 7:43 по тихоокеанскому времени: как сообщило Wired, ChatGPT перестал отвечать. Через несколько минут проблемы появились у Claude и Grok. К 12:38 сервисы снова заработали.
За эти примерно пять часов проявилось устройство ИИ-экономики, которое большинство пользователей обычно не замечает.
Страница состояния OpenAI сообщила о повышенном числе ошибок в ChatGPT и Codex. Компания объяснила неполадки ошибкой маршрутизации и заявила, что исправление было готово к 8:17 по тихоокеанскому времени. Anthropic сообщила, что большинство моделей Claude восстановились, однако Opus 4.8 и Opus 5, две наиболее производительные модели компании, оставались недоступны дольше.
Grok, разработанный SpaceXAI, также столкнулся с масштабным сбоем. У Gemini от Google на Downdetector зарегистрировали около 500 жалоб, но, по данным ShadowIO, Google сам инцидент не подтверждал.
Последствия быстро вышли за пределы самих чат-ботов. Cursor — инструмент для программирования, которым ежедневно пользуются миллионы разработчиков, — подтвердил собственный сбой, поскольку внутри опирается на Claude и Grok. На Downdetector зарегистрировали:
В социальных сетях тем временем появилось множество шуток о том, что во время сбоя пользователи наконец смогли увидеть солнце.
Почему сервисы отказали одновременно
Чтобы понять, как четыре компании могли столкнуться с похожими проблемами, нужно разобраться, как модель попадает на экран пользователя. Сама модель — это набор весов, огромный файл с числами. Для её работы нужны стойки с GPU в центре обработки данных, а также сеть, которая направляет запрос к этим GPU и возвращает результат.
Почти ни одна ИИ-компания не владеет всей этой инфраструктурой. Вычислительные мощности арендуют у облачных поставщиков — Microsoft Azure, Amazon, Google и Oracle, — а всё чаще и друг у друга.
Поэтому доступность модели зависит от самого ненадёжного звена в цепочке, которую пользователь не видит. Если в одном облачном регионе возникает сбой сети, одновременно могут ухудшиться все модели, чьи запросы проходят через него, даже если их разработчики никак не связаны между собой.
Единой причины не нашли
Несколько источников указали на возможный сбой в регионе Microsoft Azure East US: примерно в то же время Azure действительно зафиксировал всплеск сообщений о неполадках. Однако, по данным CircleID, Microsoft заявила, что Azure не был причиной сбоя.
В четверг днём SpaceXAI опубликовала извинения и сообщила, что проблемы Grok начались после отказа вычислительного центра компании в Мемфисе. Компания также извинилась перед пострадавшими «вычислительными партнёрами».
Такая формулировка может означать, что SpaceXAI делится вычислительными мощностями с другими ИИ-лабораториями и что как минимум одна из них тоже пострадала после сбоя в Мемфисе. Это объяснило бы одновременные проблемы Grok и Claude, но не сбой OpenAI, которая описала собственную проблему как ошибку маршрутизации.
Наиболее вероятный вариант — несколько независимых инцидентов совпали по времени, а между частью сервисов существовала общая вычислительная инфраструктура. К утру пятницы только OpenAI действительно ответила на вопросы о причинах произошедшего.
ИИ становится критической инфраструктурой
Тенденции вроде «мозга ИИ» и ИИ-агентов делают базовую инфраструктуру ещё важнее.
Дэвид Москателли, генеральный директор базирующейся в Чикаго Go.ИИ, ранее известной как Go Abacus, заявил, что ИИ очень быстро превратился из инструмента повышения производительности в критическую инфраструктуру. Компания создаёт локальные ИИ-системы примерно для 200 клиентов из регулируемых отраслей, включая Farmers Insurance, D.L Evans Bank, Axos Bank и John Hopkins.
Клиентам Go.ИИ нужны контроль над рабочими процессами ИИ и собственная инфраструктура. Они запускают GoLLM или открытые модели на принадлежащем им оборудовании и платят фиксированную ежемесячную сумму без отдельной платы за обработку текста. Поэтому проблемы стороннего поставщика напрямую не затрагивают их работу.
Москателли не призывает компании полностью отказываться от облачных услуг. По его мнению, вопрос нужно решать на уровне архитектуры. Будущее корпоративного ИИ он связывает с возможностью выбирать подходящую модель и среду запуска, сохраняя контроль над собственными данными и операциями.
Компании, считает он, должны исходить из того, что любой отдельный поставщик может отключиться, и заранее проектировать систему с учётом этого риска. Для этого нужны:
Каждая из этих компаний говорит о надёжности как о характеристике продукта. Но события 3 сентября показали, что надёжность стала общей характеристикой всей отрасли: компании конкурируют своими моделями, но часто используют одну и ту же инфраструктуру, не раскрывая это публично.
Если часть бизнеса работает на ИИ-агентах или выстраивается вокруг торговли с помощью агентов, возникает отдельный вопрос: что произойдёт с такими процессами, когда ИИ-инфраструктура остановится?
Для технологических организаций это поднимает в списке приоритетов четыре пункта. ИИ становится инфраструктурой, а скрытые зависимости под ним будут определять, кто продолжит работу во время следующего сбоя.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram