Технический инцидент
Технический порядок действий при недоступности сайта, очередей, базы, DNS или внешнего сервиса
Цель первых действий — сохранить безопасность и денежные операции, определить границу сбоя и не уничтожить доказательства. Массовый перезапуск не является диагностикой.
Первые пять минут
Зафиксируйте начало, часовой пояс и первый известный симптом.
Определите затронутые функции: сайт, панель, заявки, платежи, чат или уведомления.
Остановите рискованную автоматизацию штатным способом, если возможны дубли выплат или callback.
Назначьте одного координатора и один журнал событий.
Сохраните коды, Ray ID, URL, идентификаторы безопасных тестов и первые ошибки.
Проверьте страницу состояния внешнего провайдера и его доступность с сервера.
Не публикуйте заявку клиента, реквизиты, ключи и полный файл окружения в общем канале инцидента.
Определение слоя
Домен не разрешается
Регистратор, NS, DNSSEC и зона DNS
Ошибка Cloudflare 52x
Origin, сертификат, сеть и Nginx
Клиентский сайт 502, панель работает
Служба клиентского SSR или его vhost
Панель 500
PHP, Laravel, база или последний release
Данные открываются, фоновые действия стоят
Redis, Horizon, cron или внешняя интеграция
Чат только после обновления
Reverb, WebSocket, Nginx или Cloudflare
Только один провайдер недоступен
DNS сервера, исходящая сеть, TLS или API провайдера
Подтвердите слой независимой проверкой. Ошибка в браузере одного оператора может быть локальным кешем, а успешный ping не подтверждает работу HTTPS или API.
Сохранение доказательств
Сохраните ограниченный временной диапазон журналов Nginx, приложения и конкретной systemd-службы, показатели Horizon/Pulse и историю операций провайдера. На существующем сервере дополнительно сохраните состояние Supervisor и PM2, если именно они управляют процессами. Зафиксируйте последнее изменение DNS, Cloudflare, Nginx, окружения или поставки.
Перед перезапуском процесса сохраните его ошибку и число ожидающих задач. Перед очисткой диска установите, какой каталог вырос. Перед восстановлением базы остановите запись и сохраните текущее повреждённое состояние для разбора.
Восстановление
Исправляйте минимальный подтверждённый компонент. Используйте reload Nginx после nginx -t или контролируемый перезапуск одной соответствующей службы. Перезагрузка сервера допустима при системной причине или отсутствии другого способа после сохранения данных.
Если основной признак — необычный объём или распределение трафика, используйте отдельную инструкцию «Что такое DDoS и как защищаться».
Повтор неудачного финансового задания выполняется только после сверки с внешней системой. Если исход неизвестен, переведите операцию в ручную проверку.
Завершение
Повторите исходный сценарий.
Проверьте очередь до нормальной задержки.
Проверьте отсутствие дублей и потерянных заявок.
Наблюдайте систему согласованный период.
Зафиксируйте причину, влияние, восстановление и предотвращение.
Отзовите временные доступы и правила.
Обновите инструкцию, если фактический порядок отличался.
Инцидент закрывается после восстановления функции и контроля последствий, а не сразу после ответа страницы 200.
Последнее обновление
Это было полезно?