For the complete documentation index, see llms.txt. This page is also available as Markdown.

Технический инцидент

Технический порядок действий при недоступности сайта, очередей, базы, DNS или внешнего сервиса

Цель первых действий — сохранить безопасность и денежные операции, определить границу сбоя и не уничтожить доказательства. Массовый перезапуск не является диагностикой.

Первые пять минут

  1. Зафиксируйте начало, часовой пояс и первый известный симптом.

  2. Определите затронутые функции: сайт, панель, заявки, платежи, чат или уведомления.

  3. Остановите рискованную автоматизацию штатным способом, если возможны дубли выплат или callback.

  4. Назначьте одного координатора и один журнал событий.

  5. Сохраните коды, Ray ID, URL, идентификаторы безопасных тестов и первые ошибки.

  6. Проверьте страницу состояния внешнего провайдера и его доступность с сервера.

Не публикуйте заявку клиента, реквизиты, ключи и полный файл окружения в общем канале инцидента.

Определение слоя

Наблюдение
Начальная область

Домен не разрешается

Регистратор, NS, DNSSEC и зона DNS

Ошибка Cloudflare 52x

Origin, сертификат, сеть и Nginx

Клиентский сайт 502, панель работает

Служба клиентского SSR или его vhost

Панель 500

PHP, Laravel, база или последний release

Данные открываются, фоновые действия стоят

Redis, Horizon, cron или внешняя интеграция

Чат только после обновления

Reverb, WebSocket, Nginx или Cloudflare

Только один провайдер недоступен

DNS сервера, исходящая сеть, TLS или API провайдера

Подтвердите слой независимой проверкой. Ошибка в браузере одного оператора может быть локальным кешем, а успешный ping не подтверждает работу HTTPS или API.

Сохранение доказательств

Сохраните ограниченный временной диапазон журналов Nginx, приложения и конкретной systemd-службы, показатели Horizon/Pulse и историю операций провайдера. На существующем сервере дополнительно сохраните состояние Supervisor и PM2, если именно они управляют процессами. Зафиксируйте последнее изменение DNS, Cloudflare, Nginx, окружения или поставки.

Перед перезапуском процесса сохраните его ошибку и число ожидающих задач. Перед очисткой диска установите, какой каталог вырос. Перед восстановлением базы остановите запись и сохраните текущее повреждённое состояние для разбора.

Восстановление

Исправляйте минимальный подтверждённый компонент. Используйте reload Nginx после nginx -t или контролируемый перезапуск одной соответствующей службы. Перезагрузка сервера допустима при системной причине или отсутствии другого способа после сохранения данных.

Если основной признак — необычный объём или распределение трафика, используйте отдельную инструкцию «Что такое DDoS и как защищаться».

Повтор неудачного финансового задания выполняется только после сверки с внешней системой. Если исход неизвестен, переведите операцию в ручную проверку.

Завершение

  1. Повторите исходный сценарий.

  2. Проверьте очередь до нормальной задержки.

  3. Проверьте отсутствие дублей и потерянных заявок.

  4. Наблюдайте систему согласованный период.

  5. Зафиксируйте причину, влияние, восстановление и предотвращение.

  6. Отзовите временные доступы и правила.

  7. Обновите инструкцию, если фактический порядок отличался.

Инцидент закрывается после восстановления функции и контроля последствий, а не сразу после ответа страницы 200.

Последнее обновление

Это было полезно?