Эксплуатация · База
Настроить health checks
Сделать проверки состояния сервиса и зависимостей для мониторинга и оркестрации.
Быстро понять за 2 минуты
Сделать проверки состояния сервиса и зависимостей для мониторинга и оркестрации. На выходе: health endpoint работает.
Контекст
Пункт относится к этапу «Эксплуатация». Его задача — сделать сервис понятным и безопасным в эксплуатации. Он нужен до передачи результата разработчикам, QA и команде эксплуатации: иначе команда рискует делать один health на все случаи.
Что это дает
Health checks помогают балансировщику и команде понять, жив ли сервис и готов ли он принимать трафик. Это помогает связать работу с общей целью: надежная, безопасная и поддерживаемая система. Практический эффект виден, когда health endpoint работает.
Как выполнить
- Разделите liveness и readiness.
- Проверяйте критические зависимости осторожно.
- Не делайте health endpoint тяжелым.
Критерии приемки
- Health endpoint работает.
- Readiness учитывает критические зависимости.
- Мониторинг использует checks.
Типичные ошибки
- Делать один health на все случаи.
- Проверять внешние сервисы слишком часто.
- Возвращать 200 при деградации критической зависимости.
Инструменты
Рабочий артефакт
Runbook
Эксплуатация: документ с выводом, доказательствами, ответственным и следующим действием
Пример для разработки сервиса заказов: специалист начинает с действия «Разделите liveness и readiness». Результат прикладывают к рабочей задаче и передают следующему участнику. Пункт закрывают не по факту обсуждения, а когда выполнено условие: «Health endpoint работает».
- Logs
- Metrics
- Alerts
- Rollback
Контроль качества
Операционная готовность сервиса
Health endpoint работает.
После изменения контрактов, релизов, инцидентов, роста нагрузки и пересмотра архитектурных решений.
Контракт, ограничения, сценарии отказа, метрики, владельца сервиса и критерии готовности.
Перед отметкой выполнено: Health endpoint работает.
Как применять
Начинайте с границ ответственности и пользовательского сценария, который обслуживает система. Затем проверьте контракт, данные, отказоустойчивость, безопасность и наблюдаемость. Хороший backend-пункт фиксирует, что именно меняется, как это проверить и какие метрики покажут стабильность решения.
Режим обучения
Тест по теме
Проверка понимания
Ответьте на вопросы по материалу и получите итоговый отчет: что понято хорошо, а что стоит перечитать.