Справочник событий
Справочник оповещений кластера Nova Container Platform. Для каждого оповещения указаны уровень важности, время до срабатывания (параметр for), краткое описание, а также разделы «Что означает» и «Что делать».
О том, как устроена система оповещений и как разбирать сработавшие события, см. Работа с событиями.
1. Longhorn (распределённое хранилище)
1.1. LonghornVolumeActualSpaceUsedWarning
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Том Longhorn заполнен более чем на 90%
Что означает: Реально занятое место на томе хранилища Longhorn превышает 90% от его ёмкости дольше 5 минут.
Что делать: Проверить, что расходует место на томе, расширить том или почистить данные, пока не начались проблемы с записью.
1.2. LonghornVolumeStatusCritical
Важность: Критический
Время до срабатывания: 5 мин.
Описание: Том Longhorn в состоянии Fault (авария)
Что означает: Реплики тома Longhorn отказали, и том перешёл в состояние Fault — данные тома недоступны для нормальной работы.
Что делать: Срочно проверить состояние реплик и ноды хранилища через Longhorn UI/CRD, восстановить или пересоздать реплики.
1.3. LonghornVolumeStatusWarning
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Том Longhorn деградировал
Что означает: У тома Longhorn не хватает здоровых реплик (обычно после падения ноды или диска), он работает в деградированном режиме.
Что делать: Проверить ноды/диски, на которых должны быть реплики, дождаться пересборки реплик или вмешаться вручную.
1.4. LonghornNodeStorageWarning
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Хранилище на ноде Longhorn заполнено более чем на 70%
Что означает: Суммарное использование дискового пространства, выделенного под Longhorn на конкретной ноде, превысило 70%.
Что делать: Спланировать расширение хранилища на ноде или перебалансировку томов, пока не дошло до критического уровня.
1.5. LonghornDiskStorageWarning
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Диск, подключённый к Longhorn, заполнен более чем на 70%
Что означает: Конкретный диск, зарегистрированный в Longhorn на ноде, использован более чем на 70% ёмкости.
Что делать: Проверить конкретный диск на ноде, освободить место или добавить ёмкость.
1.6. LonghornNodeDown
Важность: Критический
Время до срабатывания: 5 мин.
Описание: Нода(ы) Longhorn offline
Что означает: Одна или несколько нод кластера хранения Longhorn считаются оффлайн дольше 5 минут — это влияет на доступность реплик томов.
Что делать: Проверить состояние соответствующих Kubernetes-нод и longhorn-manager на них, разобраться, почему нода выпала.
1.7. LonghornInstanceManagerCPUUsageWarning
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Instance Manager Longhorn превышает CPU-запрос более чем на 300%
Что означает: Процесс instance-manager (обслуживает реплики/engine томов) использует CPU в 3+ раза больше заданного request — возможна нехватка ресурсов ноды.
Что делать: Проверить нагрузку по вводу-выводу на томах этой ноды и при необходимости увеличить лимиты/requests или разгрузить ноду.
1.8. LonghornNodeCPUUsageWarning
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Высокая загрузка CPU на ноде Longhorn
Что означает: CPU ноды, задействованной под Longhorn, загружен более чем на 90% от общей ёмкости дольше 5 минут.
Что делать: Проверить общую загрузку ноды (не только Longhorn) и при необходимости перераспределить нагрузку.
2. Аудит Kubernetes
2.1. AuditLogError
Важность: Предупреждение
Время до срабатывания: 1 мин.
Описание: Ошибка записи audit-лога на kube-apiserver
Что означает: kube-apiserver не может записать часть событий аудита — либо кончается место на диске, либо кто-то вмешивается в audit-логи.
Что делать: Проверить свободное место на ноде control-plane и целостность audit-логов; при подозрении на постороннее вмешательство эскалировать как инцидент безопасности.
3. Мониторинг кластера (общее состояние)
3.1. TargetDown
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Больше 10% целей мониторинга недоступны
Что означает: Более 10% целей сбора метрик Prometheus (job/service) в namespace недоступны дольше 15 минут — вероятны проблемы сети, упавшие ноды или сбои компонентов.
Что делать: Проверить состояние подов/нод соответствующего job и сетевую связность до них.
3.2. ClusterMonitoringOperatorReconciliationErrors
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Оператор мониторинга кластера не может применить конфигурацию
Что означает: Компонент, отвечающий за reconciliation стека мониторинга, час подряд не может успешно свести состояние к желаемому.
Что делать: Посмотреть логи cluster-monitoring-operator, найти конкретную ошибку reconciliation.
3.3. AlertmanagerReceiversNotConfigured
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: В Alertmanager не настроены получатели уведомлений
Что означает: У Alertmanager нет ни одного настроенного получателя (интеграции со Slack/email/PagerDuty и т.п.), поэтому сработавшие оповещения фактически никуда не уходят.
Что делать: Настроить хотя бы один получатель и маршрутизацию в конфигурации Alertmanager, иначе критичные инциденты останутся незамеченными.
3.4. KubeDeploymentReplicasMismatch
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Deployment не набирает нужное число реплик
Что означает: У Deployment в системных namespace число доступных реплик меньше желаемого более 15 минут, и обновление реплик не идёт — часто из-за упавших/недоступных нод.
Что делать: Посмотреть события и статус подов Deployment (kubectl describe), проверить состояние нод, на которых они должны планироваться.
3.5. MultipleContainersOOMKilled
Важность: Информационный
Время до срабатывания: 15 мин.
Описание: Массовые OOMKill контейнеров
Что означает: За последние 15 минут более 5 раз контейнеры были убиты по причине нехватки памяти (OOMKilled) — либо утечка памяти в приложении, либо тесные лимиты, либо проблема с конкретной нодой.
Что делать: Найти конкретные под(ы)/контейнеры через kube_pod_container_status_last_terminated_reason, проверить их лимиты памяти и потребление.
3.6. Watchdog
Важность: Не указан
Описание: Техническое контрольное оповещение (Watchdog)
Что означает: Это оповещение всегда в состоянии срабатывания (firing) — оно не сигнализирует о проблеме, а подтверждает, что вся цепочка Prometheus → Alertmanager → канал уведомлений работает.
Что делать: Ничего не чинить по содержанию; если Watchdog перестал приходить в канал уведомлений — значит сломана сама цепочка оповещений, и чинить нужно именно её.
3.7. NodeNetworkInterfaceFlapping
Важность: Предупреждение
Время до срабатывания: 2 мин.
Описание: Сетевой интерфейс ноды часто меняет статус (частое переключение)
Что означает: Состояние up/down сетевого интерфейса ноды менялось более 2 раз за 2 минуты — признак нестабильного линка, драйвера или кабеля/порта.
Что делать: Проверить физическое подключение, логи драйвера сетевой карты и коммутатор, к которому подключена нода.
4. Вспомогательные контейнеры config-reloader
4.1. ConfigReloaderSidecarErrors
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Вспомогательный контейнер config-reloader не может применить конфигурацию
Что означает: Вспомогательный контейнер, который следит за ConfigMap/Secret и перезагружает конфигурацию соседнего процесса (Prometheus/Alertmanager и т.п.), 10 минут подряд не может успешно её перечитать — конфигурация могла устареть.
Что делать: Посмотреть логи config-reloader в поде, проверить корректность связанного ConfigMap/Secret.
5. Утилизация CPU
5.1. HighOverallControlPlaneCPU
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Суммарная загрузка CPU control-plane превышает безопасный порог (>60% на 3 нодах)
Что означает: При трёх control-plane нодах суммарная загрузка CPU выше 60% означает, что кластер уже не выдержит отказ одной ноды: оставшиеся две не справятся с нагрузкой.
Что делать: Спланировать увеличение CPU/памяти на control-plane нодах заранее, не дожидаясь реального отказа.
5.2. ExtremelyHighIndividualControlPlaneCPU (предупреждение)
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Экстремальная загрузка CPU на одной control-plane ноде (предупреждение)
Что означает: На одной из control-plane нод загрузка CPU превысила 90% — риск деградации kube-apiserver и etcd из-за нехватки CPU для сериализации запросов.
Что делать: Проверить, какие процессы грузят ноду, и по возможности снизить нагрузку или добавить ресурсы control-plane.
5.3. ExtremelyHighIndividualControlPlaneCPU (критический)
Важность: Критический
Время до срабатывания: 1 ч.
Описание: Устойчиво экстремальная загрузка CPU control-plane ноды (критично)
Что означает: Загрузка CPU control-plane ноды держится выше 90% целый час — велик риск каскадного отказа: если эта нода откажет, остальные control-plane ноды тоже могут не выдержать.
Что делать: Немедленно разгрузить или расширить control-plane; это критическая деградация отказоустойчивости кластера.
6. DNS (CoreDNS)
6.1. CoreDNSPanicking
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: CoreDNS падает с паникой (panic)
Что означает: В процессе CoreDNS зафиксированы Go-паники за последние 10 минут — сервис DNS может перезапускаться и терять запросы.
Что делать: Посмотреть логи пода CoreDNS на предмет стектрейса паники, проверить версию и конфигурацию CoreDNS.
6.2. CoreDNSHealthCheckSlow
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Health-check CoreDNS выполняется медленно
Что означает: 95-й перцентиль времени health-check запроса CoreDNS превышает 10 секунд — признак перегрузки или деградации сервиса DNS.
Что делать: Проверить нагрузку на под(ы) CoreDNS (CPU/память/число запросов) и при необходимости масштабировать.
6.3. CoreDNSErrorsHigh
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: CoreDNS возвращает много SERVFAIL
Что означает: Более 1% DNS-ответов CoreDNS в namespace — это SERVFAIL, то есть DNS не может разрешить запросы — может ломать работу многих сервисов в кластере.
Что делать: Проверить вышестоящие DNS-серверы и конфигурацию CoreDNS (Corefile), логи на конкретные ошибки разрешения имён.
7. etcd (хранилище состояния кластера)
7.1. etcdMembersDown
Важность: Критический
Время до срабатывания: 10 мин.
Описание: Участники кластера etcd недоступны
Что означает: Один или несколько участников etcd либо не отвечают на сбор метрик (up=0), либо не могут обменяться данными с другими участниками (много ошибок сети между ними).
Что делать: Проверить состояние подов/нод etcd и сетевую связность между control-plane нодами — потеря кворума критична для всего кластера.
7.2. etcdNoLeader
Важность: Критический
Время до срабатывания: 1 мин.
Описание: У кластера etcd нет лидера
Что означает: Член etcd сообщает, что в кластере отсутствует избранный лидер — запись в etcd (а значит, и изменения состояния Kubernetes) невозможна.
Что делать: Срочно проверить сеть между etcd-нодами и их ресурсы (диск/CPU) — частая причина отсутствия лидера — сетевые разрывы или перегрузка диска.
7.3. etcdMemberCommunicationSlow
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Медленный обмен данными между участниками etcd
Что означает: 99-й перцентиль времени round-trip между репликами etcd превышает 150 мс — признак сетевых задержек между control-plane нодами.
Что делать: Проверить сетевую задержку/пропускную способность между нодами, на которых развёрнут etcd.
7.4. etcdHighNumberOfFailedProposals
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Много неудачных предложений записи в etcd
Что означает: За 15 минут etcd зафиксировал более 5 неудачных предложений записи (попыток записи через Raft) — обычно из-за нестабильной сети или перегрузки диска/лидера.
Что делать: Проверить логи etcd на конкретную причину отказов предложений записи, состояние диска и лидера кластера.
7.5. etcdHighFsyncDurations (предупреждение)
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Долгий fsync WAL в etcd (предупреждение)
Что означает: 99-й перцентиль времени fsync журнала записи (WAL) etcd превышает 0.5 секунды — диск под etcd не успевает за нагрузкой, что напрямую влияет на задержки всего API Kubernetes.
Что делать: Проверить производительность диска (лучше — SSD/NVMe с низкой задержкой) под etcd, убрать конкурирующую нагрузку на этот диск.
7.6. etcdHighFsyncDurations (критический)
Важность: Критический
Время до срабатывания: 10 мин.
Описание: Критически долгий fsync WAL в etcd
Что означает: 99-й перцентиль fsync WAL превышает уже 1 секунду — это критический уровень деградации диска, на котором стоит etcd.
Что делать: Срочно разобраться с диском etcd (замена/выделенный диск), пока не начались таймауты и потери лидера.
7.7. etcdHighCommitDurations
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Долгие commit-операции в etcd
Что означает: 99-й перцентиль времени commit в backend etcd (bbolt) превышает 250 мс — тоже указывает на проблемы с дисковой подсистемой под etcd.
Что делать: Проверить производительность и загрузку диска etcd, при необходимости выполнить дефрагментацию базы.
7.8. etcdDatabaseQuotaLowSpace
Важность: Критический
Время до срабатывания: 10 мин.
Описание: База etcd почти заполнила квоту размера
Что означает: Размер базы данных etcd превысил 95% от заданной квоты (etcd_server_quota_backend_bytes) — при достижении 100% etcd перестанет принимать запись, и кластер «замёрзнет».
Что делать: Срочно выполнить дефрагментацию etcd (etcdctl defrag) или увеличить квоту, а также разобраться, что раздувает базу (часто — старые ревизии/события).
7.9. etcdExcessiveDatabaseGrowth
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: База etcd растёт аномально быстро
Что означает: По тренду последних 4 часов прогнозируется, что размер базы etcd превысит квоту в течение ближайших 4 часов.
Что делать: Найти источник резкого роста записи в etcd (например, шумный контроллер/CRD с частыми обновлениями), при необходимости выполнить дефрагментацию.
7.10. etcdDatabaseHighFragmentationRatio
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Высокая фрагментация базы etcd
Что означает: Реально используемое место в базе etcd меньше 50% от выделенного объёма (при этом занято уже больше 100 МБ) — много места занято «мусором» от старых ревизий.
Что делать: Выполнить дефрагментацию etcd (etcdctl defrag) поочерёдно на каждом члене кластера, чтобы вернуть неиспользуемое место ОС.
7.11. etcdGRPCRequestsSlow
Важность: Критический
Время до срабатывания: 30 мин.
Описание: Медленные gRPC-запросы к etcd
Что означает: 99-й перцентиль времени обработки unary gRPC-запросов к etcd превышает 1 секунду на протяжении 30 минут — клиенты (kube-apiserver) будут получать медленные ответы.
Что делать: Проверить нагрузку на etcd (диск, сеть, число запросов) и какие конкретно gRPC-методы тормозят.
7.12. etcdHighNumberOfFailedGRPCRequests (предупреждение)
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Много неудачных gRPC-запросов к etcd (предупреждение)
Что означает: Более 10% gRPC-запросов к etcd завершаются ошибками (Unavailable, ResourceExhausted, DeadlineExceeded и т.п.).
Что делать: Проверить логи etcd и kube-apiserver на конкретные коды ошибок и метод, который чаще всего отказывает.
7.13. etcdHighNumberOfFailedGRPCRequests (критический)
Важность: Критический
Время до срабатывания: 10 мин.
Описание: Критически много неудачных gRPC-запросов к etcd
Что означает: Доля неудачных gRPC-запросов к etcd превысила уже 50% — это серьёзная деградация, влияющая на работу всего API Kubernetes.
Что делать: Немедленно расследовать состояние etcd-кластера (ресурсы, сеть, лидер), это близко к отказу control-plane.
7.14. etcdHighNumberOfLeaderChanges
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Частые перевыборы лидера etcd
Что означает: В среднем более 5 смен лидера etcd за последние 10 минут — частые перевыборы обычно вызваны нехваткой ресурсов, сетевыми задержками или помехами со стороны других компонентов.
Что делать: Проверить сетевую стабильность и нагрузку на control-plane ноды, посмотреть логи etcd вокруг моментов перевыборов.
7.15. etcdInsufficientMembers
Важность: Критический
Время до срабатывания: 3 мин.
Описание: У etcd нет кворума (недостаточно живых участников)
Что означает: Количество доступных и имеющих лидера участников etcd меньше половины от общего числа — Kubernetes API перестаёт принимать запросы на чтение и запись.
Что делать: Срочно проверить, включены ли все control-plane ноды и есть ли между ними сетевая связность — это полноценный инцидент, блокирующий работу кластера.
8. Ingress NGINX
8.1. NGINXConfigFailed
Важность: Критический
Время до срабатывания: 1 мин.
Описание: Ingress-nginx не может применить новую конфигурацию
Что означает: Тест конфигурации nginx после очередного reload завершился ошибкой — новая конфигурация Ingress не применяется, контроллер продолжает работать со старой.
Что делать: Найти и откатить последнее изменение Ingress-ресурса, вызвавшее невалидный nginx.conf.
8.2. NGINXCertificateExpiry
Важность: Критический
Время до срабатывания: 1 мин.
Описание: Скоро истекает TLS-сертификат на Ingress
Что означает: Один из SSL-сертификатов, используемых ingress-nginx, истекает менее чем через 7 дней.
Что делать: Продлить/перевыпустить сертификат (системные сертификаты можно обновить через nova-ctl certs renew) до истечения срока.
8.3. NGINXTooMany500s
Важность: Предупреждение
Время до срабатывания: 1 мин.
Описание: Много ответов 5xx через ingress-nginx
Что означает: Более 5% всех запросов через ingress-nginx завершаются серверными ошибками (5xx) — проблема на стороне бэкенд-сервисов или самого ingress.
Что делать: Посмотреть, какие именно backend-сервисы отдают 5xx, проверить их логи и состояние подов.
8.4. NGINXTooMany400s
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Много ответов 4xx через ingress-nginx
Что означает: Более 5% запросов через ingress-nginx получают клиентские ошибки (4xx) — может быть проблема с маршрутизацией, авторизацией или некорректными клиентами.
Что делать: Проверить конкретные пути/хосты с высоким числом 4xx в логах nginx, убедиться, что это не баг в конфигурации Ingress.
9. kube-apiserver: SLO доступности
9.1. KubeAPIErrorBudgetBurn (быстрый расход)
Важность: Критический
Время до срабатывания: 2 мин.
Описание: kube-apiserver быстро расходует error budget (SLO)
Что означает: kube-apiserver отдаёт ошибки/высокие задержки настолько интенсивно, что при таком темпе весь месячный бюджет ошибок SLO будет исчерпан за часы — комбинация окон 1h/5m ловит быстрые всплески.
Что делать: Посмотреть дашборд API Performance и состояние etcd — часто первопричина именно в etcd.
9.2. KubeAPIErrorBudgetBurn (устойчивый расход)
Важность: Критический
Время до срабатывания: 15 мин.
Описание: kube-apiserver медленно, но устойчиво расходует error budget (SLO)
Что означает: То же нарушение SLO API-сервера, но зафиксированное в более длинных окнах (6h/30m) — то есть проблема не разовый всплеск, а устойчивая деградация.
Что делать: Изучить тренд ошибок и задержки API за последние часы, проверить etcd и нагрузку на control-plane.
10. kube-controller-manager
10.1. KubeControllerManagerDown
Важность: Критический
Время до срабатывания: 15 мин.
Описание: kube-controller-manager недоступен для мониторинга
Что означает: Prometheus не видит ни одной работающей цели job=kube-controller-manager 15 минут — компонент, отвечающий за большинство контроллеров Kubernetes, не отвечает.
Что делать: Проверить под(ы) kube-controller-manager на control-plane нодах (статус, логи, события).
10.2. PodDisruptionBudgetAtLimit
Важность: Предупреждение
Время до срабатывания: 60 мин.
Описание: PodDisruptionBudget на пределе допустимых нарушений
Что означает: Число healthy-подов под защитой PDB равно минимально допустимому — любое дополнительное добровольное прерывание (drain, апдейт) будет заблокировано.
Что делать: Иметь это в виду перед плановыми операциями (drain нод, rollout) — сначала выяснить, почему часть подов недоступна.
10.3. PodDisruptionBudgetLimit
Важность: Критический
Время до срабатывания: 15 мин.
Описание: PodDisruptionBudget нарушен
Что означает: Число healthy-подов уже меньше минимально требуемого по PDB — нарушение бюджета прерываний, что может блокировать нормальные операции обслуживания кластера.
Что делать: Разобраться, почему поды недоступны (см. смежные оповещения по подам/деплойментам), восстановить нужное число реплик.
10.4. GarbageCollectorSyncFailed
Важность: Предупреждение
Время до срабатывания: 60 мин.
Описание: Ошибки синхронизации в Garbage Collector контроллере
Что означает: Контроллер сборки мусора kube-controller-manager (удаление зависимых объектов) в течение часа сталкивается с ошибками синхронизации доступных ресурсов.
Что делать: Посмотреть логи kube-controller-manager на предмет конкретной ошибки, часто связана с проблемным API/CRD.
11. kube-proxy
11.1. KubeProxyDown
Важность: Критический
Время до срабатывания: 15 мин.
Описание: kube-proxy недоступен для мониторинга
Что означает: Prometheus не видит ни одного работающего kube-proxy 15 минут — сетевые правила (Service/ClusterIP) на затронутых нодах могут не обновляться.
Что делать: Проверить поды/DaemonSet kube-proxy на нодах, их логи и состояние.
12. kube-scheduler
12.1. KubeSchedulerDown
Важность: Критический
Время до срабатывания: 15 мин.
Описание: kube-scheduler недоступен для мониторинга
Что означает: Prometheus не видит ни одного работающего kube-scheduler 15 минут — новые поды могут перестать планироваться на ноды.
Что делать: Проверить под(ы) kube-scheduler на control-plane нодах.
13. kube-state-metrics
13.1. KubeStateMetricsListErrors
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: kube-state-metrics получает ошибки при list-запросах к API
Что означает: Более 1% list-запросов kube-state-metrics к Kubernetes API завершаются ошибкой — часть метрик о состоянии объектов кластера может быть неполной или устаревшей.
Что делать: Проверить права RBAC и доступность kube-apiserver для service account kube-state-metrics, посмотреть логи компонента.
13.2. KubeStateMetricsWatchErrors
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: kube-state-metrics получает ошибки при watch-запросах к API
Что означает: Более 1% watch-запросов kube-state-metrics завершаются ошибкой — метрики о состоянии объектов кластера могут отставать от реальности.
Что делать: Проверить логи kube-state-metrics и доступность API-сервера, возможно требуется перезапуск компонента.
14. Kubernetes: объекты и рабочие нагрузки
14.1. KubePodCrashLooping
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Под постоянно перезапускается (CrashLoopBackOff)
Что означает: Контейнер пода находится в состоянии ожидания с причиной CrashLoopBackOff — он падает вскоре после старта и Kubernetes раз за разом пытается его перезапустить.
Что делать: Посмотреть логи и события пода (kubectl logs --previous, kubectl describe pod), найти причину падения приложения.
14.2. KubePodNotReady
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Под не переходит в состояние Ready больше 15 минут
Что означает: Под (не принадлежащий Job) находится в фазе Pending или Unknown дольше 15 минут — не может запуститься или потерял связь с kubelet.
Что делать: Проверить события планирования (нехватка ресурсов, проблемы с образом, PVC) и состояние ноды, на которую должен попасть под.
14.3. KubeDeploymentGenerationMismatch
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Generation Deployment не совпадает — возможен неудачный rollout
Что означает: observedGeneration контроллера отстаёт от metadata.generation Deployment — последнее изменение не было полностью применено и не откачено автоматически.
Что делать: Проверить статус rollout (kubectl rollout status/history) и события Deployment, при необходимости откатить вручную.
14.4. KubeStatefulSetReplicasMismatch
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: StatefulSet не набирает нужное число готовых реплик
Что означает: Число готовых реплик StatefulSet не совпадает с желаемым дольше 15 минут, и обновление реплик не продвигается.
Что делать: Проверить статус подов StatefulSet по очереди (обновление идёт последовательно) и события/логи проблемного пода.
14.5. KubeStatefulSetGenerationMismatch
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Generation StatefulSet не совпадает — возможен неудачный rollout
Что означает: Аналогично Deployment: изменение StatefulSet применено не полностью и не откачено.
Что делать: Проверить статус и историю rollout StatefulSet, события контроллера.
14.6. KubeStatefulSetUpdateNotRolledOut
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Обновление StatefulSet не выкатилось до конца
Что означает: Ревизия обновления StatefulSet не совпадает с текущей, и число обновлённых реплик не растёт — раскатка зависла.
Что делать: Проверить, на каком поде остановилось обновление, и почему (readiness/liveness, ресурсы, PVC).
14.7. KubeDaemonSetRolloutStuck
Важность: Предупреждение
Время до срабатывания: 30 мин.
Описание: Раскатка DaemonSet зависла
Что означает: DaemonSet минимум 30 минут не может привести число запланированных/обновлённых/доступных подов к желаемому значению на всех нодах.
Что делать: Проверить, на каких нодах не хватает пода DaemonSet и почему (taints, ресурсы, ошибки образа).
14.8. KubeContainerWaiting
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Контейнер больше часа в состоянии Waiting
Что означает: Контейнер пода уже более часа находится в состоянии ожидания (например, ImagePullBackOff, CreateContainerConfigError и т.п.).
Что делать: Посмотреть причину ожидания через kubectl describe pod — чаще всего это проблема с образом, секретом/конфигмапом или ресурсами.
14.9. KubeDaemonSetNotScheduled
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Не все поды DaemonSet запланированы
Что означает: Часть подов DaemonSet, которые должны быть на нодах, ещё не запланированы.
Что делать: Проверить, есть ли на недостающих нодах taints/nodeSelector, блокирующие планирование, и хватает ли ресурсов.
14.10. KubeDaemonSetMisScheduled
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Поды DaemonSet запущены не на тех нодах
Что означает: Есть поды DaemonSet, работающие на нодах, где они не должны находиться (например, после смены nodeSelector/taints).
Что делать: Проверить, почему появилось несоответствие, и дать DaemonSet пересоздать поды на правильных нодах.
14.11. KubeJobNotCompleted
Важность: Предупреждение
Описание: Job выполняется слишком долго (>12 часов)
Что означает: Job запущен и активен уже более 12 часов без завершения — вероятно завис или обрабатывает намного больше данных, чем ожидалось.
Что делать: Проверить логи Job и решить, нужно ли его прервать вручную или дать доработать.
14.12. KubeJobFailed
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Job завершился с ошибкой
Что означает: Job перешёл в состояние failed и не смог успешно завершиться.
Что делать: Посмотреть логи упавших подов Job, после анализа удалить неудачный Job — это снимет оповещение.
14.13. KubeHpaReplicasMismatch
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: HPA не может привести число реплик к целевому
Что означает: Горизонтальный автоскейлер (HPA) дольше 15 минут не может довести текущее число реплик до желаемого (в допустимом диапазоне min/max).
Что делать: Проверить, хватает ли ресурсов кластера для масштабирования и не блокирует ли что-то создание новых подов.
14.14. KubeHpaMaxedOut
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: HPA упёрся в максимум реплик
Что означает: HPA работает на максимально разрешённом числе реплик дольше 15 минут — приложению может не хватать текущего потолка масштабирования.
Что делать: Оценить реальную нагрузку и при необходимости увеличить maxReplicas или оптимизировать приложение.
14.15. KubeCPUOvercommit
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Кластер переподписан по CPU-запросам
Что означает: Суммарные requests по CPU для подов превышают то, что осталось бы доступным при отказе самой мощной ноды — кластер не переживёт потерю одной ноды без деградации.
Что делать: Пересмотреть requests подов или добавить capacity, чтобы сохранить отказоустойчивость на потерю одной ноды.
14.16. KubeMemoryOvercommit
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Кластер переподписан по памяти
Что означает: Аналогично CPU: суммарные requests по памяти превышают доступную ёмкость на случай отказа самой большой ноды.
Что делать: Пересмотреть requests по памяти или добавить capacity.
14.17. KubeCPUQuotaOvercommit
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Суммарные ResourceQuota по CPU в namespace’ах переподписаны (>150%)
Что означает: Сумма жёстких CPU-квот, выданных namespace’ам, превышает реальную ёмкость кластера в 1.5 раза — при одновременной утилизации квот кластеру не хватит CPU.
Что делать: Пересмотреть выданные квоты namespace’ам, привести их в соответствие с реальной ёмкостью кластера.
14.18. KubeMemoryQuotaOvercommit
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Суммарные ResourceQuota по памяти в namespace’ах переподписаны (>150%)
Что означает: Аналогично CPU-квотам, но по памяти.
Что делать: Пересмотреть выданные квоты по памяти для namespace’ов.
14.19. KubeQuotaAlmostFull
Важность: Информационный
Время до срабатывания: 15 мин.
Описание: Квота namespace почти исчерпана
Что означает: Namespace использует более 90% выделенной ему ResourceQuota по какому-то ресурсу.
Что делать: Информационно предупредить владельцев namespace — скоро новые объекты/поды не смогут создаваться из-за квоты.
14.20. KubeQuotaFullyUsed
Важность: Информационный
Время до срабатывания: 15 мин.
Описание: Квота namespace использована полностью
Что означает: Namespace выбрал 100% выделенной ResourceQuota по какому-то ресурсу.
Что делать: Создание новых объектов данного типа/ресурса в namespace будет заблокировано — при необходимости увеличить квоту.
14.21. KubeQuotaExceeded
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Квота namespace превышена
Что означает: Фактическое использование ресурса в namespace превысило заданный hard limit ResourceQuota — редкая ситуация, обычно указывающая на рассинхронизацию учёта.
Что делать: Разобраться в несоответствии факта и квоты, проверить ResourceQuota и реальное потребление в namespace.
14.22. KubePersistentVolumeFillingUp (критический)
Важность: Критический
Время до срабатывания: 1 мин.
Описание: PersistentVolume почти заполнен (критично, <3%)
Что означает: На PVC осталось менее 3% свободного места, и он реально используется — риск немедленного отказа приложения из-за нехватки диска.
Что делать: Срочно расширить том (если StorageClass поддерживает resize) или очистить данные на нём.
14.23. KubePersistentVolumeFillingUp (предупреждение)
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: PersistentVolume скоро заполнится (прогноз на 4 дня)
Что означает: Свободного места на PVC меньше 15%, и по тренду последних 6 часов расчётное время до заполнения — около 4 дней.
Что делать: Заранее спланировать расширение тома или очистку данных, не дожидаясь критического уровня.
14.24. KubePersistentVolumeInodesFillingUp (критический)
Важность: Критический
Время до срабатывания: 1 мин.
Описание: На PersistentVolume заканчиваются inode (критично, <3%)
Что означает: Свободных inode на PVC осталось менее 3% — новые файлы нельзя будет создать, даже если есть свободное место в байтах.
Что делать: Найти источник большого числа мелких файлов на томе и почистить их либо пересоздать том с бОльшим числом inode.
14.25. KubePersistentVolumeInodesFillingUp (предупреждение)
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: На PersistentVolume скоро закончатся inode (прогноз на 4 дня)
Что означает: Свободных inode меньше 15%, и по тренду они закончатся примерно через 4 дня.
Что делать: Заранее разобраться с источником роста числа файлов на томе.
14.26. KubePersistentVolumeErrors
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Проблема с provisioning PersistentVolume
Что означает: PersistentVolume находится в статусе Failed или Pending — том не может быть создан или подключён.
Что делать: Проверить логи storage-провижнера (в этом кластере — Longhorn) и события самого PV/PVC.
14.27. KubeClientErrors
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Клиент Kubernetes API получает много ошибок 5xx
Что означает: Более 1% запросов от некоторого клиента (job/instance) к kube-apiserver завершаются ошибками 5xx на протяжении 15 минут.
Что делать: Определить, какой именно компонент (job/instance) является клиентом, и посмотреть его логи, а также состояние самого apiserver.
14.28. KubeAggregatedAPIErrors
Важность: Предупреждение
Описание: Агрегированный API-сервис сообщает об ошибках
Что означает: Aggregated APIService (расширение kube-apiserver сторонним API, например metrics-server) более 4 раз за 10 минут отмечался как недоступный.
Что делать: Проверить под(ы), реализующие данный APIService, и его логи/доступность.
14.29. KubeAggregatedAPIDown
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Агрегированный API-сервис в основном недоступен
Что означает: Доступность агрегированного APIService за последние 10 минут упала ниже 85%.
Что делать: Проверить состояние бэкенд-сервиса, реализующего этот APIService.
14.30. KubeAPIDown
Важность: Критический
Время до срабатывания: 15 мин.
Описание: kube-apiserver недоступен для мониторинга
Что означает: Prometheus не видит ни одной живой цели сбора метрик apiserver 15 минут — критическая ситуация, при которой Kubernetes API может быть полностью недоступен.
Что делать: Немедленно проверить control-plane ноды и состояние apiserver — это блокирующий инцидент для всего кластера.
14.31. KubeAPITerminatedRequests
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: kube-apiserver принудительно обрывает много запросов
Что означает: Более 20% входящих запросов к apiserver завершаются принудительным обрывом (terminated) — обычно из-за перегрузки и защитных лимитов (APF).
Что делать: Проверить нагрузку на apiserver, какие клиенты создают избыточную нагрузку, и настройки Priority & Fairness.
14.32. KubeNodeNotReady
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Нода не в состоянии Ready
Что означает: Условие Ready ноды равно false/неизвестно дольше 15 минут — kubelet не подтверждает готовность ноды к запуску подов.
Что делать: Проверить kubelet и системные ресурсы (диск/память/PID) на ноде, а также сетевую доступность до control-plane.
14.33. KubeNodeUnreachable
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Нода недостижима
Что означает: На ноду выставлен taint unreachable — control-plane не может с ней связаться, часть workload’ов может быть перепланирована на другие ноды.
Что делать: Проверить сеть и физическое/виртуальное состояние ноды, при необходимости перезапустить её.
14.34. KubeletTooManyPods
Важность: Информационный
Время до срабатывания: 15 мин.
Описание: Kubelet работает почти на пределе по числу подов
Что означает: На ноде запущено более 95% от максимально допустимого числа подов (обычно 110) — скоро новые поды перестанут туда планироваться.
Что делать: Перераспределить нагрузку на другие ноды или добавить ёмкость кластера.
14.35. KubeNodeReadinessFlapping
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Готовность ноды часто переключается (частое переключение)
Что означает: Статус Ready ноды менялся более 2 раз за 15 минут — нестабильность самой ноды или сети до control-plane.
Что делать: Проверить ресурсы и сетевую стабильность ноды, логи kubelet.
14.36. KubeletPlegDurationHigh
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Kubelet PLEG работает медленно
Что означает: 99-й перцентиль времени цикла Pod Lifecycle Event Generator (PLEG) kubelet превышает 10 секунд — признак перегрузки ноды или проблем с container runtime.
Что делать: Проверить нагрузку CPU/IO на ноде и состояние container runtime (containerd/docker).
14.37. KubeletPodStartUpLatencyHigh
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Высокая задержка запуска подов на ноде
Что означает: 99-й перцентиль времени старта пода на ноде превышает 60 секунд — поды долго стартуют (загрузка образов, инициализация runtime и т.п.).
Что делать: Проверить скорость pull образов, нагрузку на ноду и container runtime.
14.38. KubeletClientCertificateRenewalErrors
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Kubelet не может обновить клиентский сертификат
Что означает: Kubelet на ноде получает ошибки при попытке автоматически обновить свой клиентский TLS-сертификат для связи с apiserver.
Что делать: Проверить логи kubelet и состояние CSR/сертификатов на ноде, при истечении сертификата нода отвалится от кластера. Требуется запланировать обновление сертификатов.
14.39. KubeletServerCertificateRenewalErrors
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Kubelet не может обновить серверный сертификат
Что означает: То же самое, но для серверного TLS-сертификата kubelet (используется apiserver для обращения к kubelet).
Что делать: Проверить сертификаты и логи kubelet, при необходимости вмешаться в процесс ротации вручную. Требуется запланировать обновление сертификатов.
14.40. KubeletDown
Важность: Критический
Время до срабатывания: 15 мин.
Описание: Kubelet недоступен для мониторинга
Что означает: Prometheus не видит ни одной работающей цели сбора метрик kubelet 15 минут — на затронутых нодах может быть полностью нарушена работа подов.
Что делать: Проверить состояние соответствующих нод и процесс kubelet на них.
15. MinIO (объектное хранилище)
15.1. MinioNodesOffline
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Нода(ы) MinIO офлайн
Что означает: В кластере MinIO больше 5 минут зафиксированы оффлайн-ноды — снижается отказоустойчивость объектного хранилища.
Что делать: Проверить состояние подов MinIO и нод, на которых они запущены.
15.2. MinioDisksOffline
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Диск(и) MinIO офлайн
Что означает: В кластере MinIO больше 5 минут зафиксированы оффлайн-диски — часть erasure-set хранилища деградировала.
Что делать: Проверить состояние конкретных дисков/PV, используемых MinIO, заменить неисправные.
15.3. HighMinioRequests
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Высокое число запросов к MinIO
Что означает: Счётчик S3-запросов к MinIO превысил 100000 (заданный абсолютный порог, накопительный счётчик, а не скорость в секунду).
Что делать: Оценить, ожидаемый ли это рост нагрузки или аномальный клиент, при необходимости масштабировать MinIO.
15.4. HighMinioObjects
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Слишком много объектов в бакете MinIO
Что означает: Число объектов в бакете превысило 100 000 000 — большие бакеты могут замедлять листинг и обслуживание.
Что делать: Продумать партиционирование данных по нескольким бакетам или политику ретенции/удаления старых объектов.
15.5. HighMinioMemoryUsage
Важность: Критический
Время до срабатывания: 5 мин.
Описание: Высокое использование памяти MinIO
Что означает: Использование памяти на ноде MinIO превысило 80%.
Что делать: Проверить нагрузку на MinIO (число одновременных запросов, размер объектов) и ресурсы, выделенные подам.
15.6. High Minio CPU Usage
Важность: Критический
Время до срабатывания: 5 мин.
Описание: Высокое использование CPU MinIO
Что означает: Загрузка CPU на ноде MinIO превысила 80% (100% минус средняя idle-загрузка).
Что делать: Проверить интенсивность запросов к MinIO и при необходимости добавить ресурсы/масштабировать кластер.
15.7. HighMinioDiskUsage
Важность: Критический
Время до срабатывания: 10 мин.
Описание: Мало свободного места на диске MinIO
Что означает: На ноде MinIO осталось менее 100 МБ свободного места на диске — риск отказа записи новых объектов.
Что делать: Срочно освободить место или расширить хранилище MinIO.
16. Узлы кластера (node-exporter)
16.1. NodeFilesystemSpaceFillingUp (предупреждение)
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Файловая система заполнится в течение суток (предупреждение)
Что означает: Свободного места на файловой системе меньше 15%, и по тренду последних 6 часов прогнозируется полное заполнение в течение 24 часов.
Что делать: Заранее почистить/расширить диск на указанной ноде и устройстве.
16.2. NodeFilesystemSpaceFillingUp (критический)
Важность: Критический
Время до срабатывания: 1 ч.
Описание: Файловая система заполнится в течение 4 часов (критично)
Что означает: Свободного места меньше 10%, и по тренду прогнозируется заполнение уже в течение 4 часов — требует быстрой реакции.
Что делать: Срочно освободить место или расширить диск, иначе приложения на ноде начнут падать из-за нехватки места.
16.3. NodeFilesystemAlmostOutOfSpace (предупреждение)
Важность: Предупреждение
Время до срабатывания: 30 мин.
Описание: На файловой системе осталось меньше 5% места
Что означает: Свободного места на файловой системе меньше 5% прямо сейчас (без прогноза, по факту).
Что делать: Освободить место немедленно — очистить логи/временные файлы, расширить диск.
16.4. NodeFilesystemAlmostOutOfSpace (критический)
Важность: Критический
Время до срабатывания: 30 мин.
Описание: На файловой системе осталось меньше 3% места (критично)
Что означает: Критически мало свободного места — меньше 3%, риск отказа записи данных на ноде.
Что делать: Срочно освободить место или расширить диск.
16.5. NodeFilesystemFilesFillingUp (предупреждение)
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Закончатся inode в течение суток (предупреждение)
Что означает: Свободных inode меньше 40%, и по тренду прогнозируется их исчерпание в течение 24 часов.
Что делать: Найти источник большого числа мелких файлов на файловой системе и почистить его заранее.
16.6. NodeFilesystemFilesFillingUp (критический)
Важность: Критический
Время до срабатывания: 1 ч.
Описание: Закончатся inode в течение 4 часов (критично)
Что означает: Свободных inode меньше 20%, и по тренду они закончатся уже в течение 4 часов.
Что делать: Срочно почистить лишние файлы либо перенести данные на файловую систему с большим числом inode.
16.7. NodeFilesystemAlmostOutOfFiles (предупреждение)
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Осталось меньше 5% свободных inode
Что означает: Свободных inode на файловой системе меньше 5% прямо сейчас.
Что делать: Найти и удалить массу мелких файлов (часто — логи, временные файлы, кэши).
16.8. NodeFilesystemAlmostOutOfFiles (критический)
Важность: Критический
Время до срабатывания: 1 ч.
Описание: Осталось меньше 3% свободных inode (критично)
Что означает: Критически мало свободных inode — меньше 3%, новые файлы скоро нельзя будет создать даже при наличии места в байтах.
Что делать: Срочно почистить файлы или пересоздать файловую систему с большим числом inode.
16.9. NodeNetworkReceiveErrs
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Много ошибок приёма на сетевом интерфейсе
Что означает: Более 1% принимаемых пакетов на сетевом интерфейсе ноды завершаются ошибками на протяжении часа — признак проблем с кабелем/портом/драйвером.
Что делать: Проверить физическое подключение, статистику ошибок на коммутаторе и драйвер сетевой карты.
16.10. NodeNetworkTransmitErrs
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Много ошибок передачи на сетевом интерфейсе
Что означает: Более 1% отправляемых пакетов завершаются ошибками на протяжении часа.
Что делать: Аналогично приёму — проверить физический линк и драйвер сетевой карты.
16.11. NodeHighNumberConntrackEntriesUsed
Важность: Предупреждение
Описание: Таблица conntrack близка к лимиту
Что означает: Число используемых записей conntrack превысило 75% от лимита ядра — при достижении 100% новые соединения начнут отбрасываться.
Что делать: Увеличить nf_conntrack_max на ноде или разобраться, что создаёт аномально много соединений.
16.12. NodeTextFileCollectorScrapeError
Важность: Предупреждение
Описание: Ошибка чтения текстовых файлов метрик node-exporter
Что означает: node-exporter не смог прочитать один из .prom файлов textfile-коллектора (кастомные метрики с ноды).
Что делать: Проверить формат и права доступа к файлам в каталоге textfile-коллектора на ноде.
16.13. NodeClockSkewDetected
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Обнаружено расхождение часов (clock skew)
Что означает: Смещение системных часов ноды относительно эталона больше 50 мс и продолжает расти в ту же сторону — может ломать TLS, распределённые блокировки и логику, чувствительную ко времени.
Что делать: Проверить работу NTP/chrony на ноде и доступность источников времени.
16.14. NodeClockNotSynchronising
Важность: Критический
Время до срабатывания: 10 мин.
Описание: Часы ноды не синхронизируются
Что означает: Часы ноды не синхронизированы с NTP, и оценка максимальной погрешности превышает 16 секунд.
Что делать: Проверить конфигурацию и доступность NTP-сервиса на ноде — вероятно, служба синхронизации времени не работает.
16.15. NodeRAIDDegraded
Важность: Критический
Время до срабатывания: 15 мин.
Описание: RAID-массив деградировал
Что означает: В программном RAID (mdadm) не хватает активных дисков относительно требуемого числа, и свободных spare-дисков недостаточно, чтобы восстановиться автоматически.
Что делать: Срочно заменить отказавший(е) диск(и) в массиве вручную.
16.16. NodeRAIDDiskFailure
Важность: Предупреждение
Описание: Диск в RAID-массиве отказал
Что означает: Хотя бы один диск в программном RAID-массиве помечен как failed.
Что делать: Запланировать замену диска в массиве, проверить состояние остальных дисков.
16.17. NodeFileDescriptorLimit (предупреждение)
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Использование file descriptor приближается к лимиту (предупреждение)
Что означает: Число выделенных файловых дескрипторов на ноде превысило 70% от максимума ядра.
Что делать: Проверить, какие процессы держат много открытых файлов/сокетов, при необходимости увеличить лимит ядра.
16.18. NodeFileDescriptorLimit (критический)
Важность: Критический
Время до срабатывания: 15 мин.
Описание: Использование file descriptor почти достигло лимита (критично)
Что означает: Число используемых файловых дескрипторов превысило 90% от максимума — риск отказа операций open()/socket() на ноде.
Что делать: Срочно найти процесс, утекающий дескрипторы, или увеличить лимит fs.file-max.
17. Сеть узлов
17.1. NodeNetworkInterfaceFlapping (группа node-network)
Важность: Предупреждение
Время до срабатывания: 2 мин.
Описание: Сетевой интерфейс ноды часто меняет статус (частое переключение, дублирующее правило)
Что означает: То же самое условие, что и в первом вхождении этого оповещения — интерфейс более 2 раз за 2 минуты меняет состояние up/down; правило продублировано в отдельной группе node-network.
Что делать: См. пояснение к первому вхождению — проверить физическое подключение, кабель/порт и драйвер сетевой карты.
18. Pod Security
18.1. PodSecurityViolation
Важность: Информационный
Описание: Есть нарушения политики Pod Security (аудит)
Что означает: За сутки зафиксированы workload’ы, не соответствующие профилю Pod Security Admission (privileged/baseline/restricted), настроенному в кластере или namespace — пока только в режиме audit, без блокировки.
Что делать: Посмотреть, какие именно поды нарушают политику, и привести их спецификацию в соответствие или скорректировать профиль namespace.
19. PostgreSQL
19.1. PostgresInstanceDown
Важность: Критический
Время до срабатывания: 1 мин.
Описание: Экземпляр PostgreSQL недоступен
Что означает: postgres-exporter минуту не может подключиться к PostgreSQL (pg_up=0) — сервер базы данных не отвечает.
Что делать: Проверить под/процесс PostgreSQL, его логи и состояние ноды/диска, на которых он развёрнут — это критично для всех зависящих сервисов.
19.2. PostgresExporterErrors
Важность: Критический
Время до срабатывания: 10 мин.
Описание: postgres-exporter не работает или выдаёт ошибки
Что означает: Экспортер метрик PostgreSQL сам не может собрать данные — либо он упал, либо не может подключиться к базе.
Что делать: Проверить логи и статус пода postgres-exporter, а также доступность PostgreSQL для него.
19.3. PostgresReplicationLagSizeTooLarge
Важность: Критический
Время до срабатывания: 5 мин.
Описание: Слишком большое отставание репликации PostgreSQL
Что означает: Реплика отстаёт от лидера более чем на 1 ГБ несинхронизированных данных — при failover это грозит существенной потерей данных.
Что делать: Проверить сеть и нагрузку между primary и репликой, а также I/O на реплике.
19.4. PostgresTooManyDeadTuples
Важность: Предупреждение
Время до срабатывания: 30 мин.
Описание: Слишком много мёртвых строк (dead tuples) в таблице
Что означает: Доля «мёртвых» (удалённых/обновлённых, но ещё не вычищенных) строк в таблице превысила 5% при абсолютном числе больше 1 млн — autovacuum не успевает за нагрузкой.
Что делать: Проверить настройки autovacuum для этой таблицы/базы и при необходимости запустить VACUUM вручную.
19.5. PostgresInactiveReplicationSlots
Важность: Предупреждение
Время до срабатывания: 30 мин.
Описание: Есть неактивные replication slots
Что означает: В PostgreSQL есть replication slot, к которому давно никто не подключается — WAL-файлы для него будут копиться на диске бесконечно.
Что делать: Определить, какой slot неактивен и почему (потерянный consumer), удалить его, если он больше не нужен — иначе диск переполнится.
19.6. PostgresSplitBrain
Важность: Критический
Время до срабатывания: 1 мин.
Описание: Split brain: несколько PostgreSQL в режиме read-write одновременно
Что означает: В одном кластере PostgreSQL обнаружено больше одного экземпляра в режиме primary (read-write) одновременно — крайне опасная ситуация, ведущая к расхождению данных.
Что делать: Немедленно вмешаться вручную: определить настоящий primary и перевести лишние экземпляры в read-only/реплику, во избежание рассинхронизации данных.
19.7. PostgresTooManyConnections
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Слишком много подключений к PostgreSQL
Что означает: Число активных подключений к базе превысило 90% от max_connections — новые подключения могут начать отклоняться.
Что делать: Проверить источник большого числа соединений (пул приложения, отсутствие pgbouncer), при необходимости увеличить лимит или включить пулинг.
19.8. PostgresPromotedNode
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Реплика PostgreSQL стала primary (failover)
Что означает: Standby-сервер был промоутирован в primary — произошёл автоматический или ручной failover кластера PostgreSQL.
Что делать: Убедиться, что failover прошёл штатно, проверить состояние остальных реплик и причину, по которой произошла смена лидера.
19.9. PgBouncerWaitingClients
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: У PgBouncer есть ожидающие клиенты
Что означает: Есть клиентские подключения, ожидающие свободного соединения к базе через PgBouncer — пул соединений исчерпан или медленно освобождается.
Что делать: Проверить размер пула PgBouncer и долгие/висящие запросы к базе.
19.10. PgBouncerNotEnoughConnections
Важность: Критический
Время до срабатывания: 10 мин.
Описание: Пулу PgBouncer не хватает размера под текущую нагрузку
Что означает: Число активных + ожидающих клиентских соединений превышает настроенный pool_size базы данных.
Что делать: Увеличить pool_size для базы в конфигурации PgBouncer либо снизить число параллельных подключений со стороны приложения.
19.11. PgBouncerPoolFillingUp
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Пул PgBouncer почти заполнен
Что означает: В пуле PgBouncer осталось 15 или меньше свободных соединений до лимита pool_size.
Что делать: Заранее проверить рост нагрузки на базу и спланировать увеличение пула, пока не начались отказы новым клиентам.
19.12. PgBouncerAvgWaitTimeTooHigh
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Клиенты PgBouncer долго ждут соединение
Что означает: Среднее время ожидания клиентом свободного соединения через PgBouncer превышает 1 секунду.
Что делать: Проверить размер пула и скорость выполнения запросов к базе — возможно, база сама стала узким местом.
19.13. PgBouncerQueryTimeTooHigh
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Запросы через PgBouncer выполняются слишком долго
Что означает: Средняя длительность запроса, проходящего через PgBouncer, превышает 5 секунд.
Что делать: Найти медленные запросы (pg_stat_statements) и оптимизировать их или добавить индексы.
19.14. DatabaseLowDiskAvailable
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Мало места на диске под PostgreSQL
Что означает: Диск с данными PostgreSQL (/var/lib/postgresql) занят на 80% и больше — меньше 20% свободного места.
Что делать: Освободить место (старые WAL/бэкапы) или расширить диск под базу данных, пока запись не остановилась.
20. Prometheus: служебные правила
20.1. MultipleDefaultStorageClasses
Важность: Критический
Время до срабатывания: 10 мин.
Описание: В кластере несколько StorageClass помечены как default
Что означает: Обнаружено более одного StorageClass с аннотацией default одновременно — поведение при автоматическом выборе класса для PVC без явного storageClassName становится непредсказуемым.
Что делать: Оставить default только у одного StorageClass, убрать аннотацию у остальных.
21. Prometheus (самомониторинг)
21.1. PrometheusBadConfig
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Prometheus не может перезагрузить конфигурацию
Что означает: Последняя попытка reload конфигурации Prometheus завершилась ошибкой (например, синтаксическая ошибка в правилах или scrape-конфиге) — Prometheus продолжает работать со старой конфигурацией.
Что делать: Посмотреть логи Prometheus на конкретную ошибку валидации конфигурации/правил.
21.2. PrometheusNotificationQueueRunningFull
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Очередь уведомлений Prometheus скоро переполнится
Что означает: По прогнозу на ближайшие 30 минут очередь отправки оповещений в Alertmanager заполнится полностью — новые оповещения могут начать теряться.
Что делать: Проверить доступность и скорость обработки со стороны Alertmanager, возможно он перегружен или недоступен.
21.3. PrometheusErrorSendingAlertsToSomeAlertmanagers
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Prometheus не может отправить часть оповещений в Alertmanager
Что означает: Более 1% попыток отправки оповещений в конкретный экземпляр Alertmanager завершаются ошибкой.
Что делать: Проверить доступность и состояние соответствующего instance Alertmanager, сеть до него.
21.4. PrometheusNotConnectedToAlertmanagers
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Prometheus не подключён ни к одному Alertmanager
Что означает: Prometheus не видит ни одного живого Alertmanager через service discovery — сработавшие оповещения никуда не отправляются.
Что делать: Проверить доступность Alertmanager и корректность конфигурации оповещений в Prometheus.
21.5. PrometheusTSDBReloadsFailing
Важность: Предупреждение
Время до срабатывания: 4 ч.
Описание: Ошибки перезагрузки блоков TSDB Prometheus
Что означает: За последние 3 часа были неудачные попытки Prometheus перечитать блоки данных с диска.
Что делать: Проверить логи Prometheus и состояние диска, на котором хранится TSDB.
21.6. PrometheusTSDBCompactionsFailing
Важность: Предупреждение
Время до срабатывания: 4 ч.
Описание: Ошибки компакции блоков TSDB Prometheus
Что означает: За последние 3 часа зафиксированы неудачные попытки компактации блоков хранилища временных рядов.
Что делать: Проверить логи Prometheus и свободное место/производительность диска под TSDB.
21.7. PrometheusNotIngestingSamples
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Prometheus не записывает новые метрики
Что означает: Prometheus перестал добавлять новые сэмплы в TSDB, хотя у него есть активные цели или правила — по сути мониторинг перестал видеть метрики.
Что делать: Проверить логи Prometheus и его ресурсы (память/диск), возможно требуется перезапуск.
21.8. PrometheusDuplicateTimestamps
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Prometheus отбрасывает сэмплы с дублирующимися таймстемпами
Что означает: Prometheus получает от какой-то цели несколько разных значений с одинаковым timestamp и вынужден их отбрасывать.
Что делать: Проверить экспортёр/приложение, которое отдаёт метрики с некорректными/повторяющимися таймстемпами.
21.9. PrometheusOutOfOrderTimestamps
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Prometheus отбрасывает сэмплы с таймстемпами не по порядку
Что означает: От какой-то цели приходят сэмплы с таймстемпами раньше уже записанных — они отбрасываются.
Что делать: Проверить время (NTP) и логику экспортёра, отдающего такие метрики.
21.10. PrometheusRemoteStorageFailures
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Ошибки отправки в remote storage
Что означает: Более 1% сэмплов не удаётся отправить во внешнее remote_write хранилище.
Что делать: Проверить доступность и производительность удалённого хранилища, логи Prometheus по конкретному remote_name/url.
21.11. PrometheusRemoteWriteBehind
Важность: Информационный
Время до срабатывания: 15 мин.
Описание: Remote write отстаёт от реального времени
Что означает: Очередь remote_write отстаёт от текущего времени больше чем на 120 секунд — удалённое хранилище не успевает получать свежие данные.
Что делать: Проверить пропускную способность и нагрузку на remote storage endpoint.
21.12. PrometheusRemoteWriteDesiredShards
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Remote write упирается в лимит шардов очереди
Что означает: Расчётное желаемое число шардов очереди remote_write превышает настроенный максимум — отправка данных не успевает за их поступлением.
Что делать: Увеличить max_shards в конфигурации remote_write либо разобраться, почему приёмник данных работает медленно.
21.13. PrometheusRuleFailures
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: У Prometheus не выполняются некоторые правила
Что означает: За последние 5 минут были ошибки при вычислении правил оповещения и recording-правил.
Что делать: Посмотреть логи Prometheus, найти правило с ошибкой (часто — деление на ноль или отсутствующие метрики).
21.14. PrometheusMissingRuleEvaluations
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Prometheus пропускает итерации вычисления правил
Что означает: Группа правил не успевает выполниться за отведённый интервал evaluation_interval и пропускает итерации.
Что делать: Увеличить interval группы правил или упростить/распараллелить тяжёлые запросы в ней.
21.15. PrometheusTargetLimitHit
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Достигнут лимит числа целей scrape
Что означает: Часть целей была отброшена, потому что превышен настроенный target_limit для job.
Что делать: Увеличить target_limit в scrape-конфиге или разбить job на несколько с более узким scope.
21.16. PrometheusLabelLimitHit
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Достигнут лимит по количеству/длине лейблов
Что означает: Часть целей отброшена из-за превышения label_limit, label_name_length_limit или label_value_length_limit.
Что делать: Проверить экспортёр, отдающий метрики с избыточным числом или длиной лейблов, либо увеличить лимиты.
21.17. PrometheusScrapeBodySizeLimitHit
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Достигнут лимит размера тела ответа при scrape
Что означает: Часть scrape-запросов провалилась, так как ответ цели превысил body_size_limit.
Что делать: Увеличить body_size_limit или сократить объём отдаваемых целью метрик.
21.18. PrometheusScrapeSampleLimitHit
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Достигнут лимит числа сэмплов при scrape
Что означает: Часть scrape-запросов провалилась из-за превышения sample_limit — цель отдаёт слишком много временных рядов за раз.
Что делать: Увеличить sample_limit или уменьшить кардинальность метрик у цели.
21.19. PrometheusTargetSyncFailure
Важность: Критический
Время до срабатывания: 5 мин.
Описание: Prometheus не может синхронизировать цели
Что означает: Из-за некорректной конфигурации Prometheus не смог синхронизировать список целей для сбора метрик.
Что делать: Проверить последние изменения scrape-конфигурации/ServiceMonitor на синтаксические или семантические ошибки.
22. Thanos Sidecar
22.1. ThanosSidecarBucketOperationsFailed
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Ошибки операций Thanos Sidecar с объектным хранилищем
Что означает: Thanos Sidecar, который выгружает блоки Prometheus в объектное хранилище, час получает ошибки операций с бакетом.
Что делать: Проверить доступность и права доступа к объектному хранилищу (MinIO/S3), используемому Thanos.
22.2. ThanosSidecarNoConnectionToStartedPrometheus
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Thanos Sidecar не может установить соединение с Prometheus
Что означает: Thanos Sidecar не видит запущенный и готовый к работе (WAL replay завершён) Prometheus рядом с собой.
Что делать: Проверить сетевое взаимодействие между контейнерами Prometheus и Thanos Sidecar в одном поде.
23. Prometheus Operator
23.1. PrometheusOperatorListErrors
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Prometheus Operator получает много ошибок list-операций
Что означает: Более 40% list-запросов контроллера Prometheus Operator к API Kubernetes завершаются ошибкой.
Что делать: Проверить RBAC-права и доступность kube-apiserver для Prometheus Operator.
23.2. PrometheusOperatorWatchErrors
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Prometheus Operator получает много ошибок watch-операций
Что означает: Более 40% watch-запросов контроллера завершаются ошибкой — оператор может не видеть изменения CRD (ServiceMonitor, PrometheusRule и т.п.) вовремя.
Что делать: Проверить RBAC и доступность API-сервера для Prometheus Operator.
23.3. PrometheusOperatorSyncFailed
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Reconciliation Prometheus Operator завершился ошибкой
Что означает: Последний цикл синхронизации ресурсов одним из контроллеров Prometheus Operator завершился неудачей.
Что делать: Посмотреть логи prometheus-operator на конкретную ошибку по контроллеру.
23.4. PrometheusOperatorReconcileErrors
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Много ошибок reconciliation у Prometheus Operator
Что означает: Более 10% операций reconciliation контроллера завершаются ошибками.
Что делать: Проверить логи оператора и валидность связанных CRD (Prometheus, Alertmanager, PrometheusRule и т.д.).
23.5. PrometheusOperatorNodeLookupErrors
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Ошибки поиска адресов нод у Prometheus Operator
Что означает: Оператор не может разрешить адреса нод при формировании конфигурации.
Что делать: Проверить DNS/сетевую связность оператора до API Kubernetes и до самих нод.
23.6. PrometheusOperatorNotReady
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Prometheus Operator не готов
Что означает: Контроллер Prometheus Operator сообщает, что не готов обрабатывать соответствующие ресурсы.
Что делать: Проверить статус и логи пода prometheus-operator.
23.7. PrometheusOperatorRejectedResources
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Prometheus Operator отклонил ресурсы
Что означает: Оператор отклонил часть управляемых им ресурсов (например, некорректные ServiceMonitor/PrometheusRule).
Что делать: Посмотреть события/логи оператора, найти конкретный отклонённый ресурс и исправить его определение.
23.8. ConfigReloaderSidecarErrors (Prometheus Operator)
Важность: Предупреждение
Время до срабатывания: 10 мин.
Описание: Вспомогательный контейнер config-reloader не может применить конфигурацию (Prometheus Operator)
Что означает: То же самое, что и оповещение выше, но правило продублировано в группе Prometheus Operator.
Что делать: См. пояснение к первому вхождению этого оповещения — посмотреть логи config-reloader и связанный ConfigMap/Secret.
24. StarVault
24.1. StarVault Sealed
Важность: Критический
Время до срабатывания: 0 мин.
Описание: StarVault запечатан (sealed)
Что означает: Instance StarVault (StarVault) находится в состоянии sealed — не может расшифровывать секреты и обслуживать запросы, пока не будет распечатан (unseal).
Что делать: Выполнить процедуру unseal (unseal keys/авто-unseal), это критично для всех сервисов, зависящих от секретов StarVault.
24.2. StarVaultTooManyInfinityTokens
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: Слишком много StarVault-токенов без срока действия
Что означает: В StarVault больше 3 токенов с бессрочным TTL (+Inf) — потенциальный риск безопасности, если такой токен утечёт.
Что делать: Проверить, кем и зачем выданы бессрочные токены, отозвать неоправданные и настроить политику TTL.
24.3. StarVaultClusterHealth
Важность: Критический
Время до срабатывания: 0 мин.
Описание: Кластер StarVault нездоров
Что означает: Доля активных (healthy) узлов StarVault упала до 50% или ниже от общего числа узлов кластера.
Что делать: Проверить состояние узлов StarVault и кворум storage backend (Raft/Consul).
25. Thanos Querier
25.1. ThanosQueryHttpRequestQueryErrorRateHigh
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Thanos Query отдаёт много ошибок на /query
Что означает: Более 5% HTTP-запросов на endpoint query у Thanos Querier завершаются ошибкой 5xx.
Что делать: Проверить логи Thanos Querier и доступность store-компонентов (Prometheus/Thanos Store), к которым он обращается.
25.2. ThanosQueryHttpRequestQueryRangeErrorRateHigh
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Thanos Query отдаёт много ошибок на /query_range
Что означает: То же самое, но для endpoint query_range (запросы диапазонов, обычно используются графиками).
Что делать: Аналогично — проверить логи и состояние store-компонентов Thanos.
25.3. ThanosQueryGrpcServerErrorRate
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Высокая доля ошибок gRPC-сервера Thanos Query
Что означает: Более 5% входящих gRPC-запросов к Thanos Querier завершаются ошибкой.
Что делать: Проверить логи Thanos Querier и нагрузку на него.
25.4. ThanosQueryGrpcClientErrorRate
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Высокая доля ошибок gRPC-клиента Thanos Query
Что означает: Более 5% исходящих gRPC-запросов от Thanos Querier к store-узлам завершаются ошибкой.
Что делать: Проверить доступность и состояние store-узлов (Prometheus Sidecar, Thanos Store Gateway), к которым обращается Querier.
25.5. ThanosQueryHighDNSFailures
Важность: Предупреждение
Время до срабатывания: 1 ч.
Описание: Много ошибок разрешения DNS-имён у Thanos Query
Что означает: Более 1% попыток разрешить адреса store-эндпоинтов через DNS завершаются ошибкой.
Что делать: Проверить DNS-сервис в кластере (CoreDNS) и корректность адресов store-эндпоинтов в конфигурации Thanos Query.
26. Сертификаты x509
26.1. X509ExporterReadErrors
Важность: Предупреждение
Время до срабатывания: 5 мин.
Описание: x509-certificate-exporter не может прочитать часть сертификатов
Что означает: За 15 минут экспортёр столкнулся с ошибками чтения файлов сертификатов или запросов к Kubernetes API.
Что делать: Проверить логи экспортёра; если ошибка появилась сразу при старте — возможно, это временно и связано с инициализацией.
26.2. CertificateError
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Сертификат не удаётся декодировать
Что означает: Найден сертификат (в Secret или на файловой системе ноды), который не получается распарсить как валидный x509-сертификат.
Что делать: Проверить указанный Secret/файл — сертификат повреждён или в неверном формате.
26.3. CertificateRenewal
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Сертификат стоит обновить (менее 28 дней до истечения)
Что означает: До истечения срока действия сертификата осталось меньше 28 дней — это раннее предупреждение.
Что делать: Запланировать продление/перевыпуск сертификата в обычном режиме. Требуется запланировать обновление сертификатов.
26.4. CertificateExpiration14days
Важность: Предупреждение
Время до срабатывания: 15 мин.
Описание: Сертификат истекает менее чем через 14 дней
Что означает: Срок действия сертификата истекает менее чем через 14 дней.
Что делать: Продлить/перевыпустить сертификат в ближайшее время, не откладывая надолго. Требуется запланировать обновление сертификатов.
26.5. CertificateExpiration7days
Важность: Критический
Время до срабатывания: 15 мин.
Описание: Сертификат истекает менее чем через 7 дней (критично)
Что означает: До истечения сертификата осталось меньше недели — риск отказа TLS-соединений становится реальным.
Что делать: Срочно продлить/перевыпустить сертификат, проверить работу cert-manager/автообновления, если он должен был сделать это сам. Требуется запланировать обновление сертификатов.
26.6. CertificateExpiration3days
Важность: Критический
Время до срабатывания: 15 мин.
Описание: Сертификат истекает менее чем через 3 дня (критично)
Что означает: До истечения сертификата осталось меньше 3 дней.
Что делать: Немедленно продлить/перевыпустить сертификат — вручную, если автоматизация не сработала. Требуется запланировать обновление сертификатов.
26.7. CertificateExpiration1day
Важность: Критический
Время до срабатывания: 15 мин.
Описание: Сертификат истекает менее чем через 1 день (критично)
Что означает: До истечения сертификата остаются часы — сервисы, использующие его, вот-вот начнут получать ошибки TLS.
Что делать: Экстренно перевыпустить/заменить сертификат прямо сейчас. Требуется запланировать обновление сертификатов.
27. OperatorHub
27.1. CsvAbnormalFailedOver2Min
Важность: Предупреждение
Время до срабатывания: 2 мин.
Описание: Установка оператора (OLM CSV) провалилась
Что означает: ClusterServiceVersion (описание версии оператора в OLM) находится в статусе Failed дольше 2 минут.
Что делать: Посмотреть события/описание CSV (reason из label) и логи OLM-каталога, из которого ставился оператор.
27.2. CsvAbnormalOver30Min
Важность: Предупреждение
Время до срабатывания: 30 мин.
Описание: Установка/обновление оператора (OLM CSV) зависло
Что означает: CSV дольше 30 минут находится в переходном/нештатном статусе (Replacing, Pending, Deleting, Unknown) — установка или обновление оператора застряло.
Что делать: Проверить статус и события CSV/Subscription/InstallPlan этого оператора в namespace nova-operatorhub.
27.3. InstallPlanStepAppliedWithWarnings
Важность: Предупреждение
Описание: OLM применил шаг установки с предупреждениями
Что означает: При установке или обновлении оператора через OLM API-сервер вернул предупреждение на одном из шагов InstallPlan.
Что делать: Посмотреть событие AppliedWithWarnings и связанный InstallPlan, чтобы понять, что именно вызвало предупреждение.