Для улучшения работы сайта мы используем файлы cookies. Оставаясь на сайте, вы соглашаетесь с политикой обработки персональных данных.

Справочник событий

Справочник оповещений кластера Nova Container Platform. Для каждого оповещения указаны уровень важности, время до срабатывания (параметр for), краткое описание, а также разделы «Что означает» и «Что делать».

О том, как устроена система оповещений и как разбирать сработавшие события, см. Работа с событиями.

1. Longhorn (распределённое хранилище)

1.1. LonghornVolumeActualSpaceUsedWarning

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Том Longhorn заполнен более чем на 90%

Что означает: Реально занятое место на томе хранилища Longhorn превышает 90% от его ёмкости дольше 5 минут.

Что делать: Проверить, что расходует место на томе, расширить том или почистить данные, пока не начались проблемы с записью.

1.2. LonghornVolumeStatusCritical

Важность: Критический

Время до срабатывания: 5 мин.

Описание: Том Longhorn в состоянии Fault (авария)

Что означает: Реплики тома Longhorn отказали, и том перешёл в состояние Fault — данные тома недоступны для нормальной работы.

Что делать: Срочно проверить состояние реплик и ноды хранилища через Longhorn UI/CRD, восстановить или пересоздать реплики.

1.3. LonghornVolumeStatusWarning

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Том Longhorn деградировал

Что означает: У тома Longhorn не хватает здоровых реплик (обычно после падения ноды или диска), он работает в деградированном режиме.

Что делать: Проверить ноды/диски, на которых должны быть реплики, дождаться пересборки реплик или вмешаться вручную.

1.4. LonghornNodeStorageWarning

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Хранилище на ноде Longhorn заполнено более чем на 70%

Что означает: Суммарное использование дискового пространства, выделенного под Longhorn на конкретной ноде, превысило 70%.

Что делать: Спланировать расширение хранилища на ноде или перебалансировку томов, пока не дошло до критического уровня.

1.5. LonghornDiskStorageWarning

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Диск, подключённый к Longhorn, заполнен более чем на 70%

Что означает: Конкретный диск, зарегистрированный в Longhorn на ноде, использован более чем на 70% ёмкости.

Что делать: Проверить конкретный диск на ноде, освободить место или добавить ёмкость.

1.6. LonghornNodeDown

Важность: Критический

Время до срабатывания: 5 мин.

Описание: Нода(ы) Longhorn offline

Что означает: Одна или несколько нод кластера хранения Longhorn считаются оффлайн дольше 5 минут — это влияет на доступность реплик томов.

Что делать: Проверить состояние соответствующих Kubernetes-нод и longhorn-manager на них, разобраться, почему нода выпала.

1.7. LonghornInstanceManagerCPUUsageWarning

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Instance Manager Longhorn превышает CPU-запрос более чем на 300%

Что означает: Процесс instance-manager (обслуживает реплики/engine томов) использует CPU в 3+ раза больше заданного request — возможна нехватка ресурсов ноды.

Что делать: Проверить нагрузку по вводу-выводу на томах этой ноды и при необходимости увеличить лимиты/requests или разгрузить ноду.

1.8. LonghornNodeCPUUsageWarning

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Высокая загрузка CPU на ноде Longhorn

Что означает: CPU ноды, задействованной под Longhorn, загружен более чем на 90% от общей ёмкости дольше 5 минут.

Что делать: Проверить общую загрузку ноды (не только Longhorn) и при необходимости перераспределить нагрузку.

2. Аудит Kubernetes

2.1. AuditLogError

Важность: Предупреждение

Время до срабатывания: 1 мин.

Описание: Ошибка записи audit-лога на kube-apiserver

Что означает: kube-apiserver не может записать часть событий аудита — либо кончается место на диске, либо кто-то вмешивается в audit-логи.

Что делать: Проверить свободное место на ноде control-plane и целостность audit-логов; при подозрении на постороннее вмешательство эскалировать как инцидент безопасности.

3. Мониторинг кластера (общее состояние)

3.1. TargetDown

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Больше 10% целей мониторинга недоступны

Что означает: Более 10% целей сбора метрик Prometheus (job/service) в namespace недоступны дольше 15 минут — вероятны проблемы сети, упавшие ноды или сбои компонентов.

Что делать: Проверить состояние подов/нод соответствующего job и сетевую связность до них.

3.2. ClusterMonitoringOperatorReconciliationErrors

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Оператор мониторинга кластера не может применить конфигурацию

Что означает: Компонент, отвечающий за reconciliation стека мониторинга, час подряд не может успешно свести состояние к желаемому.

Что делать: Посмотреть логи cluster-monitoring-operator, найти конкретную ошибку reconciliation.

3.3. AlertmanagerReceiversNotConfigured

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: В Alertmanager не настроены получатели уведомлений

Что означает: У Alertmanager нет ни одного настроенного получателя (интеграции со Slack/email/PagerDuty и т.п.), поэтому сработавшие оповещения фактически никуда не уходят.

Что делать: Настроить хотя бы один получатель и маршрутизацию в конфигурации Alertmanager, иначе критичные инциденты останутся незамеченными.

3.4. KubeDeploymentReplicasMismatch

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Deployment не набирает нужное число реплик

Что означает: У Deployment в системных namespace число доступных реплик меньше желаемого более 15 минут, и обновление реплик не идёт — часто из-за упавших/недоступных нод.

Что делать: Посмотреть события и статус подов Deployment (kubectl describe), проверить состояние нод, на которых они должны планироваться.

3.5. MultipleContainersOOMKilled

Важность: Информационный

Время до срабатывания: 15 мин.

Описание: Массовые OOMKill контейнеров

Что означает: За последние 15 минут более 5 раз контейнеры были убиты по причине нехватки памяти (OOMKilled) — либо утечка памяти в приложении, либо тесные лимиты, либо проблема с конкретной нодой.

Что делать: Найти конкретные под(ы)/контейнеры через kube_pod_container_status_last_terminated_reason, проверить их лимиты памяти и потребление.

3.6. Watchdog

Важность: Не указан

Описание: Техническое контрольное оповещение (Watchdog)

Что означает: Это оповещение всегда в состоянии срабатывания (firing) — оно не сигнализирует о проблеме, а подтверждает, что вся цепочка Prometheus → Alertmanager → канал уведомлений работает.

Что делать: Ничего не чинить по содержанию; если Watchdog перестал приходить в канал уведомлений — значит сломана сама цепочка оповещений, и чинить нужно именно её.

3.7. NodeNetworkInterfaceFlapping

Важность: Предупреждение

Время до срабатывания: 2 мин.

Описание: Сетевой интерфейс ноды часто меняет статус (частое переключение)

Что означает: Состояние up/down сетевого интерфейса ноды менялось более 2 раз за 2 минуты — признак нестабильного линка, драйвера или кабеля/порта.

Что делать: Проверить физическое подключение, логи драйвера сетевой карты и коммутатор, к которому подключена нода.

4. Вспомогательные контейнеры config-reloader

4.1. ConfigReloaderSidecarErrors

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Вспомогательный контейнер config-reloader не может применить конфигурацию

Что означает: Вспомогательный контейнер, который следит за ConfigMap/Secret и перезагружает конфигурацию соседнего процесса (Prometheus/Alertmanager и т.п.), 10 минут подряд не может успешно её перечитать — конфигурация могла устареть.

Что делать: Посмотреть логи config-reloader в поде, проверить корректность связанного ConfigMap/Secret.

5. Утилизация CPU

5.1. HighOverallControlPlaneCPU

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Суммарная загрузка CPU control-plane превышает безопасный порог (>60% на 3 нодах)

Что означает: При трёх control-plane нодах суммарная загрузка CPU выше 60% означает, что кластер уже не выдержит отказ одной ноды: оставшиеся две не справятся с нагрузкой.

Что делать: Спланировать увеличение CPU/памяти на control-plane нодах заранее, не дожидаясь реального отказа.

5.2. ExtremelyHighIndividualControlPlaneCPU (предупреждение)

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Экстремальная загрузка CPU на одной control-plane ноде (предупреждение)

Что означает: На одной из control-plane нод загрузка CPU превысила 90% — риск деградации kube-apiserver и etcd из-за нехватки CPU для сериализации запросов.

Что делать: Проверить, какие процессы грузят ноду, и по возможности снизить нагрузку или добавить ресурсы control-plane.

5.3. ExtremelyHighIndividualControlPlaneCPU (критический)

Важность: Критический

Время до срабатывания: 1 ч.

Описание: Устойчиво экстремальная загрузка CPU control-plane ноды (критично)

Что означает: Загрузка CPU control-plane ноды держится выше 90% целый час — велик риск каскадного отказа: если эта нода откажет, остальные control-plane ноды тоже могут не выдержать.

Что делать: Немедленно разгрузить или расширить control-plane; это критическая деградация отказоустойчивости кластера.

6. DNS (CoreDNS)

6.1. CoreDNSPanicking

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: CoreDNS падает с паникой (panic)

Что означает: В процессе CoreDNS зафиксированы Go-паники за последние 10 минут — сервис DNS может перезапускаться и терять запросы.

Что делать: Посмотреть логи пода CoreDNS на предмет стектрейса паники, проверить версию и конфигурацию CoreDNS.

6.2. CoreDNSHealthCheckSlow

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Health-check CoreDNS выполняется медленно

Что означает: 95-й перцентиль времени health-check запроса CoreDNS превышает 10 секунд — признак перегрузки или деградации сервиса DNS.

Что делать: Проверить нагрузку на под(ы) CoreDNS (CPU/память/число запросов) и при необходимости масштабировать.

6.3. CoreDNSErrorsHigh

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: CoreDNS возвращает много SERVFAIL

Что означает: Более 1% DNS-ответов CoreDNS в namespace — это SERVFAIL, то есть DNS не может разрешить запросы — может ломать работу многих сервисов в кластере.

Что делать: Проверить вышестоящие DNS-серверы и конфигурацию CoreDNS (Corefile), логи на конкретные ошибки разрешения имён.

7. etcd (хранилище состояния кластера)

7.1. etcdMembersDown

Важность: Критический

Время до срабатывания: 10 мин.

Описание: Участники кластера etcd недоступны

Что означает: Один или несколько участников etcd либо не отвечают на сбор метрик (up=0), либо не могут обменяться данными с другими участниками (много ошибок сети между ними).

Что делать: Проверить состояние подов/нод etcd и сетевую связность между control-plane нодами — потеря кворума критична для всего кластера.

7.2. etcdNoLeader

Важность: Критический

Время до срабатывания: 1 мин.

Описание: У кластера etcd нет лидера

Что означает: Член etcd сообщает, что в кластере отсутствует избранный лидер — запись в etcd (а значит, и изменения состояния Kubernetes) невозможна.

Что делать: Срочно проверить сеть между etcd-нодами и их ресурсы (диск/CPU) — частая причина отсутствия лидера — сетевые разрывы или перегрузка диска.

7.3. etcdMemberCommunicationSlow

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Медленный обмен данными между участниками etcd

Что означает: 99-й перцентиль времени round-trip между репликами etcd превышает 150 мс — признак сетевых задержек между control-plane нодами.

Что делать: Проверить сетевую задержку/пропускную способность между нодами, на которых развёрнут etcd.

7.4. etcdHighNumberOfFailedProposals

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Много неудачных предложений записи в etcd

Что означает: За 15 минут etcd зафиксировал более 5 неудачных предложений записи (попыток записи через Raft) — обычно из-за нестабильной сети или перегрузки диска/лидера.

Что делать: Проверить логи etcd на конкретную причину отказов предложений записи, состояние диска и лидера кластера.

7.5. etcdHighFsyncDurations (предупреждение)

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Долгий fsync WAL в etcd (предупреждение)

Что означает: 99-й перцентиль времени fsync журнала записи (WAL) etcd превышает 0.5 секунды — диск под etcd не успевает за нагрузкой, что напрямую влияет на задержки всего API Kubernetes.

Что делать: Проверить производительность диска (лучше — SSD/NVMe с низкой задержкой) под etcd, убрать конкурирующую нагрузку на этот диск.

7.6. etcdHighFsyncDurations (критический)

Важность: Критический

Время до срабатывания: 10 мин.

Описание: Критически долгий fsync WAL в etcd

Что означает: 99-й перцентиль fsync WAL превышает уже 1 секунду — это критический уровень деградации диска, на котором стоит etcd.

Что делать: Срочно разобраться с диском etcd (замена/выделенный диск), пока не начались таймауты и потери лидера.

7.7. etcdHighCommitDurations

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Долгие commit-операции в etcd

Что означает: 99-й перцентиль времени commit в backend etcd (bbolt) превышает 250 мс — тоже указывает на проблемы с дисковой подсистемой под etcd.

Что делать: Проверить производительность и загрузку диска etcd, при необходимости выполнить дефрагментацию базы.

7.8. etcdDatabaseQuotaLowSpace

Важность: Критический

Время до срабатывания: 10 мин.

Описание: База etcd почти заполнила квоту размера

Что означает: Размер базы данных etcd превысил 95% от заданной квоты (etcd_server_quota_backend_bytes) — при достижении 100% etcd перестанет принимать запись, и кластер «замёрзнет».

Что делать: Срочно выполнить дефрагментацию etcd (etcdctl defrag) или увеличить квоту, а также разобраться, что раздувает базу (часто — старые ревизии/события).

7.9. etcdExcessiveDatabaseGrowth

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: База etcd растёт аномально быстро

Что означает: По тренду последних 4 часов прогнозируется, что размер базы etcd превысит квоту в течение ближайших 4 часов.

Что делать: Найти источник резкого роста записи в etcd (например, шумный контроллер/CRD с частыми обновлениями), при необходимости выполнить дефрагментацию.

7.10. etcdDatabaseHighFragmentationRatio

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Высокая фрагментация базы etcd

Что означает: Реально используемое место в базе etcd меньше 50% от выделенного объёма (при этом занято уже больше 100 МБ) — много места занято «мусором» от старых ревизий.

Что делать: Выполнить дефрагментацию etcd (etcdctl defrag) поочерёдно на каждом члене кластера, чтобы вернуть неиспользуемое место ОС.

7.11. etcdGRPCRequestsSlow

Важность: Критический

Время до срабатывания: 30 мин.

Описание: Медленные gRPC-запросы к etcd

Что означает: 99-й перцентиль времени обработки unary gRPC-запросов к etcd превышает 1 секунду на протяжении 30 минут — клиенты (kube-apiserver) будут получать медленные ответы.

Что делать: Проверить нагрузку на etcd (диск, сеть, число запросов) и какие конкретно gRPC-методы тормозят.

7.12. etcdHighNumberOfFailedGRPCRequests (предупреждение)

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Много неудачных gRPC-запросов к etcd (предупреждение)

Что означает: Более 10% gRPC-запросов к etcd завершаются ошибками (Unavailable, ResourceExhausted, DeadlineExceeded и т.п.).

Что делать: Проверить логи etcd и kube-apiserver на конкретные коды ошибок и метод, который чаще всего отказывает.

7.13. etcdHighNumberOfFailedGRPCRequests (критический)

Важность: Критический

Время до срабатывания: 10 мин.

Описание: Критически много неудачных gRPC-запросов к etcd

Что означает: Доля неудачных gRPC-запросов к etcd превысила уже 50% — это серьёзная деградация, влияющая на работу всего API Kubernetes.

Что делать: Немедленно расследовать состояние etcd-кластера (ресурсы, сеть, лидер), это близко к отказу control-plane.

7.14. etcdHighNumberOfLeaderChanges

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Частые перевыборы лидера etcd

Что означает: В среднем более 5 смен лидера etcd за последние 10 минут — частые перевыборы обычно вызваны нехваткой ресурсов, сетевыми задержками или помехами со стороны других компонентов.

Что делать: Проверить сетевую стабильность и нагрузку на control-plane ноды, посмотреть логи etcd вокруг моментов перевыборов.

7.15. etcdInsufficientMembers

Важность: Критический

Время до срабатывания: 3 мин.

Описание: У etcd нет кворума (недостаточно живых участников)

Что означает: Количество доступных и имеющих лидера участников etcd меньше половины от общего числа — Kubernetes API перестаёт принимать запросы на чтение и запись.

Что делать: Срочно проверить, включены ли все control-plane ноды и есть ли между ними сетевая связность — это полноценный инцидент, блокирующий работу кластера.

8. Ingress NGINX

8.1. NGINXConfigFailed

Важность: Критический

Время до срабатывания: 1 мин.

Описание: Ingress-nginx не может применить новую конфигурацию

Что означает: Тест конфигурации nginx после очередного reload завершился ошибкой — новая конфигурация Ingress не применяется, контроллер продолжает работать со старой.

Что делать: Найти и откатить последнее изменение Ingress-ресурса, вызвавшее невалидный nginx.conf.

8.2. NGINXCertificateExpiry

Важность: Критический

Время до срабатывания: 1 мин.

Описание: Скоро истекает TLS-сертификат на Ingress

Что означает: Один из SSL-сертификатов, используемых ingress-nginx, истекает менее чем через 7 дней.

Что делать: Продлить/перевыпустить сертификат (системные сертификаты можно обновить через nova-ctl certs renew) до истечения срока.

8.3. NGINXTooMany500s

Важность: Предупреждение

Время до срабатывания: 1 мин.

Описание: Много ответов 5xx через ingress-nginx

Что означает: Более 5% всех запросов через ingress-nginx завершаются серверными ошибками (5xx) — проблема на стороне бэкенд-сервисов или самого ingress.

Что делать: Посмотреть, какие именно backend-сервисы отдают 5xx, проверить их логи и состояние подов.

8.4. NGINXTooMany400s

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Много ответов 4xx через ingress-nginx

Что означает: Более 5% запросов через ingress-nginx получают клиентские ошибки (4xx) — может быть проблема с маршрутизацией, авторизацией или некорректными клиентами.

Что делать: Проверить конкретные пути/хосты с высоким числом 4xx в логах nginx, убедиться, что это не баг в конфигурации Ingress.

9. kube-apiserver: SLO доступности

9.1. KubeAPIErrorBudgetBurn (быстрый расход)

Важность: Критический

Время до срабатывания: 2 мин.

Описание: kube-apiserver быстро расходует error budget (SLO)

Что означает: kube-apiserver отдаёт ошибки/высокие задержки настолько интенсивно, что при таком темпе весь месячный бюджет ошибок SLO будет исчерпан за часы — комбинация окон 1h/5m ловит быстрые всплески.

Что делать: Посмотреть дашборд API Performance и состояние etcd — часто первопричина именно в etcd.

9.2. KubeAPIErrorBudgetBurn (устойчивый расход)

Важность: Критический

Время до срабатывания: 15 мин.

Описание: kube-apiserver медленно, но устойчиво расходует error budget (SLO)

Что означает: То же нарушение SLO API-сервера, но зафиксированное в более длинных окнах (6h/30m) — то есть проблема не разовый всплеск, а устойчивая деградация.

Что делать: Изучить тренд ошибок и задержки API за последние часы, проверить etcd и нагрузку на control-plane.

10. kube-controller-manager

10.1. KubeControllerManagerDown

Важность: Критический

Время до срабатывания: 15 мин.

Описание: kube-controller-manager недоступен для мониторинга

Что означает: Prometheus не видит ни одной работающей цели job=kube-controller-manager 15 минут — компонент, отвечающий за большинство контроллеров Kubernetes, не отвечает.

Что делать: Проверить под(ы) kube-controller-manager на control-plane нодах (статус, логи, события).

10.2. PodDisruptionBudgetAtLimit

Важность: Предупреждение

Время до срабатывания: 60 мин.

Описание: PodDisruptionBudget на пределе допустимых нарушений

Что означает: Число healthy-подов под защитой PDB равно минимально допустимому — любое дополнительное добровольное прерывание (drain, апдейт) будет заблокировано.

Что делать: Иметь это в виду перед плановыми операциями (drain нод, rollout) — сначала выяснить, почему часть подов недоступна.

10.3. PodDisruptionBudgetLimit

Важность: Критический

Время до срабатывания: 15 мин.

Описание: PodDisruptionBudget нарушен

Что означает: Число healthy-подов уже меньше минимально требуемого по PDB — нарушение бюджета прерываний, что может блокировать нормальные операции обслуживания кластера.

Что делать: Разобраться, почему поды недоступны (см. смежные оповещения по подам/деплойментам), восстановить нужное число реплик.

10.4. GarbageCollectorSyncFailed

Важность: Предупреждение

Время до срабатывания: 60 мин.

Описание: Ошибки синхронизации в Garbage Collector контроллере

Что означает: Контроллер сборки мусора kube-controller-manager (удаление зависимых объектов) в течение часа сталкивается с ошибками синхронизации доступных ресурсов.

Что делать: Посмотреть логи kube-controller-manager на предмет конкретной ошибки, часто связана с проблемным API/CRD.

11. kube-proxy

11.1. KubeProxyDown

Важность: Критический

Время до срабатывания: 15 мин.

Описание: kube-proxy недоступен для мониторинга

Что означает: Prometheus не видит ни одного работающего kube-proxy 15 минут — сетевые правила (Service/ClusterIP) на затронутых нодах могут не обновляться.

Что делать: Проверить поды/DaemonSet kube-proxy на нодах, их логи и состояние.

12. kube-scheduler

12.1. KubeSchedulerDown

Важность: Критический

Время до срабатывания: 15 мин.

Описание: kube-scheduler недоступен для мониторинга

Что означает: Prometheus не видит ни одного работающего kube-scheduler 15 минут — новые поды могут перестать планироваться на ноды.

Что делать: Проверить под(ы) kube-scheduler на control-plane нодах.

13. kube-state-metrics

13.1. KubeStateMetricsListErrors

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: kube-state-metrics получает ошибки при list-запросах к API

Что означает: Более 1% list-запросов kube-state-metrics к Kubernetes API завершаются ошибкой — часть метрик о состоянии объектов кластера может быть неполной или устаревшей.

Что делать: Проверить права RBAC и доступность kube-apiserver для service account kube-state-metrics, посмотреть логи компонента.

13.2. KubeStateMetricsWatchErrors

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: kube-state-metrics получает ошибки при watch-запросах к API

Что означает: Более 1% watch-запросов kube-state-metrics завершаются ошибкой — метрики о состоянии объектов кластера могут отставать от реальности.

Что делать: Проверить логи kube-state-metrics и доступность API-сервера, возможно требуется перезапуск компонента.

14. Kubernetes: объекты и рабочие нагрузки

14.1. KubePodCrashLooping

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Под постоянно перезапускается (CrashLoopBackOff)

Что означает: Контейнер пода находится в состоянии ожидания с причиной CrashLoopBackOff — он падает вскоре после старта и Kubernetes раз за разом пытается его перезапустить.

Что делать: Посмотреть логи и события пода (kubectl logs --previous, kubectl describe pod), найти причину падения приложения.

14.2. KubePodNotReady

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Под не переходит в состояние Ready больше 15 минут

Что означает: Под (не принадлежащий Job) находится в фазе Pending или Unknown дольше 15 минут — не может запуститься или потерял связь с kubelet.

Что делать: Проверить события планирования (нехватка ресурсов, проблемы с образом, PVC) и состояние ноды, на которую должен попасть под.

14.3. KubeDeploymentGenerationMismatch

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Generation Deployment не совпадает — возможен неудачный rollout

Что означает: observedGeneration контроллера отстаёт от metadata.generation Deployment — последнее изменение не было полностью применено и не откачено автоматически.

Что делать: Проверить статус rollout (kubectl rollout status/history) и события Deployment, при необходимости откатить вручную.

14.4. KubeStatefulSetReplicasMismatch

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: StatefulSet не набирает нужное число готовых реплик

Что означает: Число готовых реплик StatefulSet не совпадает с желаемым дольше 15 минут, и обновление реплик не продвигается.

Что делать: Проверить статус подов StatefulSet по очереди (обновление идёт последовательно) и события/логи проблемного пода.

14.5. KubeStatefulSetGenerationMismatch

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Generation StatefulSet не совпадает — возможен неудачный rollout

Что означает: Аналогично Deployment: изменение StatefulSet применено не полностью и не откачено.

Что делать: Проверить статус и историю rollout StatefulSet, события контроллера.

14.6. KubeStatefulSetUpdateNotRolledOut

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Обновление StatefulSet не выкатилось до конца

Что означает: Ревизия обновления StatefulSet не совпадает с текущей, и число обновлённых реплик не растёт — раскатка зависла.

Что делать: Проверить, на каком поде остановилось обновление, и почему (readiness/liveness, ресурсы, PVC).

14.7. KubeDaemonSetRolloutStuck

Важность: Предупреждение

Время до срабатывания: 30 мин.

Описание: Раскатка DaemonSet зависла

Что означает: DaemonSet минимум 30 минут не может привести число запланированных/обновлённых/доступных подов к желаемому значению на всех нодах.

Что делать: Проверить, на каких нодах не хватает пода DaemonSet и почему (taints, ресурсы, ошибки образа).

14.8. KubeContainerWaiting

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Контейнер больше часа в состоянии Waiting

Что означает: Контейнер пода уже более часа находится в состоянии ожидания (например, ImagePullBackOff, CreateContainerConfigError и т.п.).

Что делать: Посмотреть причину ожидания через kubectl describe pod — чаще всего это проблема с образом, секретом/конфигмапом или ресурсами.

14.9. KubeDaemonSetNotScheduled

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Не все поды DaemonSet запланированы

Что означает: Часть подов DaemonSet, которые должны быть на нодах, ещё не запланированы.

Что делать: Проверить, есть ли на недостающих нодах taints/nodeSelector, блокирующие планирование, и хватает ли ресурсов.

14.10. KubeDaemonSetMisScheduled

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Поды DaemonSet запущены не на тех нодах

Что означает: Есть поды DaemonSet, работающие на нодах, где они не должны находиться (например, после смены nodeSelector/taints).

Что делать: Проверить, почему появилось несоответствие, и дать DaemonSet пересоздать поды на правильных нодах.

14.11. KubeJobNotCompleted

Важность: Предупреждение

Описание: Job выполняется слишком долго (>12 часов)

Что означает: Job запущен и активен уже более 12 часов без завершения — вероятно завис или обрабатывает намного больше данных, чем ожидалось.

Что делать: Проверить логи Job и решить, нужно ли его прервать вручную или дать доработать.

14.12. KubeJobFailed

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Job завершился с ошибкой

Что означает: Job перешёл в состояние failed и не смог успешно завершиться.

Что делать: Посмотреть логи упавших подов Job, после анализа удалить неудачный Job — это снимет оповещение.

14.13. KubeHpaReplicasMismatch

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: HPA не может привести число реплик к целевому

Что означает: Горизонтальный автоскейлер (HPA) дольше 15 минут не может довести текущее число реплик до желаемого (в допустимом диапазоне min/max).

Что делать: Проверить, хватает ли ресурсов кластера для масштабирования и не блокирует ли что-то создание новых подов.

14.14. KubeHpaMaxedOut

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: HPA упёрся в максимум реплик

Что означает: HPA работает на максимально разрешённом числе реплик дольше 15 минут — приложению может не хватать текущего потолка масштабирования.

Что делать: Оценить реальную нагрузку и при необходимости увеличить maxReplicas или оптимизировать приложение.

14.15. KubeCPUOvercommit

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Кластер переподписан по CPU-запросам

Что означает: Суммарные requests по CPU для подов превышают то, что осталось бы доступным при отказе самой мощной ноды — кластер не переживёт потерю одной ноды без деградации.

Что делать: Пересмотреть requests подов или добавить capacity, чтобы сохранить отказоустойчивость на потерю одной ноды.

14.16. KubeMemoryOvercommit

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Кластер переподписан по памяти

Что означает: Аналогично CPU: суммарные requests по памяти превышают доступную ёмкость на случай отказа самой большой ноды.

Что делать: Пересмотреть requests по памяти или добавить capacity.

14.17. KubeCPUQuotaOvercommit

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Суммарные ResourceQuota по CPU в namespace’ах переподписаны (>150%)

Что означает: Сумма жёстких CPU-квот, выданных namespace’ам, превышает реальную ёмкость кластера в 1.5 раза — при одновременной утилизации квот кластеру не хватит CPU.

Что делать: Пересмотреть выданные квоты namespace’ам, привести их в соответствие с реальной ёмкостью кластера.

14.18. KubeMemoryQuotaOvercommit

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Суммарные ResourceQuota по памяти в namespace’ах переподписаны (>150%)

Что означает: Аналогично CPU-квотам, но по памяти.

Что делать: Пересмотреть выданные квоты по памяти для namespace’ов.

14.19. KubeQuotaAlmostFull

Важность: Информационный

Время до срабатывания: 15 мин.

Описание: Квота namespace почти исчерпана

Что означает: Namespace использует более 90% выделенной ему ResourceQuota по какому-то ресурсу.

Что делать: Информационно предупредить владельцев namespace — скоро новые объекты/поды не смогут создаваться из-за квоты.

14.20. KubeQuotaFullyUsed

Важность: Информационный

Время до срабатывания: 15 мин.

Описание: Квота namespace использована полностью

Что означает: Namespace выбрал 100% выделенной ResourceQuota по какому-то ресурсу.

Что делать: Создание новых объектов данного типа/ресурса в namespace будет заблокировано — при необходимости увеличить квоту.

14.21. KubeQuotaExceeded

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Квота namespace превышена

Что означает: Фактическое использование ресурса в namespace превысило заданный hard limit ResourceQuota — редкая ситуация, обычно указывающая на рассинхронизацию учёта.

Что делать: Разобраться в несоответствии факта и квоты, проверить ResourceQuota и реальное потребление в namespace.

14.22. KubePersistentVolumeFillingUp (критический)

Важность: Критический

Время до срабатывания: 1 мин.

Описание: PersistentVolume почти заполнен (критично, <3%)

Что означает: На PVC осталось менее 3% свободного места, и он реально используется — риск немедленного отказа приложения из-за нехватки диска.

Что делать: Срочно расширить том (если StorageClass поддерживает resize) или очистить данные на нём.

14.23. KubePersistentVolumeFillingUp (предупреждение)

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: PersistentVolume скоро заполнится (прогноз на 4 дня)

Что означает: Свободного места на PVC меньше 15%, и по тренду последних 6 часов расчётное время до заполнения — около 4 дней.

Что делать: Заранее спланировать расширение тома или очистку данных, не дожидаясь критического уровня.

14.24. KubePersistentVolumeInodesFillingUp (критический)

Важность: Критический

Время до срабатывания: 1 мин.

Описание: На PersistentVolume заканчиваются inode (критично, <3%)

Что означает: Свободных inode на PVC осталось менее 3% — новые файлы нельзя будет создать, даже если есть свободное место в байтах.

Что делать: Найти источник большого числа мелких файлов на томе и почистить их либо пересоздать том с бОльшим числом inode.

14.25. KubePersistentVolumeInodesFillingUp (предупреждение)

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: На PersistentVolume скоро закончатся inode (прогноз на 4 дня)

Что означает: Свободных inode меньше 15%, и по тренду они закончатся примерно через 4 дня.

Что делать: Заранее разобраться с источником роста числа файлов на томе.

14.26. KubePersistentVolumeErrors

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Проблема с provisioning PersistentVolume

Что означает: PersistentVolume находится в статусе Failed или Pending — том не может быть создан или подключён.

Что делать: Проверить логи storage-провижнера (в этом кластере — Longhorn) и события самого PV/PVC.

14.27. KubeClientErrors

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Клиент Kubernetes API получает много ошибок 5xx

Что означает: Более 1% запросов от некоторого клиента (job/instance) к kube-apiserver завершаются ошибками 5xx на протяжении 15 минут.

Что делать: Определить, какой именно компонент (job/instance) является клиентом, и посмотреть его логи, а также состояние самого apiserver.

14.28. KubeAggregatedAPIErrors

Важность: Предупреждение

Описание: Агрегированный API-сервис сообщает об ошибках

Что означает: Aggregated APIService (расширение kube-apiserver сторонним API, например metrics-server) более 4 раз за 10 минут отмечался как недоступный.

Что делать: Проверить под(ы), реализующие данный APIService, и его логи/доступность.

14.29. KubeAggregatedAPIDown

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Агрегированный API-сервис в основном недоступен

Что означает: Доступность агрегированного APIService за последние 10 минут упала ниже 85%.

Что делать: Проверить состояние бэкенд-сервиса, реализующего этот APIService.

14.30. KubeAPIDown

Важность: Критический

Время до срабатывания: 15 мин.

Описание: kube-apiserver недоступен для мониторинга

Что означает: Prometheus не видит ни одной живой цели сбора метрик apiserver 15 минут — критическая ситуация, при которой Kubernetes API может быть полностью недоступен.

Что делать: Немедленно проверить control-plane ноды и состояние apiserver — это блокирующий инцидент для всего кластера.

14.31. KubeAPITerminatedRequests

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: kube-apiserver принудительно обрывает много запросов

Что означает: Более 20% входящих запросов к apiserver завершаются принудительным обрывом (terminated) — обычно из-за перегрузки и защитных лимитов (APF).

Что делать: Проверить нагрузку на apiserver, какие клиенты создают избыточную нагрузку, и настройки Priority & Fairness.

14.32. KubeNodeNotReady

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Нода не в состоянии Ready

Что означает: Условие Ready ноды равно false/неизвестно дольше 15 минут — kubelet не подтверждает готовность ноды к запуску подов.

Что делать: Проверить kubelet и системные ресурсы (диск/память/PID) на ноде, а также сетевую доступность до control-plane.

14.33. KubeNodeUnreachable

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Нода недостижима

Что означает: На ноду выставлен taint unreachable — control-plane не может с ней связаться, часть workload’ов может быть перепланирована на другие ноды.

Что делать: Проверить сеть и физическое/виртуальное состояние ноды, при необходимости перезапустить её.

14.34. KubeletTooManyPods

Важность: Информационный

Время до срабатывания: 15 мин.

Описание: Kubelet работает почти на пределе по числу подов

Что означает: На ноде запущено более 95% от максимально допустимого числа подов (обычно 110) — скоро новые поды перестанут туда планироваться.

Что делать: Перераспределить нагрузку на другие ноды или добавить ёмкость кластера.

14.35. KubeNodeReadinessFlapping

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Готовность ноды часто переключается (частое переключение)

Что означает: Статус Ready ноды менялся более 2 раз за 15 минут — нестабильность самой ноды или сети до control-plane.

Что делать: Проверить ресурсы и сетевую стабильность ноды, логи kubelet.

14.36. KubeletPlegDurationHigh

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Kubelet PLEG работает медленно

Что означает: 99-й перцентиль времени цикла Pod Lifecycle Event Generator (PLEG) kubelet превышает 10 секунд — признак перегрузки ноды или проблем с container runtime.

Что делать: Проверить нагрузку CPU/IO на ноде и состояние container runtime (containerd/docker).

14.37. KubeletPodStartUpLatencyHigh

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Высокая задержка запуска подов на ноде

Что означает: 99-й перцентиль времени старта пода на ноде превышает 60 секунд — поды долго стартуют (загрузка образов, инициализация runtime и т.п.).

Что делать: Проверить скорость pull образов, нагрузку на ноду и container runtime.

14.38. KubeletClientCertificateRenewalErrors

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Kubelet не может обновить клиентский сертификат

Что означает: Kubelet на ноде получает ошибки при попытке автоматически обновить свой клиентский TLS-сертификат для связи с apiserver.

Что делать: Проверить логи kubelet и состояние CSR/сертификатов на ноде, при истечении сертификата нода отвалится от кластера. Требуется запланировать обновление сертификатов.

14.39. KubeletServerCertificateRenewalErrors

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Kubelet не может обновить серверный сертификат

Что означает: То же самое, но для серверного TLS-сертификата kubelet (используется apiserver для обращения к kubelet).

Что делать: Проверить сертификаты и логи kubelet, при необходимости вмешаться в процесс ротации вручную. Требуется запланировать обновление сертификатов.

14.40. KubeletDown

Важность: Критический

Время до срабатывания: 15 мин.

Описание: Kubelet недоступен для мониторинга

Что означает: Prometheus не видит ни одной работающей цели сбора метрик kubelet 15 минут — на затронутых нодах может быть полностью нарушена работа подов.

Что делать: Проверить состояние соответствующих нод и процесс kubelet на них.

15. MinIO (объектное хранилище)

15.1. MinioNodesOffline

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Нода(ы) MinIO офлайн

Что означает: В кластере MinIO больше 5 минут зафиксированы оффлайн-ноды — снижается отказоустойчивость объектного хранилища.

Что делать: Проверить состояние подов MinIO и нод, на которых они запущены.

15.2. MinioDisksOffline

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Диск(и) MinIO офлайн

Что означает: В кластере MinIO больше 5 минут зафиксированы оффлайн-диски — часть erasure-set хранилища деградировала.

Что делать: Проверить состояние конкретных дисков/PV, используемых MinIO, заменить неисправные.

15.3. HighMinioRequests

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Высокое число запросов к MinIO

Что означает: Счётчик S3-запросов к MinIO превысил 100000 (заданный абсолютный порог, накопительный счётчик, а не скорость в секунду).

Что делать: Оценить, ожидаемый ли это рост нагрузки или аномальный клиент, при необходимости масштабировать MinIO.

15.4. HighMinioObjects

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Слишком много объектов в бакете MinIO

Что означает: Число объектов в бакете превысило 100 000 000 — большие бакеты могут замедлять листинг и обслуживание.

Что делать: Продумать партиционирование данных по нескольким бакетам или политику ретенции/удаления старых объектов.

15.5. HighMinioMemoryUsage

Важность: Критический

Время до срабатывания: 5 мин.

Описание: Высокое использование памяти MinIO

Что означает: Использование памяти на ноде MinIO превысило 80%.

Что делать: Проверить нагрузку на MinIO (число одновременных запросов, размер объектов) и ресурсы, выделенные подам.

15.6. High Minio CPU Usage

Важность: Критический

Время до срабатывания: 5 мин.

Описание: Высокое использование CPU MinIO

Что означает: Загрузка CPU на ноде MinIO превысила 80% (100% минус средняя idle-загрузка).

Что делать: Проверить интенсивность запросов к MinIO и при необходимости добавить ресурсы/масштабировать кластер.

15.7. HighMinioDiskUsage

Важность: Критический

Время до срабатывания: 10 мин.

Описание: Мало свободного места на диске MinIO

Что означает: На ноде MinIO осталось менее 100 МБ свободного места на диске — риск отказа записи новых объектов.

Что делать: Срочно освободить место или расширить хранилище MinIO.

16. Узлы кластера (node-exporter)

16.1. NodeFilesystemSpaceFillingUp (предупреждение)

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Файловая система заполнится в течение суток (предупреждение)

Что означает: Свободного места на файловой системе меньше 15%, и по тренду последних 6 часов прогнозируется полное заполнение в течение 24 часов.

Что делать: Заранее почистить/расширить диск на указанной ноде и устройстве.

16.2. NodeFilesystemSpaceFillingUp (критический)

Важность: Критический

Время до срабатывания: 1 ч.

Описание: Файловая система заполнится в течение 4 часов (критично)

Что означает: Свободного места меньше 10%, и по тренду прогнозируется заполнение уже в течение 4 часов — требует быстрой реакции.

Что делать: Срочно освободить место или расширить диск, иначе приложения на ноде начнут падать из-за нехватки места.

16.3. NodeFilesystemAlmostOutOfSpace (предупреждение)

Важность: Предупреждение

Время до срабатывания: 30 мин.

Описание: На файловой системе осталось меньше 5% места

Что означает: Свободного места на файловой системе меньше 5% прямо сейчас (без прогноза, по факту).

Что делать: Освободить место немедленно — очистить логи/временные файлы, расширить диск.

16.4. NodeFilesystemAlmostOutOfSpace (критический)

Важность: Критический

Время до срабатывания: 30 мин.

Описание: На файловой системе осталось меньше 3% места (критично)

Что означает: Критически мало свободного места — меньше 3%, риск отказа записи данных на ноде.

Что делать: Срочно освободить место или расширить диск.

16.5. NodeFilesystemFilesFillingUp (предупреждение)

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Закончатся inode в течение суток (предупреждение)

Что означает: Свободных inode меньше 40%, и по тренду прогнозируется их исчерпание в течение 24 часов.

Что делать: Найти источник большого числа мелких файлов на файловой системе и почистить его заранее.

16.6. NodeFilesystemFilesFillingUp (критический)

Важность: Критический

Время до срабатывания: 1 ч.

Описание: Закончатся inode в течение 4 часов (критично)

Что означает: Свободных inode меньше 20%, и по тренду они закончатся уже в течение 4 часов.

Что делать: Срочно почистить лишние файлы либо перенести данные на файловую систему с большим числом inode.

16.7. NodeFilesystemAlmostOutOfFiles (предупреждение)

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Осталось меньше 5% свободных inode

Что означает: Свободных inode на файловой системе меньше 5% прямо сейчас.

Что делать: Найти и удалить массу мелких файлов (часто — логи, временные файлы, кэши).

16.8. NodeFilesystemAlmostOutOfFiles (критический)

Важность: Критический

Время до срабатывания: 1 ч.

Описание: Осталось меньше 3% свободных inode (критично)

Что означает: Критически мало свободных inode — меньше 3%, новые файлы скоро нельзя будет создать даже при наличии места в байтах.

Что делать: Срочно почистить файлы или пересоздать файловую систему с большим числом inode.

16.9. NodeNetworkReceiveErrs

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Много ошибок приёма на сетевом интерфейсе

Что означает: Более 1% принимаемых пакетов на сетевом интерфейсе ноды завершаются ошибками на протяжении часа — признак проблем с кабелем/портом/драйвером.

Что делать: Проверить физическое подключение, статистику ошибок на коммутаторе и драйвер сетевой карты.

16.10. NodeNetworkTransmitErrs

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Много ошибок передачи на сетевом интерфейсе

Что означает: Более 1% отправляемых пакетов завершаются ошибками на протяжении часа.

Что делать: Аналогично приёму — проверить физический линк и драйвер сетевой карты.

16.11. NodeHighNumberConntrackEntriesUsed

Важность: Предупреждение

Описание: Таблица conntrack близка к лимиту

Что означает: Число используемых записей conntrack превысило 75% от лимита ядра — при достижении 100% новые соединения начнут отбрасываться.

Что делать: Увеличить nf_conntrack_max на ноде или разобраться, что создаёт аномально много соединений.

16.12. NodeTextFileCollectorScrapeError

Важность: Предупреждение

Описание: Ошибка чтения текстовых файлов метрик node-exporter

Что означает: node-exporter не смог прочитать один из .prom файлов textfile-коллектора (кастомные метрики с ноды).

Что делать: Проверить формат и права доступа к файлам в каталоге textfile-коллектора на ноде.

16.13. NodeClockSkewDetected

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Обнаружено расхождение часов (clock skew)

Что означает: Смещение системных часов ноды относительно эталона больше 50 мс и продолжает расти в ту же сторону — может ломать TLS, распределённые блокировки и логику, чувствительную ко времени.

Что делать: Проверить работу NTP/chrony на ноде и доступность источников времени.

16.14. NodeClockNotSynchronising

Важность: Критический

Время до срабатывания: 10 мин.

Описание: Часы ноды не синхронизируются

Что означает: Часы ноды не синхронизированы с NTP, и оценка максимальной погрешности превышает 16 секунд.

Что делать: Проверить конфигурацию и доступность NTP-сервиса на ноде — вероятно, служба синхронизации времени не работает.

16.15. NodeRAIDDegraded

Важность: Критический

Время до срабатывания: 15 мин.

Описание: RAID-массив деградировал

Что означает: В программном RAID (mdadm) не хватает активных дисков относительно требуемого числа, и свободных spare-дисков недостаточно, чтобы восстановиться автоматически.

Что делать: Срочно заменить отказавший(е) диск(и) в массиве вручную.

16.16. NodeRAIDDiskFailure

Важность: Предупреждение

Описание: Диск в RAID-массиве отказал

Что означает: Хотя бы один диск в программном RAID-массиве помечен как failed.

Что делать: Запланировать замену диска в массиве, проверить состояние остальных дисков.

16.17. NodeFileDescriptorLimit (предупреждение)

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Использование file descriptor приближается к лимиту (предупреждение)

Что означает: Число выделенных файловых дескрипторов на ноде превысило 70% от максимума ядра.

Что делать: Проверить, какие процессы держат много открытых файлов/сокетов, при необходимости увеличить лимит ядра.

16.18. NodeFileDescriptorLimit (критический)

Важность: Критический

Время до срабатывания: 15 мин.

Описание: Использование file descriptor почти достигло лимита (критично)

Что означает: Число используемых файловых дескрипторов превысило 90% от максимума — риск отказа операций open()/socket() на ноде.

Что делать: Срочно найти процесс, утекающий дескрипторы, или увеличить лимит fs.file-max.

17. Сеть узлов

17.1. NodeNetworkInterfaceFlapping (группа node-network)

Важность: Предупреждение

Время до срабатывания: 2 мин.

Описание: Сетевой интерфейс ноды часто меняет статус (частое переключение, дублирующее правило)

Что означает: То же самое условие, что и в первом вхождении этого оповещения — интерфейс более 2 раз за 2 минуты меняет состояние up/down; правило продублировано в отдельной группе node-network.

Что делать: См. пояснение к первому вхождению — проверить физическое подключение, кабель/порт и драйвер сетевой карты.

18. Pod Security

18.1. PodSecurityViolation

Важность: Информационный

Описание: Есть нарушения политики Pod Security (аудит)

Что означает: За сутки зафиксированы workload’ы, не соответствующие профилю Pod Security Admission (privileged/baseline/restricted), настроенному в кластере или namespace — пока только в режиме audit, без блокировки.

Что делать: Посмотреть, какие именно поды нарушают политику, и привести их спецификацию в соответствие или скорректировать профиль namespace.

19. PostgreSQL

19.1. PostgresInstanceDown

Важность: Критический

Время до срабатывания: 1 мин.

Описание: Экземпляр PostgreSQL недоступен

Что означает: postgres-exporter минуту не может подключиться к PostgreSQL (pg_up=0) — сервер базы данных не отвечает.

Что делать: Проверить под/процесс PostgreSQL, его логи и состояние ноды/диска, на которых он развёрнут — это критично для всех зависящих сервисов.

19.2. PostgresExporterErrors

Важность: Критический

Время до срабатывания: 10 мин.

Описание: postgres-exporter не работает или выдаёт ошибки

Что означает: Экспортер метрик PostgreSQL сам не может собрать данные — либо он упал, либо не может подключиться к базе.

Что делать: Проверить логи и статус пода postgres-exporter, а также доступность PostgreSQL для него.

19.3. PostgresReplicationLagSizeTooLarge

Важность: Критический

Время до срабатывания: 5 мин.

Описание: Слишком большое отставание репликации PostgreSQL

Что означает: Реплика отстаёт от лидера более чем на 1 ГБ несинхронизированных данных — при failover это грозит существенной потерей данных.

Что делать: Проверить сеть и нагрузку между primary и репликой, а также I/O на реплике.

19.4. PostgresTooManyDeadTuples

Важность: Предупреждение

Время до срабатывания: 30 мин.

Описание: Слишком много мёртвых строк (dead tuples) в таблице

Что означает: Доля «мёртвых» (удалённых/обновлённых, но ещё не вычищенных) строк в таблице превысила 5% при абсолютном числе больше 1 млн — autovacuum не успевает за нагрузкой.

Что делать: Проверить настройки autovacuum для этой таблицы/базы и при необходимости запустить VACUUM вручную.

19.5. PostgresInactiveReplicationSlots

Важность: Предупреждение

Время до срабатывания: 30 мин.

Описание: Есть неактивные replication slots

Что означает: В PostgreSQL есть replication slot, к которому давно никто не подключается — WAL-файлы для него будут копиться на диске бесконечно.

Что делать: Определить, какой slot неактивен и почему (потерянный consumer), удалить его, если он больше не нужен — иначе диск переполнится.

19.6. PostgresSplitBrain

Важность: Критический

Время до срабатывания: 1 мин.

Описание: Split brain: несколько PostgreSQL в режиме read-write одновременно

Что означает: В одном кластере PostgreSQL обнаружено больше одного экземпляра в режиме primary (read-write) одновременно — крайне опасная ситуация, ведущая к расхождению данных.

Что делать: Немедленно вмешаться вручную: определить настоящий primary и перевести лишние экземпляры в read-only/реплику, во избежание рассинхронизации данных.

19.7. PostgresTooManyConnections

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Слишком много подключений к PostgreSQL

Что означает: Число активных подключений к базе превысило 90% от max_connections — новые подключения могут начать отклоняться.

Что делать: Проверить источник большого числа соединений (пул приложения, отсутствие pgbouncer), при необходимости увеличить лимит или включить пулинг.

19.8. PostgresPromotedNode

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Реплика PostgreSQL стала primary (failover)

Что означает: Standby-сервер был промоутирован в primary — произошёл автоматический или ручной failover кластера PostgreSQL.

Что делать: Убедиться, что failover прошёл штатно, проверить состояние остальных реплик и причину, по которой произошла смена лидера.

19.9. PgBouncerWaitingClients

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: У PgBouncer есть ожидающие клиенты

Что означает: Есть клиентские подключения, ожидающие свободного соединения к базе через PgBouncer — пул соединений исчерпан или медленно освобождается.

Что делать: Проверить размер пула PgBouncer и долгие/висящие запросы к базе.

19.10. PgBouncerNotEnoughConnections

Важность: Критический

Время до срабатывания: 10 мин.

Описание: Пулу PgBouncer не хватает размера под текущую нагрузку

Что означает: Число активных + ожидающих клиентских соединений превышает настроенный pool_size базы данных.

Что делать: Увеличить pool_size для базы в конфигурации PgBouncer либо снизить число параллельных подключений со стороны приложения.

19.11. PgBouncerPoolFillingUp

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Пул PgBouncer почти заполнен

Что означает: В пуле PgBouncer осталось 15 или меньше свободных соединений до лимита pool_size.

Что делать: Заранее проверить рост нагрузки на базу и спланировать увеличение пула, пока не начались отказы новым клиентам.

19.12. PgBouncerAvgWaitTimeTooHigh

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Клиенты PgBouncer долго ждут соединение

Что означает: Среднее время ожидания клиентом свободного соединения через PgBouncer превышает 1 секунду.

Что делать: Проверить размер пула и скорость выполнения запросов к базе — возможно, база сама стала узким местом.

19.13. PgBouncerQueryTimeTooHigh

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Запросы через PgBouncer выполняются слишком долго

Что означает: Средняя длительность запроса, проходящего через PgBouncer, превышает 5 секунд.

Что делать: Найти медленные запросы (pg_stat_statements) и оптимизировать их или добавить индексы.

19.14. DatabaseLowDiskAvailable

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Мало места на диске под PostgreSQL

Что означает: Диск с данными PostgreSQL (/var/lib/postgresql) занят на 80% и больше — меньше 20% свободного места.

Что делать: Освободить место (старые WAL/бэкапы) или расширить диск под базу данных, пока запись не остановилась.

20. Prometheus: служебные правила

20.1. MultipleDefaultStorageClasses

Важность: Критический

Время до срабатывания: 10 мин.

Описание: В кластере несколько StorageClass помечены как default

Что означает: Обнаружено более одного StorageClass с аннотацией default одновременно — поведение при автоматическом выборе класса для PVC без явного storageClassName становится непредсказуемым.

Что делать: Оставить default только у одного StorageClass, убрать аннотацию у остальных.

21. Prometheus (самомониторинг)

21.1. PrometheusBadConfig

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Prometheus не может перезагрузить конфигурацию

Что означает: Последняя попытка reload конфигурации Prometheus завершилась ошибкой (например, синтаксическая ошибка в правилах или scrape-конфиге) — Prometheus продолжает работать со старой конфигурацией.

Что делать: Посмотреть логи Prometheus на конкретную ошибку валидации конфигурации/правил.

21.2. PrometheusNotificationQueueRunningFull

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Очередь уведомлений Prometheus скоро переполнится

Что означает: По прогнозу на ближайшие 30 минут очередь отправки оповещений в Alertmanager заполнится полностью — новые оповещения могут начать теряться.

Что делать: Проверить доступность и скорость обработки со стороны Alertmanager, возможно он перегружен или недоступен.

21.3. PrometheusErrorSendingAlertsToSomeAlertmanagers

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Prometheus не может отправить часть оповещений в Alertmanager

Что означает: Более 1% попыток отправки оповещений в конкретный экземпляр Alertmanager завершаются ошибкой.

Что делать: Проверить доступность и состояние соответствующего instance Alertmanager, сеть до него.

21.4. PrometheusNotConnectedToAlertmanagers

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Prometheus не подключён ни к одному Alertmanager

Что означает: Prometheus не видит ни одного живого Alertmanager через service discovery — сработавшие оповещения никуда не отправляются.

Что делать: Проверить доступность Alertmanager и корректность конфигурации оповещений в Prometheus.

21.5. PrometheusTSDBReloadsFailing

Важность: Предупреждение

Время до срабатывания: 4 ч.

Описание: Ошибки перезагрузки блоков TSDB Prometheus

Что означает: За последние 3 часа были неудачные попытки Prometheus перечитать блоки данных с диска.

Что делать: Проверить логи Prometheus и состояние диска, на котором хранится TSDB.

21.6. PrometheusTSDBCompactionsFailing

Важность: Предупреждение

Время до срабатывания: 4 ч.

Описание: Ошибки компакции блоков TSDB Prometheus

Что означает: За последние 3 часа зафиксированы неудачные попытки компактации блоков хранилища временных рядов.

Что делать: Проверить логи Prometheus и свободное место/производительность диска под TSDB.

21.7. PrometheusNotIngestingSamples

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Prometheus не записывает новые метрики

Что означает: Prometheus перестал добавлять новые сэмплы в TSDB, хотя у него есть активные цели или правила — по сути мониторинг перестал видеть метрики.

Что делать: Проверить логи Prometheus и его ресурсы (память/диск), возможно требуется перезапуск.

21.8. PrometheusDuplicateTimestamps

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Prometheus отбрасывает сэмплы с дублирующимися таймстемпами

Что означает: Prometheus получает от какой-то цели несколько разных значений с одинаковым timestamp и вынужден их отбрасывать.

Что делать: Проверить экспортёр/приложение, которое отдаёт метрики с некорректными/повторяющимися таймстемпами.

21.9. PrometheusOutOfOrderTimestamps

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Prometheus отбрасывает сэмплы с таймстемпами не по порядку

Что означает: От какой-то цели приходят сэмплы с таймстемпами раньше уже записанных — они отбрасываются.

Что делать: Проверить время (NTP) и логику экспортёра, отдающего такие метрики.

21.10. PrometheusRemoteStorageFailures

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Ошибки отправки в remote storage

Что означает: Более 1% сэмплов не удаётся отправить во внешнее remote_write хранилище.

Что делать: Проверить доступность и производительность удалённого хранилища, логи Prometheus по конкретному remote_name/url.

21.11. PrometheusRemoteWriteBehind

Важность: Информационный

Время до срабатывания: 15 мин.

Описание: Remote write отстаёт от реального времени

Что означает: Очередь remote_write отстаёт от текущего времени больше чем на 120 секунд — удалённое хранилище не успевает получать свежие данные.

Что делать: Проверить пропускную способность и нагрузку на remote storage endpoint.

21.12. PrometheusRemoteWriteDesiredShards

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Remote write упирается в лимит шардов очереди

Что означает: Расчётное желаемое число шардов очереди remote_write превышает настроенный максимум — отправка данных не успевает за их поступлением.

Что делать: Увеличить max_shards в конфигурации remote_write либо разобраться, почему приёмник данных работает медленно.

21.13. PrometheusRuleFailures

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: У Prometheus не выполняются некоторые правила

Что означает: За последние 5 минут были ошибки при вычислении правил оповещения и recording-правил.

Что делать: Посмотреть логи Prometheus, найти правило с ошибкой (часто — деление на ноль или отсутствующие метрики).

21.14. PrometheusMissingRuleEvaluations

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Prometheus пропускает итерации вычисления правил

Что означает: Группа правил не успевает выполниться за отведённый интервал evaluation_interval и пропускает итерации.

Что делать: Увеличить interval группы правил или упростить/распараллелить тяжёлые запросы в ней.

21.15. PrometheusTargetLimitHit

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Достигнут лимит числа целей scrape

Что означает: Часть целей была отброшена, потому что превышен настроенный target_limit для job.

Что делать: Увеличить target_limit в scrape-конфиге или разбить job на несколько с более узким scope.

21.16. PrometheusLabelLimitHit

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Достигнут лимит по количеству/длине лейблов

Что означает: Часть целей отброшена из-за превышения label_limit, label_name_length_limit или label_value_length_limit.

Что делать: Проверить экспортёр, отдающий метрики с избыточным числом или длиной лейблов, либо увеличить лимиты.

21.17. PrometheusScrapeBodySizeLimitHit

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Достигнут лимит размера тела ответа при scrape

Что означает: Часть scrape-запросов провалилась, так как ответ цели превысил body_size_limit.

Что делать: Увеличить body_size_limit или сократить объём отдаваемых целью метрик.

21.18. PrometheusScrapeSampleLimitHit

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Достигнут лимит числа сэмплов при scrape

Что означает: Часть scrape-запросов провалилась из-за превышения sample_limit — цель отдаёт слишком много временных рядов за раз.

Что делать: Увеличить sample_limit или уменьшить кардинальность метрик у цели.

21.19. PrometheusTargetSyncFailure

Важность: Критический

Время до срабатывания: 5 мин.

Описание: Prometheus не может синхронизировать цели

Что означает: Из-за некорректной конфигурации Prometheus не смог синхронизировать список целей для сбора метрик.

Что делать: Проверить последние изменения scrape-конфигурации/ServiceMonitor на синтаксические или семантические ошибки.

22. Thanos Sidecar

22.1. ThanosSidecarBucketOperationsFailed

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Ошибки операций Thanos Sidecar с объектным хранилищем

Что означает: Thanos Sidecar, который выгружает блоки Prometheus в объектное хранилище, час получает ошибки операций с бакетом.

Что делать: Проверить доступность и права доступа к объектному хранилищу (MinIO/S3), используемому Thanos.

22.2. ThanosSidecarNoConnectionToStartedPrometheus

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Thanos Sidecar не может установить соединение с Prometheus

Что означает: Thanos Sidecar не видит запущенный и готовый к работе (WAL replay завершён) Prometheus рядом с собой.

Что делать: Проверить сетевое взаимодействие между контейнерами Prometheus и Thanos Sidecar в одном поде.

23. Prometheus Operator

23.1. PrometheusOperatorListErrors

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Prometheus Operator получает много ошибок list-операций

Что означает: Более 40% list-запросов контроллера Prometheus Operator к API Kubernetes завершаются ошибкой.

Что делать: Проверить RBAC-права и доступность kube-apiserver для Prometheus Operator.

23.2. PrometheusOperatorWatchErrors

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Prometheus Operator получает много ошибок watch-операций

Что означает: Более 40% watch-запросов контроллера завершаются ошибкой — оператор может не видеть изменения CRD (ServiceMonitor, PrometheusRule и т.п.) вовремя.

Что делать: Проверить RBAC и доступность API-сервера для Prometheus Operator.

23.3. PrometheusOperatorSyncFailed

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Reconciliation Prometheus Operator завершился ошибкой

Что означает: Последний цикл синхронизации ресурсов одним из контроллеров Prometheus Operator завершился неудачей.

Что делать: Посмотреть логи prometheus-operator на конкретную ошибку по контроллеру.

23.4. PrometheusOperatorReconcileErrors

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Много ошибок reconciliation у Prometheus Operator

Что означает: Более 10% операций reconciliation контроллера завершаются ошибками.

Что делать: Проверить логи оператора и валидность связанных CRD (Prometheus, Alertmanager, PrometheusRule и т.д.).

23.5. PrometheusOperatorNodeLookupErrors

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Ошибки поиска адресов нод у Prometheus Operator

Что означает: Оператор не может разрешить адреса нод при формировании конфигурации.

Что делать: Проверить DNS/сетевую связность оператора до API Kubernetes и до самих нод.

23.6. PrometheusOperatorNotReady

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Prometheus Operator не готов

Что означает: Контроллер Prometheus Operator сообщает, что не готов обрабатывать соответствующие ресурсы.

Что делать: Проверить статус и логи пода prometheus-operator.

23.7. PrometheusOperatorRejectedResources

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Prometheus Operator отклонил ресурсы

Что означает: Оператор отклонил часть управляемых им ресурсов (например, некорректные ServiceMonitor/PrometheusRule).

Что делать: Посмотреть события/логи оператора, найти конкретный отклонённый ресурс и исправить его определение.

23.8. ConfigReloaderSidecarErrors (Prometheus Operator)

Важность: Предупреждение

Время до срабатывания: 10 мин.

Описание: Вспомогательный контейнер config-reloader не может применить конфигурацию (Prometheus Operator)

Что означает: То же самое, что и оповещение выше, но правило продублировано в группе Prometheus Operator.

Что делать: См. пояснение к первому вхождению этого оповещения — посмотреть логи config-reloader и связанный ConfigMap/Secret.

24. StarVault

24.1. StarVault Sealed

Важность: Критический

Время до срабатывания: 0 мин.

Описание: StarVault запечатан (sealed)

Что означает: Instance StarVault (StarVault) находится в состоянии sealed — не может расшифровывать секреты и обслуживать запросы, пока не будет распечатан (unseal).

Что делать: Выполнить процедуру unseal (unseal keys/авто-unseal), это критично для всех сервисов, зависящих от секретов StarVault.

24.2. StarVaultTooManyInfinityTokens

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: Слишком много StarVault-токенов без срока действия

Что означает: В StarVault больше 3 токенов с бессрочным TTL (+Inf) — потенциальный риск безопасности, если такой токен утечёт.

Что делать: Проверить, кем и зачем выданы бессрочные токены, отозвать неоправданные и настроить политику TTL.

24.3. StarVaultClusterHealth

Важность: Критический

Время до срабатывания: 0 мин.

Описание: Кластер StarVault нездоров

Что означает: Доля активных (healthy) узлов StarVault упала до 50% или ниже от общего числа узлов кластера.

Что делать: Проверить состояние узлов StarVault и кворум storage backend (Raft/Consul).

25. Thanos Querier

25.1. ThanosQueryHttpRequestQueryErrorRateHigh

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Thanos Query отдаёт много ошибок на /query

Что означает: Более 5% HTTP-запросов на endpoint query у Thanos Querier завершаются ошибкой 5xx.

Что делать: Проверить логи Thanos Querier и доступность store-компонентов (Prometheus/Thanos Store), к которым он обращается.

25.2. ThanosQueryHttpRequestQueryRangeErrorRateHigh

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Thanos Query отдаёт много ошибок на /query_range

Что означает: То же самое, но для endpoint query_range (запросы диапазонов, обычно используются графиками).

Что делать: Аналогично — проверить логи и состояние store-компонентов Thanos.

25.3. ThanosQueryGrpcServerErrorRate

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Высокая доля ошибок gRPC-сервера Thanos Query

Что означает: Более 5% входящих gRPC-запросов к Thanos Querier завершаются ошибкой.

Что делать: Проверить логи Thanos Querier и нагрузку на него.

25.4. ThanosQueryGrpcClientErrorRate

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Высокая доля ошибок gRPC-клиента Thanos Query

Что означает: Более 5% исходящих gRPC-запросов от Thanos Querier к store-узлам завершаются ошибкой.

Что делать: Проверить доступность и состояние store-узлов (Prometheus Sidecar, Thanos Store Gateway), к которым обращается Querier.

25.5. ThanosQueryHighDNSFailures

Важность: Предупреждение

Время до срабатывания: 1 ч.

Описание: Много ошибок разрешения DNS-имён у Thanos Query

Что означает: Более 1% попыток разрешить адреса store-эндпоинтов через DNS завершаются ошибкой.

Что делать: Проверить DNS-сервис в кластере (CoreDNS) и корректность адресов store-эндпоинтов в конфигурации Thanos Query.

26. Сертификаты x509

26.1. X509ExporterReadErrors

Важность: Предупреждение

Время до срабатывания: 5 мин.

Описание: x509-certificate-exporter не может прочитать часть сертификатов

Что означает: За 15 минут экспортёр столкнулся с ошибками чтения файлов сертификатов или запросов к Kubernetes API.

Что делать: Проверить логи экспортёра; если ошибка появилась сразу при старте — возможно, это временно и связано с инициализацией.

26.2. CertificateError

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Сертификат не удаётся декодировать

Что означает: Найден сертификат (в Secret или на файловой системе ноды), который не получается распарсить как валидный x509-сертификат.

Что делать: Проверить указанный Secret/файл — сертификат повреждён или в неверном формате.

26.3. CertificateRenewal

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Сертификат стоит обновить (менее 28 дней до истечения)

Что означает: До истечения срока действия сертификата осталось меньше 28 дней — это раннее предупреждение.

Что делать: Запланировать продление/перевыпуск сертификата в обычном режиме. Требуется запланировать обновление сертификатов.

26.4. CertificateExpiration14days

Важность: Предупреждение

Время до срабатывания: 15 мин.

Описание: Сертификат истекает менее чем через 14 дней

Что означает: Срок действия сертификата истекает менее чем через 14 дней.

Что делать: Продлить/перевыпустить сертификат в ближайшее время, не откладывая надолго. Требуется запланировать обновление сертификатов.

26.5. CertificateExpiration7days

Важность: Критический

Время до срабатывания: 15 мин.

Описание: Сертификат истекает менее чем через 7 дней (критично)

Что означает: До истечения сертификата осталось меньше недели — риск отказа TLS-соединений становится реальным.

Что делать: Срочно продлить/перевыпустить сертификат, проверить работу cert-manager/автообновления, если он должен был сделать это сам. Требуется запланировать обновление сертификатов.

26.6. CertificateExpiration3days

Важность: Критический

Время до срабатывания: 15 мин.

Описание: Сертификат истекает менее чем через 3 дня (критично)

Что означает: До истечения сертификата осталось меньше 3 дней.

Что делать: Немедленно продлить/перевыпустить сертификат — вручную, если автоматизация не сработала. Требуется запланировать обновление сертификатов.

26.7. CertificateExpiration1day

Важность: Критический

Время до срабатывания: 15 мин.

Описание: Сертификат истекает менее чем через 1 день (критично)

Что означает: До истечения сертификата остаются часы — сервисы, использующие его, вот-вот начнут получать ошибки TLS.

Что делать: Экстренно перевыпустить/заменить сертификат прямо сейчас. Требуется запланировать обновление сертификатов.

27. OperatorHub

27.1. CsvAbnormalFailedOver2Min

Важность: Предупреждение

Время до срабатывания: 2 мин.

Описание: Установка оператора (OLM CSV) провалилась

Что означает: ClusterServiceVersion (описание версии оператора в OLM) находится в статусе Failed дольше 2 минут.

Что делать: Посмотреть события/описание CSV (reason из label) и логи OLM-каталога, из которого ставился оператор.

27.2. CsvAbnormalOver30Min

Важность: Предупреждение

Время до срабатывания: 30 мин.

Описание: Установка/обновление оператора (OLM CSV) зависло

Что означает: CSV дольше 30 минут находится в переходном/нештатном статусе (Replacing, Pending, Deleting, Unknown) — установка или обновление оператора застряло.

Что делать: Проверить статус и события CSV/Subscription/InstallPlan этого оператора в namespace nova-operatorhub.

27.3. InstallPlanStepAppliedWithWarnings

Важность: Предупреждение

Описание: OLM применил шаг установки с предупреждениями

Что означает: При установке или обновлении оператора через OLM API-сервер вернул предупреждение на одном из шагов InstallPlan.

Что делать: Посмотреть событие AppliedWithWarnings и связанный InstallPlan, чтобы понять, что именно вызвало предупреждение.