Cooldown до 2-го выпуска
Первая ступень эскалирующего cooldown (ADR-005): пауза перед тем, как инцидент (ключ дедупликации — класс + провайдер) выпустится в ленту во второй раз.
если меньше Чаще повтор одного и того же инцидента сразу после первого выпуска — дежурный привыкает к повторам и перестаёт их читать.
если больше Второе напоминание о ещё не решённом инциденте придёт позже.
Три ступени обязаны не убывать: 1-я ≤ 2-я ≤ 3-я. Лестница задом наперёд означает «чем дольше горит инцидент, тем чаще будим дежурного» — бэкенд отклоняет такой патч целиком (400) с точным указанием, какая ступень нарушена. Нижняя граница = интервал опроса (сейчас 1 мин по умолчанию) — бэкенд физически не успевает переоценить сигнал чаще.
Cooldown до 3-го выпуска
Вторая ступень лестницы: пауза перед третьим выпуском того же инцидента — если он всё ещё не решён после первого повтора.
если меньше Третье напоминание приходит раньше — ближе к темпу первой ступени, эскалация слабее.
если больше Инцидент, доживший до третьего выпуска, дольше не напоминает о себе.
Три ступени обязаны не убывать: 1-я ≤ 2-я ≤ 3-я. Лестница задом наперёд означает «чем дольше горит инцидент, тем чаще будим дежурного» — бэкенд отклоняет такой патч целиком (400) с точным указанием, какая ступень нарушена.
Cooldown с 4-го выпуска и далее
Третья, конечная ступень: пауза перед четвёртым и каждым следующим выпуском — лестница дальше не растёт, это потолок.
если меньше Долгоживущий нерешённый инцидент продолжает напоминать о себе чаще, чем задумано эскалацией.
если больше Долгоживущий инцидент почти замолкает — при очень большом значении реагирование на застарелую проблему растягивается на дни.
Три ступени обязаны не убывать: 1-я ≤ 2-я ≤ 3-я. Лестница задом наперёд означает «чем дольше горит инцидент, тем чаще будим дежурного» — бэкенд отклоняет такой патч целиком (400) с точным указанием, какая ступень нарушена.
Порог «провайдер потерян»
Сколько времени без единого успешного опроса должно пройти, прежде чем провайдер считается потерянным (алерт класса data_health).
если меньше Провайдер помечается потерянным чаще — обычная задержка опроса или короткий сетевой сбой превращаются в ложную тревогу «нет данных».
если больше Реальная потеря наблюдений будет замечена позже — всё это время дашборд продолжит показывать последнее известное значение так, будто оно свежее.
Нижняя граница на бэкенде — интервал опроса (сейчас 1 мин по умолчанию): порог короче интервала опроса протухал бы раньше, чем успевает прийти следующий тик.
Порог доли сбоев
Доля сбойных опросов в окне, выше которой провайдер считается «слепым» — детектор перестаёт доверять его наблюдениям.
если меньше Более чувствителен к спорадическим сбоям — временные сетевые проблемы чаще выглядят как деградация провайдера.
если больше Устойчивее к разовым сбоям, но настоящая деградация провайдера (частые ошибки API) будет замечена позже.
Порог всплеска расхода
Во сколько раз расход должен превысить адаптивную базовую линию (медиана + MAD), чтобы считаться всплеском.
если меньше Более чувствителен к всплескам — обычный шум провайдера чаще проходит порог.
если больше Пропустит небольшие, но реальные аномалии расхода.
Порог выхода из уже открытой тревоги (spikeExitRatio, по умолчанию 2.0) в этой форме не редактируется, а этот порог обязан быть строго больше него — иначе бэкенд отклонит патч (400): без запаса гистерезис не защищает от дребезга между входом и выходом из тревоги.
Множитель MAD
Насколько порог всплеска растягивается для шумных провайдеров: итоговый порог = 1 + k · 1.4826 · (MAD / медиана).
если меньше Порог ближе к фиксированному ×3 для всех — шумные провайдеры (разброс 15–20% от медианы) чаще дают ложные всплески.
если больше Порог для шумных провайдеров растягивается сильнее — настоящий всплеск у шумного провайдера может остаться незамеченным.
Прогрев после старта
Пока с запуска ноды не прошло это время, прогнозные классы (runway, spike) молчат — базовой линии ещё не существует. Пороговые и data_health-алерты работают всегда.
если меньше Прогнозные алерты включаются раньше, но на менее надёжной базовой линии — выше риск ложного срабатывания в первые минуты.
если больше Дольше «слепой» период после каждого рестарта ноды — runway и spike-алерты не сработают вообще, даже при реальной проблеме.