Spend monitor где деньги кончатся первыми
Тема

Пороги детектора

применяются сразу после подтверждения, без пересборки

Cooldown до 2-го выпуска

Первая ступень эскалирующего cooldown (ADR-005): пауза перед тем, как инцидент (ключ дедупликации — класс + провайдер) выпустится в ленту во второй раз.

если меньше Чаще повтор одного и того же инцидента сразу после первого выпуска — дежурный привыкает к повторам и перестаёт их читать.
если больше Второе напоминание о ещё не решённом инциденте придёт позже.

Три ступени обязаны не убывать: 1-я ≤ 2-я ≤ 3-я. Лестница задом наперёд означает «чем дольше горит инцидент, тем чаще будим дежурного» — бэкенд отклоняет такой патч целиком (400) с точным указанием, какая ступень нарушена. Нижняя граница = интервал опроса (сейчас 1 мин по умолчанию) — бэкенд физически не успевает переоценить сигнал чаще.

мин
сейчас: 45 мин · по умолчанию: 45 мин
Cooldown до 3-го выпуска

Вторая ступень лестницы: пауза перед третьим выпуском того же инцидента — если он всё ещё не решён после первого повтора.

если меньше Третье напоминание приходит раньше — ближе к темпу первой ступени, эскалация слабее.
если больше Инцидент, доживший до третьего выпуска, дольше не напоминает о себе.

Три ступени обязаны не убывать: 1-я ≤ 2-я ≤ 3-я. Лестница задом наперёд означает «чем дольше горит инцидент, тем чаще будим дежурного» — бэкенд отклоняет такой патч целиком (400) с точным указанием, какая ступень нарушена.

мин
сейчас: 120 мин · по умолчанию: 120 мин
Cooldown с 4-го выпуска и далее

Третья, конечная ступень: пауза перед четвёртым и каждым следующим выпуском — лестница дальше не растёт, это потолок.

если меньше Долгоживущий нерешённый инцидент продолжает напоминать о себе чаще, чем задумано эскалацией.
если больше Долгоживущий инцидент почти замолкает — при очень большом значении реагирование на застарелую проблему растягивается на дни.

Три ступени обязаны не убывать: 1-я ≤ 2-я ≤ 3-я. Лестница задом наперёд означает «чем дольше горит инцидент, тем чаще будим дежурного» — бэкенд отклоняет такой патч целиком (400) с точным указанием, какая ступень нарушена.

мин
сейчас: 360 мин · по умолчанию: 360 мин
Порог «провайдер потерян»

Сколько времени без единого успешного опроса должно пройти, прежде чем провайдер считается потерянным (алерт класса data_health).

если меньше Провайдер помечается потерянным чаще — обычная задержка опроса или короткий сетевой сбой превращаются в ложную тревогу «нет данных».
если больше Реальная потеря наблюдений будет замечена позже — всё это время дашборд продолжит показывать последнее известное значение так, будто оно свежее.

Нижняя граница на бэкенде — интервал опроса (сейчас 1 мин по умолчанию): порог короче интервала опроса протухал бы раньше, чем успевает прийти следующий тик.

мин
сейчас: 15 мин · по умолчанию: 15 мин
Порог доли сбоев

Доля сбойных опросов в окне, выше которой провайдер считается «слепым» — детектор перестаёт доверять его наблюдениям.

если меньше Более чувствителен к спорадическим сбоям — временные сетевые проблемы чаще выглядят как деградация провайдера.
если больше Устойчивее к разовым сбоям, но настоящая деградация провайдера (частые ошибки API) будет замечена позже.
%
сейчас: 50 % · по умолчанию: 50 %
Порог всплеска расхода

Во сколько раз расход должен превысить адаптивную базовую линию (медиана + MAD), чтобы считаться всплеском.

если меньше Более чувствителен к всплескам — обычный шум провайдера чаще проходит порог.
если больше Пропустит небольшие, но реальные аномалии расхода.

Порог выхода из уже открытой тревоги (spikeExitRatio, по умолчанию 2.0) в этой форме не редактируется, а этот порог обязан быть строго больше него — иначе бэкенд отклонит патч (400): без запаса гистерезис не защищает от дребезга между входом и выходом из тревоги.

×
сейчас: 3 × · по умолчанию: 3 ×
Множитель MAD

Насколько порог всплеска растягивается для шумных провайдеров: итоговый порог = 1 + k · 1.4826 · (MAD / медиана).

если меньше Порог ближе к фиксированному ×3 для всех — шумные провайдеры (разброс 15–20% от медианы) чаще дают ложные всплески.
если больше Порог для шумных провайдеров растягивается сильнее — настоящий всплеск у шумного провайдера может остаться незамеченным.
× MAD
сейчас: 8 × MAD · по умолчанию: 8 × MAD
Прогрев после старта

Пока с запуска ноды не прошло это время, прогнозные классы (runway, spike) молчат — базовой линии ещё не существует. Пороговые и data_health-алерты работают всегда.

если меньше Прогнозные алерты включаются раньше, но на менее надёжной базовой линии — выше риск ложного срабатывания в первые минуты.
если больше Дольше «слепой» период после каждого рестарта ноды — runway и spike-алерты не сработают вообще, даже при реальной проблеме.
мин
сейчас: 45 мин · по умолчанию: 45 мин
изменений нет
Значения общие для всех провайдеров — раздельных порогов по провайдеру нет. «По умолчанию» — это значения, зашитые в код детектора; кнопка сброса возвращает поле к ним, а не к тому, что было до правки в этой сессии.
Оценка расхода строится по разности наблюдений и имеет известный предел точности: пополнение между двумя опросами маскирует расход. Это предел метода, а не дефект данных.