diff --git a/docs/backlog.md b/docs/backlog.md index 8e2d717..b44cc61 100644 --- a/docs/backlog.md +++ b/docs/backlog.md @@ -239,3 +239,21 @@ Chelsty-infra milczy, ale status NOMINAL podważa zaufanie do panelu. **Fix**: heartbeat TTL → po przekroczeniu oznacz status `stale` lub `down`. **Powiązane**: brain-watchdog ślepy na per-node freshness. *(Otwarty jako TODO implementacyjny — przeniesiony z sesji 2026-06-08)* + +## Anomaly detection liveness — mózg uczy się wzorca dobowego per node (pomysł 2026-06-26) + +**Idea**: zamiast statycznych okien czasowych w regułach alertowych (np. "lustro 7-23"), +mózg (supervisor/observer) czyta historię metryk z Prometheus (range queries / Grafana) +i SAM wykrywa wzorzec dobowy każdego węzła. `up==0` zgodne z nauczonym wzorcem offline +(lustro zwykle off nocą, solaria nieregularnie) = NIE anomalia, nie alarmuj. `up==0` +odbiegające od wzorca = realna awaria → alert. Inteligencja w mózgu + dane jako źródło +wzorca, nie sztywne godziny wpisywane ręcznie. + +**Warunek**: wymaga TYGODNI historii metryk. fleet-prometheus postawiony 2026-06-25 → +realne dopiero za ~2-4 tygodnie, gdy uzbiera się wzorzec dobowy. + +**Pułapka**: uczący się system może przeoczyć realną awarię pokrywającą się z typowym +oknem offline (statyczna reguła jest głupia, ale przewidywalna). Uwzględnić przy projektowaniu. + +**Na teraz**: targety scrape'owane BEZ polityki alertowej, label tylko `node:`. Prometheus +gromadzi historię. Anomaly detection = osobny świadomy projekt później (CC, z testami).