docs(backlog): add anomaly-detection liveness idea (mózg learns per-node daily pattern)
This commit is contained in:
parent
3b71707660
commit
1529911012
|
|
@ -239,3 +239,21 @@ Chelsty-infra milczy, ale status NOMINAL podważa zaufanie do panelu.
|
|||
**Fix**: heartbeat TTL → po przekroczeniu oznacz status `stale` lub `down`.
|
||||
**Powiązane**: brain-watchdog ślepy na per-node freshness.
|
||||
*(Otwarty jako TODO implementacyjny — przeniesiony z sesji 2026-06-08)*
|
||||
|
||||
## Anomaly detection liveness — mózg uczy się wzorca dobowego per node (pomysł 2026-06-26)
|
||||
|
||||
**Idea**: zamiast statycznych okien czasowych w regułach alertowych (np. "lustro 7-23"),
|
||||
mózg (supervisor/observer) czyta historię metryk z Prometheus (range queries / Grafana)
|
||||
i SAM wykrywa wzorzec dobowy każdego węzła. `up==0` zgodne z nauczonym wzorcem offline
|
||||
(lustro zwykle off nocą, solaria nieregularnie) = NIE anomalia, nie alarmuj. `up==0`
|
||||
odbiegające od wzorca = realna awaria → alert. Inteligencja w mózgu + dane jako źródło
|
||||
wzorca, nie sztywne godziny wpisywane ręcznie.
|
||||
|
||||
**Warunek**: wymaga TYGODNI historii metryk. fleet-prometheus postawiony 2026-06-25 →
|
||||
realne dopiero za ~2-4 tygodnie, gdy uzbiera się wzorzec dobowy.
|
||||
|
||||
**Pułapka**: uczący się system może przeoczyć realną awarię pokrywającą się z typowym
|
||||
oknem offline (statyczna reguła jest głupia, ale przewidywalna). Uwzględnić przy projektowaniu.
|
||||
|
||||
**Na teraz**: targety scrape'owane BEZ polityki alertowej, label tylko `node:`. Prometheus
|
||||
gromadzi historię. Anomaly detection = osobny świadomy projekt później (CC, z testami).
|
||||
|
|
|
|||
Loading…
Reference in a new issue