30 lines
1.2 KiB
Markdown
30 lines
1.2 KiB
Markdown
|
|
---
|
||
|
|
okf: "0.1"
|
||
|
|
type: decision
|
||
|
|
visibility: private
|
||
|
|
status: active
|
||
|
|
updated: 2026-08-03
|
||
|
|
links:
|
||
|
|
- ../phases/backlog.md
|
||
|
|
---
|
||
|
|
|
||
|
|
## Anomaly detection liveness — mózg uczy się wzorca dobowego per node (pomysł 2026-06-26)
|
||
|
|
|
||
|
|
**Idea**: zamiast statycznych okien czasowych w regułach alertowych (np. "lustro 7-23"),
|
||
|
|
mózg (supervisor/observer) czyta historię metryk z Prometheus (range queries / Grafana)
|
||
|
|
i SAM wykrywa wzorzec dobowy każdego węzła. `up==0` zgodne z nauczonym wzorcem offline
|
||
|
|
(lustro zwykle off nocą, solaria nieregularnie) = NIE anomalia, nie alarmuj. `up==0`
|
||
|
|
odbiegające od wzorca = realna awaria → alert. Inteligencja w mózgu + dane jako źródło
|
||
|
|
wzorca, nie sztywne godziny wpisywane ręcznie.
|
||
|
|
|
||
|
|
**Warunek**: wymaga TYGODNI historii metryk. fleet-prometheus postawiony 2026-06-25 →
|
||
|
|
realne dopiero za ~2-4 tygodnie, gdy uzbiera się wzorzec dobowy.
|
||
|
|
|
||
|
|
**Pułapka**: uczący się system może przeoczyć realną awarię pokrywającą się z typowym
|
||
|
|
oknem offline (statyczna reguła jest głupia, ale przewidywalna). Uwzględnić przy projektowaniu.
|
||
|
|
|
||
|
|
**Na teraz**: targety scrape'owane BEZ polityki alertowej, label tylko `node:`. Prometheus
|
||
|
|
gromadzi historię. Anomaly detection = osobny świadomy projekt później (CC, z testami).
|
||
|
|
|
||
|
|
---
|