Rozstrzygniecie 1. Monolit mieszal cztery typy OKF. Rozbity PER TYP po
granicy sekcji `##`:
10 x decision — pozycje backlogu (w tym backlog-aktywne 28 KB
i backlog-zamkniete 12 KB, ktore zostaja calosciami)
7 x incident — bugi/awarie dotad wtopione w backlog: cutover HA ken,
checkpoint observera, ha-diag-agent node=unknown,
deploy-local ghost-kontenery, paperless-worker config,
deploy-node nie przebudowuje obrazu, ollama bez sterownika
2 x phase — HA configs-as-code, monitoring floty Prometheus
kb/phases/backlog.md zostaje jako cienki indeks (type: phase, status: active):
oryginalna preambula + wygenerowany spis linkow do wszystkich 19 elementow.
23 przychodzace odwolania zostaja przepiete na ta sciezke w grupie 7.
NIE rozbijano po `###` (38 pozycji w "Aktywne" + 13 w "Zamkniete" = 51
plikow). Rozstrzygniecie mowi "rozbij per typ", a nie per pozycja;
rozdrobnienie do 51 plikow rozerwaloby czytelnosc backlogu.
Kontrola: preambula + 19 sekcji == oryginal z HEAD (multizbior niepustych
linii). Tresc pozycji nietknieta.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
32 lines
1.4 KiB
Markdown
32 lines
1.4 KiB
Markdown
---
|
||
okf: "0.1"
|
||
type: decision
|
||
visibility: private
|
||
status: active
|
||
updated: 2026-08-04
|
||
links:
|
||
- ../phases/backlog.md
|
||
- ../incidents/2026-07-30-ollama-solaria-vanish.md
|
||
---
|
||
|
||
## M1 aktywna na SOLARII — cleanup node-agenta wyłączony do czasu R1 (2026-08-04)
|
||
|
||
**Data**: 2026-08-04
|
||
**Źródło**: `docs/incidents/2026-07-30-ollama-solaria-vanish.md` (§7, M1).
|
||
**Stan**: w `hosts/solaria/runtime/node-agent/docker-compose.override.yml` ustawiono
|
||
`NODE_TYPE=lte_node` (było `ai_node`) na czas backfillu embed (faza mailowa KB).
|
||
`lte_node` powoduje wczesny return w `run_safe_cleanup()`, więc na SOLARII nie działa
|
||
niefiltrowany `docker container prune` kasujący zatrzymane kontenery w ≤60 s —
|
||
łącznie z tymi, które mają `restart: unless-stopped` i zostały zatrzymane świadomie.
|
||
`self.node_type` jest czytane wyłącznie w `run_safe_cleanup()` i dwóch liniach logu,
|
||
więc monitoring, eventy i dispatch akcji działają bez zmian.
|
||
**Skutek uboczny**: `lte_node` pomija CAŁY cleanup — na czas mitygacji nie są sprzątane
|
||
dangling images ani build cache. Pilnować miejsca na dysku SOLARII.
|
||
**Nie zdeployowane** — zmiana jest tylko w repo (branch `task/m1-prune-mitigation`);
|
||
wchodzi przy najbliższym redeployu node-agenta na SOLARII.
|
||
**Zdjąć po**: wdrożeniu R1 (filtrowanie prune po restart policy / labelu compose) na tym
|
||
nodzie — wtedy przywrócić `NODE_TYPE=ai_node`. R1–R3 w toku po stronie subsystemu A.
|
||
|
||
---
|
||
|