homelab-codex-ws/kb/decisions/backlog-m1-solaria-prune-mitigation.md
oskar e87bef4cf2 feat(kb): SPLIT backlog.md (72 KB) -> 19 dokumentow + cienki indeks
Rozstrzygniecie 1. Monolit mieszal cztery typy OKF. Rozbity PER TYP po
granicy sekcji `##`:

  10 x decision  — pozycje backlogu (w tym backlog-aktywne 28 KB
                   i backlog-zamkniete 12 KB, ktore zostaja calosciami)
   7 x incident  — bugi/awarie dotad wtopione w backlog: cutover HA ken,
                   checkpoint observera, ha-diag-agent node=unknown,
                   deploy-local ghost-kontenery, paperless-worker config,
                   deploy-node nie przebudowuje obrazu, ollama bez sterownika
   2 x phase     — HA configs-as-code, monitoring floty Prometheus

kb/phases/backlog.md zostaje jako cienki indeks (type: phase, status: active):
oryginalna preambula + wygenerowany spis linkow do wszystkich 19 elementow.
23 przychodzace odwolania zostaja przepiete na ta sciezke w grupie 7.

NIE rozbijano po `###` (38 pozycji w "Aktywne" + 13 w "Zamkniete" = 51
plikow). Rozstrzygniecie mowi "rozbij per typ", a nie per pozycja;
rozdrobnienie do 51 plikow rozerwaloby czytelnosc backlogu.

Kontrola: preambula + 19 sekcji == oryginal z HEAD (multizbior niepustych
linii). Tresc pozycji nietknieta.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-04 16:53:57 +02:00

1.4 KiB
Raw Blame History

okf type visibility status updated links
0.1 decision private active 2026-08-04
../phases/backlog.md
../incidents/2026-07-30-ollama-solaria-vanish.md

M1 aktywna na SOLARII — cleanup node-agenta wyłączony do czasu R1 (2026-08-04)

Data: 2026-08-04 Źródło: docs/incidents/2026-07-30-ollama-solaria-vanish.md (§7, M1). Stan: w hosts/solaria/runtime/node-agent/docker-compose.override.yml ustawiono NODE_TYPE=lte_node (było ai_node) na czas backfillu embed (faza mailowa KB). lte_node powoduje wczesny return w run_safe_cleanup(), więc na SOLARII nie działa niefiltrowany docker container prune kasujący zatrzymane kontenery w ≤60 s — łącznie z tymi, które mają restart: unless-stopped i zostały zatrzymane świadomie. self.node_type jest czytane wyłącznie w run_safe_cleanup() i dwóch liniach logu, więc monitoring, eventy i dispatch akcji działają bez zmian. Skutek uboczny: lte_node pomija CAŁY cleanup — na czas mitygacji nie są sprzątane dangling images ani build cache. Pilnować miejsca na dysku SOLARII. Nie zdeployowane — zmiana jest tylko w repo (branch task/m1-prune-mitigation); wchodzi przy najbliższym redeployu node-agenta na SOLARII. Zdjąć po: wdrożeniu R1 (filtrowanie prune po restart policy / labelu compose) na tym nodzie — wtedy przywrócić NODE_TYPE=ai_node. R1R3 w toku po stronie subsystemu A.