homelab-codex-ws/docs/sessions/2026-06-30-fleet-inventory.md
oskar 510fe0b600 feat(kb): frontmatter OKF dla 39 session logow
Session logi zostaja w docs/sessions/ (decyzja z etapu 1). Dodany wylacznie
blok frontmattera: type: session-log, visibility: private, status: active,
updated = data ostatniego commita pliku.

Tresc nietknieta — kazdy plik to +9/-0 linii.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-04 16:58:04 +02:00

3.4 KiB

okf type visibility status updated links
0.1 session-log private active 2026-06-30

Sesja 2026-06-30 — Inwentaryzacja floty + gaszenie dysku SATURN

Cel

Pełna inwentaryzacja floty (repo↔rzeczywistość) jako fundament przed dalszą architekturą dokumentów KB. Start od weryfikacji stanu faktycznego wszystkich nodów.

Zrobione

Inwentaryzacja floty (główna robota)

  • CC (Sonnet 4.6) w worktree fleet-inventory zebrał stan faktyczny (docker ps + free/df/nproc) z 4 dostępnych nodów: PIHA, VPS, SOLARIA, SATURN. LUSTRO+CHELSTY offline (timeout :22) -> oznaczone UNREACHABLE.
  • Wynik: docs/infra/inventory-2026-06-30.md — 23 zpriorytetyzowane rozjazdy.
  • Kluczowe ustalenia:
    • forgejo biega na PIHA (always-on), ale service.yaml owner_node=saturn — rozjazd
    • mosquitto biega na VPS, service.yaml owner=piha, na PIHA go nie ma
    • npm — dwie instancje: PIHA (LAN ingress :80/:443) + VPS (public); repo zna jedna
    • homeassistant5 na PIHA (HA "ken", :8123) niedeklarowany w repo
    • control-plane biega na VPS (healthy) I SATURN (control-plane-ui UNHEALTHY)
    • PIHA: 40 kontenerow, ~6 w GitOps, 33 "shadow" poza repo (immich, vaultwarden, wikijs, actual, audiobookshelf, elasticsearch, grafana, prom, portainer...)
    • capabilities nieaktualne: SATURN RAM 8->14GiB, dysk 64->159GB; SOLARIA CPU 24->32
    • ollama zadeklarowana (owner=solaria) ale NIE biega

Gaszenie dysku SATURN (pilne — ugaszone)

  • SATURN dysk 91% (15G wolne) = jedyne realne ryzyko awarii.
  • docker image prune -a -f -> +4.1G (k3s/k3d sprzed 4 lat, stary HA 2.3G, postgresy)
  • journalctl --vacuum-size=200M -> +3.7G
  • rm syslog.1 + rotacje -> +4.2G
  • Wynik: 91% -> 83% (27G wolne), poza strefa ryzyka.
  • Bonus diagnostyczny: przyczyna control-plane-ui UNHEALTHY = healthcheck uzywa curl, ktorego NIE MA w obrazie -> failuje w kolko -> log spam (4.2G syslog).
  • /opt/anaconda3 16G = najwiekszy pojedynczy zjadacz dysku (env-y Pythona, decyzja Oskara).

safeclean.sh — 3 bugi naprawione (repo ubuntu-scripts, osobne)

  • BUG #1: dry-run pokazywal reclaimable z docker system df (bez filtra), a apply prune'owal z --filter until=168h -> dry-run obiecywal 4.8G, apply robil 0B. Fix: dry-run pokazuje teraz realny reclaim z filtrem + tip o --docker-all.
  • BUG #2: du podwojnie liczyl eCryptfs home -> warning dodany.
  • BUG #3: rotated rsyslog (syslog.1 4.2G) byl poza zakresem -> dodana kategoria "rotated system logs" (kasuje tylko zrotowane, nigdy aktywne).
  • Commit 37233f0 na main (ubuntu-scripts).

Nastepna sesja — naprawa 23 rozjazdow (pogrupowana)

  • Grupa A (czyste docs, zero ryzyka): capabilities SATURN/SOLARIA, forgejo owner_node->piha, mosquitto->vps, brakujace hosts/saturn/services.yaml
  • Grupa B (wymaga decyzji): npm x2 (zostawic oba czy usunac PIHA?), control-plane na SATURN (dev-instance czy usunac? + healthcheck curl fix), ollama nie biega
  • Grupa C (sprzatanie): postgres:18->17, anonimowy outline-postgres image, humanai/umami do repo, audyt 33 shadow kontenerow PIHA

Watek wstrzymany (z poprzedniej sesji)

Architektura dokumentow KB — decyzje zamkniete (SSO=Forgejo-OIDC, ingress LAN-only, archiwum hybryda Nextcloud-kopia/Paperless-referencja), host OTWARTY (PIHA ~0.5G wolne RAM -> Nextcloud sie nie zmiesci). Wrocic po naprawie rozjazdow — inwentaryzacja potwierdzila ze PIHA przeciazona (40 kontenerow), wiec host dokumentow wymaga decyzji.