Dwa niezalezne root cause: PermissionError na save_eml (archiwum root:root po sudo-runach 06.08) + fleet-prometheus nigdy nie dostal /-/reload po dodaniu regul kb-mail-sync.yml/kb-ingest.yml (zylo tylko fleet-liveness). Naprawa: chown archiwum + 2 tick recovery (548 kopert, 0 bledow) + reload Prometheusa z weryfikacja lancucha alertowego end-to-end (brain-watchdog->Telegram wpiety poprawnie).
2.1 KiB
2.1 KiB
| okf | type | visibility | status | updated | links |
|---|---|---|---|---|---|
| 0.1 | session-log | private | active | 2026-08-26 |
Sesja 2026-08-26 — incydent kb-mail-sync: 20 dni ciszy, wykryte i naprawione
Timeline
- Wykrycie — przy sanity checku po 3 tygodniach bez nadzoru (kontynuacja sesji 16:00,
patrz
docs/sessions/2026-08-26.md):mail-imap-syncnie zapisał żadnej koperty od 2026-08-06 18:01 (pierwszy i jedyny udany tick automatu) mimo że timer tykał godzinowo przez 20 dni. ~548 maili zaległości. - Diagnoza —
PermissionErrornasave_eml: katalogi archiwum2026/08powstałyroot:rootz ręcznychsudo-runów 06.08, timer działa jakooskar. Kursor nie przeskakiwał niezapisanej wiadomości (zgodnie z projektem) — stąd cisza bez utraty poczty, ale też bez sygnału. - Naprawa zapisu —
chown -R oskar:oskarna archiwum + dwa ręczne ticki: run#1 170 inserted/379 perm-errors (zaległości sprzed chowna), run#2 378 inserted/155 archive_exists/0 errors — pełne odzyskanie. - Reload Prometheusa — przez CC z SOLARII (SSH na VPS):
promtool check rulesOK,POST /-/reload, weryfikacja/api/v1/rules(wszystkie trzy grupy żywe), metryka scrape'owana i świeża,/api/v1/alertsczyste,brain-watchdog→Telegram wpięty poprawnie (PROMETHEUS_URLOK, kontener healthy).
Pełny opis root cause (oba, niezależne) i rekomendacje R1–R3: kb/incidents/2026-08-26-mail-sync-20-dni-ciszy.md.
Stan
Przyrostówka znów żywa i po raz pierwszy faktycznie monitorowana — reguła
KbMailSyncStale istniała w repo od 06.08, ale dopiero teraz jest realnie załadowana w
Prometheusie. Wcześniej alert nie mógł wystrzelić niezależnie od tego, jak długo trwałaby
awaria zapisu.
Plan sprzed incydentu — przesunięty
Rotacja haseł (kb-postgres + teraz też TG_TOKEN, wyciekł w tej sesji przez cat .env
diagnostyczny — czwarty przypadek tej klasy) i recon Fazy 5 (wiki-kompilat) — obie pozycje
przesunięte na następną sesję, nie ruszone dzisiaj poza samą diagnozą.