documents-ingest-cyclic (jobs/documents-ingest/src/documents_ingest/cyclic_ingest.py): orkiestruje paperless_adapter -> chunk_embed -> summarize(--backend anthropic, claude-haiku-4-5) -> summarize(--embed-summaries) bez zmian w samych jobach. Ollama@SOLARIA (availability_target: medium) jest tolerowana offline: probe GET /api/tags przed obu etapami embed, brak -> pominięcie, nie fail (oba embed passy idempotentne, nadrobią się na kolejnym ticku). Czwarty etap (embed-summaries) dopisany ponad plan §7.1 (który wymieniał tylko 3 kroki) — bez niego nowe streszczenia miałyby embedding=NULL i byłyby niewidoczne dla cascade_query (bramka kroku 4, WHERE embedding IS NOT NULL); potwierdzone z Oskarem. Predykaty pass/fail każdego etapu 1:1 z exit-checkiem danego joba (chunks_errors, llm_errors, stats-balance itd.) — etapy izolowane, nie fail-fast (wcześniejszy fail nie blokuje kolejnych, tak jak joby izolują błędy per wiersz). Metryki .prom (atomowy zapis, last_success_timestamp trzymany z poprzedniego pliku przy failu) do /opt/homelab/state/node-exporter/kb-ingest.prom. 36 nowych testów (202/202 pakietu). systemd (jobs/documents-ingest/systemd/): pierwszy systemd-timer w repo — kb-ingest.timer (OnCalendar=*-*-* 03:30, Persistent=true, plan §7.1) + kb-ingest.service (host-level, User oskar, EnvironmentFile /opt/homelab/kb/.env) + kb-ingest-run.sh (log per-run do /opt/homelab/logs/kb-ingest/, konwencja repo). Instalacja i sekrety udokumentowane w README (Faza 3 krok 5) — instalacja na PIHA dopiero po merge. fleet-prometheus (rules/kb-ingest.yml): KbIngestStale (>172800s od last_success, critical) + KbEmbedBacklogGrowing (backlog>0 przez 72h, warning) — dostawa istniejącym torem brain-watchdog->Telegram, bez Alertmanagera (konwencja liveness.yml). node_exporter: owner_node vps -> per-host (service.yaml) + wpis + override (--collector.textfile.directory, bez nowego mountu — czyta przez istniejący /:/host:ro) + topology.yaml dla PIHA. Domyka pozycję z docs/backlog.md "stability-agent / node_exporter owner_node single, biegaja wielomiejscowo -> per-host" (połowę — node_exporter; stability-agent zostaje osobnym follow-upem) w ramach paczki B inwentaryzacji monitoringu dla PIHA. Test end-to-end na żywo na PIHA (2× --apply, po potwierdzeniu z Oskarem): pierwszy run złapał 5 dokumentów faktycznie nowych w Paperless (nieoczekiwane, niezwiązane z tym taskiem) -> 82 nowe chunki (2 ocr_junk), 5 nowych streszczeń, 5 embeddingów streszczeń, 0 błędów, metryki zapisane. Drugi run: pełna idempotencja, wszystko 0. ANTHROPIC_API_KEY dodany przez Oskara ręcznie do /opt/homelab/kb/.env (nigdy nie logowany/generowany). Co dalej: prawdziwa instalacja systemd (services.yaml już przygotowany, po merge), zdecydowanie czy stability-agent też idzie na per-host przy okazji. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
39 lines
2.2 KiB
YAML
39 lines
2.2 KiB
YAML
# fleet-prometheus kb-ingest rules — module 5 phase 3 step 5
|
|
# (docs/kb/modules/05-faza3-plan.md §7.2).
|
|
#
|
|
# Same delivery convention as liveness.yml: no Alertmanager, these rules only make alerts
|
|
# FIRING (visible at GET /api/v1/alerts on this Prometheus instance); brain-watchdog@PIHA
|
|
# polls that API and forwards to Telegram. Do NOT add Alertmanager config here.
|
|
#
|
|
# Metrics come from documents-ingest-cyclic's Prometheus textfile-collector output
|
|
# (jobs/documents-ingest/systemd, `/opt/homelab/state/node-exporter/kb-ingest.prom`),
|
|
# scraped via node_exporter's textfile collector on PIHA — every series from that target
|
|
# already carries `node="piha"` (fleet-node job's static_configs label), same as liveness.yml.
|
|
|
|
groups:
|
|
- name: kb-ingest
|
|
rules:
|
|
- alert: KbIngestStale
|
|
# 2 missed daily runs (OnCalendar=*-*-* 03:30) — the timer itself down, or every
|
|
# run since has hard-failed (Ollama-down alone never blocks this: the wrapper only
|
|
# skips its two embed stages then, still updating last_success_timestamp).
|
|
expr: time() - kb_ingest_last_success_timestamp{node="piha"} > 172800
|
|
for: 5m
|
|
labels:
|
|
severity: critical
|
|
annotations:
|
|
summary: "kb-ingest stale on {{ $labels.node }}"
|
|
description: "kb-ingest.timer has not completed a successful run in over 48h on {{ $labels.node }} — check `journalctl -u kb-ingest.service` and the latest /opt/homelab/logs/kb-ingest/run-*.log."
|
|
|
|
- alert: KbEmbedBacklogGrowing
|
|
# SOLARIA/Ollama has been unreachable (or embedding has been failing) for 3 straight
|
|
# days of ticks — the backlog itself isn't an incident (Ollama sleeps by design,
|
|
# plan §1.3), sustained non-zero for this long is.
|
|
expr: kb_ingest_embed_backlog{node="piha"} > 0
|
|
for: 72h
|
|
labels:
|
|
severity: warning
|
|
annotations:
|
|
summary: "kb-ingest embed backlog growing on {{ $labels.node }}"
|
|
description: "kb_ingest_embed_backlog on {{ $labels.node }} has been > 0 for 72h straight — Ollama@SOLARIA may not have come back up in that window, or chunk/summary embedding has been failing on live Ollama."
|