runbook: incident digest jamais ordonnance (DSM task manquante) - constat 25/07

This commit is contained in:
2026-07-25 22:34:58 +00:00
parent 85eecd4ea3
commit 013a4b2a09
@@ -29,3 +29,16 @@ puis `publish_workflow` MCP → actif (`active=t`, `activeVersionId==versionId`)
- Token Telegram **en clair** dans le node Code de "INFRA | OpenHuman Watch" (`9MkE8Fx3ZlY485Y5`) → roter + passer sur credential ND_Telegram. - Token Telegram **en clair** dans le node Code de "INFRA | OpenHuman Watch" (`9MkE8Fx3ZlY485Y5`) → roter + passer sur credential ND_Telegram.
- Mot de passe Postgres n8n faible (`n8npass`). - Mot de passe Postgres n8n faible (`n8npass`).
- VK Bifrost `bfk-0c…` (déjà flaggée, transitée en clair). - VK Bifrost `bfk-0c…` (déjà flaggée, transitée en clair).
## INCIDENT 25/07/2026 — digest jamais parti depuis le 15/07 (tache DSM jamais creee)
**Constat** : `execution_entity` du workflow `X51xQsOpXeedaBKt` ne compte que 2 executions, **32550 et 32551, toutes deux le 15/07/2026** (tests manuels de validation). Zero execution depuis, soit 10 jours de silence total sur Telegram et email. Cause confirmee : `/etc/crontab` ne contient aucune ligne pour `veille_infra.py` ; les 10 taches `synoschedtask` existantes datent toutes d'avant juillet 2026 (taches systeme historiques). L'etape "a creer via UI web DSM" du plan initial n'a jamais ete faite, le pipeline est valide bout-en-bout mais n'a jamais ete branche a un declencheur automatique.
**Statut** : passe de "operationnel" a **"construit, non ordonnance"**.
**Effet de bord repere en creusant** : conteneur `veille-frontend` (app `nyora-veille`, dashboard de curation, sans lien avec ce digest infra) tombe le 21/07, notifie uniquement via l'alerte Synology native (`sns@synologynotification.com`), redemarre depuis (17h up au 25/07). Ce canal natif fonctionne bien pour du temps reel ; le digest quotidien n'a pas vocation a le dupliquer.
**Action requise (root, DSM UI, non automatisable via mcp-nas)** : creer la tache Panneau de configuration -> Planificateur de taches -> Creer -> Tache declenchee -> Script defini par l'utilisateur, executee en tant que **root**, quotidienne **08:00**, commande `python3 /volume1/docker/veille-infra/veille_infra.py`.
**Recommandation v2 (a construire, necessite acces n8n MCP)** : ajouter un heartbeat, un second workflow n8n (Schedule Trigger 09:00) qui verifie si `X51xQsOpXeedaBKt` a eu une execution `success` dans les dernieres 30h et alerte Telegram si silence. Objectif : que ce type de panne silencieuse de 10 jours ne puisse plus se reproduire sans alerte.