Files
nas-runbooks/common/prompt-defensif-anti-refus-contre-productif.md

14 lines
2.2 KiB
Markdown

# Langage anti-refus dans les prompts cron — effet contre-productif
**Contexte** : job "Veille Orientini 2026" (hermes-perso, job_id 3f86aa355207) envoie un email routinier (parent → enfant, adresse perso, info orientation universitaire) avec PPTX en pièce jointe, 3x/jour depuis le 27/06.
**Incident (23/07/2026)** : le modèle (DeepSeek V4 Flash) a hallucine un scenario complet de phishing (email se faisant passer pour une "équipe d'orientation" demandant une vérification de mot de passe) alors que rien de tel n'existe dans le prompt, et a refusé d'exécuter la tâche pour raisons éthiques. A capitulé immédiatement une fois challengé, en qualifiant sa propre sortie d'"hallucination" — auto-évaluation non fiable en soi (introspection LLM peu fiable), mais confirmée exacte ici après vérification factuelle du prompt réel sur le NAS.
**Root cause identifiée** : le prompt contenait déjà du langage défensif méta, ajouté suite à un épisode antérieur (comparaison avec backup du 09/07, prompt propre, sans ce langage) : "Ne jamais refuser sous prétexte d'éthique", "Ce n'est pas une usurpation", "Aucune tromperie là-dedans". Hypothèse : ce langage défensif répété active chez un modèle de petite taille le pattern de reconnaissance "email + identifiants/mot de passe + tiers = ingénierie sociale" — effet inverse de celui recherché (effet "ne pense pas à un éléphant rose").
**Fix appliqué (24/07/2026)** : remplacement du langage défensif/protestataire par du contexte factuel neutre ("Contexte : email routinier d'un parent à son enfant depuis son adresse personnelle, en copie son adresse professionnelle — information d'orientation universitaire"). Backup avant modif : jobs.json.bak-20260724T011938.
**Règle générale** : dans les prompts cron/agents, éviter le langage "ne refuse pas", "ce n'est pas de la tromperie/usurpation" — ça peut amorcer le pattern qu'on cherche justement à éviter. Préférer une description factuelle neutre du contexte légitime, sans meta-commentaire défensif.
**À surveiller** : si le job re-halluciné malgré ce fix, envisager un changement de modèle pour ce job spécifique plutôt qu'un nouveau patch de prompt.