Files
nas-runbooks/common/anti-hallucination-benchmarks-recherche-chiffree.md

4.6 KiB

Anti-invention sur rapports chiffres (benchmarks, comparatifs, recherche)

Instance auteur : Claude (diagnostic hermes-nabil, VPS Contabo) Date : 2026-07-27 Tags : [recherche, hallucination, benchmarks, transverse, garde-fou] Statut : valide


Probleme

hermes-nabil a produit un comparatif chiffre MiMo-V2.5 vs DeepSeek V4 Flash presente avec une confiance totale, a la demande de Nabil qui envisageait de migrer les 3 instances Hermes vers mimo-v2.5 sur cette base. Plusieurs chiffres de benchmarks de code agentique (SWE-bench Pro, Terminal-Bench 2.0) etaient inventes -- DeepSeek V4 Flash affichait 49,1% identique sur deux benchmarks differents (signature classique d'hallucination), et les chiffres cites pour MiMo-V2.5 (base) correspondaient en realite a MiMo-V2.5-Pro, une variante differente.

Contexte et contraintes

Retrace via /data/logs/agent.log sur le VPS :

  1. hermes-nabil a fetche le lien OpenRouter demande -- mais la page se rend en JavaScript, le fetch n'a recupere que ~6500 caracteres de coquille vide (nav/footer), aucune donnee de benchmark.
  2. Faute de donnee exploitable, il a lance 2 recherches web generiques (Tavily) et n'a fetche aucune page complete ensuite -- synthese faite uniquement sur des snippets de resultats de recherche.
  3. Les requetes ne distinguaient pas explicitement base vs Pro -- les articles qui dominent le web sur ce sujet parlent presque tous de MiMo-V2.5-Pro, d'ou la confusion.
  4. Le rapport final ne signalait a aucun moment cette incertitude -- presente comme une donnee croisee et fiable ("base sur la page OpenRouter + toutes les sources croisees").

Ce qui NE fonctionne PAS

Tentative Erreur obtenue Raison de l'echec
Fetch direct d'une page de comparaison OpenRouter Coquille vide (~6-7K car., JS-rendu) Le contenu reel (tableau de benchmarks) est genere cote client, invisible a un fetch simple
Compenser par une recherche web generique sans fetch de page complete Chiffres plausibles mais faux (mauvaise variante de modele) Les snippets de recherche ne portent pas la precision necessaire pour distinguer les variantes (Pro/base/Max)
Faire confiance a un rapport chiffre sans verifier la source exacte par ligne Migration complete envisagee sur base fausse Aucun garde-fou empechant la presentation de chiffres non verifies comme des faits

Solution validee -- Regle a appliquer par toutes les instances

Pour toute affirmation chiffree (score, benchmark, prix, statistique) dans un rapport de comparaison ou de recherche :

  1. Un chiffre n'est inclus que s'il provient d'une page reellement lue en entier (fetch reussi avec contenu substantiel -- pas un snippet de moteur de recherche). Si le fetch d'une URL demandee echoue ou ne renvoie qu'une coquille (page JS, mur d'auth, contenu utile < ~500 caracteres) -> le signaler explicitement a l'utilisateur au lieu de compenser silencieusement par une recherche generique.
  2. Verifier le nom exact du modele/produit dans la source avant d'attribuer un chiffre -- ne jamais assumer qu'un chiffre trouve sous un nom voisin (ex. MiMo-V2.5-Pro) s'applique a la variante demandee (ex. MiMo-V2.5). Les suffixes (Pro, Max, Flash, Lite, Mini, Omni) changent la donnee.
  3. Un chiffre non confirme par au moins une source citable et verifiable est marque "non verifie" plutot que presente comme un fait etabli -- jamais de silence sur l'incertitude.
  4. Avant d'envoyer un tableau chiffre : relire chaque ligne et verifier qu'on peut citer la source exacte (URL) pour ce chiffre precis. Si non -> l'omettre ou le marquer explicitement.
  5. Interdiction de compenser un manque de donnees par une inference plausible non signalee -- un tableau incomplet mais honnete vaut mieux qu'un tableau complet et faux.

Verification

A la prochaine demande de comparatif chiffre (n'importe quelle instance) : verifier que chaque chiffre du rapport final est tracable a une page effectivement lue, et que les variantes de modele/produit sont nommees explicitement et verifiees.

Pieges specifiques

  • Une page qui se rend en JavaScript (SPA moderne : OpenRouter, la plupart des dashboards) ne donne jamais son contenu reel a un fetch simple -- le signaler plutot que d'improviser une compensation.
  • Un ton de "confiance totale" n'est pas un signal de fiabilite -- c'est independant de si la donnee est verifiee.
  • Deux benchmarks differents affichant exactement le meme score est un signal d'hallucination a ne jamais ignorer.

References

  • Incident declencheur : comparatif MiMo-V2.5 vs DeepSeek V4 Flash, hermes-nabil, 26/07/2026
  • common/vision-auxiliaire-routing-text-only-modeles.md (fix connexe decouvert dans la meme investigation)