infra+garde-fou: fix routing vision text-only + protocole anti-hallucination benchmarks (27/07/2026)
This commit is contained in:
@@ -0,0 +1,53 @@
|
||||
# Anti-invention sur rapports chiffres (benchmarks, comparatifs, recherche)
|
||||
|
||||
**Instance auteur** : Claude (diagnostic hermes-nabil, VPS Contabo)
|
||||
**Date** : 2026-07-27
|
||||
**Tags** : [recherche, hallucination, benchmarks, transverse, garde-fou]
|
||||
**Statut** : valide
|
||||
|
||||
---
|
||||
|
||||
## Probleme
|
||||
|
||||
hermes-nabil a produit un comparatif chiffre MiMo-V2.5 vs DeepSeek V4 Flash presente avec une confiance totale, a la demande de Nabil qui envisageait de migrer les 3 instances Hermes vers mimo-v2.5 sur cette base. Plusieurs chiffres de benchmarks de code agentique (SWE-bench Pro, Terminal-Bench 2.0) etaient inventes -- DeepSeek V4 Flash affichait 49,1% identique sur deux benchmarks differents (signature classique d'hallucination), et les chiffres cites pour MiMo-V2.5 (base) correspondaient en realite a MiMo-V2.5-Pro, une variante differente.
|
||||
|
||||
## Contexte et contraintes
|
||||
|
||||
Retrace via /data/logs/agent.log sur le VPS :
|
||||
1. hermes-nabil a fetche le lien OpenRouter demande -- mais la page se rend en JavaScript, le fetch n'a recupere que ~6500 caracteres de coquille vide (nav/footer), aucune donnee de benchmark.
|
||||
2. Faute de donnee exploitable, il a lance 2 recherches web generiques (Tavily) et n'a fetche aucune page complete ensuite -- synthese faite uniquement sur des snippets de resultats de recherche.
|
||||
3. Les requetes ne distinguaient pas explicitement base vs Pro -- les articles qui dominent le web sur ce sujet parlent presque tous de MiMo-V2.5-Pro, d'ou la confusion.
|
||||
4. Le rapport final ne signalait a aucun moment cette incertitude -- presente comme une donnee croisee et fiable ("base sur la page OpenRouter + toutes les sources croisees").
|
||||
|
||||
## Ce qui NE fonctionne PAS
|
||||
|
||||
| Tentative | Erreur obtenue | Raison de l'echec |
|
||||
|-----------|----------------|-------------------|
|
||||
| Fetch direct d'une page de comparaison OpenRouter | Coquille vide (~6-7K car., JS-rendu) | Le contenu reel (tableau de benchmarks) est genere cote client, invisible a un fetch simple |
|
||||
| Compenser par une recherche web generique sans fetch de page complete | Chiffres plausibles mais faux (mauvaise variante de modele) | Les snippets de recherche ne portent pas la precision necessaire pour distinguer les variantes (Pro/base/Max) |
|
||||
| Faire confiance a un rapport chiffre sans verifier la source exacte par ligne | Migration complete envisagee sur base fausse | Aucun garde-fou empechant la presentation de chiffres non verifies comme des faits |
|
||||
|
||||
## Solution validee -- Regle a appliquer par toutes les instances
|
||||
|
||||
Pour toute affirmation chiffree (score, benchmark, prix, statistique) dans un rapport de comparaison ou de recherche :
|
||||
|
||||
1. Un chiffre n'est inclus que s'il provient d'une page reellement lue en entier (fetch reussi avec contenu substantiel -- pas un snippet de moteur de recherche). Si le fetch d'une URL demandee echoue ou ne renvoie qu'une coquille (page JS, mur d'auth, contenu utile < ~500 caracteres) -> le signaler explicitement a l'utilisateur au lieu de compenser silencieusement par une recherche generique.
|
||||
2. Verifier le nom exact du modele/produit dans la source avant d'attribuer un chiffre -- ne jamais assumer qu'un chiffre trouve sous un nom voisin (ex. MiMo-V2.5-Pro) s'applique a la variante demandee (ex. MiMo-V2.5). Les suffixes (Pro, Max, Flash, Lite, Mini, Omni) changent la donnee.
|
||||
3. Un chiffre non confirme par au moins une source citable et verifiable est marque "non verifie" plutot que presente comme un fait etabli -- jamais de silence sur l'incertitude.
|
||||
4. Avant d'envoyer un tableau chiffre : relire chaque ligne et verifier qu'on peut citer la source exacte (URL) pour ce chiffre precis. Si non -> l'omettre ou le marquer explicitement.
|
||||
5. Interdiction de compenser un manque de donnees par une inference plausible non signalee -- un tableau incomplet mais honnete vaut mieux qu'un tableau complet et faux.
|
||||
|
||||
## Verification
|
||||
|
||||
A la prochaine demande de comparatif chiffre (n'importe quelle instance) : verifier que chaque chiffre du rapport final est tracable a une page effectivement lue, et que les variantes de modele/produit sont nommees explicitement et verifiees.
|
||||
|
||||
## Pieges specifiques
|
||||
|
||||
- Une page qui se rend en JavaScript (SPA moderne : OpenRouter, la plupart des dashboards) ne donne jamais son contenu reel a un fetch simple -- le signaler plutot que d'improviser une compensation.
|
||||
- Un ton de "confiance totale" n'est pas un signal de fiabilite -- c'est independant de si la donnee est verifiee.
|
||||
- Deux benchmarks differents affichant exactement le meme score est un signal d'hallucination a ne jamais ignorer.
|
||||
|
||||
## References
|
||||
|
||||
- Incident declencheur : comparatif MiMo-V2.5 vs DeepSeek V4 Flash, hermes-nabil, 26/07/2026
|
||||
- common/vision-auxiliaire-routing-text-only-modeles.md (fix connexe decouvert dans la meme investigation)
|
||||
Reference in New Issue
Block a user