54 lines
4.6 KiB
Markdown
54 lines
4.6 KiB
Markdown
# Anti-invention sur rapports chiffres (benchmarks, comparatifs, recherche)
|
|
|
|
**Instance auteur** : Claude (diagnostic hermes-nabil, VPS Contabo)
|
|
**Date** : 2026-07-27
|
|
**Tags** : [recherche, hallucination, benchmarks, transverse, garde-fou]
|
|
**Statut** : valide
|
|
|
|
---
|
|
|
|
## Probleme
|
|
|
|
hermes-nabil a produit un comparatif chiffre MiMo-V2.5 vs DeepSeek V4 Flash presente avec une confiance totale, a la demande de Nabil qui envisageait de migrer les 3 instances Hermes vers mimo-v2.5 sur cette base. Plusieurs chiffres de benchmarks de code agentique (SWE-bench Pro, Terminal-Bench 2.0) etaient inventes -- DeepSeek V4 Flash affichait 49,1% identique sur deux benchmarks differents (signature classique d'hallucination), et les chiffres cites pour MiMo-V2.5 (base) correspondaient en realite a MiMo-V2.5-Pro, une variante differente.
|
|
|
|
## Contexte et contraintes
|
|
|
|
Retrace via /data/logs/agent.log sur le VPS :
|
|
1. hermes-nabil a fetche le lien OpenRouter demande -- mais la page se rend en JavaScript, le fetch n'a recupere que ~6500 caracteres de coquille vide (nav/footer), aucune donnee de benchmark.
|
|
2. Faute de donnee exploitable, il a lance 2 recherches web generiques (Tavily) et n'a fetche aucune page complete ensuite -- synthese faite uniquement sur des snippets de resultats de recherche.
|
|
3. Les requetes ne distinguaient pas explicitement base vs Pro -- les articles qui dominent le web sur ce sujet parlent presque tous de MiMo-V2.5-Pro, d'ou la confusion.
|
|
4. Le rapport final ne signalait a aucun moment cette incertitude -- presente comme une donnee croisee et fiable ("base sur la page OpenRouter + toutes les sources croisees").
|
|
|
|
## Ce qui NE fonctionne PAS
|
|
|
|
| Tentative | Erreur obtenue | Raison de l'echec |
|
|
|-----------|----------------|-------------------|
|
|
| Fetch direct d'une page de comparaison OpenRouter | Coquille vide (~6-7K car., JS-rendu) | Le contenu reel (tableau de benchmarks) est genere cote client, invisible a un fetch simple |
|
|
| Compenser par une recherche web generique sans fetch de page complete | Chiffres plausibles mais faux (mauvaise variante de modele) | Les snippets de recherche ne portent pas la precision necessaire pour distinguer les variantes (Pro/base/Max) |
|
|
| Faire confiance a un rapport chiffre sans verifier la source exacte par ligne | Migration complete envisagee sur base fausse | Aucun garde-fou empechant la presentation de chiffres non verifies comme des faits |
|
|
|
|
## Solution validee -- Regle a appliquer par toutes les instances
|
|
|
|
Pour toute affirmation chiffree (score, benchmark, prix, statistique) dans un rapport de comparaison ou de recherche :
|
|
|
|
1. Un chiffre n'est inclus que s'il provient d'une page reellement lue en entier (fetch reussi avec contenu substantiel -- pas un snippet de moteur de recherche). Si le fetch d'une URL demandee echoue ou ne renvoie qu'une coquille (page JS, mur d'auth, contenu utile < ~500 caracteres) -> le signaler explicitement a l'utilisateur au lieu de compenser silencieusement par une recherche generique.
|
|
2. Verifier le nom exact du modele/produit dans la source avant d'attribuer un chiffre -- ne jamais assumer qu'un chiffre trouve sous un nom voisin (ex. MiMo-V2.5-Pro) s'applique a la variante demandee (ex. MiMo-V2.5). Les suffixes (Pro, Max, Flash, Lite, Mini, Omni) changent la donnee.
|
|
3. Un chiffre non confirme par au moins une source citable et verifiable est marque "non verifie" plutot que presente comme un fait etabli -- jamais de silence sur l'incertitude.
|
|
4. Avant d'envoyer un tableau chiffre : relire chaque ligne et verifier qu'on peut citer la source exacte (URL) pour ce chiffre precis. Si non -> l'omettre ou le marquer explicitement.
|
|
5. Interdiction de compenser un manque de donnees par une inference plausible non signalee -- un tableau incomplet mais honnete vaut mieux qu'un tableau complet et faux.
|
|
|
|
## Verification
|
|
|
|
A la prochaine demande de comparatif chiffre (n'importe quelle instance) : verifier que chaque chiffre du rapport final est tracable a une page effectivement lue, et que les variantes de modele/produit sont nommees explicitement et verifiees.
|
|
|
|
## Pieges specifiques
|
|
|
|
- Une page qui se rend en JavaScript (SPA moderne : OpenRouter, la plupart des dashboards) ne donne jamais son contenu reel a un fetch simple -- le signaler plutot que d'improviser une compensation.
|
|
- Un ton de "confiance totale" n'est pas un signal de fiabilite -- c'est independant de si la donnee est verifiee.
|
|
- Deux benchmarks differents affichant exactement le meme score est un signal d'hallucination a ne jamais ignorer.
|
|
|
|
## References
|
|
|
|
- Incident declencheur : comparatif MiMo-V2.5 vs DeepSeek V4 Flash, hermes-nabil, 26/07/2026
|
|
- common/vision-auxiliaire-routing-text-only-modeles.md (fix connexe decouvert dans la meme investigation)
|