
Refonte
Le carnet de La Refonte
Un comparatif chiffré des quatre façons de classer des messages entrants, à partir de bancs d'essai publics : précision, coût pour 1 000 messages, latence et calibration, chaque chiffre sourcé et daté.


Refonte

SEO

IA
Sur les bancs d'essai publics passés en revue ici, un classifieur entraîné (fastText, SetFit ou une API dédiée) reste la référence de précision et de coût pour trier des catégories stables, tandis qu'un grand modèle de langage appelé en JSON coûte plusieurs fois plus cher par message et perd en précision sur les tâches à catégories fines. Jev, le modèle de décision de TypeSafe AI, publie des latences de l'ordre de la centaine de millisecondes et un tarif proche de celui d'un classifieur, sans qu'aucun banc d'essai public de précision n'existe encore pour lui sur une tâche de ce type. Un moteur de règles reste imbattable en coût et en latence tant que les catégories ne bougent pas. Ce comparatif chiffre chaque affirmation avec sa source ; aucun chiffre ne vient d'un test propre à La Refonte.
Trier un message entrant en une catégorie n'a rien de nouveau : c'est un problème de classification de texte, documenté depuis des années. Notre article sur le choix entre modèle de décision et LLM pose déjà le critère qui départage les familles : qui lit la sortie, du code ou une personne. Ce dossier ne rejoue pas cet arbitrage conceptuel. Il rassemble les chiffres publics qui permettent de le vérifier sur un cas précis, le tri de messages, avec quatre approches : un moteur de règles et mots-clés, un classifieur entraîné (fastText, une régression logistique, SetFit ou une API de classification), un grand modèle de langage appelé avec une instruction de sortie JSON, et Jev, le modèle de décision calibré de TypeSafe AI, présenté dans notre article sur Jev et implémenté pas à pas dans notre guide Jev sur Cloudflare Workers AI.
Les chiffres qui suivent viennent tous de bancs d'essai publiés par des tiers, de tarifs affichés par les éditeurs ou de relevés de la démo publique askjev.ai. Aucun ne vient d'un test mené par La Refonte sur son propre corpus de messages ; le tri d'un flux de messages entrants reste un cas d'usage fréquent pour une petite structure, comme le rappelle notre article sur l'automatisation des tâches.
Quatre chiffres à retenir avant le détail
188 ms
Latence médiane de Jev sur 172 appels de la démo askjev.ai, 18-19 septembre 2026
0,69 à 0,96 s
Temps de première réponse d'un LLM léger (Claude Haiku 4.5), selon deux bancs d'essai publics
45 % contre 11 %
Erreur de calibration d'un LLM non ajusté contre une régression logistique, étude Nyckel, août 2024
1 600 x
Écart de taille entre SetFit (110 M paramètres) et GPT-3 (175 milliards), à score RAFT comparable
Aucun banc d'essai public ne porte exactement sur un tri de messages clients. Les plus proches restent les études qui comparent un modèle affiné sur des exemples annotés à un grand modèle de langage appelé sans entraînement (zero-shot), sur des tâches de classification de texte en catégories. Une étude publiée en juin 2024 compare cinq modèles affinés (RoBERTa, DeBERTa V3, ELECTRA, XLNet, BART) à GPT-3.5, GPT-4 et Claude Opus en zero-shot, sur quatre tâches testées chacune sur 200 exemples. L'écart varie fortement selon la tâche : sur une analyse de sentiment, GPT-4 atteint un F1 de 0,87 contre 0,92 pour RoBERTa Large, un écart faible. Sur une classification de position (stance) à plusieurs catégories, l'écart se creuse : DeBERTa V3 atteint un F1 de 0,94 contre 0,51 pour GPT-4 et 0,57 pour Claude Opus. Sur une détection d'émotion à catégories fines, GPT-3.5 tombe à un F1 de 0,15.
Un second banc d'essai, plus ancien mais toujours cité, compare SetFit, un classifieur entraîné sur peu d'exemples avec un modèle de 110 millions de paramètres, à GPT-3 (175 milliards de paramètres) sur le benchmark RAFT : SetFit obtient un score de 0,669 contre 0,627 pour GPT-3, en gagnant sur 7 des 11 tâches, avec un modèle 1 600 fois plus petit. La leçon commune aux deux études : un modèle entraîné sur des exemples de la tâche reste compétitif ou supérieur à un LLM zero-shot, surtout quand les catégories sont nombreuses ou proches les unes des autres, ce qui est souvent le cas d'un tri de messages entrants. Aucun de ces deux bancs d'essai n'inclut Jev ; aucune mesure publique de précision n'existe pour ce modèle sur une tâche de classification de texte à la date de publication de cet article.
| 01Tâche testée (échantillon) | 02Classifieur entraîné | 03LLM zero-shot | 04Source |
|---|---|---|---|
| 01Analyse de sentiment, actualités économiques (n=200) | RoBERTa Large : F1 0,92 | GPT-4 : F1 0,87 · Claude Opus : F1 0,87 | arXiv 2406.08660, juin 2024 |
| 02Classification de position, débat public (n=200) | DeBERTa V3 : F1 0,94 | GPT-4 : F1 0,51 · Claude Opus : F1 0,57 | arXiv 2406.08660, juin 2024 |
| 03Détection d'émotion, discours politiques (n=200) | XLNet Large : F1 0,89 | GPT-3.5 : F1 0,15 · Claude Opus : F1 0,11 | arXiv 2406.08660, juin 2024 |
| 04Position multi-classes, politique européenne (n=200) | DeBERTa V3 : F1 0,91 | GPT-4 : F1 0,45 | arXiv 2406.08660, juin 2024 |
| 05Benchmark RAFT, 11 tâches few-shot | SetFit (110 M paramètres) : score 0,669 | GPT-3 (175 Md paramètres) : score 0,627 | Towards Data Science, décembre 2021 |
Analyse de sentiment, actualités économiques (n=200)
Classification de position, débat public (n=200)
Détection d'émotion, discours politiques (n=200)
Position multi-classes, politique européenne (n=200)
Benchmark RAFT, 11 tâches few-shot
Les tarifs ci-dessous viennent des pages de tarification publiées par chaque éditeur, consultées le 20 septembre 2026. Pour rendre les tarifs comparables, le calcul suppose un message d'entrée d'environ 200 tokens (le texte du message et la consigne de classement) et une sortie de classification d'environ 20 tokens (la catégorie et un score). C'est une hypothèse de calcul, pas une mesure : elle sert à convertir un tarif par million de tokens en un coût par 1 000 messages, et elle doit être ajustée à la longueur réelle de vos messages avant toute décision.
Avec cette hypothèse, GPT-5 nano (0,05 $ par million de tokens en entrée, 0,40 $ en sortie selon la documentation tarifaire d'OpenAI) coûte environ 0,018 $ pour 1 000 messages. Mistral Small 4 (0,15 $ / 0,60 $ par million de tokens) coûte environ 0,042 $. Claude Haiku 4.5 (1 $ / 5 $ par million de tokens selon Anthropic) coûte environ 0,30 $, soit près de dix-sept fois le tarif de GPT-5 nano pour la même hypothèse de longueur. L'API Classifier de Mistral, un classifieur entraînable à 0,04 $ par million de tokens en entrée comme en sortie, revient à environ 0,009 $ pour 1 000 messages, avec en plus un coût d'entraînement de 1 $ par million de tokens et un stockage de 2 $ par modèle et par mois. Jev, au tarif de lancement publié par TypeSafe AI (0,042 $ par million de tokens en entrée, sortie gratuite), revient à environ 0,008 $ pour 1 000 messages. Un moteur de règles ne facture rien par message : son coût est celui du serveur qui l'exécute, pas d'un appel à un fournisseur. Le choix entre GPT, Claude ou Mistral pour un usage de rédaction plutôt que de classification est détaillé dans notre comparatif de modèles IA.
Source : Tarifs OpenAI, Anthropic, Mistral et TypeSafe AI consultés le 20 septembre 2026 ; calcul La Refonte sur une hypothèse de longueur de message, pas une mesure
Les fournisseurs ne publient pas tous leurs latences dans les mêmes conditions, ce qui rend la comparaison approximative. Sur la démo publique askjev.ai, non affiliée à l'éditeur, 172 appels lisibles les 18 et 19 septembre 2026 donnent une latence minimale de 117 ms, une médiane de 188 ms et un 95e centile à 395 ms, pour un coût affiché de 0,0000444 $ par appel, sur environ 1 057 tokens en entrée. Pour un LLM léger appelé en zero-shot, deux bancs d'essai publics donnent des temps de première réponse de 0,69 seconde (Claude Haiku 4.5, mode non-raisonnement, artificialanalysis.ai) à 0,96 seconde sur un prompt court (le même modèle via Amazon Bedrock, aimultiple.com, mesure du 12 août 2026). Ces deux chiffres portent sur le temps avant le premier jeton, pas sur la réponse complète.
Pour un classifieur entraîné ou un moteur de règles, aucun fournisseur ne publie de 95e centile comparable dans les mêmes conditions : ces modèles sont construits pour tourner sans appel à un grand modèle génératif. Un banc d'essai sur fastText note qu'il produit un modèle complet « en quelques minutes, sur une machine avec CPU seul », contre 20 à 28 minutes sur GPU pour un transformeur et 40 à 50 minutes pour affiner GPT-3 sur les serveurs d'OpenAI : un ordre de grandeur qui vaut pour l'entraînement, pas pour la latence d'une réponse individuelle, mais qui situe le rapport de coût de calcul entre les familles.
| 01Approche | 02Mesure publiée | 03Source |
|---|---|---|
| 01Jev (démo askjev.ai) | 172 appels, 18-19 septembre 2026 : minimum 117 ms, médiane 188 ms, p95 395 ms, maximum 622 ms | askjev.ai |
| 02LLM en JSON, Claude Haiku 4.5 (non-raisonnement) | Temps de première réponse : 0,69 s (prompt court) à 0,96 s (via Amazon Bedrock, 12 août 2026) | artificialanalysis.ai · aimultiple.com |
| 03Classifieur entraîné / règles | Pas de 95e centile publié dans les mêmes conditions ; fastText produit un modèle complet en quelques minutes sur CPU seul | toloka.ai |
Jev (démo askjev.ai)
LLM en JSON, Claude Haiku 4.5 (non-raisonnement)
Classifieur entraîné / règles
Un score de précision (accuracy, F1) dit si le modèle a globalement raison. Il ne dit pas si sa probabilité affichée, 92 % ou 60 %, correspond à une vraie chance d'avoir raison : c'est la calibration. Une étude publiée en août 2024, sur douze jeux de données de classification en production, de 1 000 à 10 000 exemples annotés chacun, mesure l'erreur de calibration (ECE) avant tout ajustement : environ 45 % pour la confiance auto-déclarée d'un modèle GPT, environ 50 % pour sa probabilité de logprob, contre 11 % pour une régression logistique classique. Après un ajustement statistique standard, les trois approches se rapprochent : 5 % à 8 % d'erreur. Sans cet ajustement, un seuil fixé sur la probabilité brute d'un LLM se déclenche à un rythme différent de ce que la probabilité affichée laisse croire.
C'est le point que la précision seule ne montre pas : un modèle qui répond juste 87 % du temps mais annonce 98 % de confiance pousse à relâcher la relecture humaine au mauvais moment. Jev est présenté par son éditeur comme un modèle calibré, avec une architecture propre désignée RLCD ; aucune étude indépendante de calibration n'a été trouvée pour ce modèle à la date de publication de cet article, seulement la revendication de l'éditeur.
Les chiffres de ce dossier viennent de bancs d'essai publiés par des tiers, de tarifs affichés par les éditeurs et de la démo publique askjev.ai : aucun ne vient d'un test mené par La Refonte sur un corpus de messages français. La méthode qui suit permet de rejouer la même comparaison sur votre propre flux, avec vos propres catégories.
Étape 1
Prenez environ 200 messages réels anonymisés, une taille proche des échantillons utilisés dans les bancs d'essai cités plus haut, avec les catégories que vous utilisez déjà.
Étape 2
Un moteur de règles existant, un classifieur entraîné sur votre historique (ou une API comme le Classifier de Mistral), un LLM appelé avec une instruction de sortie JSON stricte, et Jev via l'API TypeSafe ou le binding Cloudflare Workers AI.
Étape 3
Comparez chaque sortie à l'étiquette posée par une personne, catégorie par catégorie, pas seulement le taux global de bonnes réponses.
Étape 4
Additionnez les tokens facturés en entrée et en sortie sur la facture du fournisseur, plutôt que d'extrapoler depuis le tarif catalogue.
Étape 5
Relevez la médiane et le 95e centile sur votre volume, pas seulement le temps du premier appel.
Étape 6
Regroupez les prédictions par tranche de probabilité affichée et comparez au taux de bonnes réponses réel dans chaque tranche.
Étape 7
Le seuil retenu, la tranche de confiance qui déclenche une relecture humaine, et un journal des cas revus.
Dernière mise à jour : 20 septembre 2026
Le parcours IA de La Refonte aide à poser ce protocole sur votre propre flux : quel volume, quelles catégories, quel seuil, quelle relecture humaine. Programme et modalités sur la page de la formation.
Pour aller plus loin



Sans engagement, sans jargon
Trente minutes pour identifier ce qui freine votre visibilité et repartir avec les priorités dans le bon ordre.
Discutons de votre projet
30 min · Google Meet
Choisissez le créneau qui vous convient dans notre calendrier. On analyse votre situation avant l’appel pour aller droit au but.
Recherche des créneaux disponibles...