Le carnet de La Refonte

Classer des messages : règles, LLM, classifieur ou Jev

Un comparatif chiffré des quatre façons de classer des messages entrants, à partir de bancs d'essai publics : précision, coût pour 1 000 messages, latence et calibration, chaque chiffre sourcé et daté.

  • IA & Automatisation
  • Jev
  • Classification
  • LLM
  • Comparatif
Refonte de Site Web

Refonte

Agence SEO

SEO

Intégration IA

IA

Sur les bancs d'essai publics passés en revue ici, un classifieur entraîné (fastText, SetFit ou une API dédiée) reste la référence de précision et de coût pour trier des catégories stables, tandis qu'un grand modèle de langage appelé en JSON coûte plusieurs fois plus cher par message et perd en précision sur les tâches à catégories fines. Jev, le modèle de décision de TypeSafe AI, publie des latences de l'ordre de la centaine de millisecondes et un tarif proche de celui d'un classifieur, sans qu'aucun banc d'essai public de précision n'existe encore pour lui sur une tâche de ce type. Un moteur de règles reste imbattable en coût et en latence tant que les catégories ne bougent pas. Ce comparatif chiffre chaque affirmation avec sa source ; aucun chiffre ne vient d'un test propre à La Refonte.

📌 À retenir

  • Sur la tâche de position testée par un banc d'essai public de juin 2024, un classifieur entraîné atteint un F1 de 0,94 contre 0,51 pour un LLM zero-shot, sur un échantillon de 200 messages.
  • Le coût calculé pour 1 000 messages va de 0 dollar pour un moteur de règles à 0,30 dollar pour un LLM courant, selon les tarifs publiés le 20 septembre 2026.
  • Jev, le modèle de décision de TypeSafe AI, publie une latence médiane de 188 ms sur 172 appels de sa démo publique ; aucun banc d'essai public de précision n'existe encore pour lui.
  • Un LLM non ajusté affiche une erreur de calibration proche de 45 %, contre 11 % pour une régression logistique, selon une étude d'août 2024 : la précision seule ne suffit pas à fixer un seuil.

Un même problème, quatre familles déjà connues

Trier un message entrant en une catégorie n'a rien de nouveau : c'est un problème de classification de texte, documenté depuis des années. Notre article sur le choix entre modèle de décision et LLM pose déjà le critère qui départage les familles : qui lit la sortie, du code ou une personne. Ce dossier ne rejoue pas cet arbitrage conceptuel. Il rassemble les chiffres publics qui permettent de le vérifier sur un cas précis, le tri de messages, avec quatre approches : un moteur de règles et mots-clés, un classifieur entraîné (fastText, une régression logistique, SetFit ou une API de classification), un grand modèle de langage appelé avec une instruction de sortie JSON, et Jev, le modèle de décision calibré de TypeSafe AI, présenté dans notre article sur Jev et implémenté pas à pas dans notre guide Jev sur Cloudflare Workers AI.

Les chiffres qui suivent viennent tous de bancs d'essai publiés par des tiers, de tarifs affichés par les éditeurs ou de relevés de la démo publique askjev.ai. Aucun ne vient d'un test mené par La Refonte sur son propre corpus de messages ; le tri d'un flux de messages entrants reste un cas d'usage fréquent pour une petite structure, comme le rappelle notre article sur l'automatisation des tâches.

Quatre chiffres à retenir avant le détail

188 ms

Latence médiane de Jev sur 172 appels de la démo askjev.ai, 18-19 septembre 2026

0,69 à 0,96 s

Temps de première réponse d'un LLM léger (Claude Haiku 4.5), selon deux bancs d'essai publics

45 % contre 11 %

Erreur de calibration d'un LLM non ajusté contre une régression logistique, étude Nyckel, août 2024

1 600 x

Écart de taille entre SetFit (110 M paramètres) et GPT-3 (175 milliards), à score RAFT comparable

Le protocole suivi pour ce comparatif

1Bancs d'essai publicsPapiers, tarifs éditeurs…2Quatre approchesRègles, classifieur, LLM…3Quatre mesuresPrécision, coût, latence…4DécisionSeuil et relecture humai…

Précision : ce que mesurent les bancs d'essai publics

Aucun banc d'essai public ne porte exactement sur un tri de messages clients. Les plus proches restent les études qui comparent un modèle affiné sur des exemples annotés à un grand modèle de langage appelé sans entraînement (zero-shot), sur des tâches de classification de texte en catégories. Une étude publiée en juin 2024 compare cinq modèles affinés (RoBERTa, DeBERTa V3, ELECTRA, XLNet, BART) à GPT-3.5, GPT-4 et Claude Opus en zero-shot, sur quatre tâches testées chacune sur 200 exemples. L'écart varie fortement selon la tâche : sur une analyse de sentiment, GPT-4 atteint un F1 de 0,87 contre 0,92 pour RoBERTa Large, un écart faible. Sur une classification de position (stance) à plusieurs catégories, l'écart se creuse : DeBERTa V3 atteint un F1 de 0,94 contre 0,51 pour GPT-4 et 0,57 pour Claude Opus. Sur une détection d'émotion à catégories fines, GPT-3.5 tombe à un F1 de 0,15.

Un second banc d'essai, plus ancien mais toujours cité, compare SetFit, un classifieur entraîné sur peu d'exemples avec un modèle de 110 millions de paramètres, à GPT-3 (175 milliards de paramètres) sur le benchmark RAFT : SetFit obtient un score de 0,669 contre 0,627 pour GPT-3, en gagnant sur 7 des 11 tâches, avec un modèle 1 600 fois plus petit. La leçon commune aux deux études : un modèle entraîné sur des exemples de la tâche reste compétitif ou supérieur à un LLM zero-shot, surtout quand les catégories sont nombreuses ou proches les unes des autres, ce qui est souvent le cas d'un tri de messages entrants. Aucun de ces deux bancs d'essai n'inclut Jev ; aucune mesure publique de précision n'existe pour ce modèle sur une tâche de classification de texte à la date de publication de cet article.

01

Analyse de sentiment, actualités économiques (n=200)

Classifieur entraîné
RoBERTa Large : F1 0,92
LLM zero-shot
GPT-4 : F1 0,87 · Claude Opus : F1 0,87
Source
arXiv 2406.08660, juin 2024
02

Classification de position, débat public (n=200)

Classifieur entraîné
DeBERTa V3 : F1 0,94
LLM zero-shot
GPT-4 : F1 0,51 · Claude Opus : F1 0,57
Source
arXiv 2406.08660, juin 2024
03

Détection d'émotion, discours politiques (n=200)

Classifieur entraîné
XLNet Large : F1 0,89
LLM zero-shot
GPT-3.5 : F1 0,15 · Claude Opus : F1 0,11
Source
arXiv 2406.08660, juin 2024
04

Position multi-classes, politique européenne (n=200)

Classifieur entraîné
DeBERTa V3 : F1 0,91
LLM zero-shot
GPT-4 : F1 0,45
Source
arXiv 2406.08660, juin 2024
05

Benchmark RAFT, 11 tâches few-shot

Classifieur entraîné
SetFit (110 M paramètres) : score 0,669
LLM zero-shot
GPT-3 (175 Md paramètres) : score 0,627
Source
Towards Data Science, décembre 2021
Aucune de ces tâches n'est un tri de messages clients : ce sont les bancs d'essai publics les plus proches, sur des échantillons de 200 exemples ou le benchmark RAFT. Le F1 et le score RAFT ne sont pas directement comparables entre eux.

Coût pour 1 000 messages : le calcul, poste par poste

Les tarifs ci-dessous viennent des pages de tarification publiées par chaque éditeur, consultées le 20 septembre 2026. Pour rendre les tarifs comparables, le calcul suppose un message d'entrée d'environ 200 tokens (le texte du message et la consigne de classement) et une sortie de classification d'environ 20 tokens (la catégorie et un score). C'est une hypothèse de calcul, pas une mesure : elle sert à convertir un tarif par million de tokens en un coût par 1 000 messages, et elle doit être ajustée à la longueur réelle de vos messages avant toute décision.

Avec cette hypothèse, GPT-5 nano (0,05 $ par million de tokens en entrée, 0,40 $ en sortie selon la documentation tarifaire d'OpenAI) coûte environ 0,018 $ pour 1 000 messages. Mistral Small 4 (0,15 $ / 0,60 $ par million de tokens) coûte environ 0,042 $. Claude Haiku 4.5 (1 $ / 5 $ par million de tokens selon Anthropic) coûte environ 0,30 $, soit près de dix-sept fois le tarif de GPT-5 nano pour la même hypothèse de longueur. L'API Classifier de Mistral, un classifieur entraînable à 0,04 $ par million de tokens en entrée comme en sortie, revient à environ 0,009 $ pour 1 000 messages, avec en plus un coût d'entraînement de 1 $ par million de tokens et un stockage de 2 $ par modèle et par mois. Jev, au tarif de lancement publié par TypeSafe AI (0,042 $ par million de tokens en entrée, sortie gratuite), revient à environ 0,008 $ pour 1 000 messages. Un moteur de règles ne facture rien par message : son coût est celui du serveur qui l'exécute, pas d'un appel à un fournisseur. Le choix entre GPT, Claude ou Mistral pour un usage de rédaction plutôt que de classification est détaillé dans notre comparatif de modèles IA.

Coût calculé pour 1 000 messages, à tarif publié (hypothèse : 200 tokens en entrée, 20 en sortie)

Règles (calcul local)$ pour 1 000 messages: Règles (calcul local) = 00Jev (tarif éditeur)$ pour 1 000 messages: Jev (tarif éditeur) = 0.00840,008Classifieur, API Classifier Mistral$ pour 1 000 messages: Classifieur, API Classifier Mistral = 0.00880,009LLM, GPT-5 nano$ pour 1 000 messages: LLM, GPT-5 nano = 0.0180,018LLM, Mistral Small 4$ pour 1 000 messages: LLM, Mistral Small 4 = 0.0420,042LLM, Claude Haiku 4.5$ pour 1 000 messages: LLM, Claude Haiku 4.5 = 0.30,3

Source : Tarifs OpenAI, Anthropic, Mistral et TypeSafe AI consultés le 20 septembre 2026 ; calcul La Refonte sur une hypothèse de longueur de message, pas une mesure

Latence : ce que les fournisseurs publient

Les fournisseurs ne publient pas tous leurs latences dans les mêmes conditions, ce qui rend la comparaison approximative. Sur la démo publique askjev.ai, non affiliée à l'éditeur, 172 appels lisibles les 18 et 19 septembre 2026 donnent une latence minimale de 117 ms, une médiane de 188 ms et un 95e centile à 395 ms, pour un coût affiché de 0,0000444 $ par appel, sur environ 1 057 tokens en entrée. Pour un LLM léger appelé en zero-shot, deux bancs d'essai publics donnent des temps de première réponse de 0,69 seconde (Claude Haiku 4.5, mode non-raisonnement, artificialanalysis.ai) à 0,96 seconde sur un prompt court (le même modèle via Amazon Bedrock, aimultiple.com, mesure du 12 août 2026). Ces deux chiffres portent sur le temps avant le premier jeton, pas sur la réponse complète.

Pour un classifieur entraîné ou un moteur de règles, aucun fournisseur ne publie de 95e centile comparable dans les mêmes conditions : ces modèles sont construits pour tourner sans appel à un grand modèle génératif. Un banc d'essai sur fastText note qu'il produit un modèle complet « en quelques minutes, sur une machine avec CPU seul », contre 20 à 28 minutes sur GPU pour un transformeur et 40 à 50 minutes pour affiner GPT-3 sur les serveurs d'OpenAI : un ordre de grandeur qui vaut pour l'entraînement, pas pour la latence d'une réponse individuelle, mais qui situe le rapport de coût de calcul entre les familles.

01

Jev (démo askjev.ai)

Mesure publiée
172 appels, 18-19 septembre 2026 : minimum 117 ms, médiane 188 ms, p95 395 ms, maximum 622 ms
Source
askjev.ai
02

LLM en JSON, Claude Haiku 4.5 (non-raisonnement)

Mesure publiée
Temps de première réponse : 0,69 s (prompt court) à 0,96 s (via Amazon Bedrock, 12 août 2026)
Source
artificialanalysis.ai · aimultiple.com
03

Classifieur entraîné / règles

Mesure publiée
Pas de 95e centile publié dans les mêmes conditions ; fastText produit un modèle complet en quelques minutes sur CPU seul
Source
toloka.ai

Calibration : quand la probabilité veut dire quelque chose

Un score de précision (accuracy, F1) dit si le modèle a globalement raison. Il ne dit pas si sa probabilité affichée, 92 % ou 60 %, correspond à une vraie chance d'avoir raison : c'est la calibration. Une étude publiée en août 2024, sur douze jeux de données de classification en production, de 1 000 à 10 000 exemples annotés chacun, mesure l'erreur de calibration (ECE) avant tout ajustement : environ 45 % pour la confiance auto-déclarée d'un modèle GPT, environ 50 % pour sa probabilité de logprob, contre 11 % pour une régression logistique classique. Après un ajustement statistique standard, les trois approches se rapprochent : 5 % à 8 % d'erreur. Sans cet ajustement, un seuil fixé sur la probabilité brute d'un LLM se déclenche à un rythme différent de ce que la probabilité affichée laisse croire.

C'est le point que la précision seule ne montre pas : un modèle qui répond juste 87 % du temps mais annonce 98 % de confiance pousse à relâcher la relecture humaine au mauvais moment. Jev est présenté par son éditeur comme un modèle calibré, avec une architecture propre désignée RLCD ; aucune étude indépendante de calibration n'a été trouvée pour ce modèle à la date de publication de cet article, seulement la revendication de l'éditeur.

Rejouer cette comparaison sur vos messages

Les chiffres de ce dossier viennent de bancs d'essai publiés par des tiers, de tarifs affichés par les éditeurs et de la démo publique askjev.ai : aucun ne vient d'un test mené par La Refonte sur un corpus de messages français. La méthode qui suit permet de rejouer la même comparaison sur votre propre flux, avec vos propres catégories.

Le protocole, étape par étape

  1. 1

    Étape 1

    Constituez un échantillon

    Prenez environ 200 messages réels anonymisés, une taille proche des échantillons utilisés dans les bancs d'essai cités plus haut, avec les catégories que vous utilisez déjà.

  2. 2

    Étape 2

    Faites tourner les quatre approches sur le même lot

    Un moteur de règles existant, un classifieur entraîné sur votre historique (ou une API comme le Classifier de Mistral), un LLM appelé avec une instruction de sortie JSON stricte, et Jev via l'API TypeSafe ou le binding Cloudflare Workers AI.

  3. 3

    Étape 3

    Mesurez la précision par une matrice de confusion

    Comparez chaque sortie à l'étiquette posée par une personne, catégorie par catégorie, pas seulement le taux global de bonnes réponses.

  4. 4

    Étape 4

    Comptez le coût réellement facturé

    Additionnez les tokens facturés en entrée et en sortie sur la facture du fournisseur, plutôt que d'extrapoler depuis le tarif catalogue.

  5. 5

    Étape 5

    Mesurez la latence en conditions réelles

    Relevez la médiane et le 95e centile sur votre volume, pas seulement le temps du premier appel.

  6. 6

    Étape 6

    Vérifiez la calibration avant de fixer un seuil

    Regroupez les prédictions par tranche de probabilité affichée et comparez au taux de bonnes réponses réel dans chaque tranche.

  7. 7

    Étape 7

    Documentez la décision

    Le seuil retenu, la tranche de confiance qui déclenche une relecture humaine, et un journal des cas revus.

Sources

Dernière mise à jour : 20 septembre 2026

Rejouez la comparaison sur vos messages

Le parcours IA de La Refonte aide à poser ce protocole sur votre propre flux : quel volume, quelles catégories, quel seuil, quelle relecture humaine. Programme et modalités sur la page de la formation.

En savoir plus

Questions fréquentes

Les règles ne relèvent d'aucun apprentissage automatique : c'est du code écrit à la main. Le classifieur entraîné mobilise de l'apprentissage supervisé, sur des exemples annotés, ou du few-shot pour une méthode comme SetFit. Un LLM en JSON s'appuie sur l'apprentissage déjà fait par son éditeur, appliqué ici en zero-shot, sans réentraînement de votre côté. Jev repose, selon son éditeur, sur une architecture propre désignée RLCD, distincte de l'apprentissage supervisé classique et non détaillée publiquement au-delà de cette annonce.

Pour aller plus loin

Sur le même sujet

Voir tout le blog

Sans engagement, sans jargon

On regarde votre site ensemble ?

Trente minutes pour identifier ce qui freine votre visibilité et repartir avec les priorités dans le bon ordre.

Discutons de votre projet

30 min · Google Meet

Choisissez le créneau qui vous convient dans notre calendrier. On analyse votre situation avant l’appel pour aller droit au but.