Le carnet de La Refonte

Jev en français : ce que dit le modèle, et le jeu d'essai

TypeSafe AI, Cloudflare et la documentation de Jev restent silencieux sur la langue. Les bancs d'essai publics sur des modèles multilingues comparables donnent des repères. La Refonte publie un jeu de 30 messages français annotés, une grille et un protocole de mesure, sans inscription.

  • IA & Automatisation
  • Jev
  • Modèle de décision
  • Multilingue
  • PME
Refonte de Site Web

Refonte

Agence SEO

SEO

Intégration IA

IA

Jev, le modèle de décision de TypeSafe AI, ne revendique aucune limite de langue : ni sur le site de l'éditeur, ni sur la fiche modèle Cloudflare, ni dans sa documentation technique, où le mot « français » n'apparaît jamais. Le 20 septembre 2026, La Refonte a rejoué sur ce jeu de 30 messages en français, annotés à la main, un protocole de trois passes via l'API OpenRouter : 21 messages sur 30 obtiennent le bon service, 23 sur 30 le bon niveau d'urgence exact et 29 sur 30 à un niveau près, 26 sur 30 le bon ton, avec une médiane de latence de 471 ms. Jev comprend le français des messages clients, fautes et style familier compris ; la qualité du tri dépend d'abord des critères écrits pour chaque catégorie.

📌 À retenir

  • Ni typesafe.ai, ni la documentation de Jev, ni sa fiche modèle Cloudflare ne mentionnent une langue prise en charge, français inclus.
  • La Refonte a mesuré, le 20 septembre 2026 sur ce jeu de 30 messages : 21/30 de bon service (70 %), 23/30 d'urgence exacte (77 %), 29/30 à un niveau d'urgence près (97 %), 26/30 de bon ton (87 %).
  • 7 des 9 erreurs de service concernent la catégorie fourre-tout « autre » : 4 avec une confiance sous 0,3, donc renvoyées à une relecture humaine par un seuil à 0,7 ; 3 restent des erreurs confiantes (#19, #24, #29).
  • Conclusion assurée par cette mesure : Jev comprend le français des messages clients, fautes et familier compris. La qualité du tri dépend d'abord de la clarté des critères écrits pour chaque catégorie, « autre » en tête.

Ce que l'éditeur et Cloudflare disent, et ne disent pas, de la langue de Jev

TypeSafe AI a annoncé Jev le 15 septembre 2026 comme premier modèle public de sa catégorie « System One ». La presse spécialisée a relayé l'annonce dès le lendemain : The Register a détaillé le profil du fondateur et le financement de 40 millions de dollars, ActuIA a présenté l'approche à ses lecteurs francophones le 18 septembre. Aucun de ces textes n'aborde la question de la langue d'entrée du modèle.

La page d'accueil de l'éditeur, consultée le 20 septembre 2026, ne contient aucune déclaration sur les langues prises en charge. Sa documentation technique, elle aussi rédigée en anglais, décrit les trois types de questions du modèle sans mentionner ni le français ni une quelconque limite linguistique. La fiche du modèle « typesafe/jev » sur Cloudflare Workers AI, classée dans la catégorie « Text Generation » malgré sa nature d'évaluation structurée, se limite à indiquer une fenêtre de contexte de 32 000 tokens et renvoie au tableau de bord pour le tarif. Elle non plus ne dit rien de la langue.

La démonstration publique askjev.ai, elle, ne permet même pas de tester le français : son serveur filtre les messages selon une liste de mots anglais et refuse toute soumission rédigée dans une autre langue, relevé constaté par La Refonte les 18 et 19 septembre 2026. Ce n'est pas une limite de Jev lui-même, puisque la démo n'est pas éditée par TypeSafe AI, mais elle interdit d'observer par ce biais le comportement du modèle sur une entrée française.

Ce silence a une explication technique plausible. Jev évalue un état contre des questions typées : il ne génère pas de texte, donc la notion habituelle de « langue de sortie » d'un modèle génératif ne s'applique pas de la même façon. Reste la question qui compte pour une équipe française : le modèle comprend-il un état et des critères écrits en français aussi bien qu'en anglais ? Aucune des sources consultées n'y répond, ce qui déplace la réponse vers les bancs d'essai publics sur des modèles comparables, puis vers un test mené sur ses propres messages.

01

typesafe.ai (annonce et accueil)

Ce qu'elle documente
Architecture RLCD, vitesse, prix, absence d'hallucination revendiquée
Mention de la langue
Aucune mention de langue
02

docs.typesafe.ai (documentation technique)

Ce qu'elle documente
Primitives Choice, Score, Noul, guide de démarrage
Mention de la langue
Aucune mention de langue, documentation en anglais
03

Fiche modèle Cloudflare Workers AI (typesafe/jev)

Ce qu'elle documente
Catégorie, fenêtre de contexte 32 000 tokens, tarif renvoyé au tableau de bord
Mention de la langue
Aucune mention de langue
04

askjev.ai (démonstration publique, non affiliée)

Ce qu'elle documente
Interface de test avec 6 questions fixes
Mention de la langue
Filtre serveur qui refuse les soumissions non anglaises
Ce que chaque source officielle documente sur Jev, et ce qu'elle dit de la langue. Sources consultées le 20 septembre 2026.
Accueil de typesafe.ai le 19 septembre 2026 : bandeau « TypeSafe announces System One models and Jev » daté du 15 septembre et titre « The First (Public) System One Model ».
L'accueil de typesafe.ai, capturé le 19 septembre 2026 : aucune mention de langue prise en charge dans l'annonce ni ailleurs sur la page. Source : typesafe.ai.

Ce que les bancs d'essai publics disent des modèles de décision en français

À défaut d'une réponse de l'éditeur, la littérature publique sur les grands modèles multilingues donne des repères. Une étude d'octobre 2026 sur la calibration multilingue des grands modèles de langage mesure, sur LLaMA 3 et le test MMMLU, une erreur de calibration (ECE, plus basse est meilleure) de 4,61 % en anglais contre 13,87 % en français, pour une exactitude de 51,30 % en français sur cette tâche. La moyenne toutes langues non anglaises confondues grimpe à 23,12 %. L'écart n'est donc pas propre au français, mais le français n'y échappe pas.

Le même travail teste Aya, un modèle pensé dès le départ pour le multilingue : l'écart s'y resserre nettement, 20,66 % en anglais contre 26,77 % en moyenne non anglaise. Qwen3, entraîné sur un corpus plus équilibré entre les langues, réduit l'écart à 1,56 point seulement. La leçon rejoint celle que documentait déjà, en 2023, un article sur l'iniquité des tokeniseurs entre langues : la performance multilingue d'un modèle dépend directement de la part de chaque langue dans ses données d'entraînement, pas d'une propriété universelle du français ou de l'anglais.

Le français coûte aussi plus de tokens

Un second écart, indépendant de la calibration, touche la tokenisation. Une mesure comparant un même passage traduit dans sept langues montre, sur l'encodage o200k de GPT-5, 1,17 token par mot en anglais contre 1,40 en français, soit près de 20 % de tokens en plus pour porter le même sens. L'écart se creuse sur les encodages plus anciens : 110 tokens en anglais contre 194 en français sur l'encodeur cl100k de GPT-4 pour ce même passage, et un rapport comparable mesuré sur Claude Sonnet et Claude Opus.

Pour un modèle de décision comme Jev, facturé au token d'entrée et borné à une fenêtre de contexte fixe, ce n'est pas un détail théorique. Un état en français consomme mécaniquement plus de la fenêtre de 32 000 tokens qu'un état équivalent en anglais, et coûte un peu plus au tarif annoncé de 0,042 dollar par million de tokens en entrée. L'écart reste minoritaire devant la fenêtre disponible pour un message client isolé, mais il grossit avec un état volumineux ou un historique de conversation joint. Notre guide pour déployer Jev sur Cloudflare Workers AI détaille la lecture du seuil de confiance une fois l'appel en place.

Aucun de ces chiffres ne mesure Jev lui-même : ils décrivent des modèles multilingues généralistes et des tokeniseurs GPT ou Claude, pas l'architecture RLCD propre à TypeSafe AI. Ils fixent seulement un ordre de grandeur plausible avant un test direct, et expliquent pourquoi la question de ce dossier ne se limite pas à « répond-il en français » mais porte sur la fiabilité de la décision elle-même.

01

LLaMA 3

ECE anglais
4,61 %
ECE français ou non anglais
13,87 % (français) / 23,12 % (moyenne non anglaise)
Exactitude français (MMMLU)
51,30 %
02

Aya (multilingue dès l'origine)

ECE anglais
20,66 %
ECE français ou non anglais
26,77 % (moyenne non anglaise)
Exactitude français (MMMLU)
Non précisé pour le français seul
03

Qwen3 (corpus plus équilibré)

ECE anglais
Écart anglais/non anglais
ECE français ou non anglais
1,56 point d'écart seulement
Exactitude français (MMMLU)
Non précisé pour le français seul
Écart de calibration (ECE, plus bas est meilleur) et d'exactitude entre l'anglais et le français ou la moyenne non anglaise, sur trois familles de modèles multilingues. Source : étude arXiv sur la calibration multilingue, octobre 2026. Ces modèles sont distincts de Jev.

Tokens nécessaires pour un même passage traduit, français vs anglais

055110165220275GPT-4 (cl100k)110Anglais: GPT-4 (cl100k) = 110194Français: GPT-4 (cl100k) = 194Claude Sonnet 4.6116Anglais: Claude Sonnet 4.6 = 116207Français: Claude Sonnet 4.6 = 207Claude Opus 4.8177Anglais: Claude Opus 4.8 = 177275Français: Claude Opus 4.8 = 275Tokens pour le même passageAnglaisFrançais

Source : Mesure comparant un passage de référence traduit en 7 langues, tiktoken pour GPT-4/GPT-5, endpoint officiel Anthropic pour Claude (2026)

Les pièges propres au français des messages clients

Un message client en français porte des difficultés que les bancs d'essai anglophones ne rencontrent pas dans les mêmes proportions. Les accents et l'orthographe glissent souvent dans un clavier saisi vite : une négation oubliée qui inverse le sens, un mot tronqué, des majuscules qui remplacent la ponctuation pour marquer l'urgence. Le registre change d'un message à l'autre, du vouvoiement formel au tutoiement familier, parfois dans le même échange. Une expression réunionnaise ou créole peut apparaître sans prévenir dans un message envoyé depuis un territoire ultramarin. L'ironie et le sarcasme, difficiles à repérer même pour un lecteur humain pressé, se glissent dans les réclamations. Enfin, un même message mélange souvent plusieurs demandes : une question de facturation suivie d'une remarque sur un retard de livraison.

Un grand modèle de langage génératif absorbe ces variations en les reformulant dans sa réponse, ce qui masque l'ambiguïté plutôt que de la trancher. Un modèle de décision comme Jev fonctionne différemment : il ne reformule rien, il évalue l'état fourni contre des questions déjà typées, avec leurs critères écrits en langage courant. Cette contrainte change la nature du problème. Une faute d'orthographe ou un accent manquant n'empêche pas d'évaluer un critère du type « le message exprime-t-il une urgence » ou « quel service est concerné », tant que le sens général reste lisible. Un message à double demande, lui, reste un vrai piège : le schéma de questions doit prévoir qu'un message porte plusieurs sujets, faute de quoi une seule réponse écrase les autres.

Le vrai levier n'est donc pas la robustesse supposée du modèle aux fautes, sur laquelle aucune source consultée ne s'engage, mais la qualité du cadrage des questions et de leurs critères. Un critère « urgent » décrit en une phrase vague laisse le modèle deviner. Le même critère, décrit avec un exemple positif et un exemple négatif en français courant, réduit la place laissée à l'interprétation, quelle que soit la langue de départ.

Un message client en français face aux questions typées de Jev

1Message client en françaisFautes, familier, ironie…2Questions typéesService, urgence, ton3JevÉvalue l'état, ne reform…4Décision et confianceÀ comparer à l'annotatio…
Exemple illustratif adapté au français (non exécuté ici, à valider sur Workers AI)
// Adaptation illustrative de l'exemple officiel Cloudflare, en français : non testée dans cet article.
const response = await env.AI.run(
  'typesafe/jev',
  {
    state: "Bonjour, ca fait 3 jours que mon virement n'arrive pas, c'est vraiment n'importe quoi !!",
    questions: {
      urgence: {
        type: 'noul',
        instructions: 'Ce message exprime-t-il une urgence ?',
        criteria: { true: "Delai depasse ou mot explicite d'urgence", false: 'Aucune urgence exprimee' },
      },
      service: {
        type: 'choice',
        instructions: 'Quel service doit traiter cette demande ?',
        criteria: {
          facturation: 'Paiements, virements, factures',
          technique: 'Pannes, bugs, integrations',
          commercial: 'Tarifs, nouveaux comptes, devis',
        },
      },
      ton: {
        type: 'score',
        instructions: "Quel est le niveau d'agacement du client ?",
        criteria: ['Calme', 'Agace', 'Tres en colere'],
      },
    },
  },
)
console.log(response)

Le jeu d'essai : 30 messages en français construits pour ce test

Le tableau qui suit réunit 30 messages rédigés spécifiquement pour ce dossier. Ce ne sont pas des messages clients réels : aucune donnée personnelle n'est en jeu, et aucune anonymisation n'a donc été nécessaire pour les publier. Ils ont été écrits pour couvrir, de façon volontaire, les pièges décrits plus haut : fautes d'orthographe, tutoiement et vouvoiement mélangés, une expression réunionnaise, de l'ironie, des messages à double demande, et quelques messages neutres sans difficulté particulière pour servir de repère.

Chaque message porte trois annotations fixées à l'avance par une lecture humaine, avant tout passage dans un modèle : le service concerné, le niveau d'urgence et le ton. Ces trois annotations forment la vérité de référence à laquelle une décision de Jev pourra être comparée. Le service retenu suit le même découpage que l'exemple officiel de Cloudflare : facturation, technique, commercial, avec une option « autre ». L'urgence et le ton suivent chacun une échelle à trois niveaux, détaillée dans la grille qui suit le tableau.

01

1

Message (rédigé pour le test)
Bonjour, je n'ai pas reçu ma facture du mois dernier, pouvez-vous me la renvoyer svp ?
Service attendu
Facturation
Urgence attendue
Faible
Ton attendu
Calme
02

2

Message (rédigé pour le test)
ca fait 3 fois que j'ecrit et personne me repond CEST INADMISSIBLE
Service attendu
Autre
Urgence attendue
Élevée
Ton attendu
En colère
03

3

Message (rédigé pour le test)
Salut, le bouton de paiement bug depuis ce matin, impossible de valider ma commande
Service attendu
Technique
Urgence attendue
Élevée
Ton attendu
Agacé
04

4

Message (rédigé pour le test)
Bonjour, je voudrais connaître vos tarifs pour un abonnement annuel, merci d'avance
Service attendu
Commercial
Urgence attendue
Faible
Ton attendu
Calme
05

5

Message (rédigé pour le test)
mon compte a été débité deux fois pour la même commande, il faut rembourser vite
Service attendu
Facturation
Urgence attendue
Élevée
Ton attendu
Agacé
06

6

Message (rédigé pour le test)
Coucou, petite question, est-ce que vous livrez à La Réunion ?
Service attendu
Commercial
Urgence attendue
Faible
Ton attendu
Calme
07

7

Message (rédigé pour le test)
Lé la 3 jours mon colis i arrive pa, mi lé pa contan sa
Service attendu
Autre
Urgence attendue
Moyenne
Ton attendu
Agacé
08

8

Message (rédigé pour le test)
Ah super, encore un bug sur votre site, bravo les ingénieurs
Service attendu
Technique
Urgence attendue
Moyenne
Ton attendu
Agacé
09

9

Message (rédigé pour le test)
Bonsoir, j'aimerais résilier mon abonnement et être remboursé du mois en cours, et savoir si vous avez une offre étudiante
Service attendu
Commercial
Urgence attendue
Faible
Ton attendu
Calme
10

10

Message (rédigé pour le test)
URGENT mon site est down depuis 1h je perds des clients
Service attendu
Technique
Urgence attendue
Élevée
Ton attendu
En colère
11

11

Message (rédigé pour le test)
Petite précision sur ma facture d'octobre, rien de grave, quand vous avez 5 minutes
Service attendu
Facturation
Urgence attendue
Faible
Ton attendu
Calme
12

12

Message (rédigé pour le test)
tu peux m'dire pourquoi j'ai été facturé deux fois stp
Service attendu
Facturation
Urgence attendue
Moyenne
Ton attendu
Agacé
13

13

Message (rédigé pour le test)
Je souhaite passer une commande groupée pour mon entreprise, quel est le délai de livraison ?
Service attendu
Commercial
Urgence attendue
Faible
Ton attendu
Calme
14

14

Message (rédigé pour le test)
j'ai contacté 3 fois le support et toujours pas de reponse, je vais changer de prestataire
Service attendu
Autre
Urgence attendue
Élevée
Ton attendu
En colère
15

15

Message (rédigé pour le test)
Bonjour, l'application plante à chaque ouverture depuis la mise à jour d'hier
Service attendu
Technique
Urgence attendue
Moyenne
Ton attendu
Agacé
16

16

Message (rédigé pour le test)
Merci pour votre réactivité la dernière fois, j'ai juste une question sur le renouvellement
Service attendu
Commercial
Urgence attendue
Faible
Ton attendu
Calme
17

17

Message (rédigé pour le test)
g reçu un colis vide, c'est une blague ??
Service attendu
Autre
Urgence attendue
Élevée
Ton attendu
Agacé
18

18

Message (rédigé pour le test)
Bonjour, je n'arrive pas à me connecter à mon espace client depuis ce matin
Service attendu
Technique
Urgence attendue
Moyenne
Ton attendu
Calme
19

19

Message (rédigé pour le test)
Franchement, pour le prix, on pourrait s'attendre à un service qui marche
Service attendu
Autre
Urgence attendue
Moyenne
Ton attendu
Agacé
20

20

Message (rédigé pour le test)
Est-ce que vous proposez une facture avec TVA pour mon entreprise ?
Service attendu
Facturation
Urgence attendue
Faible
Ton attendu
Calme
21

21

Message (rédigé pour le test)
STOP je veux être remboursé MAINTENANT ou je porte plainte
Service attendu
Facturation
Urgence attendue
Élevée
Ton attendu
En colère
22

22

Message (rédigé pour le test)
hello, juste pour savoir si le SAV répond aussi le samedi
Service attendu
Autre
Urgence attendue
Faible
Ton attendu
Calme
23

23

Message (rédigé pour le test)
je suis obligé de relancer pour la 4e fois, ça commence à faire beaucoup
Service attendu
Autre
Urgence attendue
Moyenne
Ton attendu
Agacé
24

24

Message (rédigé pour le test)
Bonjour, j'ai deux questions : la première sur ma commande en retard, la seconde sur un devis pour un second produit
Service attendu
Autre
Urgence attendue
Moyenne
Ton attendu
Calme
25

25

Message (rédigé pour le test)
Tout va bien, je voulais juste vous remercier pour la livraison rapide
Service attendu
Autre
Urgence attendue
Faible
Ton attendu
Calme
26

26

Message (rédigé pour le test)
g pas reçu le mail de confirmation, c urgent jen ai besoin pour demain
Service attendu
Technique
Urgence attendue
Élevée
Ton attendu
Agacé
27

27

Message (rédigé pour le test)
Pouvez-vous m'indiquer comment mettre à jour ma carte bancaire enregistrée ?
Service attendu
Facturation
Urgence attendue
Faible
Ton attendu
Calme
28

28

Message (rédigé pour le test)
ça devient n'importe quoi, deuxième panne cette semaine
Service attendu
Technique
Urgence attendue
Élevée
Ton attendu
En colère
29

29

Message (rédigé pour le test)
Bonjour, je voulais juste confirmer que ma commande partira bien demain
Service attendu
Autre
Urgence attendue
Faible
Ton attendu
Calme
30

30

Message (rédigé pour le test)
Mi lé kontan mais mi trouv sa un pé sher pour sa
Service attendu
Commercial
Urgence attendue
Faible
Ton attendu
Calme
Les 30 messages du jeu d'essai, rédigés pour ce dossier, avec leur annotation de référence (service, urgence, ton) fixée par lecture humaine avant tout passage dans un modèle. Aucun message réel, aucune donnée personnelle.

La grille d'annotation et le calcul du taux d'accord

La grille fixe, pour chaque message, trois champs à renseigner et leurs valeurs possibles. Le service reprend quatre valeurs : facturation, technique, commercial, autre. L'urgence et le ton suivent chacun une échelle à trois niveaux, décrite dans le tableau ci-dessous avec un critère écrit en français pour chaque valeur, afin que deux personnes différentes annotent le même message de la même façon.

Le taux d'accord se calcule de deux façons complémentaires. Le pourcentage d'accord brut compare, champ par champ, la décision du modèle à l'annotation de référence, et compte la part de messages où les deux coïncident exactement : c'est le calcul utilisé dans les résultats plus bas. Cette mesure simple surestime l'accord quand une valeur domine largement les autres. Le kappa de Cohen corrige ce biais : il compare l'accord observé à l'accord qu'on obtiendrait par un tirage aléatoire respectant la même répartition des valeurs, et renvoie un chiffre entre -1 et 1, où 0 correspond à un accord de pur hasard et 1 à un accord parfait.

Les résultats mesurés le 20 septembre 2026 sur ce jeu de 30 messages sont présentés plus bas, dans la section « Résultats du jeu d'essai ».

01

Urgence

Valeur
Faible
Critère de décision
Aucun délai dépassé, aucun mot d'urgence
02

Urgence

Valeur
Moyenne
Critère de décision
Une gêne réelle mais pas de risque immédiat
03

Urgence

Valeur
Élevée
Critère de décision
Délai dépassé, perte financière ou mot explicite d'urgence
04

Ton

Valeur
Calme
Critère de décision
Formulation neutre ou courtoise, sans marque d'agacement
05

Ton

Valeur
Agacé
Critère de décision
Répétition, majuscules partielles, ponctuation appuyée
06

Ton

Valeur
En colère
Critère de décision
Menace, mise en demeure, vocabulaire fort
07

Service

Valeur
Facturation
Critère de décision
Paiement, remboursement, TVA, moyen de paiement
08

Service

Valeur
Technique
Critère de décision
Panne, bug, connexion, intégration
09

Service

Valeur
Commercial
Critère de décision
Tarif, offre, nouvelle commande, devis
10

Service

Valeur
Autre
Critère de décision
Aucun des trois ci-dessus, ou plusieurs sujets mélangés
La grille d'annotation utilisée pour fixer la vérité de référence des 30 messages, avant toute comparaison à une décision de modèle.

Le protocole de mesure : trois passes, un seuil, les désaccords

  1. 1

    Étape 1

    Trois passes indépendantes

    Chaque message du jeu d'essai est soumis trois fois à Jev, pour vérifier si la décision reste stable sur un même état, avant de la comparer à l'annotation humaine.

  2. 2

    Étape 2

    Comparaison à l'annotation de référence

    Les trois réponses sont comparées aux valeurs de la grille, champ par champ, avec le calcul du pourcentage d'accord et du kappa de Cohen décrits plus haut.

  3. 3

    Étape 3

    Un seuil de confiance déclenche la relecture

    En dessous d'un seuil fixé à l'avance, la décision part en relecture humaine plutôt que d'être appliquée automatiquement, quel que soit le champ concerné.

  4. 4

    Étape 4

    Les désaccords sont documentés, pas arbitrés en silence

    Un message où les trois passes ne s'accordent pas entre elles, ou où le modèle diverge de l'annotation de référence, est consigné avec sa raison probable plutôt qu'écarté.

Résultats du jeu d'essai (20 septembre 2026)

La Refonte a exécuté ce protocole le 20 septembre 2026, depuis un poste connecté par Starlink, via l'API OpenRouter (endpoint /api/alpha/decisions, modèle typesafe/jev-1.13-20260917) : chaque message du jeu d'essai a été soumis trois fois, soit 90 appels sur les 30 messages. La latence mesurée ici est un aller-retour client complet depuis ce poste, pas la latence serveur, à comparer avec réserve à un relevé mesuré côté serveur.

Taux d'accord sur 30 messages, 3 passes chacun

21/30

Service correct (70 %)

23/30

Urgence exacte (77 %)

29/30

Urgence à un niveau près (97 %)

26/30

Ton correct (87 %)

29/30

Service stable sur les 3 passes (97 %)

Le tableau suivant liste les 9 messages où le service obtenu par Jev diverge du service attendu, avec la confiance renvoyée par le modèle pour sa réponse.

01

7

Message
Lé la 3 jours mon colis i arrive pa, mi lé pa contan sa
Service attendu
Autre
Service obtenu
Technique
Confiance
0,22
02

9

Message
Bonsoir, j'aimerais résilier mon abonnement et être remboursé du mois en cours, et savoir si vous avez une offre étudiante
Service attendu
Commercial
Service obtenu
Facturation
Confiance
0,91
03

14

Message
j'ai contacté 3 fois le support et toujours pas de reponse, je vais changer de prestataire
Service attendu
Autre
Service obtenu
Commercial
Confiance
0,27
04

17

Message
g reçu un colis vide, c'est une blague ??
Service attendu
Autre
Service obtenu
Technique
Confiance
0,06
05

19

Message
Franchement, pour le prix, on pourrait s'attendre à un service qui marche
Service attendu
Autre
Service obtenu
Technique
Confiance
0,93
06

22

Message
hello, juste pour savoir si le SAV répond aussi le samedi
Service attendu
Autre
Service obtenu
Technique
Confiance
0,25
07

24

Message
Bonjour, j'ai deux questions : la première sur ma commande en retard, la seconde sur un devis pour un second produit
Service attendu
Autre
Service obtenu
Commercial
Confiance
0,99
08

29

Message
Bonjour, je voulais juste confirmer que ma commande partira bien demain
Service attendu
Autre
Service obtenu
Commercial
Confiance
0,93
09

30

Message
Mi lé kontan mais mi trouv sa un pé sher pour sa
Service attendu
Commercial
Service obtenu
Autre
Confiance
0,62
Les 9 messages où le service obtenu diverge de l'annotation de référence, sur 30 messages et 3 passes, mesurés par La Refonte le 20 septembre 2026 avec typesafe/jev-1.13-20260917.

Ce qu'il faut retenir avant de tester Jev sur vos messages en français

Aucune des sources officielles consultées, l'éditeur, sa documentation et la fiche modèle Cloudflare, ne prend position sur le français. La mesure du 20 septembre 2026 sur les 30 messages de ce dossier répond directement à la question, sur ce périmètre : Jev traite correctement 21 messages sur 30 pour le service, 23 sur 30 pour l'urgence exacte et 26 sur 30 pour le ton, fautes d'orthographe, tutoiement et une expression réunionnaise compris dans le jeu de test.

La quasi-totalité des erreurs de service, 7 sur 9, concerne la catégorie fourre-tout « autre » : un message de remerciement, une confirmation de commande ou une double question s'y glissent aussi bien qu'une vraie réclamation hors des trois autres services. C'est d'abord un défaut de nos propres critères, la catégorie « autre » n'étant définie que par ce qu'elle n'est pas, pas seulement une limite du modèle : 4 de ces 7 erreurs tombent sous une confiance de 0,3, largement sous un seuil de relecture humaine fixé à 0,7, et sont donc rattrapées avant tout envoi automatique. 3 restent des erreurs confiantes malgré tout, #19, #24 et #29 dans le tableau plus haut : la confiance seule n'y aurait pas suffi, une catégorie « autre » mieux définie par ses propres critères l'aurait probablement évitée.

Le jeu de 30 messages, sa grille d'annotation et le protocole en trois passes, publiés plus haut sans inscription, restent valables pour reprendre ce test sur vos propres catégories de service, avec vos propres critères d'urgence et de ton, en particulier pour écrire une catégorie « autre » qui se définisse positivement plutôt que par défaut.

Une fois le tri fiabilisé sur l'entrée, la question suivante porte sur la sortie : comment vérifier qu'une réponse rédigée par une IA reste correcte avant de partir au client, sujet détaillé dans notre article sur les garde-fous d'une réponse IA. Le tri des demandes entrantes proprement dit, au-delà de ce test, est traité dans notre guide pour trier les demandes d'un formulaire avec l'IA. Le fonctionnement général du modèle reste décrit dans notre article de référence sur Jev, le modèle de décision.

Sources

Dernière mise à jour : 20 septembre 2026

Le jeu d'essai et la grille, sans inscription, sont dans cet article

Copiez le tableau des 30 messages et la grille d'annotation directement depuis cette page. Pour cadrer un test sur vos propres catégories métier, le parcours IA de La Refonte travaille les questions typées, les automatisations et les garde-fous sur deux jours.

En savoir plus

Questions fréquentes sur Jev et le français

Ni l'éditeur, ni sa documentation, ni la fiche modèle Cloudflare Workers AI ne mentionnent une langue prise en charge. La Refonte a testé directement : sur 30 messages en français annotés à la main et soumis trois fois chacun le 20 septembre 2026, Jev obtient le bon service dans 21 cas sur 30, la bonne urgence exacte dans 23 cas sur 30 et le bon ton dans 26 cas sur 30. Il comprend les fautes d'orthographe et le langage familier des messages testés ; ses erreurs se concentrent sur une catégorie de service mal définie plutôt que sur la compréhension de la langue elle-même.

Pour aller plus loin

Sur le même sujet

Voir tout le blog

Sans engagement, sans jargon

On regarde votre site ensemble ?

Trente minutes pour identifier ce qui freine votre visibilité et repartir avec les priorités dans le bon ordre.

Discutons de votre projet

30 min · Google Meet

Choisissez le créneau qui vous convient dans notre calendrier. On analyse votre situation avant l’appel pour aller droit au but.