Exemple de rapport de test

Le tri de 60 e-mails de clients, noté.

Ce que livre un test d'IA privée, montré sur le test publié par Meow. Un test sur vos documents suit la même forme, avec vos documents et vos réponses de référence, sous accord de confidentialité.

Tâche
Trier chaque e-mail de client pour l'équipe d'une fiduciaire : ses sujets, son urgence, l'échéance que donne le client et ce qu'il demande.
Documents
20 e-mails de clients rédigés pour le test, chacun en anglais, en français et en allemand : 60 en tout.
Réponses de référence
Chaque e-mail étiqueté à la main avant qu'un modèle ne le voie, selon des règles d'étiquetage écrites d'abord.
Modèles
Des modèles ouverts de 0,6, 1,7 et 8 milliards de paramètres dans un navigateur sur un portable Apple M1 ; un modèle de 32 milliards sur une NVIDIA RTX PRO 6000 au bureau de Meow, relancé avec les règles d'étiquetage dans ses consignes.
Dates
Du 28 au 30 septembre 2026.

Tous les scores

Le tri, mesuré : la taille seuleRéponses justes sur 20 e-mails par langue, avec les mêmes consignes pour chaque modèle. Les temps sont des médianes : 32B sur un GPU de serveur, les autres sur un portable Apple M1.
Anglais
0.6B1.7B8B32B
Délai19141815
Sujets11121011
Urgence9111111
Les trois justes6353
Temps par e-mailMédiane1,3 s2,4 s6,6 s1,5 s
Français
0.6B1.7B8B32B
Délai12122019
Sujets1298
Urgence591412
Les trois justes0053
Temps par e-mailMédiane1,5 s3,0 s6,7 s1,7 s
Allemand
0.6B1.7B8B32B
Délai13122018
Sujets3746
Urgence9141010
Les trois justes1432
Temps par e-mailMédiane1,5 s3,1 s7,4 s1,6 s
Le même 32B, avec les règles dans les consignesLes consignes ci-dessus nomment les champs, sans plus. Ici, elles donnent aussi les règles selon lesquelles les réponses ont été vérifiées, mot pour mot, telles qu'elles avaient été écrites avant qu'aucun modèle ne voie les e-mails.
Anglais
Mêmes consignesRègles ajoutées
Délai1520
Sujets1110
Urgence1119
Les trois justes39
Français
Mêmes consignesRègles ajoutées
Délai1920
Sujets86
Urgence1219
Les trois justes36
Allemand
Mêmes consignesRègles ajoutées
Délai1820
Sujets67
Urgence1020
Les trois justes27

Chaque e-mail et chaque réponse

Où les modèles se sont trompés

  1. Un modèle plus grand ne comble qu'une partie de l'écart de langue. En français, 8B a trouvé tous les délais, 20 sur 20, et nommé les bons sujets 9 fois, contre une seule pour 0.6B. En allemand, il a aussi trouvé tous les délais, mais a classé 19 des 20 e-mails dans « Autre ».
  2. Plus grand n'est pas forcément meilleur. Avec les mêmes consignes, 32B a eu les trois justes moins souvent que 8B dans chaque langue : il juge urgents des e-mails que les réponses vérifiées classent comme normaux, et ajoute des sujets que le client n'a pas demandés.
  3. Une fois le modèle assez grand, les consignes comptent plus que la taille. Avec les règles ajoutées, le même 32B a jugé l'urgence juste dans 19 ou 20 e-mails sur 20 et trouvé tous les délais, dans les trois langues. Des règles d'urgence détaillées avaient fait classer presque tous les e-mails comme urgents par le plus petit modèle.
  4. Les sujets restent le plus difficile. Même avec les règles, 32B n'a choisi exactement les bons sujets que dans 6 à 10 e-mails sur 20, surtout en ajoutant un sujet que l'e-mail ne fait que mentionner. C'est à cela que servent des exemples tirés de vos propres e-mails.

La décision sur ces chiffres

Pour la meilleure exécution, le modèle de 32 milliards avec les règles écrites dans ses consignes :

Partie de la réponseVerdictJustes, sur 20
DélaiFeu vert20 en anglais, 20 en français, 20 en allemand
SujetsPas sans une personne qui vérifie10 en anglais, 6 en français, 7 en allemand
UrgenceFeu vert19 en anglais, 19 en français, 20 en allemand
Les trois justesPas d'automatisation complète9 en anglais, 6 en français, 7 en allemand

La suite proposée

Avec les règles ajoutées, le même modèle 32B est passé de 3 à 9 e-mails sur 20 avec les trois justes en anglais. Reste le jugement sur les sujets : l'étape suivante, ce sont des exemples tirés de vos propres e-mails, vérifiés avec le même test.

Ce qu'ajoute un rapport sur vos documents

Ce que coûte l'exploitation
Par document et par mois, sur le matériel dont le modèle choisi a besoin : dans le cloud suisse d'Infomaniak, sur les serveurs de Meow en Suisse ou dans vos locaux.
Vos documents, vos réponses de référence
30 à 50 de vos vrais documents, lus sur un serveur GPU au bureau de Meow en Suisse et notés selon des réponses vérifiées avec vous.
La confirmation écrite de l'effacement
Vos documents sont effacés à la fin du test, et vous recevez une confirmation écrite. Les e-mails de cet exemple ont été rédigés pour le test : il n'y avait rien à effacer.

Réserver un appel gratuit de 15 minutes

Choisissez le moment qui vous convient : l'invitation arrive aussitôt dans votre boîte de réception. Si l'horaire ne nous convient plus, vous avez de nos nouvelles le jour ouvrable même.

Ce qui se passe en 15 minutes

  1. 0–5 min

    Votre situation

    Ce que l'IA devrait faire pour vous, et ce qu'elle ne doit jamais voir.

  2. 5–10 min

    Ce qui est possible

    Quelles tâches peuvent tourner en privé, ce que cela coûte à peu près, et ce qui doit rester humain.

  3. 10–15 min

    La prochaine étape

    Un atelier, un test sur vos propres documents, ou rien pour l'instant.

  1. Choisissez un horaire
  2. Où envoyer l'invitation
Jour
Heure (heure suisse)
Matin
Après-midi
Vous préférez écrire ? Envoyer un message

Dites-nous ce que l'IA devrait faire pour vous, et ce qu'elle ne doit jamais voir. Nous vous dirons franchement ce qui est possible, ce que cela coûte et ce qui doit rester humain. Pas encore de détails ? Un bonjour suffit.

Que pouvons-nous prendre en charge pour vous ?