Exemple de rapport de test
Le tri de 60 e-mails de clients, noté.
Ce que livre un test d'IA privée, montré sur le test publié par Meow. Un test sur vos documents suit la même forme, avec vos documents et vos réponses de référence, sous accord de confidentialité.
- Tâche
- Trier chaque e-mail de client pour l'équipe d'une fiduciaire : ses sujets, son urgence, l'échéance que donne le client et ce qu'il demande.
- Documents
- 20 e-mails de clients rédigés pour le test, chacun en anglais, en français et en allemand : 60 en tout.
- Réponses de référence
- Chaque e-mail étiqueté à la main avant qu'un modèle ne le voie, selon des règles d'étiquetage écrites d'abord.
- Modèles
- Des modèles ouverts de 0,6, 1,7 et 8 milliards de paramètres dans un navigateur sur un portable Apple M1 ; un modèle de 32 milliards sur une NVIDIA RTX PRO 6000 au bureau de Meow, relancé avec les règles d'étiquetage dans ses consignes.
- Dates
- Du 28 au 30 septembre 2026.
Tous les scores
| 0.6B | 1.7B | 8B | 32B | |
|---|---|---|---|---|
| Délai | 19 | 14 | 18 | 15 |
| Sujets | 11 | 12 | 10 | 11 |
| Urgence | 9 | 11 | 11 | 11 |
| Les trois justes | 6 | 3 | 5 | 3 |
| Temps par e-mailMédiane | 1,3 s | 2,4 s | 6,6 s | 1,5 s |
| 0.6B | 1.7B | 8B | 32B | |
|---|---|---|---|---|
| Délai | 12 | 12 | 20 | 19 |
| Sujets | 1 | 2 | 9 | 8 |
| Urgence | 5 | 9 | 14 | 12 |
| Les trois justes | 0 | 0 | 5 | 3 |
| Temps par e-mailMédiane | 1,5 s | 3,0 s | 6,7 s | 1,7 s |
| 0.6B | 1.7B | 8B | 32B | |
|---|---|---|---|---|
| Délai | 13 | 12 | 20 | 18 |
| Sujets | 3 | 7 | 4 | 6 |
| Urgence | 9 | 14 | 10 | 10 |
| Les trois justes | 1 | 4 | 3 | 2 |
| Temps par e-mailMédiane | 1,5 s | 3,1 s | 7,4 s | 1,6 s |
| Mêmes consignes | Règles ajoutées | |
|---|---|---|
| Délai | 15 | 20 |
| Sujets | 11 | 10 |
| Urgence | 11 | 19 |
| Les trois justes | 3 | 9 |
| Mêmes consignes | Règles ajoutées | |
|---|---|---|
| Délai | 19 | 20 |
| Sujets | 8 | 6 |
| Urgence | 12 | 19 |
| Les trois justes | 3 | 6 |
| Mêmes consignes | Règles ajoutées | |
|---|---|---|
| Délai | 18 | 20 |
| Sujets | 6 | 7 |
| Urgence | 10 | 20 |
| Les trois justes | 2 | 7 |
Où les modèles se sont trompés
- Un modèle plus grand ne comble qu'une partie de l'écart de langue. En français, 8B a trouvé tous les délais, 20 sur 20, et nommé les bons sujets 9 fois, contre une seule pour 0.6B. En allemand, il a aussi trouvé tous les délais, mais a classé 19 des 20 e-mails dans « Autre ».
- Plus grand n'est pas forcément meilleur. Avec les mêmes consignes, 32B a eu les trois justes moins souvent que 8B dans chaque langue : il juge urgents des e-mails que les réponses vérifiées classent comme normaux, et ajoute des sujets que le client n'a pas demandés.
- Une fois le modèle assez grand, les consignes comptent plus que la taille. Avec les règles ajoutées, le même 32B a jugé l'urgence juste dans 19 ou 20 e-mails sur 20 et trouvé tous les délais, dans les trois langues. Des règles d'urgence détaillées avaient fait classer presque tous les e-mails comme urgents par le plus petit modèle.
- Les sujets restent le plus difficile. Même avec les règles, 32B n'a choisi exactement les bons sujets que dans 6 à 10 e-mails sur 20, surtout en ajoutant un sujet que l'e-mail ne fait que mentionner. C'est à cela que servent des exemples tirés de vos propres e-mails.
La décision sur ces chiffres
Pour la meilleure exécution, le modèle de 32 milliards avec les règles écrites dans ses consignes :
| Partie de la réponse | Verdict | Justes, sur 20 |
|---|---|---|
| Délai | Feu vert | 20 en anglais, 20 en français, 20 en allemand |
| Sujets | Pas sans une personne qui vérifie | 10 en anglais, 6 en français, 7 en allemand |
| Urgence | Feu vert | 19 en anglais, 19 en français, 20 en allemand |
| Les trois justes | Pas d'automatisation complète | 9 en anglais, 6 en français, 7 en allemand |
La suite proposée
Avec les règles ajoutées, le même modèle 32B est passé de 3 à 9 e-mails sur 20 avec les trois justes en anglais. Reste le jugement sur les sujets : l'étape suivante, ce sont des exemples tirés de vos propres e-mails, vérifiés avec le même test.
Ce qu'ajoute un rapport sur vos documents
- Ce que coûte l'exploitation
- Par document et par mois, sur le matériel dont le modèle choisi a besoin : dans le cloud suisse d'Infomaniak, sur les serveurs de Meow en Suisse ou dans vos locaux.
- Vos documents, vos réponses de référence
- 30 à 50 de vos vrais documents, lus sur un serveur GPU au bureau de Meow en Suisse et notés selon des réponses vérifiées avec vous.
- La confirmation écrite de l'effacement
- Vos documents sont effacés à la fin du test, et vous recevez une confirmation écrite. Les e-mails de cet exemple ont été rédigés pour le test : il n'y avait rien à effacer.
Réserver un appel gratuit de 15 minutes
Choisissez le moment qui vous convient : l'invitation arrive aussitôt dans votre boîte de réception. Si l'horaire ne nous convient plus, vous avez de nos nouvelles le jour ouvrable même.
Ce qui se passe en 15 minutes
- 0–5 min
Votre situation
Ce que l'IA devrait faire pour vous, et ce qu'elle ne doit jamais voir.
- 5–10 min
Ce qui est possible
Quelles tâches peuvent tourner en privé, ce que cela coûte à peu près, et ce qui doit rester humain.
- 10–15 min
La prochaine étape
Un atelier, un test sur vos propres documents, ou rien pour l'instant.
Vous préférez écrire ? Envoyer un message
Dites-nous ce que l'IA devrait faire pour vous, et ce qu'elle ne doit jamais voir. Nous vous dirons franchement ce qui est possible, ce que cela coûte et ce qui doit rester humain. Pas encore de détails ? Un bonjour suffit.
