Beispiel eines Testberichts

Die Triage von 60 Kunden-E-Mails, bewertet.

Was ein Test privater KI liefert, gezeigt an Meows eigenem veröffentlichten Test. Ein Test an Ihren Dokumenten folgt derselben Form, mit Ihren Dokumenten und Ihren Referenzantworten, unter einer Geheimhaltungsvereinbarung.

Aufgabe
Jede Kunden-E-Mail für das Team einer Treuhand sortieren: ihre Themen, wie dringend sie ist, die Frist, die der Kunde nennt, und was der Kunde verlangt.
Dokumente
20 für den Test geschriebene Kunden-E-Mails, jede auf Englisch, Französisch und Deutsch: insgesamt 60.
Referenzantworten
Jede E-Mail von Hand beschriftet, bevor ein Modell sie sah, nach zuvor schriftlich festgelegten Regeln.
Modelle
Offene Modelle mit 0,6, 1,7 und 8 Milliarden Parametern in einem Browser auf einem Apple-M1-Laptop; ein Modell mit 32 Milliarden auf einer NVIDIA RTX PRO 6000 im Büro von Meow, ein zweites Mal mit den Beschriftungsregeln in seinen Anweisungen.
Daten
28. bis 30. September 2026.

Alle Ergebnisse

Triage, gemessen: nur die GrösseRichtige Antworten von 20 E-Mails pro Sprache, mit denselben Anweisungen für jedes Modell. Die Zeiten sind Mediane: 32B auf einer Server-GPU, die anderen auf einem Apple-M1-Laptop.
Englisch
0.6B1.7B8B32B
Frist19141815
Themen11121011
Dringlichkeit9111111
Alle drei richtig6353
Zeit pro E-MailMedian1.3 s2.4 s6.6 s1.5 s
Französisch
0.6B1.7B8B32B
Frist12122019
Themen1298
Dringlichkeit591412
Alle drei richtig0053
Zeit pro E-MailMedian1.5 s3.0 s6.7 s1.7 s
Deutsch
0.6B1.7B8B32B
Frist13122018
Themen3746
Dringlichkeit9141010
Alle drei richtig1432
Zeit pro E-MailMedian1.5 s3.1 s7.4 s1.6 s
Dasselbe 32B, mit den Regeln in den AnweisungenDie Anweisungen oben nennen nur die Felder. Hier enthalten sie zusätzlich die Regeln, nach denen die Antworten geprüft wurden, Wort für Wort, so wie sie geschrieben wurden, bevor ein Modell die E-Mails sah.
Englisch
Gleiche AnweisungenRegeln ergänzt
Frist1520
Themen1110
Dringlichkeit1119
Alle drei richtig39
Französisch
Gleiche AnweisungenRegeln ergänzt
Frist1920
Themen86
Dringlichkeit1219
Alle drei richtig36
Deutsch
Gleiche AnweisungenRegeln ergänzt
Frist1820
Themen67
Dringlichkeit1020
Alle drei richtig27

Jede E-Mail und jede Antwort

Wo die Modelle danebenlagen

  1. Ein grösseres Modell schliesst die Sprachlücke nur zum Teil. Auf Französisch fand 8B jede Frist, 20 von 20, und benannte die Themen 9 Mal richtig, gegenüber einmal bei 0.6B. Auf Deutsch fand es ebenfalls jede Frist, ordnete aber 19 der 20 E-Mails unter «Anderes» ein.
  2. Grösser ist nicht automatisch besser. Mit denselben Anweisungen hatte 32B in jeder Sprache seltener alle drei richtig als 8B: Es stufte E-Mails als dringend ein, die in den geprüften Antworten als normal gelten, und fügte Themen hinzu, nach denen der Kunde nicht gefragt hatte.
  3. Ab einer gewissen Grösse zählen die Anweisungen mehr als die Grösse. Mit den ergänzten Regeln beurteilte dasselbe 32B die Dringlichkeit in 19 oder 20 von 20 E-Mails richtig und fand jede Frist, in allen drei Sprachen. Ausformulierte Dringlichkeitsregeln hatten das kleinste Modell fast jede E-Mail als dringend einstufen lassen.
  4. Die Themen bleiben das Schwierigste. Auch mit den Regeln wählte 32B nur in 6 bis 10 von 20 E-Mails genau die richtigen Themen, meist weil es ein Thema hinzufügte, das die E-Mail nur erwähnt. Dafür sind Beispiele aus Ihren eigenen E-Mails da.

Der Entscheid zu diesen Zahlen

Für den besten Lauf, das 32-Milliarden-Modell mit den Regeln in den Anweisungen:

Teil der AntwortEntscheidRichtig, von 20
FristJa20 auf Englisch, 20 auf Französisch, 20 auf Deutsch
ThemenNicht ohne Prüfung durch eine Person10 auf Englisch, 6 auf Französisch, 7 auf Deutsch
DringlichkeitJa19 auf Englisch, 19 auf Französisch, 20 auf Deutsch
Alle drei richtigNicht vollautomatisch9 auf Englisch, 6 auf Französisch, 7 auf Deutsch

Der vorgeschlagene nächste Schritt

Mit den ergänzten Regeln kam dasselbe 32B-Modell auf Englisch von 3 auf 9 von 20 E-Mails mit allen drei richtig. Bleibt das Urteil über die Themen: Der nächste Schritt sind Beispiele aus Ihren eigenen E-Mails, geprüft mit demselben Test.

Was ein Bericht zu Ihren Dokumenten hinzufügt

Was der Betrieb kostet
Pro Dokument und pro Monat, auf der Hardware, die das gewählte Modell braucht: in der Schweizer Cloud von Infomaniak, auf Meows Servern in der Schweiz oder bei Ihnen vor Ort.
Ihre Dokumente, Ihre Referenzantworten
30 bis 50 Ihrer echten Dokumente, gelesen auf einem GPU-Server im Büro von Meow in der Schweiz und bewertet anhand von Antworten, die mit Ihnen geprüft wurden.
Schriftliche Bestätigung der Löschung
Ihre Dokumente werden am Ende des Tests gelöscht, und Sie erhalten eine schriftliche Bestätigung. Die E-Mails dieses Beispiels wurden für den Test geschrieben: Es gab nichts zu löschen.

Kostenloses 15‑Minuten‑Gespräch buchen

Wählen Sie eine passende Zeit: Die Einladung ist sofort in Ihrem Posteingang. Passt die Zeit auf unserer Seite nicht mehr, hören Sie noch am selben Arbeitstag von uns.

Was in 15 Minuten passiert

  1. 0–5 Min.

    Ihre Situation

    Was KI für Sie tun soll und was sie nie sehen darf.

  2. 5–10 Min.

    Was möglich ist

    Welche Aufgaben privat laufen können, was es ungefähr kostet und was menschlich bleiben soll.

  3. 10–15 Min.

    Der nächste Schritt

    Ein Workshop, ein Test an Ihren eigenen Dokumenten oder vorerst nichts.

  1. Zeit wählen
  2. Wohin die Einladung geht
Tag
Uhrzeit (Schweizer Zeit)
Vormittag
Nachmittag
Lieber schreiben? Senden Sie eine Nachricht

Sagen Sie uns, was KI für Sie tun soll und was sie nie sehen darf. Wir sagen Ihnen ehrlich, was möglich ist, was es kostet und was menschlich bleiben soll. Noch keine Details? Ein Hallo genügt.

Was sollen wir Ihnen abnehmen?