60 Kunden-E-Mails. Vier Modelle. Jede Antwort.

Meow baut private KI für Unternehmen, deren Daten nicht hinausdürfen, und wählt jedes Modell, indem es zuerst getestet wird. Das ist ein solcher Test, vollständig: Wählen Sie eine E-Mail und vergleichen Sie, was jedes Modell geantwortet hat, mit der von Hand geprüften Antwort.

Von Hand geprüft0.6Bim Browser1.7Bim Browser8Bim Browser32Beine Server-GPU32B + Regelngleiche GPU
ThemenLohnFalsch: AnderesFalsch: Vorsorge (Säule 3a)Falsch: AnderesFalsch: AnderesFalsch: Anderes
DringlichkeitNiedrigFalsch: NormalFalsch: NormalFalsch: NormalFalsch: NormalRichtig: Niedrig
FristKeineFalsch: nichtFalsch: 2025-12-31Richtig: keine FristRichtig: keineRichtig: none

Das richtige Modell wird gemessen, nicht geraten

Zusammengezählt über die 20 E-Mails, in jeder Sprache. 0.6B, 1.7B und 8B liefen im Browser auf einem Apple-M1-Laptop, 32B auf einer Server-Grafikkarte: die Modellgrösse, die ein privater Betrieb einem ganzen Team bereitstellt. Alle vier erhielten genau dieselben Anweisungen.

Triage, gemessen: nur die GrösseRichtige Antworten von 20 E-Mails pro Sprache, mit denselben Anweisungen für jedes Modell. Die Zeiten sind Mediane: 32B auf einer Server-GPU, die anderen auf einem Apple-M1-Laptop.
Englisch
0.6B1.7B8B32B
Frist19141815
Themen11121011
Dringlichkeit9111111
Alle drei richtig6353
Zeit pro E-MailMedian1.3 s2.4 s6.6 s1.5 s
Französisch
0.6B1.7B8B32B
Frist12122019
Themen1298
Dringlichkeit591412
Alle drei richtig0053
Zeit pro E-MailMedian1.5 s3.0 s6.7 s1.7 s
Deutsch
0.6B1.7B8B32B
Frist13122018
Themen3746
Dringlichkeit9141010
Alle drei richtig1432
Zeit pro E-MailMedian1.5 s3.1 s7.4 s1.6 s
Dasselbe 32B, mit den Regeln in den AnweisungenDie Anweisungen oben nennen nur die Felder. Hier enthalten sie zusätzlich die Regeln, nach denen die Antworten geprüft wurden, Wort für Wort, so wie sie geschrieben wurden, bevor ein Modell die E-Mails sah.
Englisch
Gleiche AnweisungenRegeln ergänzt
Frist1520
Themen1110
Dringlichkeit1119
Alle drei richtig39
Französisch
Gleiche AnweisungenRegeln ergänzt
Frist1920
Themen86
Dringlichkeit1219
Alle drei richtig36
Deutsch
Gleiche AnweisungenRegeln ergänzt
Frist1820
Themen67
Dringlichkeit1020
Alle drei richtig27
Die Regeln, wie sie den Anweisungen hinzugefügt wurden

Regeln: Die Dringlichkeit ist high, wenn der Kunde sagt, dass es dringend ist, oder eine Strafe oder ein Verlust unmittelbar droht, low, wenn die E-Mail nur informiert und nichts zu tun ist, und normal bei jeder anderen Anfrage. Die Frist ist das Datum, das der Kunde der Treuhänderin zum Handeln nennt, oder none. Die Themen sind alle Themen, zu denen die E-Mail etwas fragt oder verlangt.

Was der Test gezeigt hat

  1. Ein grösseres Modell schliesst die Sprachlücke nur zum Teil. Auf Französisch fand 8B jede Frist, 20 von 20, und benannte die Themen 9 Mal richtig, gegenüber einmal bei 0.6B. Auf Deutsch fand es ebenfalls jede Frist, ordnete aber 19 der 20 E-Mails unter «Anderes» ein.
  2. Grösser ist nicht automatisch besser. Mit denselben Anweisungen hatte 32B in jeder Sprache seltener alle drei richtig als 8B: Es stufte E-Mails als dringend ein, die in den geprüften Antworten als normal gelten, und fügte Themen hinzu, nach denen der Kunde nicht gefragt hatte.
  3. Ab einer gewissen Grösse zählen die Anweisungen mehr als die Grösse. Mit den ergänzten Regeln beurteilte dasselbe 32B die Dringlichkeit in 19 oder 20 von 20 E-Mails richtig und fand jede Frist, in allen drei Sprachen. Ausformulierte Dringlichkeitsregeln hatten das kleinste Modell fast jede E-Mail als dringend einstufen lassen.
  4. Die Themen bleiben das Schwierigste. Auch mit den Regeln wählte 32B nur in 6 bis 10 von 20 E-Mails genau die richtigen Themen, meist weil es ein Thema hinzufügte, das die E-Mail nur erwähnt. Dafür sind Beispiele aus Ihren eigenen E-Mails da.

Mit den ergänzten Regeln kam dasselbe 32B-Modell auf Englisch von 3 auf 9 von 20 E-Mails mit allen drei richtig. Bleibt das Urteil über die Themen: Der nächste Schritt sind Beispiele aus Ihren eigenen E-Mails, geprüft mit demselben Test.

Kostenloses 15‑Minuten‑Gespräch buchen

Agenten, die fragen, bevor sie handeln

Stackive Im täglichen Einsatz

Stackive ist die intern gebaute Plattform, mit der das Unternehmen geführt wird: E-Mail, Rechnungsstellung und Deployments laufen darüber, jedes in einem eigenen Dienst, mit einer Agentenschicht, die über alle hinweg arbeitet.

Ihre Agenten lesen, was eine Aufgabe braucht, und bereiten die Arbeit vor. Alles, was eine E-Mail sendet, eine Rechnung ausstellt oder Code ausliefert, wartet auf die Freigabe einer Person im Team, und jeder Schritt wird festgehalten. Die Schwachstellen zeigen sich zuerst hier, bevor dieselbe Art von Agenten für Sie eingerichtet wird.

Jeder Eintrag nennt, wer gehandelt hat, ein Agent oder eine Person, und nichts geht hinaus, bevor eine Person Ja gesagt hat.

Ein Vormittag im Protokoll. Eine Illustration mit erfundenen Einträgen.
  1. 08:57E-Mail-Agent14 neue E-Mails in Kundenordner sortiertErledigt
  2. 09:02E-Mail-AgentAntwort an einen Lieferanten wegen einer verspäteten Lieferung entworfenWartet auf eine Person
  3. 09:05Eine PersonDie Antwort freigegebenFreigegeben
  4. 09:05E-Mail-AgentDie Antwort gesendetGesendet
  5. 10:31RechnungsagentEine Rechnung für 12 Arbeitsstunden vorbereitetWartet auf eine Person
  6. 10:40Eine PersonZurückgeschickt: falscher StundensatzZurückgeschickt
  7. 10:42RechnungsagentDen Satz korrigiert und neu vorbereitetWartet auf eine Person
  8. 11:15AuslieferungsagentVersion 4.2 für die Veröffentlichung vorbereitetWartet auf eine Person

Barrierefreie Software

  1. Sprachsuche, die auf dem Gerät bleibt

    Lokaler Sprachassistent Prototyp, 2026

    Ein französischsprachiger Sprachassistent, um einen Hörbuchkatalog freihändig zu durchsuchen und abzuspielen, der vollständig im Browser läuft: Spracherkennung mit Whisper, ein Sprachmodell, das gesprochene Anfragen in Katalogsuchen umwandelt, und Sprachsynthese, alles auf dem Gerät der Hörerin oder des Hörers, ohne Cloud-Sprachdienst.

    Jede Änderung an Modell und Prompt wird an einem von Hand geprüften Korpus echter Sprachanfragen bewertet, sodass Verbesserungen gemessen statt angenommen werden. Einmal geladen, öffnet sich die Oberfläche auch ohne Verbindung wieder.

    Läuft auf
    Dem Gerät der Hörerin oder des Hörers
    Modelle
    Whisper, ein kleines Sprachmodell, Sprachsynthese
    Gemessen an
    Echten Sprachanfragen, von Hand geprüft
    Auf dem Gerät der Hörerin oder des Hörers
    1. Gesprochene Frage
    2. Transkribiert, dann gesucht
    3. Gesprochene Antwort
  2. Eine Hörbuchbibliothek im Browser

    Web Player Web-App, 2023

    Der Katalog der Bibliothèque Braille Romande als Web-App: mehr als 14'000 Hörbücher zum Suchen, online Hören oder Herunterladen, mit Mitglieder-Login und Hilfeseiten zu Braille- und DAISY-Büchern.

    Zuerst für Tastatur und Screenreader gebaut: Sprunglinks zu jedem Teil der Seite, und das erwartete Verhalten des Screenreaders als prüfbare Regeln festgehalten, geprüft durch automatisierte Tests mit Playwright und Axe. Der Hörbuch-Player und die Barrierefreiheits-Werkzeugleiste sind als Open-Source-Pakete veröffentlicht.

    Läuft in
    Jedem Webbrowser
    Katalog
    Mehr als 14'000 Hörbücher
    Geprüft mit
    Screenreader-Tests und Axe-Audits
    Die Startseite des Web Players: Suche, Mitglieder-Login und die neuesten Hörbücher
  3. Open-Source-Bausteine

    a11y-player und a11y-button npm-Pakete, 2025

    Der Hörbuch-Player und die Barrierefreiheits-Werkzeugleiste des Web Players, als React-Pakete veröffentlicht, damit jede App sie nutzen kann.

    a11y-player spielt DAISY-Hörbücher ab: vollständig per Tastatur bedienbar, mit Screenreadern nutzbar, mit Navigation nach Abschnitten, Wiedergabegeschwindigkeit und teilbaren Lesezeichen. a11y-button ergänzt eine Werkzeugleiste, in der Leserinnen und Leser auf hohen Kontrast umschalten, Textgrösse und Abstände ändern, eine Lesemaske oder legasthenikerfreundliche Schriften nutzen und ihre Einstellungen behalten.

    Lizenz
    MIT
    Für
    React-Apps
    Eingesetzt in
    Dem Web Player
    $ npm install a11y-player a11y-button
    
    import { DaisyPlayer } from 'a11y-player';
    import {
      AccessibilityProvider,
      AccessibilityToolbar,
    } from 'a11y-button';
    
    <AccessibilityProvider>
      <AccessibilityToolbar />
      <DaisyPlayer
        dirUrl={bookUrl}
        appUrl={appUrl}
      />
    </AccessibilityProvider>
    
  4. Bestehende Apps, neu gebaut für blinde Leserinnen und Leser

    BBR Player™ iOS / Android

    Die Hörbuch-Apps der Bibliothèque Braille Romande für iOS und Android gingen von einer Open-Source-Codebasis der BSR in Lausanne aus. Der Code wurde überarbeitet und die von den Mitgliedern gewünschten Funktionen wurden ergänzt, nach den Barrierefreiheitsrichtlinien des W3C und durchgehend in Zusammenarbeit mit blinden und sehbehinderten Leserinnen und Lesern.

    Nach der Veröffentlichung erhielten die Apps eine Auszeichnung des Bundesamts für Kultur.

    Ausgangspunkt
    Eine Open-Source-Codebasis
    Die Arbeit
    Überarbeitung und neue Funktionen
    Ausgezeichnet von
    Dem Bundesamt für Kultur
    Zwei iPhone-Bildschirme der Hörbuch-App BBR Player

KI-SicherheitEin schlechter Vorschlag. Eine geschlossene Tür.

Eine E-Mail versteckt eine Anweisung, die nur die KI liest. Das Modell folgt ihr. Die Schutzregeln halten das Kundendossier drinnen.

Die Sicherheitsaufgabe ausprobieren

Das Modell schlägt vor

Das Kundendossier weiterleiten

An archive@external-review.example

Das Modell, das die Post liest, hat keinen Zugriff auf Kundendossiers

Eine aufgezeichnete Antwort eines kleinen offenen Modells. Nichts wird gesendet.

Kostenloses 15‑Minuten‑Gespräch buchen

Wählen Sie eine passende Zeit und bestätigen Sie sie aus Ihrem Posteingang. Passt die Zeit auf unserer Seite nicht mehr, hören Sie noch am selben Arbeitstag von uns.

Was in 15 Minuten passiert

  1. 0–5 Min.

    Ihre Situation

    Was KI für Sie tun soll und was sie nie sehen darf.

  2. 5–10 Min.

    Was möglich ist

    Welche Aufgaben privat laufen können, was es ungefähr kostet und was menschlich bleiben soll.

  3. 10–15 Min.

    Der nächste Schritt

    Ein Test auf Ihren eigenen Dokumenten, eine Analyse oder vorerst nichts.

  1. Zeit wählen
  2. Wohin die Einladung geht
Tag
Uhrzeit (Schweizer Zeit)
Vormittag
Nachmittag
Lieber schreiben? Senden Sie eine Nachricht

Sagen Sie uns, was KI für Sie tun soll und was sie nie sehen darf. Wir sagen Ihnen ehrlich, was möglich ist, was es kostet und was menschlich bleiben soll. Noch keine Details? Ein Hallo genügt.

Was sollen wir Ihnen abnehmen?