Empfohlene Modelle für diese Aufgaben
Empfehlungen sprechen wir nur für Kombinationen mit dem 203er-Status gedeckt aus - bewertet nach
unserem Bezugswege-Dossier (Stand 22.07.2026), je Kombination aus Modell und Bezugsweg. Diese
Übersicht ist keine Rechtsberatung.
Whisper
gedeckt OpenAI
Whisper large-v3 ist das verbreitetste Modell für die Umwandlung von Sprache in Text: 1,55 Milliarden Parameter, trainiert auf 680.000 Stunden Audio, über 99 Sprachen, unter MIT-Lizenz. Für Kanzleien betrifft es die heikelste Datenkategorie überhaupt - Diktate, Mandantengespräche, Besprechungsmitschnitte. Genau deshalb gehört die Verarbeitung auf eine Instanz, deren Betreiber verpflichtet ist, und nicht in einen Transkriptionsdienst, dessen Verarbeitungskette man nicht kennt.
- MIT-Lizenz und klein genug, um in jeder dedizierten Instanz mitzulaufen
- Über 99 Sprachen, belastbar auch bei Nebengeräuschen und Telefonqualität
Verarbeitung: Deutschland
Stärken, Grenzen und Einordnung auf der Modell-Seite
Voxtral
gedeckt Mistral AI
Mistrals Modell für Sprache zu Text, seit Februar 2026 unter Apache 2.0: 4 Milliarden Parameter, auf Streaming ausgelegt, mit einer gemessenen Wortfehlerrate von 5,9 Prozent gegenüber 7,4 Prozent bei Whisper im FLEURS-Vergleich. Der Preis dafür ist die Sprachabdeckung - 13 Sprachen statt 99. Für eine deutschsprachige Kanzlei, die Diktate laufend statt stapelweise verarbeiten will, ist es damit die genauere Wahl, und der Hersteller sitzt in der EU.
- Genauer als Whisper im FLEURS-Vergleich - 5,9 statt 7,4 Prozent Wortfehlerrate
- Echte Streaming-Verarbeitung: Text entsteht während des Diktats, nicht erst danach
Verarbeitung: Deutschland
Stärken, Grenzen und Einordnung auf der Modell-Seite
Diktat und Transkription
gedeckt Google
Der Transkriptionsdienst der Plattform wandelt Sprache in Text; der Anbieter führt ihn als Chirp, aktuell in der Stufe `chirp_3` und in der Vorgängerstufe `chirp_2`. In der Kanzlei betrifft er die heikelste Datenkategorie überhaupt - Diktate, Mandantengespräche, Besprechungsmitschnitte. Über uns läuft er über EU-Endpunkte der Plattform, unter der gezeichneten Verschwiegenheitsvereinbarung und der eigenen Abs.-4-Urkunde der Gosign GmbH. Wer Sprache ohne jeden Dritten in der Kette verarbeiten will, findet in diesem Katalog die Modelle mit offenen Gewichten auf dedizierter Hardware als zweiten Weg.
- Managed-Transkription über den EU-Endpunkt der Plattform, ohne eigene Hardware
- Verarbeitung in der EU zugesagt; aktuelle Stufe über die EU-Multiregion aufrufbar
Stärken, Grenzen und Einordnung auf der Modell-Seite
Gemini Sprachdialog
gedeckt Google
Gemini Sprachdialog ist die Echtzeit-Stufe der Familie: Der Anbieter führt sie als `gemini-live-2.5-flash-native-audio`, sie nimmt Sprache direkt auf und antwortet gesprochen, ohne den Umweg über einen getrennten Transkriptions- und Ausgabeschritt. Für die Kanzlei ist das der Weg für begleitete Gespräche - Mandantenaufnahme, Sachverhaltsabfrage, Diktat mit Rückfragen. Weil dabei laufend Klartext übertragen wird, gilt hier dieselbe Kette wie bei den Sprachmodellen: EU-Endpunkte, gezeichnete Verschwiegenheitsvereinbarung, eigene Abs.-4-Urkunde der Gosign GmbH.
- Sprache rein, Sprache raus in einem Durchgang - kein zweiter Dienstleister für Transkription und Ausgabe
- Über EU-Einzelregionen aufrufbar, Verarbeitung in der EU zugesagt
Stärken, Grenzen und Einordnung auf der Modell-Seite