Empfohlene Modelle für diese Aufgaben
Empfehlungen sprechen wir nur für Kombinationen mit dem 203er-Status gedeckt aus - bewertet nach
unserem Bezugswege-Dossier (Stand 22.07.2026), je Kombination aus Modell und Bezugsweg. Diese
Übersicht ist keine Rechtsberatung.
Whisper
gedeckt OpenAI
Das verbreitetste Modell für die Umwandlung von Sprache in Text, mit Abdeckung von über 99 Sprachen - für Diktate, Mandantengespräche und Besprechungsmitschnitte. Es erzeugt eine Mitschrift, keine Bewertung des Gesagten; Sprecherwechsel erkennt es nicht von selbst, und bei längerer Stille kann es Text erfinden, weshalb Mitschriften gegenzuhören sind. Auf vier Wegen ist die Vertragskette geschlossen: auf eigener Hardware, wo kein Dritter mitwirkt, im dedizierten Betrieb auf reservierter Hardware, über die Open Telekom Cloud in deutschen Rechenzentren sowie über Azure, wo die Verschwiegenheitsverpflichtung nach § 203 StGB gezeichnet vorliegt. Bei Diktaten ist zusätzlich das im Auslieferungszustand aktive Abuse-Monitoring zu würdigen.
- MIT-Lizenz und klein genug, um in jeder dedizierten Instanz mitzulaufen
- Über 99 Sprachen, belastbar auch bei Nebengeräuschen und Telefonqualität
Verarbeitung: Deutschland
Stärken, Grenzen und Einordnung auf der Modell-Seite
Voxtral
gedeckt Mistral AI
Mistrals Modell für Sprache zu Text, auf laufende Verarbeitung ausgelegt: Der Text entsteht während des Diktats und nicht erst nach der Aufnahme, und im FLEURS-Vergleich liegt die Wortfehlerrate unter der des breit eingesetzten Referenzmodells - die Sprachabdeckung fällt dafür schmaler aus. Weil die Gewichte offen sind, kommt das Modell ohne Übermittlung an einen Modellhersteller aus: Im dedizierten Betrieb auf reservierter Hardware in einem deutschen Rechenzentrum ist die Kette geschlossen, gebunden wird dort der Rechenzentrumsbetreiber über die Kettenverpflichtung nach § 203 Abs. 4 StGB. Beim Betrieb auf eigener Hardware in den eigenen Räumen stellt sich die Offenbarungsfrage des § 203 gar nicht erst.
- Genauer als Whisper im FLEURS-Vergleich - 5,9 statt 7,4 Prozent Wortfehlerrate
- Echte Streaming-Verarbeitung: Text entsteht während des Diktats, nicht erst danach
Verarbeitung: Deutschland
Stärken, Grenzen und Einordnung auf der Modell-Seite
Diktat und Transkription
gedeckt Google
Der Transkriptionsdienst der Google-Plattform wandelt Sprache in Text, ohne dass eigene Hardware bereitstehen muss - betroffen sind Diktate, Mandantengespräche und Besprechungsmitschnitte, also die heikelste Datenkategorie überhaupt; die Qualität hängt maßgeblich an der Aufnahme. Über Google Vertex AI ist die Kette geschlossen: Dieselbe dienstgebundene Verschwiegenheitsvereinbarung nach § 203 StGB, die für die Sprachmodelle der Plattform gilt, erfasst auch diesen Dienst, davor greift die Kettenverpflichtung nach § 203 Abs. 4 StGB. Was der Vertrag nicht beantwortet, ist die zweite Frage jedes Mitschnitts: Er erfasst alle Anwesenden - Einwilligung und Belehrung sind vor dem ersten Einsatz zu klären.
- Managed-Transkription über den EU-Endpunkt der Plattform, ohne eigene Hardware
- Verarbeitung in der EU zugesagt; aktuelle Stufe über die EU-Multiregion aufrufbar
Stärken, Grenzen und Einordnung auf der Modell-Seite
Gemini Sprachdialog
gedeckt Google
Die Echtzeit-Stufe der Gemini-Familie: Sie nimmt Sprache direkt auf und antwortet gesprochen, ohne getrennten Schritt für Mitschrift und Ausgabe - der Weg für begleitete Gespräche, Sachverhaltsaufnahme oder Diktat mit Rückfragen im laufenden Gespräch. Über Google Vertex AI ist die Vertragskette geschlossen; die dienstgebundene Verschwiegenheitsvereinbarung nach § 203 StGB des Plattform-Betreibers erfasst diese Stufe ebenso wie die übrigen Modelle der Plattform, aufrufbar ist sie über europäische Einzelregionen. Eigens zu klären bleibt das Gespräch selbst: Ein laufender Dialog überträgt fortlaufend Klartext, und ein Mitschnitt erfasst alle Anwesenden.
- Sprache rein, Sprache raus in einem Durchgang - kein zweiter Dienstleister für Transkription und Ausgabe
- Über EU-Einzelregionen aufrufbar, Verarbeitung in der EU zugesagt
Stärken, Grenzen und Einordnung auf der Modell-Seite