Zum Inhalt springen

Spracheingabe & Diktat (Speech-to-Text)

In hwr können Texte in Formularen und Nachrichtenfeldern (z. B. bei der Ticket-Erstellung oder im Ticket-Verlauf) direkt über das Mikrofon diktiert werden.

Die integrierte Live-Spracherkennung (Speech-to-Text) wandelt gesprochene Worte in Echtzeit in geschriebenen Text um. Ein intelligenter Filter sorgt dafür, dass gesprochene Satzzeichen (wie „Punkt“ oder „Komma“) und Steuerbefehle (wie „neue Zeile“) sofort als Symbole eingesetzt werden und Satzanfänge automatisch großgeschrieben werden.


Im oberen rechten Bereich der Textfelder befindet sich das Mikrofon-Symbol:

  • Automatische Erkennung: Die Anwendung prüft beim Laden der Seite im Hintergrund, ob der aktuelle Browser die Speech-to-Text-Schnittstelle unterstützt. Ist keine Unterstützung vorhanden (z. B. Standard-Firefox ohne Speech-Flag), wird der Button automatisch ausgeblendet, um Fehlbedienungen zu vermeiden.
  • Graues Mikrofon: Die Spracheingabe wird unterstützt und ist bereit/inaktiv.
  • Klick auf das Mikrofon: Startet die Aufnahme. Der Browser fordert bei der ersten Nutzung einmalig die Berechtigung für das Mikrofon an.
  • Rotes, pulsierendes Mikrofon mit Statusanzeige:
    • Das Icon färbt sich rot und pulsiert.
    • Eine Einblendung ● Hört zu... signalisiert die aktive Aufzeichnung.
    • Gesprochene Worte erscheinen sofort Silbe für Silbe und Wort für Wort live im Textfeld.
  • Erneuter Klick oder Sprachbefehl: Beendet das Diktat. Der bisherige Text bleibt vollständig erhalten und kann manuell weitergeschrieben oder korrigiert werden.

Beim Diktieren können Satzzeichen, Absätze und Formatierungen einfach mitgesprochen werden:

Gesprochener BefehlErzeugtes ZeichenBeispiel
„Punkt“.„Reparatur abgeschlossen Punkt“ → Reparatur abgeschlossen.
„Komma“ oder „Beistrich“,„Hallo Herr Müller Komma“ → Hallo Herr Müller,
„Ausrufezeichen“!„Dringend prüfen Ausrufezeichen“ → Dringend prüfen!
„Fragezeichen“?„Wann passt der Termin Fragezeichen“ → Wann passt der Termin?
„Doppelpunkt“:„Materialliste Doppelpunkt“ → Materialliste:
„Semikolon“ oder „Strichpunkt“;„Pumpe getauscht Semikolon Dichtung geprüft“ → ... getauscht; Dichtung ...
„Bindestrich“-„Typen Bindestrich Schild“ → Typen-Schild
„Gedankenstrich“-„Wichtig Gedankenstrich bitte beachten“ → Wichtig - bitte beachten
Gesprochener BefehlWirkungBeispiel
„Neue Zeile“ oder „Zeilenumbruch“Einfacher Zeilenumbruch (\n)Neuer Satz in der nächsten Zeile
„Neuer Absatz“ oder „Absatz“Leerzeile + Zeilenumbruch (\n\n)Beginn eines neuen Sinnabschnitts
„Liste“, „Listenpunkt“, „Anstrich“ oder „Spiegelstrich“Neuer Listenpunkt (\n- )„Anstrich Schrauben prüfen“ → - Schrauben prüfen
„Erstens“, „Zweitens“, „Drittens“Nummerierter Punkt (\n1. , \n2. )„Erstens Pumpe prüfen Zweitens reinigen“ → 1. Pumpe prüfen 2. Reinigen

Das Diktat kann freihändig ohne Klick beendet werden, indem am Ende des Sprechens einer der folgenden Befehle gesagt wird. Der Befehl wird automatisch aus dem Text entfernt und die Aufnahme gestoppt:

  • „Aufzeichnung Ende“ / „Aufzeichnung beenden“
  • „Ende der Aufzeichnung“
  • „Aufnahme Ende“ / „Aufnahme beenden“ / „Aufnahme stoppen“ / „Ende der Aufnahme“
  • „Diktat Ende“ / „Diktat beenden“ / „Ende des Diktats“
  • Dezimalzahlen: Werden automatisch mit Komma formatiert:
    „21 Komma 5 Grad“ → 21,5 Grad
    „3 Komma 8 Meter“ → 3,8 Meter

Der Diktierassistent führt während des Sprechens kontinuierlich Korrekturen durch:

  1. Leerzeichen-Bereinigung: Leerzeichen vor Satzzeichen werden automatisch entfernt (aus „Hallo .“ wird „Hallo.“).
  2. Satzanfangs-Großschreibung: Nach einem Punkt (.), Ausrufezeichen (!), Fragezeichen (?) oder nach einem Zeilenumbruch wird das nachfolgende Wort automatisch großgeschrieben.
  3. Nahtloses Weiterdiktieren: Wird ein bestehender Text ergänzt, fügt die Spracherkennung den neuen Text mit passendem Leerzeichen und korrekter Groß-/Kleinschreibung an.

4. Technische Voraussetzungen & Browser-Unterstützung

Abschnitt betitelt „4. Technische Voraussetzungen & Browser-Unterstützung“

Die Diktierfunktion nutzt die hardwarebeschleunigte Web Speech API des jeweiligen Endgeräts:

  • Unterstützte Browser:
    • Google Chrome (Desktop & Android)
    • Microsoft Edge (Desktop)
    • Apple Safari (iOS / iPadOS & macOS)
  • Mikrofon-Freigabe: Beim ersten Klick fragt der Browser: „Darf die Anwendung auf Ihr Mikrofon zugreifen?“. Diese Anfrage muss mit Erlauben bestätigt werden.
  • Offline-Nutzung: Auf modernen Smartphones (z. B. aktuellen iPhones oder Android-Geräten) verarbeiten die Browser Spracherkennung direkt auf dem Gerät (On-Device).