Cookies & Datenschutz

Wir möchten Cookies für Marketing-Analysen (Meta Pixel) verwenden, um unsere Werbung zu verbessern. Diese werden nur mit Ihrer Einwilligung gesetzt – technisch notwendige Funktionen bleiben davon unberührt. Mehr dazu in unserer Datenschutzerklärung.

KI & Sprachtechnologie

Speech-to-Text (STT)

Definition

Speech-to-Text (auch ASR – Automatic Speech Recognition) wandelt gesprochene Sprache in geschriebenen Text um. In der KI-Telefonie ist STT der erste Verarbeitungsschritt: Erst der transkribierte Text kann vom Sprachmodell verstanden werden.

Moderne STT-Systeme basieren auf neuronalen Netzen, die auf vielen tausend Stunden Audiomaterial trainiert wurden. Sie erkennen Sprache heute auch bei Dialekten, Hintergrundgeräuschen und Telefonqualität (8-kHz-Audio) zuverlässig und liefern Ergebnisse als Streaming-Transkription – Wort für Wort, während noch gesprochen wird.

Woran sich Qualität bemisst

  • Word Error Rate (WER): Anteil falsch erkannter Wörter – je niedriger, desto besser
  • Latenz: Zeit bis zum ersten Transkript-Ergebnis, entscheidend für flüssige Dialoge
  • Robustheit: Umgang mit Namen, Fachbegriffen, Zahlen und Buchstabierungen

STT im KI-Telefonassistenten

Im Voice-Agent-Stack arbeitet STT im Zusammenspiel mit dem Sprachmodell (LLM) und der Sprachsynthese (Text-to-Speech): hören → verstehen → antworten. Die gesamte Kette muss unter etwa 500 ms bleiben, damit das Gespräch natürlich wirkt – Details im Artikel Latenz und Natürlichkeit.

Speech-to-Text (STT) in der Praxis erleben

Testen Sie den KI-Telefonassistenten von bitpull.ai 14 Tage kostenlos – kein Vertrag, keine Kreditkarte.