Anzeige
Anzeige
Anzeige
Anzeige
Anzeige
Anzeige
Lesedauer 3 Min.

Text to speech service

Gemessen daran, wie gut die Übertragung von Text in Sprache bereits funktioniert, wird diese Technologie noch von sehr wenigen Apps genutzt. Microsoft bietet mit Azure Speech eine einfache Möglichkeit Texte den Nutzern per Sprachausgabe näherzubringen.
Laut Microsoft wird die Ausgabe nahezu in Echtzeit generiert und sie lässt sich sogar als Audio-Datei speichern, um sie später ohne Neugenerierung parat zu haben. Auch die Sprecher hören sich dabei weitaus besser an, als die in Windows enthaltenen Muster, welche man direkt in jeder App dank des .NET-APIs System.Speech.Synthesis nutzen kann.Die Sprachsynthese in Azure steht in 45 Sprachen zur Verfügung, darunter auch deutsch. Für viele Sprachen gibt es sowohl eine männliche als auch eine weibliche Stimme für die Sprachausgabe. Auf dieser Seite können Sie sich die englischen, die deutschen sowie ein paar weitere Stimmen anhand von Mustersätzen anhören. Einstellbar sind laut Microsoft Tonhöhe, Geschwindigkeit, Lautstärke, Betonung sowie zusätzliche Pausen.Die Dokumentation dazu finden Sie auf dieser Seite. Dort gibt es unter anderem einen Schnellstart, der zeigt, wie man mithilfe von Python und dem Text-to-Speech-REST-API Text in Sprache konvertiert. Für die Schnellstartanleitung wird ein Azure-Cognitive-Services-Konto mit einer Ressource für den Speech-Dienst benötigt. Wer über kein Konto verfügt, kann über die kostenlose Testversion einen Abonnementschlüssel abrufen.Den direkten Einstieg in die Thematik finden Sie auf dieser Seite, wobei dort neben API-Keys für Text to Speech auch für Speech to Text sowie die Übersetzung und – als Preview – auch eine Sprecher-Erkennung angeboten werden.Nicht nur die Standard-Stimmen können genutzt werden, sondern man kann Stimmen auch selbst anlegen und trainieren. Allerdings gibt es solche Custom Voice Models derzeit nur für englisch und chinesisch.Beispiele: azure.microsoft.com/en-us/services/cognitive-services/text-to-speech/Dokumentation: docs.microsoft.com/en-us/azure/cognitive-services/speech-service/how-to-text-to-speechAusprobieren: azure.microsoft.com/en-us/try/cognitive-services/?api=speech-services
Miscellaneous

Neueste Beiträge

CartoType: Einsatz mit Windows Forms - Mapping mit CartoType, Teil 2
Der Big-Tech-freie Kartendienst CartoType kann dazu beitragen, Anwendungen mit Maps-Diensten unabhängiger von Google, Apple und Co. zu machen. In diesem Beitrag soll das System in einer Windows-Forms-Applikation ins Leben gerufen werden.
5 Minuten
7. Sep 2026
Vom Sub-Agenten zum Schwarm - Kimi K3 – das Modell hinter dem Agenten, Teil 5
Mehr Agenten versprechen mehr Tempo, vervielfachen aber auch Abstimmung und Risiko. Ob aus paralleler Aktivität tatsächlich Fortschritt entsteht, entscheidet sich dort, wo spektakuläre Schwarmdemos meist enden.
5 Minuten
Sichtkontakt: Coding-Driven Design - Kimi K3 – das Modell hinter dem Agenten, Teil 4
Zwischen fehlerfrei kompiliert und überzeugend gestaltet liegt eine Lücke, die reine Codeanalyse kaum erfasst. Sobald ein Agent seine eigene Oberfläche betrachtet, beginnt eine andere Art der Entwicklung mit neuen Möglichkeiten, aber auch neuen Maßstäben.
5 Minuten

Das könnte Dich auch interessieren

Zwei Konferenz-Openings, eine Sprecherin – wie aus einem Terminkonflikt ein KI-Usecase wurde - Making-of eines Avatars mit HeyGen und ElevenLabs
Ein Terminkonflikt gelöst von einem digitalen Zwilling. Die Ebner Media Group hat die erste Infinite AI Conference von einem Avatar eröffnen lassen. Ein Erfahrungsbericht über den Produktionsprozess und den echten Nutzen synthetischer Präsenz.
7 Minuten
12. Aug 2026
Planen, patchen, prüfen mit Kimi - Kimi K3 – das Modell hinter dem Agenten, Teil 3
Ein starkes Modell allein schreibt noch keinen verlässlichen Code. Erst im Repository zeigt sich, ob aus künstlicher Intelligenz ein brauchbarer Entwicklungspartner entsteht oder aber ein Risiko mit Shell-Zugriff.
5 Minuten
Gebaut für lange Läufe - Kimi K3 – das Modell hinter dem Agenten, Teil 1
Kimi K3 kombiniert 2,8 Billionen Parameter, native Bildverarbeitung und ein Kontextfenster mit einer Million Token. Das sind tolle Zahlen. Seine Besonderheit liegt aber darin, dass Architektur, Training und Laufzeitumgebung auf Agenten zielen, die über viele Schritte handeln, Werkzeuge aufrufen und Ergebnisse prüfen.
6 Minuten
Anzeige
Anzeige
Anzeige
Anzeige
Anzeige