[0001] Verfahren zum Erzeugen einer Statistik von Phondauern und Verfahren zum Ermitteln
der Dauer einzelner Phone für die Sprachsynthese
[0002] Die vorliegende Erfindung betrifft ein Verfahren zum Erzeugen einer Statistik von
Phondauern und ein Verfahren zum Ermitteln der Dauer einzelner Phone für die Sprachsynthese.
[0003] Im Sinne der vorliegenden Anmeldung ist ein Phonem die kleinste bedeutungsunterscheidende,
aber nicht selbstbedeutungstragende sprachliche Einheit (z.B. b in Bein im Unterschied
zu p in Pein). Ein Phon ist hingegen der ausgesprochene Laut eines Phonems.
[0004] Verfahren zum Erzeugen einer Statistik von Phondauern, wobei auf Grundlage dieser
Statistik bei der synthetischen Spracherzeugung die Phondauern gesteuert werden können,
sind bekannt. Bei derartigen Verfahren wird ein von einem Sprecher gesprochener Text
aufgezeichnet und der aufgezeichnete Text in einzelne Phone segmentiert. Von den einzelnen
Phonen wird die Lautlänge bestimmt. Diese Phondauer wird in einer Statistik erfasst,
wobei die Statistik eine Liste von Triphonen aufweist. Ein Triphon ist ein Kluster
von einem oder mehreren Phonemen mit dem jeweiligen rechten und linken Kontext.
[0005] Bei den bekannten Verfahren wird jeweils einem Phonem der Triphone in ihrem links-rechts
Kontext eine mittlere Phonlänge bzw. Lautdauer zugeordnet. Diese Phondauer wird aus
allen Phonen des gesprochenen Textes ermittelt, die im gleichen Kontext im gesprochenen
Text wie in dem jeweiligen Triphon vorkommen, das heißt deren benachbarte Phone korrespondieren
zu den benachbarten Phonemen im Triphon.
[0006] Bei den bekannten Verfahren zum Ermitteln der Dauer einzelner Phone für die Sprachsynthese
werden den Phonemen des zu synthetisierenden Textes die jeweils mittlere Lautdauer
des Phonems der Statistik zugeordnet, dessen Kontext im Triphon dem Kontext des Phonems
im zu synthetisierenden Textes entspricht. Ist z.B. die Phondauer des Phonems "b"
des Wortes "aber" zu Ermitteln, so wird bei dem bekannten Verfahren dem Phonem "b"
diejenige Phondauer zugeordnet, die in der Statistik dem Phonem "b" im Triphon "abe"
zugeordnet ist. Die Kontexte des Triphons und im zu synthetisierenden Text sind hier
jeweils identisch.
[0007] Der Erfindung liegt die Aufgabe zugrunde, ein Verfahren zum Erzeugen einer Statistik
von Phondauern, wobei auf Grundlage dieser Statistik bei der synthetischen Spracherzeugung
die Phondauern gesteuert werden können, und ein Verfahren zum Ermitteln der Dauer
einzelner Phone für die Sprachsynthese zu schaffen, wodurch eine Sprachsynthese mit
natürlicherer Aussprache als bei bekannten Verfahren erzielt werden soll.
[0008] Die Aufgabe wird mit einem Verfahren zum Erzeugen einer Statistik von Phondauern
mit den Merkmalen des Anspruchs 1 und durch ein Verfahren zum Ermitteln der Dauer
einzelner Phone mit den Merkmalen des Anspruchs 11 gelöst. Vorteilhafte Ausgestaltungen
der Erfindung sind in den Unteransprüchen angegeben.
[0009] Das erfindungsgemäße Verfahren zum Erzeugen einer Statistik von Phondauern auf Grundlage
derer bei der synthetischen Spracherzeugung die Phondauern gesteuert werden können,
umfasst folgende Schritte:
- Zuordnen von Phonen eines in Phone segmentierten gesprochenen und aufgezeichneten
Textes zu Phonemen von vorbestimmten Primärklustern, die aus mehreren Phonemen zusammengesetzt
sind, wobei jeweils ein Phon einem Phonem eines Primärklusters zugeordnet wird, wenn
es im gesprochenen Text zu einem im Kontext des Phonems des Primärklusters identischen
oder ähnlichen Kontext auftritt,
- Erstellen einer Primärstatistik, die zumindest die mittlere Phondauer aller Phone,
die dem jeweiligen Phonem eines Primärklusters zugeordnet sind, umfasst,
- Zuordnen von Phonen des gesprochenen und aufgezeichneten Textes zu Phonemen zu vorbestimmten
Sekundärklustern, die aus Phonemen zusammengesetzt sind, wobei zumindest die Anzahl
Phoneme einiger Sekundärkluster sich von der Anzahl der Phoneme der Primärkluster
unterscheidet, wobei jeweils ein Phon einem Phonem eines Sekundärklusters zugeordnet
wird, wenn es im gesprochenen Text zu einem im Kontext des Phonems des Sekundärklusters
identischen Kontext auftritt,
- Erstellen einer Sekundärstatistik, die zumindest die mittlere Phondauer aller Phone,
die dem jeweiligen Phonem eines Sekundärklusters zugeordnet sind, umfasst.
[0010] Die durch das erfindungsgemäße Verfahren erzeugte Statistik besteht somit aus einer
Primärstatistik und einer Sekundärstatistik. Die Primärstatistik kann auf Primärkluster
mit z.B. jeweils drei Phonemen beruhen, so dass sie der eingangs erläuterten Statistik
auf Basis von Triphonen entspricht. Die Sekundärstatistik ist eine weitere Statistik
auf Basis von Sekundärklustern, die sich in der Anzahl der Phoneme zumindest teilweise
von der Anzahl der Phoneme der Primärkluster unterscheiden. Hierdurch wird eine sprachspezifischere
Statistik zur Phondauer erzielt.
[0011] So können z.B. die Primärkluster drei Phoneme und die Sekundärkluster vier Phoneme
umfassen, wodurch ein größerer Kontext (vier Phoneme gegenüber drei Phonemen) bei
der Ermittlung der mittleren Phondauern berücksichtigt wird, so dass durch eine wesentlich
sprachspezifischere Auswertung erzielt wird.
[0012] Nach einer bevorzugten Ausführungsform der Erfindung besitzen die Primärkluster eine
konstante Anzahl Phoneme, wohingegen die Anzahl der Phoneme der Sekundärkluster variabel
ist. So können z.B. die Primärkluster jeweils drei Phoneme und die Sekundärkluster
jeweils alle Phoneme eines Wortes umfassen. Mit Hilfe dieser Sekundärkluster wird
dann eine wortspezifische Auswertung der Phondauern erzielt, die wesentlich präziser
ist, als die auf Grundlage der Triphone.
[0013] Nach einer bevorzugten Ausführungsform der Erfindung werden in der Sekundärstatistik
nur Sekundärkluster erfasst, deren Häufigkeit im Text größer oder gleich einer vorbestimmten
Mindesthäufigkeit ist. Hierdurch wird sichergestellt, dass in der Statistik nicht
signifikante Häufigkeiten nicht berücksichtigt werden. So ist es zweckmäßig, Wörter,
die in dem Text, auf dem die Statistik beruht, lediglich einmal oder zweimal vorkommen,
nicht zu berücksichtigen.
[0014] Das erfindungsgemäße Verfahren zum Ermitteln der Dauer einzelner Phone für die Sprachsynthese
beruht auf einer derartigen eine Primärstatistik und eine Sekundärstatistik umfassenden
Statistik von Phondauern. Dieses Verfahren umfasst folgende Schritte:
- Bestimmen, ob das in Sprache umzusetzende Phonem, für das die Phondauer zu ermitteln
ist, Bestandteil eines Sekundärklusters ist,
- Zuordnen der mittleren Phondauer (d), die in der Sekundärstatistik dem entsprechenden
Phonem in dem jeweiligen Sekundärkluster zugeordnet ist, falls das Phonem Bestandteil
eines Sekundärklusters ist, und
- Zuordnen der mittleren Phondauer (d), die in der Primärstatistik dem entsprechenden
Phonem in dem jeweiligen Primärkluster zugeordnet ist, falls das Phonem nicht Bestandteil
eines Sekundärklusters ist.
[0015] Bei diesem Verfahren wird bevorzugt die sprachspezifischere Sekundärstatistik bei
der Ermittlung der Phondauern ausgewertet. Hierbei ist zu berücksichtigen, dass beim
Erzeugen der Sekundärstatistik lediglich identische Kontexte zwischen dem Sekundärkluster
und dem entsprechenden Abschnitt in dem gesprochenen und aufgezeichneten Text, auf
dem die Statistiken beruhen, berücksichtigt werden, wohingegen bei der Primärstatistik
auch ähnliche Kluster zu berücksichtigen sind, falls keine identische Übereinstimmung
vorhanden ist. Dies ist ein weiterer Grund, weshalb zunächst versucht wird, die Sekundärstatistik
auszuwerten, bevor auf die Primärstatistik zurückgegriffen wird.
[0016] Gemäß einer bevorzugten Weiterbildung des Verfahrens zum Ermitteln der Dauer einzelner
Phone wird die Standardabweichung der einzelnen mittleren Phondauer berücksichtigt.
Dies bewirkt eine weitere Anpassung an eine natürliche Aussprache.
[0017] Die Erfindung wird nachfolgend beispielhaft anhand der beiliegenden Zeichnungen näher
erläutert. In denen zeigen schematisch:
- Fig. 1
- einen allgemeinen Überblick über die Abläufe bei der Erzeugung einer Statistik von
Phondauern in einem Flussdiagramm,
- Fig. 2
- die Verfahrensschritte zur statistischen Auswertung einer Sprachaufzeichnung zur Erzeugung
einer Statistik von Phondauern,
- Fig. 3
- ein Verfahren zum Ermitteln der Dauer einzelner Phone für die Sprachsynthese in einem
Flussdiagramm, und
- Fig. 4
- ein Computersystem zum Ausführen der erfindungsgemäßen Verfahren in einem Blockschaltbild.
[0018] Fig. 1 zeigt die grundlegenden Abläufe für ein Verfahren zum Erzeugen einer Statistik
von Phondauern, auf deren Grundlage bei der synthetischen Spracherzeugung die Phondauer
gesteuert werden kann.
[0019] Das Verfahren beginnt mit dem Schritt S1 und im Schritt S2 wird ein vorbestimmter
Trainingstext von einem Sprecher gesprochen und aufgezeichnet. Die Aufzeichnung erfolgt
mittels eines Mikrofons, das die akustischen Sprachsignale in korrespondierende elektrische
Sprachsignale wandelt.
[0020] Das aufgezeichnete Sprachsignal wird im Schritt S3 in einzelne Phone segmentiert.
Das Segmentieren des Sprachsignals in die einzelnen Phone wird oftmals von einem Sprachexperten
manuell durchgeführt. Es sind auch voll- und teilautomatische Verfahren bekannt, die
in der Regel auf einem HMM (Hidden-Markow-Model) Algorithmus beruhen.
[0021] Im Schritt S4 werden die einzelnen Phone statistisch ausgewertet, wobei deren Dauer
bestimmt wird. Phondauern von Phonen, die dem gleichen Phonem im gleichen oder ähnlichen
Kontext zugeordnet sind, werden statistisch ausgewertet, indem deren Mittelwerte und
Standardabweichungen berechnet werden.
[0022] Im Schritt S5 wird dieses Verfahren beendet.
[0023] Die erfindungsgemäß auszuführenden Verfahrensschritte bei der statistischen Auswertung
(S4) sind in Fig. 2 in einem Flussdiagramm dargestellt. Mit dem Schritt S6 beginnt
das statistische Auswerteverfahren. Zunächst werden die einzelnen Phone des Trainingstextes
einem Primärkluster zugeordnet. Im vorliegenden Ausführungsbeispiel ist das Primärkluster
ein aus drei Phonemen bestehendes Triphon. Ein Phon des Trainingstextes wird demjenigen
Triphon zugeordnet, dessen mittleres Phonem dem Phon des Trainingstextes entspricht
und das den gleichen Kontext wie der Abschnitt des Trainingstextes in dem das zuzuordnende
Phon angeordnet ist, aufweist. Dies bedeutet, dass die zum mittleren Phonem des Triphons
benachbarten Phoneme den benachbarten Phonen des zuzuordnenden Phones des Trainingstextes
entsprechen. Soll z.B. das Phon des Phonems "f" des Wortes "Anfang" einem solchen
Primärkluster zugeordnet werden, so wird dieses Phon dem Phonem "f" im Triphon "nfa"
zugeordnet, da die beiden benachbarten Phoneme "n" (links) und "a" (rechts) den entsprechenden
Phonen von "n" und "a" im Trainingstext entsprechen.
[0024] Die Primärkluster sind in einer vorab festgelegten Liste gespeichert. Sind die Primärkluster
Triphone, so umfasst eine solche Liste typischerweise 1500 bis 2000 Triphone. In dieser
Liste sind die am häufigsten auftretenden Permutationen von drei aufeinanderfolgenden
Phonemen enthalten. Selten und ähnlich klingende Permutationen werden in einem Kluster
zusammengefasst. So können z.B. die Triphone "ter" and "der" in einem Kluster zusammengefasst
sein.
[0025] Bei der Zuordnung nach dem Schritt S7 werden somit die Phone den jeweiligen Phonemen
im gleichen oder ähnlichen Kontext zugeordnet.
[0026] Am Ende dieses Zuordnungsvorganges sind der Liste der Primärkluster alle Phone des
Trainingstextes zugeordnet, das heißt, dass eine Liste vorliegt, in der zu jedem Primärkluster
die entsprechenden Phone des Trainingstextes gespeichert sind.
[0027] Im Schritt S8 wird die mittlere Phondauer d' und die Standardabweichung G für das
jeweils mittlere Phonem eines jedem aus drei Phonemen bestehenden Primärklusters berechnet.
Hierbei werden die Lautdauern der einzelnen einem Primärkluster zugeordneten Phone
gemittelt und als mittlere Lautdauer gespeichert und die entsprechende Standardabweichung
G berechnet.
[0028] Mit dem Schritt S8 wird somit eine Primärstatistik erzeugt, die im wesentlicher der
eingangs erörterten, aus dem Stand der Technik bekannten Statistik entspricht.
[0029] Im Schritt S9 werden die einzelnen Phone Sekundärklustern zugeordnet. Im vorliegenden
Ausführungsbeispiel umfassen die Sekundärkluster jeweils alle Phoneme eines Wortes.
Die Länge der Sekundärkluster ist somit variabel. Bei der Zuordnung der Phone zu den
Sekundärklustern werden die Wörter des Trainingstextes ermittelt und die einzelnen
Phone dieser Wörter werden den korrespondierenden Phonemen der entsprechenden Sekundärkluster
zugeordnet. Ein wesentlicher Unterschied gegenüber dem Schritt S7 ist, dass hier nicht
nur ein Phon einem Kluster zugeordnet wird, sondern alle Phone eines Wortes werden
den entsprechenden Phonemen des Sekundärkluster zugeordnet, das heißt, dass allen
Phonemen des Sekundärklusters jeweils ein Phon zugeordnet wird. Im Schritt S10 wird
geprüft, ob den Phonemen der Sekundärkluster jeweils mindestens drei Phone des Trainingstextes
zugeordnet worden sind. Ist dies nicht der Fall, bedeutet dies, dass das entsprechende
Wort im Trainingstext weniger als dreimal vorkommt und deshalb nicht statistisch signifikant
ist. Sekundärkluster, denen weniger als drei Wörter des Trainingstextes zugeordnet
worden sind, werden gelöscht.
[0030] Im vorliegenden Ausführungsbeispiel beträgt die geforderte Häufigkeit für die Signifikanz
drei. Zur Erzielung einer größeren statistischen Sicherheit kann es zweckmäßig sein,
einen entsprechend höheren Wert anzusetzen.
[0031] Im Schritt S11 wird die mittlere Phondauer d' und die Standardabweichung G für ein
jedes Phonem des Sekundärklusters berechnet und abgespeichert. Als Ergebnis des Schrittes
S11 wird eine Sekundärstatistik auf Grundlage der Sekundärkluster erhalten.
[0032] Im Schritt S12 wird das Auswerteverfahren beendet.
[0033] Mit dem in Fig. 2 gezeigten Ausführungsbeispiel wird eine Statistik erhalten, die
wesentlich sprachspezifischer ist, da die einzelnen Phondauern sehr stark von dem
entsprechenden Kontext abhängen und ein wesentlich präziserer Kontext durch den Kontext
eines gesamten Wortes berücksichtigt wird, falls dies statistisch möglich ist. Wird
auf Grundlage einer solchen zweistufigen Statistik die Lautdauer für eine Sprachsynthese
bestimmt, so ermöglicht dies eine wesentlich natürlichere Synthese der Sprache.
[0034] Im Rahmen der Erfindung können sowohl andere Primärkluster und Sekundärkluster verwendet
werden. Insbesondere ist es z.B. möglich Sekundärkluster mit einer konstanten Länge
von z.B. vier Phonemen zu verwenden. Es könnte jedoch auch zweckmäßig sein, bei bestimmten
Anwendungen, wesentlich längere Sekundärkluster zu verwenden, die z.B. eine vollständige
Phrase, einen vollständigen Satz oder einen ganzen Absatz umfassen können. Je länger
die Sekundärkluster gewählt werden, desto spezieller sollte das Anwendungsgebiet der
Sprachsynthese sein. Ein typisches Beispiel für ein sehr spezielles Anwendungsgebiet
einer Sprachsynthese ist ein Navigationssystem für Kraftfahrzeuge, bei dem wiederholt
sehr ähnliche Sätze und Satzstrukturen erzeugt werden.
[0035] In Fig. 3 ist ein Verfahren zum Ermitteln einzelner Phone für die Sprachsynthese
schematisch in einem Flussdiagramm dargestellt.
[0036] Ausgangspunkt des Verfahrens ist, dass ein Phonem eines zu synthetisierenden Textes
in ein Phon umgesetzt wird und die Dauer dieses Phons zu bestimmen ist.
[0037] Das Verfahren beginnt mit dem Schritt S13. Im Schritt S14 wird der Kontext des Phonems
im Ausgangstext bestimmt. Hierbei wird zweckmäßigerweise der Umfang des Kontextes
so gewählt, dass er der Länge des Sekundärklusters entspricht. Im vorliegenden Ausführungsbeispiel
wird der Kontext im Umfang eines Wortes bestimmt.
[0038] Im Schritt S15 wird geprüft, ob der im Schritt S14 ermittelte Kontext als Sekundärkluster
in der Sekundärstatistik gespeichert ist. Ist dies der Fall, geht der Programmablauf
auf den Schritt S16 über, mit dem die mittlere Phondauer d' die dem Phonem des Sekundärklusters
zugeordnet ist, der dem Phonem des Ausgangstextes entspricht, und die Phondauern und
die Standardabweichung ausgelesen werden. Der Programmablauf geht dann auf den Schritt
S17 über, bei dem die tatsächlich anzuwendende Phondauer d aus der mittleren Phondauer
d' und der Standardabweichung G gemäß folgender Formel berechnet wird:

wobei s ein Geschwindigkeitsskalierungsfaktor ist, der gemäß folgender Formel berechnet
wird:

wobei R
rel das Verhältnis der zu sprechenden Sprechgeschwindigkeit gegenüber der Sprechgeschwindigkeit
ist, mit der der Text auf dem die Statistik beruht, gesprochen worden ist. Durch die
Berücksichtigung der Standardabweichung werden Phone, die der Sprecher des Trainingstextes
mit stark unterschiedlichen Längen ausgesprochen hat, entsprechend stark bei der Sprachsynthese
variiert. Z.B. werden Plosiv-Laute, wie z.B. "k" sehr wenig variiert, weshalb sie
eine sehr kleine Standardabweichung besitzen. Sie werden bei der Sprachsynthese entsprechend
wenig variiert. Vokale, wie z.B. "a" werden stark variiert, weshalb sie eine entsprechend
große Standardabweichung besitzen. Bei obigen Formeln ist zu berücksichtigen, dass
der Geschwindigkeitsskalierungsfaktor s auch negative Werte annehmen kann, wodurch
die Phondauer gegenüber der mittleren Phondauer entsprechend verkürzt wird.
[0039] Ergibt die Abfrage im Schritt S15 hingegen, dass der im Schritt S14 ermittelte Kontext
nicht in der Sekundärstatistik enthalten ist, so geht der Verfahrensablauf auf den
Schritt S18 über. Im Schritt S18 wird geprüft, ob der Abschnitt des Kontextes im Bereich
des umzusetzenden Phonems identisch zu einem Primärkluster der Primärstatistik ist.
Ist dies der Fall, geht der Verfahrensablauf auf den Schritt S19 über. Im Schritt
S19 wird die mittlere Phondauer und die Standardabweichung des mittleren Phonems des
entsprechenden Primärklusters ausgelesen. Der Verfahrensablauf geht dann auf den Schritt
S17 über, mit dem in der oben erläuterten Weise die tatsächlich anzuwendende Phondauer
berechnet wird.
[0040] Ergibt die Abfrage im Schritt S18, dass zu dem Kontext des Ausgangstextes kein identisches
Primärkluster in der Primärstatistik vorhanden ist, so geht der Verfahrensablauf auf
den Schritt S20 über, in dem ein Primärkluster bestimmt wird, das dem Kontext klanglich
möglichst ähnlich ist.
[0041] Im darauffolgenden Schritt S21 werden die mittlere Phondauer und die Standardabweichung
des mittleren Phonems dieses Primärklusters ausgelesen. Der Verfahrensablauf geht
dann auf den Schritt S17 über.
[0042] Nach Ausführung des Schrittes S17 wird das Verfahren zum Ermitteln der Dauer eines
Phons eines Phonems eines Ausgangstextes im Schritt S18 beendet.
[0043] Das erfindungsgemäße Verfahren zum Bestimmen der Phondauern für die Sprachsynthese
ist somit ein zweistufiges Verfahren, bei dem zunächst versucht wird, mittels der
Sekundärstatistik eine mittlere Phondauer zu ermitteln, die auf einem speziellen Kontext
(hier: Wortlänge) beruht, wodurch eine Lautdauer ermittelt wird die der natürlichen
Sprechweise wesentlich ähnlicher ist, als die auf Grund der Primärstatistik ermittelte
Phondauer. Sollte diese Phondauerbestimmung mittels der Sekundärstatistik nicht möglich
sein, so wird auf die Primärstatistik zurückgegriffen, die grundsätzlich immer anwendbar
ist.
[0044] Insbesondere die Kombination des Verfahrens zum Erzeugen der Statistik und des Verfahrens
zum Ermitteln der Phondauern stellt ein im wesentlichen rein statistisches Verfahren
zur Ermittlung der Phondauern dar, das im wesentlichen ohne Expertenwissen erstellt
und angewendet werden kann. Bei dem oben beschriebenen Ausführungsbeispiel wird z.B.
lediglich bei der Segmentierung der Sprachaufzeichnung Expertenwissen eingesetzt,
wobei dieser Schritt mittels bekannter Verfahren auch automatisierbar ist.
[0045] Die erfindungsgemäßen Verfahren sind so einfach zu implementieren und zu trainieren.
Dennoch haben erste Versuche mit Prototypen gezeigt, dass sie bei der Sprachsynthese
eine wesentliche Steigerung der Sprachqualität bewirken, da die Phondauer durch das
Vorsehen der Sekundärstatistik sprachspezifischer ermittelt wird.
[0046] Die oben beschriebenen Verfahren können als Computerprogramme realisiert werden,
die selbständig auf einem Computer zum Erzeugen der Statistik bzw. zum Ermitteln der
Phondauern ablaufen. Sie stellen somit automatisch ausführbare Verfahren dar.
[0047] Die Computerprogramme können auch auf elektrisch lesbaren Datenträgern gespeichert
werden und so auf andere Computersysteme übertragen werden.
[0048] Ein zur Anwendung des erfindungsgemäßen Verfahrens geeignetes Computersystem ist
in Fig. 4 gezeigt. Das Computersystem 1 weist einen internen Bus 2 auf, der mit einem
Speicherbereich 3, einer zentralen Prozessoreinheit 4 und einem Interface 5 verbunden
ist. Das Interface 5 stellt über eine Datenleitung 6 eine Datenverbindung zu weiteren
Computersystemen her. An dem internen Bus 2 sind ferner eine akustische Ausgabeeinheit
7, eine grafische Ausgabeeinheit 8 und eine Eingabeeinheit 9 angeschlossen. Die akustische
Ausgabeeinheit 7 ist mit einem Lautsprecher 10, die grafische Ausgabeeinheit 8 mit
einem Bildschirm 11 und die Eingabeeinheit 9 mit einer Tastatur 12 verbunden. An dem
Computersystem 1 können über die Datenleitung 6 und das Interface 5 Sprachaufzeichnungen
eines Textes übertragen werden, die im Speicherbereich 3 abgespeichert werden. Der
Speicherbereich 3 ist in mehrere Bereiche unterteilt, in denen Sprachaufzeichnungen,
Audiodateien, Anwendungsprogramme zum Durchführen der erfindungsgemäßen Verfahren
und weitere Anwendungs- und Hilfsprogramme gespeichert sind. Die Sprachdateien werden
mit vorbestimmten Programmpaketen analysiert und in die einzelnen Phone segmentiert.
Danach wird das erfindungsgemäße Verfahren zum Erzeugen einer Statistik ausgeführt,
wobei als Ergebnis die Primär- und Sekundärstatistik vorliegen.
[0049] Ein beispielsweise über die Datenleitung 6 und das Interface 5 im Speicherbereich
3 abgespeicherter Text kann dann in eine Audiodatei umgesetzt werden, wobei die Phondauern
mittels des erfindungsgemäßen Verfahrens (Fig. 3) auf Grundlage der Primär- und Sekundärstatistik
bestimmt werden.
[0050] Eine so erzeugte Audiodatei wird über den internen Bus 2 zur akustischen Ausgabeeinheit
7 übertragen und von dieser am Lautsprecher 10 als Sprache ausgegeben.
1. Verfahren zum Erzeugen einer Statistik von Phondauern, wobei auf Grundlage dieser
Statistik bei der synthetischen Spracherzeugung die Phondauern gesteuert werden können,
umfassend folgende Schritte:
- Zuordnen von Phonen eines in Phone segmentierten gesprochenen und aufgezeichneten
Textes zu Phonemen von vorbestimmten Primärklustern, die aus mehreren Phonemen zusammengesetzt
sind, wobei jeweils ein Phon einem Phonem eines Primärklusters zugeordnet wird, wenn
es im gesprochenem Text zu einem dem Kontext des Phonems des Primärklusters identischen
oder ähnlichen Kontext auftritt,
- Erstellen einer Primärstatistik, die zumindest die mittlere Phondauer aller Phone,
die dem jeweiligen Phonem eines Primärklusters zugeordnet sind, umfasst,
gekennzeichnet durch
- Zuordnen von Phonen des gesprochenen und aufgezeichneten Textes zu Phonemen von
vorbestimmten Sekundärklustern, die aus Phonemen zusammengesetzt sind, wobei zumindest
die Anzahl Phoneme einiger Sekundärkluster sich von der Anzahl der Phoneme der Primärkluster
unterscheidet, wobei jeweils ein Phon einem Phonem eines Sekundärklusters zugeordnet
wird, wenn es im gesprochenem Text zu einem dem Kontext des Phonems des Sekundärklusters
identischen Kontext auftritt,
- Erstellen einer Sekundärstatistik, die zumindest die mittlere Phondauer aller Phone,
die dem jeweiligen Phonem eines Sekundärklusters zugeordnet sind, umfasst.
2. Verfahren zum Erzeugen einer Statistik von Phondauern nach Anspruch 1,
dadurch gekennzeichnet,
dass die Anzahl der Phoneme der Primärkluster konstant ist und die Anzahl z.B. gleich
3 ist.
3. Verfahren zum Erzeugen einer Statistik nach Anspruch 1 oder 2,
dadurch gekennzeichnet,
dass die Anzahl der Phoneme des Sekundärklusters variabel ist und die Sekundärkluster
z.B. jeweils die Phoneme eines Wortes umfassen.
4. Verfahren zum Erzeugen einer Statistik nach einem der Ansprüche 1 bis 3,
dadurch gekennzeichnet,
dass die Primärstatistik und die Sekundärstatistik jeweils die Standardabweichung der
jeweiligen Phondauer umfassen.
5. Verfahren zum Erzeugen einer Statistik nach einem der Ansprüche 1 bis 4,
dadurch gekennzeichnet,
dass mit der Sekundärstatistik nur Sekundärkluster erfasst werden, deren Häufigkeit im
Text größer oder gleich einer vorbestimmten Mindesthäufigkeit ist.
6. Verfahren zum Erzeugen einer Statistik nach einem der Ansprüche 1 bis 5,
dadurch gekennzeichnet,
dass die Mindesthäufigkeit zumindest 3 beträgt und vorzugsweise im Bereich von 3 bis 10
liegt.
7. Verfahren zum Erzeugen einer Statistik nach einem der Ansprüche 1 bis 6,
dadurch gekennzeichnet,
dass die Zuordnung der Phone zu Phonemen der Primärkluster mittels einer vorbestimmten
Liste von in Primärklustern gruppierten Phonemen erfolgt, wobei die Phone den einzelnen
Phonemen der Primärkluster der Liste zugeordnet werden und die einzelnen Zuordnungen
abgespeichert werden.
8. Verfahren nach Anspruch 7,
dadurch gekennzeichnet,
dass zu den einzelnen Phonemen der Primärklustern der Liste auf Grundlage der abgespeicherten
Zuordnungen jeweils die mittlere Phondauer (d) und die Standardabweichung (G) der
mittleren Phondauer berechnet werden.
9. Verfahren nach einem der Ansprüche 1 bis 8,
dadurch gekennzeichnet,
dass die Zuordnung der Phone zu den Phonemen der Sekundärkluster mittels einer vorbestimmten
Liste von in Sekundärklustern gruppierten Phonemen erfolgt, wobei die Phone den einzelnen
Phonemen der Sekundärkluster der Liste zugeordnet werden und die einzelnen Zuordnungen
abgespeichert werden.
10. Verfahren nach Anspruch 9,
dadurch gekennzeichnet,
dass zu den einzelnen Phonemen der Sekundärkluster der Liste auf Grundlage der abgespeicherten
Zuordnungen jeweils die mittlere Phondauer (d) und die Standardabweichung (G) der
mittleren Phondauer berechnet werden.
11. Verfahren zum Ermitteln der Dauer einzelne Phone für die Sprachsynthese, mittels einer
Statistik von Phondauern, die eine Primärstatistik und eine Sekundärstatistik aufweist,
wobei die Primärstatistik in Primärkluster gruppierte Phoneme umfasst, und den einzelnen
Phonemen der Primärkluster zumindest eine mittlere Phondauer zugeordnet ist, und die
Sekundärstatistik in Sekundärkluster gruppierte Phoneme umfasst, und den einzelnen
Phonemen der Sekundärkluster zumindest eine mittlere Phondauer zugeordnet ist, umfassend
folgende Schritte:
- Bestimmen, ob das in Sprache umzusetzende Phonem, für das die Phondauer zu ermitteln
ist, Bestandteil eines Sekundärklusters ist,
- Zuordnen der mittleren Phondauer (d), die in der Sekundärstatistik dem entsprechendem
Phonem in dem jeweiligen Sekundärkluster zugeordnet ist, falls das Phonem Bestandteil
eines Sekundärklusters ist, und
- Zuordnen der mittleren Phondauer (d), die in der Primärstatistik dem entsprechendem
Phonem in dem jeweiligen Primärkluster zugeordnet ist, falls das Phonem nicht Bestandteil
eines Sekundärklusters ist.
12. Verfahren zum Ermitteln der Dauer der einzelnen Phone bei der Sprachsynthese mittels
einer Statistik mit einem Verfahren nach einem der Ansprüche 1 bis 10 erzeugten Statistik.
13. Verfahren nach Anspruch 11 oder 12,
dadurch gekennzeichnet,
dass bei der Ermittlung der Dauer (d) der einzelnen Phone die Standardabweichungen (G)
der in der Statistik gespeicherten mittleren Phondauern (d') gemäß folgender Formel
berücksichtigt werden

wobei s ein Geschwindigkeitsskalierungsfaktor ist, der gemäß folgender Formel berechnet
wird

wobei R
rel das Verhältnis der zu sprechenden Sprechgeschwindigkeit gegenüber der Sprechgeschwindigkeit,
mit der der Text auf dem die Statistik beruht, gesprochen worden ist.
14. Vorrichtung zum Erzeugen einer Statistik von Phondauern auf Grundlage derer bei der
synthetischen Spracherzeugung die Phondauern gesteuert werden können, mit
einem Computersystem (1), das einen Speicherbereich (3) aufweist, in dem ein Programm
zum Ausführen eines Verfahrens nach einem der Ansprüche 1 bis 10 gespeichert ist.
15. Vorrichtung zum Ermitteln der Dauer einzelner Phone für die Sprachsynthese mit
einem Computersystem (1), das einen Speicherbereich (3) aufweist, in dem ein Programm
zum Ausführen eines Verfahrens nach einem der Ansprüche 11 bis 13 gespeichert ist.