[0001] Die Erfindung betrifft ein digitales Sprachsyntheseverfahren nach dem Oberbegriff
von Anspruch 1.
[0002] Bei der synthetischen Erzeugung von Sprache mit Computern sind im wesentlichen drei
Verfahren bekannt.
[0003] Bei der Formantsynthese werden mit einer Anregungsquelle mit nachgeschalteten Filtern
die Resonanzeigenschaften des menschlichen Ansatzrohres und deren Veränderungen beim
Sprechen, die durch die Bewegungen der Artikulationsorgane verursacht werden, nachgebildet.
Diese Resonanzen sind charakteristisch für die Struktur und Wahrnehmung von Vokalen.
Zur Begrenzung des Rechenaufwandes werden die ersten drei bis fünf Formanten eines
Sprachlautes synthetisch mit der Anregungsquelle erzeugt. Bei dieser Syntheseart ist
daher für die verschiedenen Anregungswellenformen nur ein geringer Speicherplatzbedarf
in einem Rechner vorzusehen. Ferner kann eine einfache Veränderung von Dauer und Grundfrequenzanregungswellenformen
realisiert werden. Nachteilig ist jedoch, daß zur Sprachausgabe ein ausgedehnter Regelapparat
benötigt wird, der oft den Einsatz von digitalen Verarbeitungsprozessoren notwendig
macht. Ferner ist nachteilig, daß die ausgegebene Sprache unnatürlich und metallisch
klingt und besondere Schwachpunkte bei Nasalen und Obstruenten, d. h. Plosiven /p,
t, k, b, d, g/, Affrikaten /pf, ts,tS/ und Frikativen /f, v, s, z, S, Z, C, j, x,
h/ aufweist.
[0004] In diesem Text stellen die zwischen Schrägstrichen // dargestellten Buchstaben Lautsymbole
dar nach SAMPA-Notation, siehe: Wells, J.; Barry, W.J.; Grice, M.; Fourcin, A.; Gibbon
D. (1992); Standard Computer-Compatible Transcription, in: ESPRIT PROJECT 2589 (SAM)
Multi-lingual speech input/output assessment, methodology and standardisation; Final
Report; Doc. SAM-UCL-037, Seiten 29ff.
[0005] Bei der artikulatorischen Synthese werden die akustischen Gegebenheiten im Ansatzrohr
modelliert, so daß die artikulatorischen Positionen und Bewegungen beim Sprechen rechnerisch
nachgebildet werden. Es wird also ein akustisches Modell des Ansatzrohres berechnet,
was zu einem erheblichen Rechenaufwand führt und eine große Rechenkapazität erfordert.
Dennoch klingt die so automatisch erzeugte Sprache unnatürlich und technisch.
[0006] Darüber hinaus ist die Konkatenationssynthese bekannt, bei der Teile von real gesprochenen
Äußerungen so verkettet werden, daß neue Äußerungen entstehen. Die einzelnen Sprachteile
bilden also Bausteine für die Erzeugung von Sprache. Die Größe der Teile kann - je
nach Anwendungsgebiet - von Wörtern und Phrasen bis zu Ausschnitten aus Lauten reichen.
Für die künstliche Erzeugung von Sprache bei unbegrenztem Wortschatz bieten sich als
Einheiten Halbsilben oder kleinere Ausschnitte an. Größere Einheiten sind nur sinnvoll,
wenn ein begrenzter Wortschatz synthetisiert werden soll.
[0007] In Systemen, die ohne Resynthese auskommen, ist die Wahl des richtigen Schneidepunktes
der Sprachbausteine entscheidend für die Qualität der Synthese. Dabei gilt es, melodische
und spektrale Brüche zu vermeiden. Konkatenative Syntheseverfahren erzielen dann -
insbesondere mit großen Bausteinen - einen natürlicheren Klang als die anderen Verfahren.
Der Regelaufwand für die Erzeugung der Laute ist außerdem recht gering. Die Beschränkungen
dieses Verfahrens liegen im relativ großen Speicherplatzbedarf für die benötigten
Sprachbausteine. Eine weitere Einschränkung dieses Verfahrens liegt darin, daß einmal
aufgenommene Bausteine bei den bekannten Systemen nur mit aufwendigen Resyntheseverfahren
(z. B. in der Dauer oder Frequenz) verändert werden können, die sich zudem nachteilig
auf den Sprachklang und die Verständlichkeit auswirken. Es werden daher auch mehrere
unterschiedliche Varianten eines Sprachbausteins aufgenommen, was den Speicherplatzbedarf
erhöht.
[0008] Unter den Konkatenationssyntheseverfahren sind im wesentlichen vier Syntheseverfahren
bekannt, die es erlauben, Sprache ohne Einschränkung des Wortschatzes zu synthetisieren.
[0009] Bei der Phonsynthese wird eine Konkatenation von Lauten oder Phonen vorgenommen.
Bei westeuropäischen Sprachen mit einem Lautinventar von ca. 30-50 Lauten und einer
durchschnittlichen Dauer der Laute von ca. 150 ms ist der Speicherplatzbedarf überschaubar
klein. Allerdings fehlen diesen Sprachsignalbausteinen die perzeptiv wichtigen Übergänge
zwischen den einzelnen Lauten, die auch nur unvollständig durch Überblenden von einzelnen
Lauten bzw. aufwendigere Resyntheseverfahren nachempfunden werden können. Daher ist
diese Syntheseart qualitativ nicht befriedigend. Auch die Berücksichtigung des phonetischen
Kontextes einzelner Laute durch Ablegen von lautlichen Varianten eines Lautes in eigenen
Sprachsignalbausteinen in der sogenannten Allophonsynthese verbessert das Sprachergebnis
aufgrund der Nichtbeachtung der artikulatorisch-akustischen Dynamik nicht wesentlich.
[0010] Die gängigste Form der Konkatenationssynthese ist die Diphonsynthese; diese benutzt
Signalbausteine, die von der Mitte eines akustisch definierten Sprachlautes bis zur
Mitte des nächsten Sprachlautes reichen. Dadurch werden die perzeptorisch wichtigen
Übergänge von einem Laut zum anderen berücksichtigt, die als akustische Folge der
Bewegungen der Sprechorgane im Sprachsignal auftreten. Außerdem werden dadurch die
Signalbausteine an spektral relativ gleichbleibenden Stellen aneinandergefügt, was
die potentiell vorhandenen Störungen des Signalflusses an den Fugen der einzelnen
Diphone verringert. Das Lautinventar westeuropäischer Sprachen besteht aus 35 bis
50 Lauten. Für eine Sprache mit 40 Lauten ergeben sich also theoretisch 1600 Diphonpaare,
die dann durch phonotaktische Einschränkungen real auf etwa 1000 reduziert werden.
In natürlicher Sprache unterscheiden sich unbetonte und betonte Laute sowohl klanglich
als auch in der Dauer voneinander. Um diese Unterschiede in der Synthese adäquat zu
berücksichtigen, werden in einigen Systemen für betonte und unbetonte Lautfolgen unterschiedliche
Diphone aufgenommen. Je nach Ansatz werden also 1000 bis 2000 Diphone mit einer durchschnittlichen
Dauer von ca. 150 ms benötigt, woraus sich je nach den Anforderungen an Dynamik und
Signalbandbreite ein Speicherplatzbedarf für die Signalbausteine von bis zu 23 MB
ergibt. Ein üblicher Wert liegt bei etwa 8 MB.
[0011] Auf einem ähnlichen Prinzip wie die Diphonsynthese beruhen auch die Triphon- und
die Halbsilbensynthese. Auch hier liegt der Schneidepunkt in der Mitte der Laute.
Allerdings werden größere Einheiten erfaßt, wodurch größere phonetische Kontexte berücksichtigt
werden können. Die Anzahl der Kombinationen nimmt dabei allerdings proportional zu.
Bei der Halbsilbensynthese liegt ein Schneidepunkt für die verwendeten Einheiten mitten
im Vokal einer Silbe. Der andere Schneidepunkt liegt am Anfang bzw. Ende einer Silbe,
wodurch je nach der Struktur der Silbe auch Sequenzen von mehreren Konsonanten in
einem Sprachbaustein aufgenommen werden. Im Deutschen werden etwa 52 unterschiedliche
Lautfolgen in Anfangssilben von Morphemen und ca. 120 Lautfolgen für mediale bzw.
finale Silben von Morphemen gezählt. Daraus ergibt sich eine theoretische Anzahl von
6240 Halbsilben für das Deutsche, von denen einige ungebräuchlich sind. Da Halbsilben
meist länger sind als Diphone, übersteigt der Speicherplatzbedarf für die Sprachsignalbausteine
den bei den Diphonen um einiges.
[0012] Das größte Problem ist daher bei einem qualitativ hochwertigen Sprachsynthesesystem
der erhebliche Speicherplatzbedarf. Zur Verringerung dieses Bedarfs wurde beispielsweise
vorgeschlagen, die Stille im Verschluß von Plosiven für alle Plosivverschlüsse zu
nutzen. Aus der EP 0 144 731 B1 ist ein Sprachsynthesesystem bekannt, in dem Teile
von Diphonen für mehrere Laute benutzt werden. Dort wird ein Sprachsynthesizer beschrieben,
der Einheits-Sprachsignalformen, die durch Teilen eines Doppellautes erzeugt werden,
abspeichert und bestimmten Ausdruckssymbolen gleichsetzt. Eine Synthetisiereinrichtung
liest die Einheits-Sprachsignalformen entsprechend den Ausgangssymbolen der konvertierten
Sequenz von Ausdruckssymbolen aus dem Speicher. Auf der Basis des Sprachteils der
Eingangszeichen wird bestimmt, ob zwei gelesene Einheits-Sprachsignalformen entweder
direkt verbunden werden, wenn der Eingangs-Sprachteil der Eingangszeichen stimmlos
ist, oder ein vorgegebenes erstes Interpolationsverfahren angewendet wird, wenn der
Eingangs-Sprachteil der Eingangszeiten stimmhaft ist, wobei die gleiche Einheits-Signalform
sowohl für einen stimmhaften /g, d, b/ als auch für seinen entsprechenden stimmlosen
/k, t, p/ Laut verwendet wird. Ferner sollen in dem Speicher auch Einheits-Sprachsignalformen
abgelegt werden, die den einem Konsonanten folgenden Vokalteil bzw. den einem Konsonanten
vorangehenden Vokalteil repräsentieren. Die Übergangsbereiche von einem Konsonanten
zu einem Vokal bzw. von einem Vokal zu einem Konsonanten kann jeweils für die Konsonanten
k und g, t und d sowie p und b gleich gesetzt werden. Der Speicherplatzbedarf wird
somit zwar reduziert, jedoch erfordert der angegebene Interpolationsvorgang einen
nicht unerheblichen Rechenaufwand.
[0013] Aus der DE 27 40 520 Al ist ein Verfahren zur Synthese von Sprache bekannt, bei dem
jedes Phonem von in einem Speicher gespeicherten Phonem-Elementen gebildet wird, wobei
Perioden von Lautschwingungen aus natürlicher Sprache gewonnen oder künstlich synthetisiert
sind. Der zu synthetisierende Text wird Satz für Satz grammatisch und phonetisch nach
den Regeln der Sprache analysiert. Neben den Perioden der Lautschwingungen sind jedem
Phonem bestimmte Arten und eine Anzahl von Zeit-Abschnitten von Rausch-Phonemen mit
entsprechender Dauer, Amplituden und Spektralverteilung gegenübergestellt. Die Perioden
der Lautschwingungen und die Elemente der Rausch-Phoneme sind in digitaler Form als
Folge von Amplitudenwerten der entsprechenden Schwingung in einem Speicher abgelegt
und werden beim Lesevorgang entsprechend der Frequenzcharakteristik und zum Erreichen
der Natürlichkeit der Sprache verändert.
[0014] Demnach ist hieraus ein digitales Sprachsyntheseverfahren nach dem Konkatenationsprinzip
entsprechend dem Oberbegriff des Patentanspruches 1 bekannt.
[0015] Um mit einem möglichst kleinen Speicherbedarf auszukommen, werden nach dem Syntheseverfahren
der DE 27 40 520 A1 einzelne Perioden von Lautschwingungen mit charakteristischer
Formant-Verteilung gespeichert. Die jedem Phonem bei Festhalten der Grundcharakteristik
des Satzes bestimmte Arten und Anzahl von den gespeicherten Perioden von Lautschwingungen
werden bestimmt und bilden dann zusammen den akustischen Spracheindruck. Danach werden
also extrem kurze Zeitreihenelemente von der Länge einer Periode der Grundschwingung
eines Lautes vom Speicher abgerufen und je nach vorher festgestellter Wiedergabeanzahl
aufeinanderfolgend wiederholt. Zur Realisierung glatter Phonemübergänge werden Perioden
(synthetische) mit Formant-Verteilungen, die dem Übergang zwischen den Phonemen entsprechen,
verwendet oder die Amplituden im Bereich der betreffenden Übergänge vermindert.
[0016] Nachteilig ist, daß eine ausreichende Natürlichkeit der Sprachwiedergabe aufgrund
der mehrfachen Wiedergabe gleicher Periodenstücke, ggf. nur synthetisch gekürzt oder
verlängert, nicht erreicht wird. Ferner wird der erheblich verringerte Speicherbedarf
durch einen vermehrten Analyse- und Interpolationsaufwand erkauft, was Rechenzeit
kostet.
[0017] Ein zum Sprachsyntheseverfahren der DE 27 40 520 A1 ähnliches Verfahren ist aus der
WO 85/04747 bekannt, bei dem jedoch von einer vollständig synthetischen Erzeugung
der Sprachsegmente ausgegangen wird. Die Sprachsegmente, die Phoneme oder Übergänge
darstellen, werden aus synthetischen Wellenformen, die nach einer vorbestimmten Art
und Weise mehrfach, ggf. in der Länge gekürzt und/oder stimmhaft wiedergegeben werden,
erzeugt. Insbesondere bei den Phonemübergängen wird auch von einer invertierten Wiedergabe
von bestimmten Zeitreihen Gebrauch gemacht. Nachteilig ist auch hier, daß bei erheblich
verringertem Speicherplatzbedarf aufgrund umfangreicher Analyse- und Synthetisiervorgänge
eine erhebliche Rechenkapazität benötigt wird. Der Sprachwiedergabe fehlt gleichwohl
die natürliche Varianz.
[0018] Aufgabe der Erfindung ist es daher, ausgehend von der DE 27 40 520 A1 ein Sprachsyntheseverfahren
anzugeben, bei dem bei geringem Speicherplatzbedarf ohne hohen Rechenaufwand eine
qualitativ hochwertige Sprachausgabe erreicht wird.
[0019] Gelöst wird diese Aufgabe mit einem Sprachsyntheseverfahren gemäß Anspruch 1.
[0020] Mit dem erfindungsgemäßen Sprachsyntheseverfahren wird eine Generalisierung bei der
Verwendung der Sprachsignalbausteine in Form von Mikrosegmenten erreicht. Es wird
damit die in der Diphonsynthese nötige Verwendung eines eigenen akustischen Segments
für jede der möglichen Verbindungen zweier Sprachlaute vermieden. Die für die Sprachausgabe
benötigten Mikrosegmente können in drei Kategorien aufgegliedert werden. Dies sind:
- 1.
- Segmente für Vokalhälften und Halbvokalhälften: Sie geben in der Dynamik der spektralen
Struktur die Bewegungen der Sprechorgane von bzw. zu der Artikulationsstelle des benachbarten
Konsonanten an. Aufgrund der Silbenstruktur der meisten Sprachen ist häufig eine Konsonant-Vokal-Konsonant-Folge
anzutreffen. Da die Bewegungen der Sprechorgane für eine gegebene Artikulationsstelle
entsprechend den relativ unbeweglichen Teilen des menschlichen Ansatzrohres unabhängig
von der Artikulationsart, d. h., unabhängig von den vorangehenden oder nachfolgenden
Konsonanten, vergleichbar sind, ist daher für jeden Vokal nur ein Mikrosegment pro
globaler Artikulationsstelle des vorherigen Konsonanten (= erste Hälfte des Vokals)
und ein Mikrosegment pro Artikulationsstelle des folgenden Konsonanten (= zweite Hälfte
des Vokals) nötig.
- 2.
- Segmente für quasi stationäre Vokalteile: Diese Segmente sind aus der Mitte von langen
Vokalrealisierungen, die klanglich relativ konstant wahrgenommen werden, herausgetrennt.
Sie werden in verschiedenen Textpositionen bzw. Kontexten eingesetzt, beispielsweise
am Wortanfang, nach den Halbvokalsegmenten, die bestimmten Konsonanten bzw. Konsonantfolgen
folgen, im Deutschen beispielsweise nach /h/, /j/ sowie /?/, zur Enddehnung, zwischen
nicht diphthongischen Vokal-Vokalfolgen und in Diphthongen als Start- und Zielpositionen.
- 3.
- Konsonantische Segmente: Die konsonantischen Segmente sind so gebildet, daß sie unabhängig
von der Art der Nachbarlaute für mehrere Vorkommen des Lautes entweder generell oder
wie vornehmlich bei Plosiven im Kontext von bestimmten Lautgruppen verwendet werden
können.
[0021] Wichtig ist, daß die in drei Kategorien aufgegliederten Mikrosegmente mehrfach in
unterschiedlichen lautlichen Kontexten verwendet werden können. D. h., daß bei Lautübergängen
die perzeptorisch wichtigen Übergänge von einem Laut zum anderen berücksichtigt werden,
ohne daß dabei für jede der möglichen Verbindungen zweier Sprachlaute eigene akustische
Segmente erforderlich sind. Die erfindungsgemäße Aufteilung in Mikrosegmente, die
einen Lautübergang teilt, ermöglicht die Verwendung identischer Segmente für verschiedene
Lautübergänge für eine Gruppe von Konsonanten. Bei diesem Prinzip der Generalisierung
bei der Verwendung von Sprachsignalbausteinen wird der zur Abspeicherung der Sprachsignalbausteine
benötigte Speicherplatz verringert. Dennoch ist die Qualität der synthetisch ausgegebenen
Sprache aufgrund der Berücksichtigung der wahrnehmungsgemäß wichtigen Lautübergänge
sehr gut.
[0022] Dadurch, daß die Segmente für Vokalhälften und Halbvokalhälften in einer Konsonant-Vokal-
oder Vokal-Konsonant-Folge für jede der Artikulationsstellen der benachbarten Konsonanten,
nämlich labial, alveolar oder velar, gleich sind, wird bei den Sprachsegmenten für
Vokale eine Mehrfachnutzung der Mikrosegmente für unterschiedlichen lautlichen Kontext
ermöglicht und damit eine erhebliche Speicherplatzverringerung erreicht.
[0023] Wenn die Segmente für quasi stationäre Vokalteile vorgesehen sind für Vokale an Wortanfängen
sowie Vokal-Vokal-Folgen, wird mit einer geringen Anzahl von zusätzlichen Mikrosegmenten
eine erhebliche Klangverbesserung der synthetischen Sprache für Wortanfänge, Diphthonge
oder Vokal-Vokalfolgen erreicht.
[0024] Dadurch, daß die konsonantischen Segmente für Plosive in zwei Mikrosegmente geteilt
sind, ein erstes Segment, das die Verschlußphase umfaßt, und ein zweites Segment,
das die Lösungsphase umfaßt, wird eine weitere Generalisierung der Sprachsegmente
erreicht. Insbesondere läßt sich die Verschlußphase für alle Plosive durch eine Zeitreihe
von Nullen darstellen. Für diesen Teil der Lautwiedergabe ist daher kein Speicherplatz
erforderlich.
[0025] Die Lösungsphase der Plosive wird nach dem im Kontext folgenden Laut differenziert.
Dabei kann eine weitere Generalisierung erreicht werden, in dem bei der Lösung zu
Vokalen nur nach den folgenden vier Vokalgruppen - vordere, ungerundete Vokale; vordere,
gerundete Vokale; tiefe bzw. zentralisierte Vokale und hintere, gerundete Vokale -
und bei einer Lösung zu Konsonanten nur nach drei unterschiedlichen Artikulationsstellen,
labial, alveolar oder velar, unterschieden wird, so daß beispielsweise für die deutsche
Sprache 42 Mikrosegmente für die sechs Plosive /p, t, k, b, d, g/ zu drei Konsonantengruppen
nach Artikulationsstelle und zu vier Vokalgruppen abgespeichert werden müssen. Dies
verringert aufgrund der Mehrfachverwendung der Mikrosegmente für unterschiedlichen
lautlichen Kontext den Speicherplatzbedarf weiter.
[0026] Vorteilhaft wird zur Kürzung von Vokalsegmenten bei einem Vokalsegment, das von einer
Artikulationsstelle zur Mitte des Vokals verläuft, die Start- und bei einem Vokalsegment,
das von der Mitte des Vokals zur folgenden Artikulationsstelle verläuft, die Zielposition
immer erreicht, während die Bewegung zur oder von der "Vokalmitte" verkürzt wird.
Eine derartige Verkürzung der Mikrosegmente bildet beispielsweise unbetonte Silben
nach, wobei die in der natürlichen, fließenden Rede zu findenden Abweichungen von
der spektralen Zielqualität des jeweiligen Vokals wiedergegeben werden und somit die
Natürlichkeit der Synthese erhöht wird. Vorteilhaft ist dabei ferner, daß für derartige
sprachliche Abwandlungen bereits gespeicherter Segmente kein dem Segment entsprechender
weiterer Speicherplatzbedarf benötigt wird.
[0027] Mit der Analyse des als Sprache auszugebenden Textes wird eine Manipulation der Mikrosegmente
in Abhängigkeit des Analyseergebnisses erreicht. Damit können Abwandlungen der Aussprache
in Abhängigkeit des Satzbaus und der Semantik sowohl Satz für Satz als auch in den
Sätzen Wort für Wort nachgebildet werden, ohne daß zusätzliche Mikrosegmente für verschiedene
Aussprachen nötig sind. Der Speicherplatzbedarf kann somit gering gehalten werden.
Darüber hinaus erfordert die Manipulation im Zeitbereich keine aufwendigen Rechenoperationen.
Gleichwohl hat die mit dem Sprachsyntheseverfahren erzeugte Sprache ein sehr natürliches
Gepräge.
[0028] Insbesondere können mit der Analyse an dem als Sprache auszugebenden Text, Sprachpausen
erkannt werden. Die Phonemkette wird an diesen Stellen mit Pausesymbolen zu einer
Symbolkette ergänzt, wobei bei der Aneinanderreihung der Mikrosegmente an den Pausesymbolen
digitale Nullen im Zeitreihensignal eingefügt werden. Die zusätzlichen Informationen
über eine Pausenstelle und deren Pausendauer wird aufgrund des Satzbaus und vorbestimmten
Regeln ermittelt. Die Pausendauer wird durch die Anzahl der einzufügenden digitalen
Nullen in Abhängigkeit der Abtastrate realisiert.
[0029] Dadurch, daß mit der Analyse Phrasengrenzen erkannt werden und die Phonemkette an
diesen Stellen mit Dehnungssymbolen zu einer Symbolkette ergänzt wird, wobei bei der
Aneinanderreihung der Mikrosegmente die Mikrosegmente entsprechend der Symbole eine
Abspieldauerdehnung im Zeitbereich erfahren, kann eine phrasenfinale Dehnung bei der
synthetischen Sprachwiedergabe nachgebildet werden. Diese Manipulation im Zeitbereich
wird an den bereits zugeordneten Mikrosegmenten ausgeführt. Es werden daher keine
zusätzlichen Sprachbausteine zur Realisierung von Enddehnungen benötigt, was den Speicherplatzbedarf
gering hält.
[0030] Dadurch, daß mit der Analyse Betonungen erkannt werden und die Phonemkette an diesen
Stellen mit Betonungssymbolen für verschiedene Betonungswerte zu einer Symbolkette
ergänzt wird, wobei bei der Aneinanderreihung der Mikrosegmente an den Mikrosegmenten
mit Betonungssymbolen eine Veränderung der Dauer der Sprachlaute erfolgt, werden die
in natürlicher Sprache vorkommenden Betonungsarten nachgebildet. Die Hauptinformation
bezüglich des durch die Abspieldauer gebildeten Wortakzents steht in einem Lexikon.
Die dann für intonatorisch getragene Satzakzente auszuwählende Betonung wird bei der
Analyse des als Sprache auszugebenden Textes aus dem Satzaufbau und vorbestimmten
Regeln ermittelt. Je nach ermittelter Betonung wird das betreffende Mikrosegment ungekürzt
oder durch Fortlassen bestimmter Mikrosegmentabschnitte gekürzt wiedergegeben. Zur
Erzeugung einer wandlungsreichen Sprache bei gleichzeitig vertretbarem Rechenaufwand
haben sich fünf Kürzungsstufen für vokalische Mikrosegmente als ausreichend erwiesen,
so daß insgesamt sechs Abspieldauermöglichkeiten zur Verfügung stehen. Diese Kürzungsstufen
sind an dem vorab abgespeicherten Mikrosegment markiert und werden kontextabhängig
bei der Textanalyse entsprechend des Analyseergebnisses, d. h. des zu wählenden Betonungswertes,
angesteuert.
[0031] Sowohl die Abspieldauerdehnung bei phrasenfinalen Silben, wie auch die verschiedenen
Kürzungsstufen für Betonungen kannen bevorzugt mit den gleichen Kürzungsstufen in
den Mikrosegmenten realisiert werden. Im Gegensatz zu betonten Silben, bei denen sich
die zeitliche Dehnung auf alle Mikrosegmente gleichmäßig verteilt, wird bei den Endsilben
von Phrasen, nämlich von Spracheinheiten, die beispielsweise in der Schriftsprache
mit den Satzzeichen Komma, Semikolon, Punkt und Doppelpunkt notiert sind, eine progressive
Verlängerung der Abspieldauer vorgesehen. Dies wird erreicht durch eine Erhöhung der
Abspieldauer der Mikrosegmente bei den phrasenfinalen Silben ab dem zweiten Mikrosegment
um jeweils eine Stufe.
[0032] Beispeilsweise wird bei dem Satz "Er hat in Paris gewohnt." die letzte Silbe "-wohnt",
ausgesprochen /vo:nt/, so gedehnt, daß die in der Tabelle in der ersten Zeile dargestellte
Mikrosegmentkette mit der in Klammern angegebenen normalen Dauerstufe, wenn diese
Silbe nicht am Phrasenende steht, gemäß den Dehnungssymbolen in die in der dritten
Zeile dargestellte Mikrosegmentkette überführt wird. Der Wertebereich für die Dehnungsstufen
geht von 1-6, wobei größere Zahlen einer längeren Dauer entsprechen. Das Symbol %
erzeugt keine Dauerveränderung.
| normal |
[2v]o |
v[5o] |
[5o]n |
[2n]t |
t[2t] |
[2t] . . . |
| Symbol |
% |
% |
+1 |
+2 |
+3 |
+4 |
| gedehnt |
[2v]o |
v[5o] |
[6o]n |
[4n]t |
t[5t] |
[6t]... |
[0033] Ähnlich ist die Bildung in anderen Sprachen oder Dialekten. In Englisch würde die
Enddehnung beispielsweise vom Satz "He saw a shrimp." für das letzte Wort durch Mikrosegmente
wie folgt gebildet werden:
| normal |
[2S]r |
[2r]I |
r[3I] |
[3I]m |
[2m]p |
p[2p] |
[2p]... |
| Symbol |
% |
% |
% |
+1 |
+2 |
+3 |
+4 |
| gedehnt |
[2S]r |
[2r]I |
r[3I] |
[4I]m |
[4m]p |
p[5p] |
[6p]... |
[0034] Bei offenen Silben, d.h. die mit einem Vokal enden, wie beispielsweise "Er war da.",
wird die Abspieldauer des zweiten Mikrosegmentes von "da", ausgesprochen /da:/, um
2 Stufen erhöht.
| normal |
d[2d] |
[2d]a |
d[4a] |
[4a]... |
| Symbol |
% |
% |
% |
+2 |
| gedehnt |
d[2d] |
[2d]a |
d[4a] |
[6a]... |
[0035] Diese Prozedur wird so lange ausgeführt, bis die längste Dauerstufe (=6) erreicht
ist.
[0036] Dadurch, daß mit der Analyse Intonationen zugeordnet werden und die Phonemkette an
diesen Stellen mit Intonationssymbolen zu einer Symbolkette ergänzt wird, wobei bei
der Aneinanderreihung der Mikrosegmente an den Intonationssymbolen eine Grundfrequenzveränderung
bestimmter Teile der Perioden von Mikrosegmenten im Zeitbereich durchgeführt wird,
wird die Melodie sprachlicher Äußerungen nachgebildet. Die Grundfrequenzveränderung
erfolgt dabei vorzugsweise durch Überspringen und Hinzufügen bestimmter Abtastwerte.
Dafür werden die vorab aufgenommenen stimmhaften Mikrosegmente, d.h. Vokale und Sonoranten,
markiert. Dabei wird automatisch jede Stimmperiode mit dem spektral informationswichtigen
ersten Teil, in dem die Stimmlippen geschlossen sind, und dem unwichtigeren zweiten
Teil, in dem die Stimmlippen offen sind, getrennt behandelt. Die Markierungen werden
so gesetzt, daß bei der Signalausgabe lediglich die spektralunkritischen zweiten Teile
jeder Periode zur Grundfrequenzveränderung gekürzt oder verlängert wiedergegeben werden.
Damit wird der Speicherplatzbedarf zur Nachbildung von Intonationen bei der Sprachausgabe
nicht wesentlich erhöht und der Rechenaufwand aufgrund der Manipulation im Zeitbereich
gering gehalten.
[0037] Bei der Aneinanderkettung verschiedener Mikrosegmente zur Sprachsynthese wird ein
weitestgehend störungsfreier akustischer Übergang zwischen aufeinanderfolgenden Mikrosegmenten
dadurch erreicht, daß die Mikrosegmente mit dem ersten Abtastwert nach dem ersten
positiven Nulldurchgang, d. h. einem Nulldurchgang mit positivem Signalanstieg, beginnen
und mit dem letzten Abtastwert vor dem letzten positiven Nulldurchgang enden. Die
digital abgespeicherten Zeitreihen der Mikrosegmente reihen sich somit nahezu stetig
aneinander. So werden aufgrund von Digitalsprüngen entstehende Knackgeräusche vermieden.
Außerdem können jederzeit durch digitale Nullen wiedergegebene Verschlußphasen von
Plosiven oder Wortunterbrechungen und allgemeine Sprachpausen im wesentlichen stetig
eingefügt werden.
[0038] Nachfolgend wird ein Ausführungsbeispiel der Erfindung anhand der Zeichnungen detailliert
beschrieben.
[0039] Darin zeigt:
- Fig. 1
- ein Ablaufdiagramm des Sprachsyntheseverfahrens,
- Fig. 2
- ein Spektrogramm und Zeitsignal des Wortes "Phonetik" und
- Fig. 3
- das Wort "Frauenheld" im Zeitbereich.
[0040] Die Verfahrensschritte des erfindungsgemäßen Sprachsynthesesystems sind in Fig. 1
in einem Ablaufdiagramm dargestellt. Die Eingabe für das Sprachsynthesesystem ist
ein Text, beispielsweise eine Textdatei. Den Wörtern des Textes wird mittels eines
im Rechner gespeicherten Lexikons eine Phonemkette zugeordnet, die die Aussprache
des jeweiligen Wortes repräsentiert. In der Sprache, insbesondere in der deutschen
Sprache, erfolgt die Wortneubildung häufig durch Zusammensetzung von Worten und Wortteilen,
z.B. mit Vor- und Nachsilben. Die Aussprache von Wörtern, wie "Hausbau", "Bebauung",
"bebaubar" usw., können aus einen Stamm, hier "bau", abgeleitet und mit der Aussprache
der Vorund Nachsilben verbunden werden. Dabei können auch Verbindungslaute, wie "s"
in "Gerichtsdiener", "es" in "Landessportschule" und "n" in "Grubenarbeiter", berücksichtigt
werden. Somit greifen für den Fall, daß ein Wort nicht im Lexikon steht, verschiedene
Ersatzmechanismen, um die Aussprache des Wortes zu verifizieren. Dabei wird zunächst
versucht, das gesuchte Wort aus Teileinträgen des Lexikons, wie oben beschrieben,
zusammenzusetzen. Falls dies nicht gelingt, wird versucht, über ein Silbenlexikon,
in dem Silben mit ihren Aussprachen eingetragen sind, zu einer Aussprache zu gelangen.
Mißlingt auch dies, so gibt es Regeln, wie Folgen von Buchstaben in Phonemfolgen umzusetzen
sind.
[0041] Unter der, wie oben dargestellt, erzeugten Phonemkette ist in Fig. 1 die syntaktisch-semantische
Analyse dargestellt. Dort sind zusätzlich zu den bekannten Ausspracheangaben im Lexikon
syntaktische und morphologische Informationen enthalten, die zusammen mit bestimmten
Schlüsselwörtern des Textes eine lokale linguistische Analyse ermöglichen, die Phrasengrenzen
und akzentuierte Wörter ausgibt. Aufgrund dieser Analyse wird die Phonemkette, die
aus den Ausspracheangaben des Lexikons stammt, modifiziert und zusätzliche Informationen
über Pausendauer und Tonhöhenwerte der Mikrosegmente werden eingefügt. Es entsteht
eine phonembasierte, prosodisch differenzierte Symbolkette, die die Eingabe für die
eigentliche Sprachausgabe liefert.
[0042] Beispielsweise berücksichtigt die syntaktisch-semantische Analyse Wortakzente, Phrasengrenzen
und Intonation. Die Abstufungen der Betontheit von Silben innerhalb eines Wortes sind
in den Lexikoneinträgen markiert. Für die Wiedergabe der dieses Wort bildenden Mikrosegemente
sind somit die Betonungsstufen vorgegeben. Die Betonungsstufe der Mikrosegmente einer
Silbe ergibt sich aus:
- der phonologischen Länge eines Lautes, die bei jedem Phonem bezeichnet ist, beispielsweise
/e:/ für langes 'e' in /fo'ne:tIK/,
- der Akzentuierung der Silbe, die in der Phonemkette vor der betonten Silbe bezeichnet
ist, beispielsweise, /fo'ne:tIK/,
- den Regeln für phrasenfinale Dehnung und
- ggf. andere Regeln, die auf der Abfolge von akzentuierten Silben beruhen, wie beispielsweise
die Längung von zwei betonten aufeinanderfolgenden Silben.
[0043] Die Phrasengrenzen, an denen neben bestimmten intonatorischen Verläufen die Phrasenenddehnung
stattfindet, werden durch linguistische Analyse ermittelt. Aus der Folge von Wortarten
wird mit vorgegebenen Regeln die Grenze von Phrasen bestimmt. Die Umsetzung der Intonation
beruht auf einem Intonations- und Pausenbeschreibungssystem, bei dem grundsätzlich
zwischen Intonationsverläufen, die an Phrasengrenzen stattfinden (steigend, fallend,
gleichbleibend, fallend-steigend) und solchen, die um Akzente lokalisiert sind (tief,
hoch, steigend, fallend), unterschieden wird. Die Zuordnung der Intonationsverläufe
erfolgt auf der Basis der syntaktischen und morphologischen Analyse unter Einbeziehung
von bestimmten Schlüsselwörtern und -zeichen im Text. So haben beispielsweise Fragen
mit Verberststellung (erkennbar durch das Fragezeichen am Ende und die Information,
daß das erste Wort des Satzes ein finites Verb ist) einen tiefen Akzentton und einen
hoch steigenden Grenzton. Normale Aussagen haben einen hohen Akzentton und eine fallende
finale Phrasengrenze. Der Verlauf der Intonation wird nach vorgegebenen Regeln erzeugt.
[0044] Für die eigentliche Sprachausgabe wird die phonembasierte Symbolkette in eine Mikrosegmentfolge
umgewandelt. Die Umwandlung einer Folge von zwei Phonemen in Mikrosegmentfolgen erfolgt
über einen Regelsatz, in dem jeder Phonemfolge eine Folge von Mikrosegmenten zugeordnet
wird.
[0045] Dabei wird bei der Aneinanderreihung der durch die Mikrosegmentkette angegebenen
nacheinanderfolgenden Mikrosegmente die zusätzlichen Informationen über Betonung,
Pausendauer, Enddehnung und Intonation berücksichtigt. Die Modifikation der Mikrosegmentabfolge
erfolgt dabei ausschließlich im Zeitbereich. In dem Zeitreihensignal der aneinandergereihten
Mikrosegmente wird beispielsweis eine Sprachpause durch Einfügen von digitalen Nullen
an der durch ein entsprechendes Pausensymbol markierten Stelle realisiert.
[0046] Die Sprachausgabe erfolgt dann durch digital/analog-Umwandlung des manipulierten
Zeitreihensignals, beispielsweise über eine im Rechner angeordnete "Soundblaster"-Karte.
[0047] Fig. 2 zeigt im oberen Teil ein Spektrogramm und im unteren Teil das dazu gehörige
Zeitsignal für das Wortbeispiel "Phonetik". Das Wort "Phonetik" wird in Symbolen als
Phonemfolge zwischen Schrägstrichen wie folgt dargestellt /fone:tIk/. Diese Phonemfolge
ist auf der die Zeitachse repräsentierenden Abszisse im oberen Teil der Fig. 2 aufgetragen.
Die Ordinate des Spektrogramms der Fig. 2 bezeichnet den Frequenzinhalt des Sprachsignals,
wobei der Grad der Schwärzung zur Amplitude der entsprechenden Frequenz proportional
ist. Im in Fig. 2 oben dargestellten Zeitsignal entspricht die Ordinate der momentanen
Amplitude des Signals. Im mittleren Feld sind mit senkrechten Strichen die Mikrosegmentgrenzen
dargestellt. Die darin angegebenen Buchstabenkürzel geben die Bezeichnung oder Symbolisierung
des jeweiligen Mikrosegmentes an. Das Beispielwort "Phonetik" besteht somit aus zwölf
Mikrosegmenten.
[0048] Die Bezeichnungen der Mikrosegmente sind so gewählt, daß die Laute außerhalb der
Klammer den Kontext kennzeichnen, wobei in der Klammer der klingende Laut angegebenen
ist. Es werden damit die kontextabhängigen Übergänge der Sprachlaute berücksichtigt.
[0049] Die konsonantischen Segmente ... (f) und (n)e sind an der jeweiligen Lautgrenze segmentiert.
Die Plosive /t/ und /k/ sind in eine Verschlußphase (t(t) und k(k)), die digital durch
auf Null gesetzte Abtastwerte nachgebildet ist und für alle Plosive verwendet wird,
und eine kurze Lösungsphase (hier: (t)I und (k)...), die kontextsensitiv ist, aufgeteilt.
Die Vokale sind jeweils in Vokalhälften geteilt, wobei die Schnittpunkte am Anfang
und in der Mitte des Vokals liegen.
[0050] In Fig. 3 ist ein weiteres Wortbeispiel "Frauenheld" im Zeitbereich wiedergegeben.
Die Phonemfolge wird mit /fraU@nhElt/ angegeben. Das in Fig. 3 dargestellte Wort umfaßt
15 Mikrosegmente, wobei hier auch quasi stationäre Mikrosegmente vorkommen. Die ersten
beiden Mikrosegmente ...(f) und (r)a sind konsonantische Segmente, deren Kontext nur
nach einer Seite spezifiziert ist. Nach dem Halbvokal r(a), der einen Übergang der
velaren Artikulationsstelle zur Mitte des a umfaßt, schließt zur Bildung des Diphthongs
/aU/ die Startposition a(a) an. aU(aU) beinhaltet die perzeptiv wichtige Transition
zwischen der Start- und der Zielposition u(U). (U)@ enthält den Übergang von /U/ nach
/@/, der normalerweise von @(@) gefolgt werden müßte. Dadurch würde /@/ zu lange dauern,
so daß dieses Segment aus Dauergründen bei /@/ und /6/ entfällt und nur die zweite
Vokalhälfte (@)n abgespielt wird. (n)h stellt ein konsonantisches Segment dar. Der
Übergang von Konsonanten zu /h/ wird - anders als bei Vokalen - nicht spezifiziert.
Daher gibt es kein Segment n(h). (h)E enthält den behauchten Anteil des Vokals /E/,
der von dem quasi-stationären E(E) gefolgt wird. (E)1 enthält die zweite Vokalhälfte
von /E/ mit dem Übergang zur dentalen Artikulationsstelle. E(1) ist ein konsonantisches
Mikrosegment, bei dem nur der Vorkontext spezifiziert ist. Das /t/ wird aufgeteilt
in eine Verschlußphase t(t) und eine Lösungsphase (t)..., die zu Stille (...) geht.
[0051] Erfindungsgemäß wird die Vielzahl der möglichen Artikulationsstellen auf drei wesentliche
Bereiche beschränkt. Die Zusammenfassung der Gruppen basiert auf den ähnlichen Bewegungen,
die zur Bildung der Laute von den Artikulatoren ausgeführt werden. Wegen der vergleichbaren
Artikulatorbewegungen ähneln sich die spektralen Übergänge zwischen den Lauten jeweils
innerhalb der drei in Tabelle 1 genannten Gruppen.
Tabelle 1:
| Artikulatoren und Artikulationsstellen und deren Bezeichnung |
| Zusammenfassung |
Bezeichnung |
Artikulator |
Artikulationsstelle |
| labial |
bilabial |
Unterlippe |
Oberlippe |
| labiodental |
Unterlippe |
obere Schneidezähne |
| alveolar |
dental alveolar |
Zungenspitze |
ober Schneidezähne |
| Zungenspitze oder Zungenblatt |
Zahndamm, Alveolen |
| velar |
palatal |
vorderer Zungenrücken |
harter Gaumen, Palatum |
| velar |
mittlerer Zungenrücken |
weicher Gaumen, Velum |
| uvular |
hinterer Zungenrücken |
Zäpfchen, Uvulum |
| -- |
pharyngeal |
Zungenwurzel |
hintere Rachenwand |
| glottal |
Stimmlippe |
Stimmlippe |
[0052] Daher wird für jeden Vokal nur ein Mikrosegment pro Artikulationsstelle des vorherigen
Konsonanten (= 1. Hälfte des Vokals) und ein Mikrosegment pro Artikulationsstelle
des folgenden Konsonanten (= 2. Hälfte des Vokals) gebraucht. Es können z. B., für
die Silben

jeweils dieselben zwei Vokalhälften verwendet werden, weil der Anfangskonsonant jeweils
mit dem Verschluß der beiden Lippen (bilabial) und der Endkonsonant durch Anhebung
der Zungenspitze zum Zahndamm (= alveolar) gebildet werden. Neben der labialen und
der alveolaren gibt es noch die velare Artikulationsstelle. Eine weitere Generalisierung
wird durch die Gruppierung der postalveolaren Konsonanten /S/ ( wie in Ma
sche) und /Z/ (wie in Ga
ge) zu den alveolaren und der labiodentalen Konsonaten /f/ und /v/ mit den labialen
erreicht, so daß, wie oben angegeben, auch /fa(tS)/, /va(tS)/, /fa(dZ)/ und /va(dZ)/
dieselben Vokalsegmente enthalten können. Für die Mikrosegmente der o.g. Beispielsilben
gilt also: p(a) = b(a) = m(a)a = (pf)(a) = f(a) = v(a) und
(a)t = (a)d = (a)s = (a)z = (a)(ts) = (a)(tS) = (a)(dZ)
= (a)n = (a)1.
[0053] Neben den eben beschriebenen Vokalhälften für den Vokal "a" gehören auch die nachfolgenden
Mikrosegmente zur Kategorie der Vokalhälften und Halbvokalhälften:
- die ersten Hälften der Monophthonge
/i:, I, e:, E, E:, a(:), O, o:, U, u:, y:, Y, 2:, 9, @, 6/, die nach einem labial,
alveolar bzw. velar gebildeten Laut auftreten;
- die zweiten Hälften der Monophthonge
/I:, I, e:, E, E:, a(:), O, o:, U, u:, y:, Y, 2:, 9, @, 6/ vor einem labialen, alveolaren
oder velaren Laut;
- Erste und zweite Hälften der Konsonanten /h/ und /j/ aus den Kontexten:
- nicht-offener ungerundeter Vordervokal /i:, I, e, E, E:/,
- nicht-offener gerunder Vordervorkal /y:, Y, 2:, 9/,
- offener ungerundeter zentrale Vokal /a(:), @; 6/,
- nicht-offener gerunderter Hinterzungenvokal /O, o:, U, u:/.
[0054] Darüber hinaus sind Segmente für quasi-stationäre Vokalteile zur Nachbildung der
Mitte einer langen Vokalrealisierung erforderlich. Diese Mikrosegmente werden in folgenden
Positionen eingesetzt:
- wortinitial,
- nach den Halbvokalsegmenten /h/, /j/ sowie um /?/,
- zur Enddehnung, wenn auf einer Endsilbe komplexe Tonbewegungen realisiert werden müssen,
- zwischen nicht diphthongischen Vokal-Vokal-Folgen, sowie
- in Diphthongen als Start- und Zielpositionen.
[0055] Durch die mehrfache Verwendung der Mikrosegmente in unterschiedlichen lautlichen
Kontexten wird der bei der Diphonsynthese entstehende Multiplikationseffekt der Lautkomibinatorik
beträchtlich reduziert, ohne die Dynamik der Artikulation zu beeinträchtigen.
[0056] Bei der erfindungsgemäß dargestellten Verallgemeinerung in den Sprachbausteinen ist
es theoretisch möglich, für die deutsche Sprache mit einer Anzahl von 266 Mikrosegmenten
auszukommen, nämlich 16 Vokale zu 3 Artikulationsstellen, stationär, zu Ende; 6 Plosive
zu 3 Konsonatengruppen nach Artikulationsstelle und zu 4 Vokalgruppen; /h/, /j/ und
/?/ zu differenzierteren Vokalgruppen. Zur Verbesserung der Klangqualität der synthetisch
gebildeten Sprache sollte die Anzahl der benötigten Mikrosegmente für die deutsche
Sprache je nach Lautdifferenzierung zwischen 320 und 350 liegen. Dies entspricht aufgrund
der zeitlich relativ kurzen Mikrosegmente einem Speicherplatzbedarf von ca. 700 kB
bei 8 bit Auflösung und 22 kHz Abtastrate. Das liefert gegenüber der bekannten Diphonsynthese
eine Reduktion um den Faktor 12 bis 32.
[0057] Zur weiteren Klangverbesserung der synthetisch gebildeten Sprache ist es vorgesehen,
in den einzelnen Mikrosegmenten Markierungen anzubringen, die eine Kürzung, Dehnung
oder Frequenzveränderung am Mikrosegment im Zeitbereich erlauben. Die Markierungen
werden an den Nulldurchgängen mit positiver Steigung des Zeitsignals der Mikrosegmente
gesetzt. Insgesamt werden fünf Kürzungsstufen ausgeführt, so daß das Mikrosegment
zusammen mit der ungekürzten Wiedergabe sechs verschiedene Stufen der Abspieldauer
hat. Bei den Kürzungen wird so verfahren, daß bei einem Vokalsegment, das von einer
Artikulationsstelle zur Mitte des Vokals verläuft die Start-, und bei einem Vokalsegment,
das von der Mitte des Vokals zur folgenden Artikulationsstelle verläuft, die Zielposition
(= Artikulationsstelle des folgenden Konsonanten) immer erreicht wird, während die
Bewegung zur oder von der "Vokalmitte" verkürzt wird. Durch dieses Verfahren wird
eine weitere generalisierte Verwendung der Mikrosegmente ermöglicht. Dieselben Signalbausteine
liefern die Grundelemente für lange und kurze Laute sowohl in betonten als auch in
unbetonten Silben. Die Reduktionen in satzmäßig nicht akzentuierten Wörtern werden
ebenfalls von denselben in satzakzentuierter Position aufgenommenen Mikrosegmenten
abgeleitet.
[0058] Darüber hinaus kann die Intonation sprachlicher Äußerungen durch eine Grundfrequenzveränderung
der periodischen Teile von Vokalen und Sonoranten erzeugt werden. Dies wird durch
eine Grundfrequenzmanipulation im Zeitbereich am Mikrosegment durchgeführt, wobei
kaum klangliche Einbußen entstehen. Der spektral informationswichtige Teil (1. Teil
= Phase der geschlossenen Glottis) jeder Stimmperiode und der unwichtigere zweite
Teil (= Phase der offenen Glottis) werden getrennt behandelt. Die erste Stimmperiode
und die darin enthaltene, konstant zu haltende "geschlossene Phase" (1. Teil der Periode)
wird markiert. Aufgrund der monotonen Sprechweise lassen sich alle anderen Perioden
im Mikrosegment automatisch finden und damit die geschlossenen Phasen definieren.
Bei der Signalausgabe werden die spektral unkritischen "offenen Phasen" zur Frequenzerhöhung
proportional kürzer ausgegeben, was eine Verkürzung der Gesamtperioden bewirkt. Bei
Frequenzsenknung wird die offene Phase proportional zum Senkungsgrad verlängert. Frequenzerhöhung
und -senkung werden über ein Mikrosegment uniform durchgeführt. Die dadurch in Stufen
verlaufende Intonation wird durch die natürliche "auditive Integration" des hörenden
Menschen weitgehend geglättet. Prinzipiell ist es jedoch möglich, die Frequenzen auch
innerhalb eines Mikrosegments zu verändern, bis hin zur Manipulation einzelner Perioden.
[0059] Nachfolgend wird die Aufnahme und Segmentation von Mikrosegmenten sowie die Sprachwiedergabe
beschrieben.
[0060] Einzelwörter, die die entsprechenden Lautkombinationen beinhalten, werden von einer
Person monoton und betont gesprochen. Diese real gesprochenen Äußerungen werden aufgenommen
und digitalisiert. Aus diesen digitaliierten Sprachäußerungen werden die Mikrosegmente
herausgeschnitten. Die Schnittpunkte der konsonantischen Segmente werden so gewählt,
daß der Einfluß benachbarter Laute an den Mikrosegmentgrenzen minimiert wird und der
Übergang zum nächsten Laut nicht mehr exakt wahrnehmbar ist. Die Vokalhälften werden
aus der Umgebung von stimmhaften Plosiven geschnitten, wobei geräuschhafte Teile der
Verschlußlösung eliminiert werden. Die quasi-stationären Vokalteile werden aus der
Mitte von langen Lauten herausgetrennt.
[0061] Alle Segmente werden so aus dem digitalen Signal der sie enthaltenden Äußerung geschnitten,
daß sie mit dem ersten Abtastwert nach dem ersten positiven Nulldurchgang beginnen
und mit dem letzten Abtastwert vor dem letzten positiven Nulldurchgang enden. Damit
werden Knackgeräusche vermieden.
[0062] Das digitale Signal hat zur Begrenzung des Speicherbedarfs beispielsweise eine Bandbreite
von 8 bit und eine Abtastrate von 22 kHz.
[0063] Die so herausgetrennten Mikrosegmente werden entsprechend des Lautes und des Kontextes
adressiert und in einem Speicher abgelegt.
[0064] Ein als Sprache auszugebender Text wird mit der entprechenden Adressenreihenfolge
dem System zugeführt. Die Lautreihenfolge bestimmt dabei die Auswahl der Adressen.
Entsprechend dieser Adressenreihenfolge werden die Mikrosegmente aus dem Speicher
gelesen und aneinandergereiht. Diese digitale Zeitreihe wird in einem digital/analog-Wandler,
beispielsweise in einer sogenannten Soundblaster-Karte, in ein analoges Signal umgewandelt,
das über Sprachausgabevorrichtungen, beispielsweise einen Lautsprecher oder Kopfhörer,
ausgegeben werden kann.
[0065] Das erfindungsgemäße Sprachsynthesesystem kann auf einem gewöhnlichen PC realisiert
werden, wobei ein Arbeitsspeicher von etwa 4 MB ausreicht. Der mit dem System realisierbare
Wortschatz ist praktisch unbegrenzt. Die Sprache ist dabei gut verständlich, wobei
auch der Rechenaufwand für Abwandlungen der Mikrosegmente, beispielsweise Kürzungen
oder Grundfrequenzveränderungen, gering ist, da das Sprachsignal im Zeitbereich bearbeitet
wird.
1. Digitales Sprachsyntheseverfahren, bei dem vorab Äußerungen einer Sprache aufgenommen,
die aufgenommenen Äußerungen in Sprachsegmente geteilt und die Segmente bestimmten
Phonemen zuordbar abgespeichert werden, wobei dann jeweils ein als Sprache auszugebender
Text in eine Phonemkette überführt wird und die abgespeicherten Segmente in einer
durch diese Phonemkette definierten Reihenfolge aufeinanderfolgend ausgegeben werden,
wobei eine Analyse an dem als Sprache auszugebenden Text erfolgt und damit der Phonemkette
ergänzende Informationen liefert, die das Zeitreihensignal der für die Sprachausgabe
aneinanderzureihenden Sprachsegmente beeinflussen,
dadurch gekennzeichnet, daß Mikrosegmente als Sprachsegmente verwendet werden, die bestehen aus:
- Segmenten für Vokalhälften und Halbvokalhälften, wobei Vokale, die zwischen Konsonanten
stehen, in zwei Mikrosegmente, eine erste Vokalhälfte beginnend kurz hinter dem Vokalanfang
bis zur Mitte des Vokals und eine zweite Vokalhälfte von der Vokalmitte bis kurz vor
das Vokalende, geteilt sind,
- Segmenten für quasi stationäre Vokalteile, die aus der Mitte eines Vokals herausgeschnitten
werden,
- konsonantischen Segmenten, die kurz hinter der vorderen Lautgrenze beginnen und
kurz vor der hinteren Lautgrenze enden, und
- Segmenten für Vokal-Vokal-Folgen, die aus der Mitte eines Vokal-Vokalübergangs herausgeschnitten
werden.
2. Sprachsyntheseverfahren nach Anspruch 1, dadurch gekennzeichnet, daß die Segmente für Vokalhälften und Halbvokalhälften in einer Konsonant-Vokal-
oder Vokal-Konsonant-Folge für jede der Artikulationsstellen des benachbarten Konsonanten,
nämlich labial, alveolar oder velar, gleich sind.
3. Sprachsyntheseverfahren nach Anspruch 1 oder 2, dadurch gekennzeichnet, daß die Segmente für quasi stationäre Vokalteile vorgesehen sind für Vokale an Wortanfängen
und Vokal-Vokal-Folgen sowie für die Laute /h/, /j/ und Glottalverschlüsse.
4. Sprachsyntheseverfahren nach Anspruch 1, 2 oder 3, dadurch gekennzeichnet, daß die konsonantischen Segmente für Plosive in zwei Mikrosegmente geteilt sind,
ein erstes Segment, das die Verschlußphase umfaßt, und ein zweites Segment, das die
Lösungsphase umfaßt.
5. Sprachsyntheseverfahren nach Anspruch 4, dadurch gekennzeichnet, daß die Verschlußphase für alle Plosive durch Aneinanderreihen von digitalen Nullen
erreicht wird.
6. Sprachsyntheseverfahren nach Anspruch 4 oder 5,
dadurch gekennzeichnet, daß die Lösungsphase der Plosive nach dem im Kontext folgenden Laut wie folgt differenziert
werden; Lösung zu Vokalen:
- vorderen, ungerundeten Vokalen;
- vorderen, gerundeten Vokalen;
- tiefen bzw. zentralisierten Vokalen und
- hinteren, gerundeten Vokalen sowie
Lösung zu Konsonanten gemäß der globalen Artikulationsstelle:
- labial
- alveolar und
- velar.
7. Sprachsyntheseverfahren nach Anspruch 1, 2, 3, 4, 5 oder 6, dadurch gekennzeichnet, daß mit der Analyse Sprachpausen erkannt werden und die Phonemkette an diesen Stellen
mit Pausesymbolen zu einer Symbolkette ergänzt wird, wobei bei der Aneinanderreihung
der Mikrosegmente an den Pausesymbolen digitale Nullen im Zeitreihensignal eingefügt
werden.
8. Sprachsyntheseverfahren nach Anspruch 1, 2, 3, 4, 5, 6 oder 7, dadurch gekennzeichnet, daß mit der Analyse Phrasengrenzen erkannt werden und die Phonemkette an diesen Stellen
mit Dehnungssymbolen zu einer Symbolkette ergänzt wird, wobei bei der Aneinanderreihung
der Mikrosegmente an den Markierungen eine Abspieldauerdehnung im Zeitbereich erfolgt.
9. Sprachsyntheseverfahren nach Anspruch 1, 2, 3, 4, 5, 6, 7 oder 8, dadurch gekennzeichnet, daß mit der Analyse Betonungen erkannt werden und die Phonemkette an diesen Stellen
mit Betonungssymbolen für verschiedene Betonungswerte zu einer Symbolkette ergänzt
wird, wobei bei der Aneinanderreihung der Mikrosegmente entsprechend dem Betonungssymbol
das Zeitsignal ungekürzt oder gekürzt wiedergegeben wird.
10. Sprachsyntheseverfahren nach Anspruch 8 oder 9, dadurch gekennzeichnet, daß 5 Kürzungsstufen durch Markierungen am Zeitreihensignal der Mikrosegmente vorgesehen
sind.
11. Sprachsyntheseverfahren nach Anspruch 8 und 10, dadurch gekennzeichnet, daß die Abspieldauerdehnung für phrasenfinale Silben bei geschlossenen Silben ab
dem zweiten Mikrosegment des Vokals durch Erhöhen der Kürzungsstufe zur längeren Abspieldauer
um jeweils eine Stufe erfolgt und bei offenen Silben für das zweite Mikrosegment des
Vokals durch Erhöhen der Kürzungsstufe zur längeren Abspieldauer um zwei Stufen erfolgt.
12. Sprachsyntheseverfahren nach einem der vorangehenden Ansprüche, dadurch gekennzeichnet, daß mit der Analyse Intonationen zugeordnet werden und die Phonemkette an diesen
Stellen mit Intonationssymbolen zu einer Symbolkette ergänzt wird, wobei bei der Aneinanderreihung
der Mikrosegmente an den Intonationssymbolen eine Grundfrequenzveränderung bestimmter
Teile der Perioden von Mikrosegmenten im Zeitbereich durchgeführt wird.
13. Sprachsyntheseverfahren nach Anspruch 12, dadurch gekennzeichnet, daß zur Senkung der Grundfrequenz bestimmte Abtastwerte ergänzt oder zur Erhöhung
der Grundfrequenz Abtastwerte in der offenen Phase der Schwingungsperiode der Stimmlippen
übersprungen werden.
14. Sprachsyntheseverfahren nach Anspruch 8, 9, 10, 11, 12 oder 13, dadurch gekennzeichnet, daß die Symbolkette unter Berücksichtigung der Phonemreihenfolge und der Symbole
in eine die Reihenfolge der Mikrosegmente und deren Abwandlungen repräsentierende
Mikrosegmentkette überführt wird.
15. Sprachsyntheseverfahren nach einem der vorangehenden Ansprüche, dadurch gekennzeichnet, daß die Mikrosegmente mit dem ersten Abtastwert nach dem ersten positiven Nulldurchgang
beginnen und mit dem letzten Abtastwert vor dem letzten positiven Nulldurchgang enden.
1. A digital speech-synthesis process , in which utterances of a language are recorded
first, the recorded utterances are divided in speech segments, and the segments are
stored allocated to defined phonemes, a text to be output as speech then being converted
into a phoneme string and the stored segments are successively output in a sequence
defined by said phoneme string, and an analysis of the text to be output as speech
is carried out and thus provided information supplementing the phoneme string, such
information modifying the series of statistical values signal of the speech segments
to be concatenated for the speech output, characterized in that microsegments are
used as speech segments, such microsegments consisting of:
- Segments for vowel halves and semi-vowel halves, vowels between consonants being
split into two microsegments, a first vowel half beginning shortly after the beginning
of the vowel and extending up to the middle of the vowel, and a second vowel half
extending from the middle of the vowel up to just before the end of the vowel;
- Segments for quasi-stationary vowel parts, such segments being cut from the middle
of a vowel;
- Consonantal segments beginning shortly after the front sound boundary and ending
shortly before the rear sound boundary; and
- Segments for vowel-vowel sequences, which are cut from the middle of a vowel-vowel
transition.
2. The speech-synthesis process according to claim 1, characterized in that the segments
for vowel halves and semi-vowel halves in a consonant-vowel or vowel-consonant sequence
are identical for each of the articulation places of the adjacent consonant, namely
labial, alveolar or velar.
3. The speech-synthesis process according to claim 1 or 2, characterized in that the
segments for quasi-stationary vowel parts are provided for vowels at the beginnings
of words and for vowel-vowel sequences as well as for the sounds /h/, /j/ and glottal
stops.
4. The speech-synthesis process according to claim 1, 2 or 3, characterized in that the
consonantal segments for plosives are divided in two microsegments: a first segment
comprising the closure phase, and a second segment comprising the release phase.
5. The speech-synthesis process according to claim 4, characterized in that the closure
phase is reached for all plosives by lining up digital zeros.
6. The speech-synthesis process according to claim 4 or 5, characterized in that the
release phases of the plosives are differentiated after the sound following in the
context as follows:
Release into vowels:
- Front, unrounded vowels;
- front, rounded vowels;
- low or centralized vowels; and
- back, rounded vowels; as well as
release into consonants according to the global articulation place:
- labial;
- alveolar; and
- velar.
7. The speech-synthesis process according to claim 1, 2, 3, 4, 5 or 6, characterized
in that the analysis detects speech pauses and the phoneme string is extended to a
symbol string by adding pause symbols at speech pauses, digital zeros being inserted
in the series of statistical values signal on the pause symbols when the microsegments
are concatenated.
8. The speech-synthesis process according to claim 1, 2, 3, 4, 5, 6, or 7, characterized
in that the analysis detects phrase boundaries and that the phoneme string is extended
in said places with lengthening symbols to form a symbol string, a lengthening of
the playback duration taking place on the markings within the time domain when the
microsegments are concatenated.
9. The speech-synthesis process according to claim 1,2, 3, 4, 5, 6, 7, or 8, characterized
in that the analysis detects stresses and that the phoneme string is extended in said
places with stress symbols for different stress values to form a symbol string, the
series of statistical values signal being reproduced unshortened or shortened according
to the stress symbol when the microsegments are concatenated.
10. The speech-synthesis process according to claim 8 or 9, characterized in that provision
is made for 5 levels of shortening by markings on the series of statistical values
signal of the microsegments.
11. The speech-synthesis process according to claims 8 and 10, characterized in that the
lengthening of the playback duration for phrase-final syllables takes place with closed
syllables starting with the second microsegment of the vowel by increasing the shortening
level for a longer playback duration in each case by one step, and with open syllables
for the second microsegment of the vowel by increasing the shortening level for a
longer playback duration by two steps.
12. The speech-synthesis process according to any one of the preceding claims, characterized
in that the analysis allocates intonations and that the phoneme string is extended
in said places with intonation symbols to form a symbol string, a fundamental frequency
change of certain components of the periods being carried out on the intonation symbols
in the time domain when the microsegments are concatenated.
13. The speech-synthesis process according to claim 12, characterized in that for reducing
the fundamental frequency, defined sample values are added, or for increasing the
fundamental frequency sample values are skipped in the open phase of the oscillation
period of the vocal cords.
14. The speech-synthesis process according to claim 8,9, 10 11, 12, or 13, characterized
in that the symbol string is converted into a microsegment string representing the
sequence of microsegments and their modifications, taking into account the sequence
phonemes and symbols.
15. The speech-synthesis process according to any one of the preceding claims, characterized
in that the microsegments start with the first sample value after the first positive
zero crossing and end with the last sample value before the last positive zero crossing.
1. Procédé de synthèse vocale numérique selon lequel on enregistre préalablement les
expressions d'une langue, on divise les expressions enregistrées en segments de parole
et on mémorise les phonèmes associés aux segments, puis, on transfère respectivement
un texte à émettre sous forme vocale à une chaîne de phonèmes et on émet les segments
enregistrés, successivement dans l'ordre défini par cette chaîne de phonèmes, on analyse
le texte à émettre sous forme vocale et on fournit ainsi les informations en complétant
la chaîne de phonèmes, qui influencent le signal série de temps des segments de voix
juxtaposés pour l'expression vocale,
caractérisé en ce que
les microsegments sont utilisés comme des segments vocaux et se composent :
- de segments pour des moitiés de voyelle et des moitiés de demi-voyelle, les voyelles
situées entre deux consonnes étant divisées en deux microsegments, une première moitié
de voyelle qui commence juste derrière le début de la voyelle et s'étend jusqu'au
milieu de la voyelle, et une seconde moitié de voyelle partant du milieu de la voyelle
juste avant la fin de la voyelle,
- de segments pour les parties de voyelle quasi stationnaires, découpés du milieu
d'une voyelle,
- des segments de consonne qui commencent juste derrière la limite vocale précédente
et se terminent juste avant la limite vocale arrière, et
- de segments pour les suites voyelle-voyelle, découpés du milieu d'une transition
voyelle-voyelle.
2. Procédé de synthèse vocale selon la revendication 1,
caractérisé en ce que
les segments pour les moitiés de voyelle et les moitiés de demi-voyelle dans une suite
consonne-voyelle ou voyelle-consonne pour chacun des points d'articulation des consonnes
voisines, à savoir labiales alvéolaires ou vélaires, sont égaux.
3. Procédé de synthèse selon l'une des revendications 1 ou 2,
caractérisé en ce que
les segments pour les parties de voyelle quasi stationnaires sont prévus pour les
voyelles au début des mots ou pour les suites voyelle/voyelle ainsi que pour les sons
/h/, /j/ et les fermetures de glotte.
4. Procédé de synthèse selon l'une des revendications 1, 2 ou 3,
caractérisé en ce que
les segments de consonne pour les plosives sont divisés en deux microsegments, un
premier segment qui comprend la phase d'occlusion et un second segment qui comprend
la phase de libération.
5. Procédé de synthèse selon la revendication 4,
caractérisé en ce que
la phase d'occlusion s'obtient pour toutes les plosives par la juxtaposition de zéros
numériques.
6. Procédé de synthèse selon l'une des revendications 4 ou 5,
caractérisé en ce que
la phase de libération de la plosive, après le son qui suit dans le contexte, est
différenciée de la manière suivante : résolution en voyelles :
- voyelles avant non arrondies,
- voyelles avant arrondies,
- voyelles basses et centralisées, et
- voyelles arrière et arrondies ainsi que
résolution pour les consonnes selon les points d'articulation globaux :
- labial
- alvéolaire
- vélaire.
7. Procédé de synthèse vocale selon l'une des revendications 1, 2, 3, 4, 5, 6,
caractérisé en ce qu'
on reconnaît par l'analyse des pauses vocales et la chaîne des phonèmes, les endroits
avec des symboles de pause qui sont complétés par une chaîne de symboles, et en juxtaposant
les microsegments, au niveau des symboles de pause, on insère des zéros numériques
dans le signal de la série de temps.
8. Procédé de synthèse vocale selon l'une des revendications 1, 2, 3, 4, 5, 6, 7,
caractérisé en ce que
par l'analyse, on décèle des limites de phrases et on complète la chaîne des phonèmes
à cet endroit avec des symboles d'extension pour arriver à une chaîne symbolique et
en juxtaposant les microsegments, on effectue une extension de la durée de lecture
dans la plage du temps au niveau des marquages.
9. Procédé de synthèse vocale selon l'une des revendications 1, 2, 3, 4, 5, 6, 7, 8,
caractérisé en ce que
l'analyse permet de déceler les accentuations et de compléter la chaîne des phonèmes
à ces endroits avec des symboles d'accentuation pour différentes valeurs d'accentuation
afin d'aboutir à une chaîne de symboles, et la juxtaposition des microsegments selon
le symbole d'accentuation reproduit le signal de temps de manière raccourcie ou non-raccourcie.
10. Procédé de synthèse vocale selon la revendication 8 ou 9,
caractérisé par
5 échelons de raccourcissement par marquage dans le signal de la série temps des microsegments.
11. Procédé de synthèse vocale selon les revendications 8 et 10,
caractérisé en ce que
- l'extension de la durée d'exécution pour les syllabes en fin de phrase avec des
syllabes fermées, se fait à partir chaque fois du second microsegment de la voyelle
par augmentation de l'échelon de raccourcissement vers la durée d'exécution plus longue,
et
- autour de chaque échelon et pour des syllabes ouvertes pour le second microsegment,
on a la voyelle par l'augmentation de l'échelon de raccourcissement pour une durée
de lecture longue, qui se fait selon deux échelons.
12. Procédé de synthèse vocale selon l'une des revendications précédentes,
caractérisé en ce que
par l'analyse, on attribue des intonations et on complète la chaîne des phonèmes à
ces endroits avec des symboles d'intonation pour former une chaîne de symboles, et,
en juxtaposant les microsegments sur les symboles d'intonation, on arrive à une variation
de la fréquence de base de certaines parties des périodes de microsegments dans la
plage de temps.
13. Procédé de synthèse vocale selon la revendication 12,
caractérisé en ce que
pour abaisser la fréquence fondamentale, on complète certaines valeurs de détection
ou pour augmenter la fréquence fondamentale, on saute certaines valeurs de détection
dans la phase ouverte de la période d'oscillation des lèvres vocales.
14. Procédé de synthèse vocale selon les revendications 8, 9, 10, 11, 12, 13,
caractérisé en ce que
la chaîne des symboles est transférée en tenant compte de la série des phonèmes et
des symboles d'une chaîne de microsegments représentant l'ordre des microsegments
et son déroulement.
15. Procédé de synthèse vocale selon l'une des revendications précédentes,
caractérisé en ce que
les microsegments commencent avec la première valeur de détection après le premier
passage par zéro positif, et se terminent avec la dernière valeur de détection avant
le dernière passage par zéro positif.