<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE ep-patent-document PUBLIC "-//EPO//EP PATENT DOCUMENT 1.4//EN" "ep-patent-document-v1-4.dtd">
<ep-patent-document id="EP08784249B1" file="EP08784249NWB1.xml" lang="de" country="EP" doc-number="2158588" kind="B1" date-publ="20101013" status="n" dtd-version="ep-patent-document-v1-4">
<SDOBI lang="de"><B000><eptags><B001EP>ATBECHDEDKESFRGBGRITLILUNLSEMCPTIESILTLVFIRO..CY..TRBGCZEEHUPLSK..HRIS..MTNO........................</B001EP><B003EP>*</B003EP><B005EP>J</B005EP><B007EP>DIM360 Ver 2.15 (14 Jul 2008) -  2100000/0</B007EP></eptags></B000><B100><B110>2158588</B110><B120><B121>EUROPÄISCHE PATENTSCHRIFT</B121></B120><B130>B1</B130><B140><date>20101013</date></B140><B190>EP</B190></B100><B200><B210>08784249.8</B210><B220><date>20080625</date></B220><B240><B241><date>20091210</date></B241></B240><B250>de</B250><B251EP>de</B251EP><B260>de</B260></B200><B300><B310>102007030209</B310><B320><date>20070627</date></B320><B330><ctry>DE</ctry></B330></B300><B400><B405><date>20101013</date><bnum>201041</bnum></B405><B430><date>20100303</date><bnum>201009</bnum></B430><B450><date>20101013</date><bnum>201041</bnum></B450><B452EP><date>20100507</date></B452EP></B400><B500><B510EP><classification-ipcr sequence="1"><text>G10L  21/00        20060101AFI20090119BHEP        </text></classification-ipcr><classification-ipcr sequence="2"><text>G06T   5/00        20060101ALI20090119BHEP        </text></classification-ipcr></B510EP><B540><B541>de</B541><B542>SPEKTRALGLÄTTUNGSVERFAHREN VON VERRAUSCHTEN SIGNALEN</B542><B541>en</B541><B542>SPECTRAL SMOOTHING METHOD FOR NOISY SIGNALS</B542><B541>fr</B541><B542>PROCÉDÉ DE FILTRAGE SPECTRAL DE SIGNAUX PARASITÉS</B542></B540><B560><B561><text>WO-A-01/73761</text></B561><B561><text>US-A- 5 365 592</text></B561><B562><text>HARALD GUSTAFSSON ET AL: "Spectral Subtraction Using Reduced Delay Convolution and Adaptive Averaging" IEEE TRANSACTIONS ON SPEECH AND AUDIO PROCESSING, IEEE SERVICE CENTER, NEW YORK, NY, US, Bd. 9, Nr. 8, 1. November 2001 (2001-11-01), XP011054141 ISSN: 1063-6676 in der Anmeldung erwähnt</text></B562><B562><text>BREITHAUPT C ET AL: "Cepstral Smoothing of Spectral Filter Gains for Speech Enhancement Without Musical Noise" IEEE SIGNAL PROCESSING LETTERS, IEEE SERVICE CENTER, PISCATAWAY, NJ, US, Bd. 14, Nr. 12, 1. Dezember 2007 (2007-12-01), Seiten 1036-1039, XP011194896 ISSN: 1070-9908</text></B562></B560></B500><B700><B720><B721><snm>MARTIN, Rainer</snm><adr><str>Am Pappelbusch 14A</str><city>44803 Bochum</city><ctry>DE</ctry></adr></B721><B721><snm>GERKMANN, Timo</snm><adr><str>Emscherstrasse 8</str><city>44791 Bochum</city><ctry>DE</ctry></adr></B721><B721><snm>BREITHAUPT, Colin</snm><adr><str>Karolinenstrasse 6</str><city>80538 München</city><ctry>DE</ctry></adr></B721></B720><B730><B731><snm>Ruhr-Universität Bochum</snm><iid>100211358</iid><irf>2008P14988WE</irf><adr><str>Universitätsstrasse 150</str><city>44801 Bochum</city><ctry>DE</ctry></adr></B731><B731><snm>Siemens Audiologische Technik GmbH</snm><iid>100220890</iid><irf>2008P14988WE</irf><adr><str>Gebbertstrasse 125</str><city>91058 Erlangen</city><ctry>DE</ctry></adr></B731></B730><B740><B741><snm>Maier, Daniel Oliver</snm><sfx>et al</sfx><iid>100997719</iid><adr><str>Siemens AG 
Postfach 22 16 34</str><city>80506 München</city><ctry>DE</ctry></adr></B741></B740></B700><B800><B840><ctry>AT</ctry><ctry>BE</ctry><ctry>BG</ctry><ctry>CH</ctry><ctry>CY</ctry><ctry>CZ</ctry><ctry>DE</ctry><ctry>DK</ctry><ctry>EE</ctry><ctry>ES</ctry><ctry>FI</ctry><ctry>FR</ctry><ctry>GB</ctry><ctry>GR</ctry><ctry>HR</ctry><ctry>HU</ctry><ctry>IE</ctry><ctry>IS</ctry><ctry>IT</ctry><ctry>LI</ctry><ctry>LT</ctry><ctry>LU</ctry><ctry>LV</ctry><ctry>MC</ctry><ctry>MT</ctry><ctry>NL</ctry><ctry>NO</ctry><ctry>PL</ctry><ctry>PT</ctry><ctry>RO</ctry><ctry>SE</ctry><ctry>SI</ctry><ctry>SK</ctry><ctry>TR</ctry></B840><B860><B861><dnum><anum>DE2008001047</anum></dnum><date>20080625</date></B861><B862>de</B862></B860><B870><B871><dnum><pnum>WO2009000255</pnum></dnum><date>20081231</date><bnum>200901</bnum></B871></B870><B880><date>20100303</date><bnum>201009</bnum></B880></B800></SDOBI><!-- EPO <DP n="1"> -->
<description id="desc" lang="de">
<p id="p0001" num="0001">Die Erfindung betrifft ein Glättungsverfahren zur Unterdrückung von fluktuierenden Artefakten bei der Störgeräuschreduktion.</p>
<p id="p0002" num="0002">In der digitalen Sprachsignalübertragung ist die Störgeräuschunterdrückung ein wichtiger Aspekt. Die mit einem Mikrofon erfassten und anschließend digitalisierten Audiosignale enthalten neben dem Nutzsignal (<figref idref="f0001">Figur 1</figref>) noch Umgebungsgeräusche, die dem Nutzsignal überlagert sind (<figref idref="f0001">Figur 2</figref>). So werden z.B. bei Freisprechanlagen in Fahrzeugen neben den Sprachsignalen noch Motoren- und Windgeräusche erfasst, bei Hörhilfen sind es ständig wechselnde Umgebungsgeräusche wie Verkehrsgeräusche oder im Hintergrund sprechende Personen wie etwa in einem Restaurant. Dadurch ist ein Verstehen des Sprachsignals nur mit erhöhter Anstrengung möglich. Die Störgeräuschreduktion zielt dementsprechend auf eine Erleichterung des<!-- EPO <DP n="2"> --> Sprachverstehens ab. Daher darf eine Verringerung des Störgeräuschs auch das Sprachsignal nicht hörbar verzerren.</p>
<p id="p0003" num="0003">Für die Störgeräuschreduktion ist die Spektraldarstellung eine günstige Repräsentation des Signals. Hierbei wird das Signal in Frequenzen aufgeschlüsselt dargestellt. Eine praktische Realisierung der Spektraldarstellung sind Kurzzeitspektren, die durch eine Zerteilung des Signals in kurze Rahmen entstehen (<figref idref="f0002">Figur 3</figref>), die getrennt voneinander einer Spektraltransformation unterzogen werden (<figref idref="f0002">Figur 4</figref>). Ein Signalrahmen kann dabei bei einer Abtastrate von <i>f<sub>s</sub></i> = 8000 Hz beispielsweise M = 256 aufeinanderfolgende digitale Signalabtastwerte umfassen, was dann einer Dauer von 32 ms entspricht. Ein transformierter Rahmen besteht dann aus M sogenannten Frequenzbins. Der quadrierte Amplitudenwert eines Frequenzbins korrespondiert zur Energie, die das Signal in dem schmalen Frequenzausschnitt von ca. 31 Hz Bandbreite enthält, der vom jeweiligen Frequenzbin repräsentiert wird. Aufgrund der Symmetrieeigenschaften der Spektraltransformation sind von den M Frequenzbins nur M/2+1, also im vorangegangenen Beispiel 129 Bins relevant für die Signaldarstellung. Mit 129 relevanten Bins und 31 Hz Bandbreite pro Bin wird insgesamt ein spektrales Band von 0 Hz bis ca. 4000 Hz abgedeckt. Dies reicht aus, um viele Sprachlaute mit hinreichender spektraler Auflösung zu beschreiben. Eine andere gängige Bandbreite ist 8000 Hz, die durch eine höhere Abtastrate und somit mehr Frequenzbins bei gleicher Rahmendauer erreicht werden kann. In einem Kurzzeitspektrum sind die Frequenzbins mit µ indiziert. Der Index für Rahmen ist λ. Die Amplituden des Kurzzeitspektrums eines Rahmens λ werden hier allgemein als spektrale Größe G<sub>µ</sub>(λ) notiert. Ein vollständiges Kurzzeitspektrum bestehend aus den M Frequenzbins eines Rahmens ergibt sich aus den Amplituden G<sub>µ</sub> (λ) der Indizes µ = 0 bis µ = M-1, also µ = 0 ... M - 1. Für reelle Zeitsignale erfüllen Kurzzeitspektren die Symmetriebedingung G<sub>µ</sub> (λ) = G<sub>M-µ</sub> (λ). Eine gängige Form der Präsentation der Kurzzeitspektren sind sogenannte Spektrogramme, die durch Aneinanderreihung zeitlich aufeinanderfolgender Kurzzeitspektren gebildet werden (vgl. beispielhaft <figref idref="f0004 f0005">Figuren 6 bis 9</figref>).<!-- EPO <DP n="3"> --></p>
<p id="p0004" num="0004">Vorteil der Spektraldarstellung ist, dass die wesentliche Sprachenergie in einer relativ geringen Anzahl von Frequenzbins konzentriert vorliegt (<figref idref="f0002">Figuren 4</figref> und <figref idref="f0004">6</figref>), während im Zeitsignal alle digitalen Abtastwerte gleich relevant sind (<figref idref="f0002">Figur 3</figref>). Die Signalenergie der Störung ist in den meisten Fällen auf eine größere Anzahl von Frequenzbins verteilt. Da die Frequenzbins unterschiedlich viel Sprachenergie enthalten, ist es möglich, das Rauschen in jenen Bins zu unterdrücken, die nur wenig Sprachenergie enthalten. Je schmalbandiger die Frequenzbins sind, desto besser gelingt diese Trennung.</p>
<p id="p0005" num="0005">Für die Störgeräuschreduktion wird eine spektrale Gewichtungsfunktion geschätzt, die nach unterschiedlichen Optimierungskriterien berechnet werden kann. Sie ergibt niedrige Werte oder Null in Frequenzbins, in denen hauptsächlich Störung vorliegt, und Werte nahe oder gleich Eins für Bins, in denen Sprachenergie dominiert (<figref idref="f0003">Figur 5</figref>). Die Gewichtungsfunktion wird im Allgemeinen für jeden Signalrahmen in jedem Frequenzbin neu geschätzt. Die Gesamtheit der Gewichtungswerte aller Frequenzbins eines Rahmens wird hier auch als "Kurzzeitspektrum der Gewichtungsfunktion" oder einfach als "Gewichtungsfunktion" bezeichnet.</p>
<p id="p0006" num="0006">Eine Multiplikation der Gewichtungsfunktion mit dem Kurzzeitspektrum des verrauschten Signals ergibt das gefilterte Spektrum, in dem die Amplituden der Frequenzbins, in denen Störung dominiert, stark verringert sind, während Sprachkomponenten nahezu unbeeinflusst bleiben (<figref idref="f0005">Figuren 8 und 9</figref>).</p>
<p id="p0007" num="0007">Schätzfehler bei der Berechnung der spektralen Gewichtungsfunktion, sogenannte Fluktuationen, ergeben gelegentlich zu hohe Gewichtungswerte für Frequenzbins, die hauptsächlich Störung enthalten (<figref idref="f0005">Figur 8</figref>). Dies geschieht unabhängig von spektral benachbarten oder zeitlich vorangegangenen Werten. Fluktuationen kommen auch schon in spektralen Zwischengrößen wie z.B. der Schätzung des Signal-zu-Rausch-Verhältnisses (signal-to-noise ratio, SNR) vor. Nach Multiplikation der schätzfehlerbehafteten Gewichtungsfunktion mit dem verrauschten Kurzzeitspektrum enthält das gefilterte Spektrum einzelne Frequenzbins, die hauptsächlich Störung enthalten und dennoch relativ hohe Amplituden aufweisen. Diese Bins heißen Ausreißer. Bei der Synthese eines<!-- EPO <DP n="4"> --> Zeitsignals aus den gefilterten Kurzzeitspektren sind die vereinzelten Ausreißer als tonale Artefakte (musical noise) zu hören, die wegen ihrer Tonalität als besonders störend empfunden werden (<figref idref="f0006">Figuren 10 und 11</figref>). Ein einzelnes tonales Artefakt hat die Dauer eines Signalrahmens und seine Frequenz wird durch den Frequenzbin bestimmt, in dem der Ausreißer vorkam.</p>
<p id="p0008" num="0008">Zur Unterdrückung von Fluktuationen in der Gewichtungsfunktion oder in spektralen Zwischengrößen bzw. zur Unterdrückung von Ausreißern im gefilterten Spektrum können diese spektralen Größen durch ein Mittelungsverfahren geglättet und somit von überhöhten Werten befreit werden. Spektrale Größen mehrerer spektral benachbarter oder zeitlich aufeinanderfolgender Frequenzbins werden dabei zu einem Mittelwert verrechnet, so dass die Amplitude einzelner Ausreißer relativiert wird. Eine Glättung ist über der Frequenz [1: <nplcit id="ncit0001" npl-type="s"><text>Tim Fingscheidt, Christophe Beaugeant and Suhadi Suhadi. Overcoming the statistical independence assumption w.r.t. frequency in speech enhancement. Proceedings, IEEE Int. Conf. Acoustics, Speech, Signal Processing (ICASSP), 1:1081-1084, 2005</text></nplcit>], entlang der Zeit [2: <nplcit id="ncit0002" npl-type="s"><text>Harald Gustafsson, Sven Erik Nordholm and Ingvar Claesson. Spectral subtraction using reduced delay convolution and adaptive averaging. IEEE Transactions on Speech and Audio Processing, 9(8):799-807, November 2001</text></nplcit>] oder als Kombination aus zeitlicher und spektraler Mittelung [3: <nplcit id="ncit0003" npl-type="s"><text>Zenton Goh, Kah-Chye Tan and B.T.G. Tan. Postprocessing method for suppressing musical noise generated by spectral subtraction. IEEE Transactions on Speech and Audio Processing, 6(3):287-292, May 1998</text></nplcit>] bekannt. Nachteil einer Glättung über der Frequenz ist, dass bei einer Verrechnung mehrerer Frequenzbins die spektrale Auflösung verringert wird, also die Unterscheidung zwischen Sprachbins und Rauschbins schwieriger wird. Eine zeitliche Glättung durch Zusammenfassung aufeinanderfolgender Werte eines Bins verringert die zeitliche Dynamik der spektralen Werte, also ihr Vermögen, schnellen zeitlichen Änderungen der Sprache zu folgen. Eine Verzerrung des Sprachsignals ist die Folge (clipping). Außerdem kann ein mit dem Sprachsignal korreliertes, irritierendes Restrauschen hörbar werden (noise shaping). Diese Glättungsverfahren im<!-- EPO <DP n="5"> --> Spektralbereich müssen deshalb im Allgemeinen aufwändig an das Sprachsignal adaptiert werden.</p>
<p id="p0009" num="0009">Eine weitere bekannte Form der Glättung einzelner Kurzzeitspektren über der Frequenz ist ein als "Liftering" bekanntes Verfahren [4: <nplcit id="ncit0004" npl-type="s"><text>Andrzej Czyzewski. Multitask noisy speech enhancement system. http://sound.eti.pg.gda.pl/denoise/main.html, 2004</text></nplcit>], [5: <nplcit id="ncit0005" npl-type="s"><text>Francois Thibault. High-level control of singing voice timbre transformations. http://www.music.mcgill.ca/thibault/Thesis/node43.html, 2004</text></nplcit>]. Hierbei wird das Kurzzeitspektrum eines Rahmens λ zunächst in den sogenannten Cepstralbereich transformiert. Die cepstrale Repräsentation der spektralen Amplituden G<sub>µ</sub>(λ) berechnet sich zu <maths id="math0001" num="(1)"><math display="block"><msubsup><mi>G</mi><mi mathvariant="italic">μʹ</mi><mi>cepst</mi></msubsup><mfenced><mi>λ</mi></mfenced><mo>=</mo><mi>IDFT</mi><mfenced open="{" close="}" separators=""><mi>log</mi><mfenced separators=""><msub><mi>G</mi><mi mathvariant="italic">μ</mi></msub><mfenced><mi>λ</mi></mfenced></mfenced></mfenced><mo>,</mo><mmultiscripts><mi>μʹ</mi><mprescripts/><mspace width="1em"/><none/></mmultiscripts><mo>=</mo><mn>0</mn><mo>…</mo><mfenced separators=""><mi>M</mi><mo>-</mo><mn>1</mn></mfenced><mo>,</mo><mi>μ</mi><mo>=</mo><mn>0</mn><mo>…</mo><mfenced separators=""><mi>M</mi><mo>-</mo><mn>1</mn></mfenced></math><img id="ib0001" file="imgb0001.tif" wi="149" he="12" img-content="math" img-format="tif"/></maths><br/>
mit IDFT{·} der inversen diskreten Fourier-Transformation (DFT) einer Folge von Werten der Länge M. Diese Transformation resultiert in M Transformationskoeffizienten <maths id="math0002" num=""><math display="inline"><msubsup><mi>G</mi><mi mathvariant="italic">μʹ</mi><mi>cepst</mi></msubsup><mfenced><mi>λ</mi></mfenced><mo>,</mo></math><img id="ib0002" file="imgb0002.tif" wi="23" he="8" img-content="math" img-format="tif" inline="yes"/></maths> den sogenannten cepstralen Bins mit Index µ'. Das Cepstrum besteht nach Gleichung (1) prinzipiell aus einer nicht-linearen Abbildung, nämlich der Logarithmierung, einer betragsmäßig vorliegenden spektralen Größe und einer anschließenden Transformation dieses logarithmierten Betragsspektrums mit einer Transformation. Der Vorteil einer cepstralen Repräsentation der Amplituden (<figref idref="f0008">Figur 14</figref>) ist, dass Sprache nicht mehr kammartig über die Frequenz verteilt ist (<figref idref="f0002">Figuren 4</figref> und <figref idref="f0004">6</figref>), sondern die wesentliche Information über das Sprachsignal in den cepstralen Bins mit kleinem Index repräsentiert ist. Außerdem wird wesentliche Sprachinformation noch in dem verhältnismäßig leicht zu detektierenden cepstralen Bin mit höherem Index repräsentiert, der die sogenannte Pitch-Frequenz (Sprachgrundfrequenz) des Sprechers repräsentiert.</p>
<p id="p0010" num="0010">Ein geglättetes Kurzzeitspektrum kann berechnet werden, indem cepstrale Bins mit relativ kleinen Beträgen zu Null gesetzt werden und anschließend das veränderte Cepstrum wieder in ein Kurzzeitspektrum rücktransformiert wird. Da allerdings starke Fluktuationen bzw. Ausreißer zu entsprechend hohen<!-- EPO <DP n="6"> --> Amplituden im Cepstrum führen, können diese Artefakte durch diese Verfahren nicht detektiert und unterdrückt werden.</p>
<p id="p0011" num="0011">Alternativ zum Liftering gibt es noch das Verfahen nach [6: <nplcit id="ncit0006" npl-type="s"><text>Petre Stoica and Niclas Sandgren. Smoothed nonparametric spectral estimation via cepstrum thresholding. IEEE Signal Processing Magazine, pages 34-45, November 2006</text></nplcit>]. Hier werden nach einem Kriterium ausgesuchte cepstrale Bins nicht zu Null gesetzt, sondern zu einem Wert, der für die Schätzung von Langzeitspektren stationärer Signale aus Kurzzeitspektren optimal ist. Diese Form der Schätzung von Signalspektren bringt für stark nicht-stationäre Signale wie Sprache generell keine Vorteile.</p>
<p id="p0012" num="0012">Das Dokument <patcit id="pcit0001" dnum="US5365592A"><text>US 5,365,592</text></patcit> offenbart ein weiteres Liftering ähnlichen Verfahren.</p>
<p id="p0013" num="0013">Hiervon ausgehend liegt der Erfindung die Aufgabe zugrunde, für die Rauschreduktion ein Glättungsverfahren zur Unterdrückung von Fluktuationen in der Gewichtungsfunktion oder in spektralen Zwischengrößen bzw. von Ausreißern in gefilterten Kurzzeitspektren aufzuzeigen, das weder die Frequenzauflösung der Kurzzeitspektren verringert noch die zeitliche Dynamik des Sprachsignals beeinträchtigt.</p>
<p id="p0014" num="0014">Die Lösung dieser Aufgabe besteht in einem Glättungsverfahren mit den Maßnahmen von Patentanspruch 1. Vorteilhafte Weiterbildungen sind Gegenstand der Unteransprüche.</p>
<p id="p0015" num="0015">Das erfindungsgemäße Glättungsverfahren umfasst folgende Schritte:
<ul id="ul0001" list-style="bullet" compact="compact">
<li>Bereitstellen von Kurzzeitspektren einer Folge von digitalen Abtastwerten umfassenden Signalrahmen,</li>
<li>Transformieren jedes Kurzzeitspektrums durch eine Hintransformation, die das Kurzzeitspektrum durch Transformationskoeffizienten beschreibt, welche das Kurzzeitspektrum in seine groben und seine feinen Strukturen unterteilt repräsentieren,</li>
<li>Glätten der Transformationskoeffizienten jeweils gleicher Koeffizientenindizes durch Kombination von wenigstens zwei aufeinanderfolgenden transformierten Kurzzeitspektren und</li>
<li>Transformieren der geglätteten Transformationskoeffizienten in geglättete Kurzzeitspektren durch eine Rücktransformation.</li>
</ul><!-- EPO <DP n="7"> --></p>
<p id="p0016" num="0016">Das erfindungsgemäße Glättungsverfahren bedient sich einer Transformation wie des Cepstrums, um ein breitbandiges Sprachsignal mit möglichst wenig Transformationskoeffizienten in seiner wesentlichen Struktur zu beschreiben. Anders als in bekannten Verfahren werden die Transformationskoeffizienten aber nicht unabhängig voneinander zu Null gesetzt, wenn sie einen Schwellwert unterschreiten. Es werden stattdessen die Werte von Transformationskoeffizienten aus mindestens zwei aufeinanderfolgenden Rahmen durch eine Glättung über die Zeit miteinander verrechnet. Hierbei wird der Grad der Glättung davon abhängig gemacht, inwieweit die durch den Koeffizienten repräsentierte spektrale Struktur entscheidend für die Beschreibung des Nutzsignals ist. Der Grad der zeitlichen Glättung eines Koeffizienten hängt daher beispielsweise davon ab, ob ein Transformationskoeffizient viel Sprachenergie enthält oder wenig. Dies ist im Cepstrum oder ähnlichen Transformationen leichter zu bestimmen als im Kurzzeitspektrum. So kann beispielsweise angenommen werden, dass die ersten vier cepstralen Koeffizienten mit Indizes µ' = 0 ... 3 und zusätzlich der Koeffizient mit maximalem Betrag und Index µ' größer 16 und kleiner 160 bei <i>f<sub>s</sub></i> = 8000 Hz (Pitch) Sprache repräsentieren. Koeffizienten mit viel Sprachinformation werden nur soweit geglättet, dass ihre zeitliche Dynamik nicht geringer wird als bei einem unverrauschten Sprachsignal. Gegebenenfalls werden diese Koeffizienten gar nicht geglättet. Sprachverzerrungen werden so verhindert. Da spektrale Fluktuationen und Ausreißer eine kurzzeitige Änderung in der Feinstruktur eines Kurzzeitspektrums darstellen, bilden sie sich im transformierten Kurzzeitspektrum als kurzzeitige Änderung derjenigen Transformationskoeffizienten ab, die die Feinstruktur des Kurzzeitspektrums repräsentieren. Da diese Transformationskoeffizienten bei unverrauschter Sprache eine relativ geringe zeitliche Änderungsrate haben, können eben diese Koeffizienten stärker geglättet werden. Eine verstärkte zeitliche Glättung wirkt somit der Ausbildung von Ausreißern entgegen, ohne die Struktur der Sprache zu beeinflussen. Das Glättungsverfahren resultiert somit nicht in einer verringerten spektralen Auflösung für Sprachlaute. Die Änderung der Feinstruktur des Kurzzeitspektrums bei aufeinanderfolgenden Rahmen ist<!-- EPO <DP n="8"> --> derart verzögert, dass nur schmalbandige spektrale Änderungen mit Zeitkonstanten kleiner als derjenigen von unverrauschter Sprache unterbunden werden.</p>
<p id="p0017" num="0017">Aus der geglätteten Größe, notiert als <maths id="math0003" num=""><math display="inline"><msubsup><mi>G</mi><mrow><mi mathvariant="italic">μʹ</mi><mo>,</mo><mi mathvariant="italic">smooth</mi></mrow><mi>cepst</mi></msubsup><mfenced><mi>λ</mi></mfenced><mo>,</mo></math><img id="ib0003" file="imgb0003.tif" wi="23" he="9" img-content="math" img-format="tif" inline="yes"/></maths> kann durch eine Rücktransformation wieder eine spektrale Darstellung des geglätteten Kurzzeitspektrums gewonnen werden. Für eine cepstrale Repräsentation, wie unter (1) beschrieben, ist eine mögliche Rücktransformation: <maths id="math0004" num="(2)"><math display="block"><msub><mi>G</mi><mrow><mi mathvariant="italic">μ</mi><mo>,</mo><mi mathvariant="italic">smooth</mi></mrow></msub><mfenced><mi>λ</mi></mfenced><mo>=</mo><mi>exp</mi><mfenced separators=""><mi>DFT</mi><mfenced open="{" close="}" separators=""><msubsup><mi>G</mi><mrow><mi mathvariant="italic">μʹ</mi><mo>,</mo><mi mathvariant="italic">smooth</mi></mrow><mi>cepst</mi></msubsup><mfenced><mi>λ</mi></mfenced></mfenced></mfenced><mo>,</mo><mi mathvariant="italic">μ</mi><mo>=</mo><mn>0</mn><mo>…</mo><mfenced separators=""><mi>M</mi><mo>-</mo><mn>1</mn></mfenced><mo>,</mo><mi mathvariant="italic">μʹ</mi><mo>=</mo><mn>0</mn><mo>…</mo><mfenced separators=""><mi>M</mi><mo>-</mo><mn>1</mn></mfenced></math><img id="ib0004" file="imgb0004.tif" wi="154" he="13" img-content="math" img-format="tif"/></maths><br/>
mit DFT{} der diskreten Fourier-Transformation und exp() der Exponentialfunktion, die in (2) elementweise angewendet wird.</p>
<p id="p0018" num="0018">Die Vorteile, die sich aus der erfindungsgemäßen Glättung von kurzzeitspektren ergeben, sind:
<ul id="ul0002" list-style="bullet" compact="compact">
<li>eine effektive Unterdrückung von Fluktuationen bzw. Ausreißern,</li>
<li>Beibehaltung der spektralen Auflösung für Sprachsignale und</li>
<li>keine hörbare Beeinflussung von Sprache.</li>
</ul></p>
<p id="p0019" num="0019">Es ist wichtig anzumerken, dass die für das Cepstrum verwendete inverse DFT in (1) und die DFT für die Rücktransformation in (2) durch andere Transformationen ersetzt werden können, ohne dass dabei die prinzipiellen Eigenschaften der Transformationskoeffizienten bzgl. der kompakten Repräsentation von Sprache verloren gehen. Genauso verhält es sich mit der Logarithmierung in (1) und der entsprechenden Umkehrfunktion in (2), der Exponentialfunktion. Auch hier sind andere nicht-lineare Abbildungen und auch lineare Abbildungen denkbar.</p>
<p id="p0020" num="0020">Transformationen unterscheiden sich in ihren verwendeten Basisfunktionen. Der Vorgang der Transformation bedeutet, dass das Signal mit den verschiedenen Basisfunktionen korreliert wird. Der resultierende Grad der Korrelation zwischen dem Signal und einer Basisfunktion ist dann der zugehörige Transformationskoeffizient. Bei einer Transformation entstehen so<!-- EPO <DP n="9"> --> viele Transformationskoeffizienten wie es Basisfunktionen gibt. Ihre Anzahl ist hier mit M bezeichnet. Für die Erfindung wichtige Transformationen sind solche, durch deren Basisfunktionen das zu transformierende Kurzzeitspektrum in seiner Grobstruktur und seiner Feinstruktur aufgeschlüsselt wird.</p>
<p id="p0021" num="0021">Ein Unterscheidungsmerkmal von Transformationen ist die Orthogonalität. Orthogonale Transformationsbasen enthalten nur Basisfunktionen, die unkorreliert sind. Für den Fall, dass das Signal mit einer der Basisfunktionen identisch ist, entstehen bei orthogonalen Transformationen Transformationskoeffizienten mit dem Wert Null, bis auf den einen Koeffizienten, der identisch zum Signal ist. Die Trennschärfe einer orthogonalen Transformation ist demnach hoch. Nicht-orthogonale Transformationen verwenden Funktionsbasen, die miteinander korreliert sind.</p>
<p id="p0022" num="0022">Ein weiteres Merkmal ist, dass die Basisfunktionen für den betrachteten Anwendungsfall diskret und endlich sind, da es sich bei den verarbeiteten Signalrahmen um diskrete Signale von der Länge eines Rahmens handelt.</p>
<p id="p0023" num="0023">Wichtiges Merkmal einer Transformation ist die Invertierbarkeit. Existiert zu einer Transformation (Hintransformation) eine inverse Transformation, so entsteht durch Transformation eines Signals in Transformationskoeffizienten und anschließender inverser Transformation (Rücktransformation) dieser Koeffizienten wieder das Ausgangssignal, falls die Transformationkoeffizienten nicht verändert wurden.</p>
<p id="p0024" num="0024">In der Signalverarbeitung, wie sie hier beschrieben wird, ist die diskrete Fourier-Transformation (DFT) eine bevorzugte Transformation. Ein dazugehöriger wichtiger Algorithmus in der diskreten Signalverarbeitung ist die "Fast-Fourier-Transformation" (FFT). Außerdem sind die diskrete Cosinus-Transformation (DCT) und die diskrete Sinus-Transformation (DST) häufig verwendete Transformationen. Diese Transformationen werden hier unter dem Begriff "Standardtransformationen" zusammengefasst. Eine für die Erfindung entscheidende bereits erwähnte Eigenschaft der Standardtransformationen ist, dass die Amplituden der verschiedenen Transformationskoeffizienten unterschiedliche<!-- EPO <DP n="10"> --> Grade an Feinstruktur des transformierten Signals repräsentieren. So beschreiben Koeffizienten mit kleinen Indizes die groben Strukturen des transformierten Signals, weil die zugehörigen Basisfunktionen niederfrequente harmonische Funktionen sind. Je höher der Index eines Transformationskoeffizienten bis hin zu µ' = M/2, desto feiner sind die Strukturen des transformierten Signals, die durch diesen Koeffizienten beschrieben werden. Für darüber hinausgehende Koeffizienten dreht sich diese Eigenschaft wegen der Symmetrie der Koeffizienten um. In der Regel werden bei der Signalverarbeitung nur die Koeffizienten mit Indizes µ' = 0 bis µ' = M/2 verarbeitet und die restlichen Werte durch spiegeln der Resultate ermittelt.</p>
<p id="p0025" num="0025">Die Invertierbarkeit der Transformationen macht es außerdem möglich, die Transformation und ihre Inverse bei der Hin- und Rücktransformation zu vertauschen. In (1) ist also auch beispielsweise die Verwendung der DFT aus (2) möglich, wenn in (2) die IDFT aus (1) verwendet wird.</p>
<p id="p0026" num="0026">Vorteilhaft werden die spektralen Koeffizienten der Kurzzeitspektren vor der Hintransformation nicht-linear abgebildet. Prinzipielle, für die Erfindung vorteilhafte Eigenschaft der nicht-linearen Abbildung ist eine Dynamik-Kompression relativ großer Amplituden und eine Dynamik-Expansion relativ kleiner Amplituden.</p>
<p id="p0027" num="0027">Entsprechend können die spektralen Koeffizienten der geglätteten Kurzzeitspektren nach der Rücktransformation nicht-linear abgebildet werden, wobei die nicht-lineare Abbildung nach der Rücktransformation die Umkehrung der nicht-linearen Abbildung vor der Hintransformation ist.</p>
<p id="p0028" num="0028">Zweckmäßigerweise werden die spektralen Koeffizienten vor der Hintransformation durch Logarithmierung nicht-linear abgebildet.</p>
<p id="p0029" num="0029">Eine Form der zeitlichen Glättung kann durch ein rekursives System vorzugsweise erster Ordnung erreicht werden: <maths id="math0005" num="(3)"><math display="block"><msubsup><mi>G</mi><mrow><mi mathvariant="italic">μʹ</mi><mo>,</mo><mi mathvariant="italic">smooth</mi></mrow><mi>cepst</mi></msubsup><mfenced><mi>λ</mi></mfenced><mo>=</mo><msub><mi>β</mi><mi mathvariant="italic">μʹ</mi></msub><mo>⁢</mo><msubsup><mi>G</mi><mrow><mi mathvariant="italic">μʹ</mi><mo>,</mo><mi mathvariant="italic">smooth</mi></mrow><mi>cepst</mi></msubsup><mo>⁢</mo><mfenced separators=""><mi>λ</mi><mo>-</mo><mn>1</mn></mfenced><mo>+</mo><mfenced separators=""><mn>1</mn><mo>-</mo><msub><mi>β</mi><mi mathvariant="italic">μʹ</mi></msub></mfenced><mo>⁢</mo><msubsup><mi>G</mi><mi mathvariant="italic">μʹ</mi><mi>cepst</mi></msubsup><mfenced><mi>λ</mi></mfenced><mn>.</mn></math><img id="ib0005" file="imgb0005.tif" wi="150" he="13" img-content="math" img-format="tif"/></maths><!-- EPO <DP n="11"> --></p>
<p id="p0030" num="0030">Mögliche Werte für die Glättungskonstanten für Koeffizienten der Standardtransformationen im Falle von Sprachsignalen sind β<sub>µ'</sub> = 0 für µ' = 0 ... 3, β<sub>µ</sub>' = 0,8 für µ' = 4 ... M/2 mit Ausnahme der Transformationskoeffizienten durch die die Pitch-Frequenz eines Sprechers repräsentiert wird, und β<sub>µ'</sub> = 0,4 für Transformationskoeffizienten, die die Pitch-Frequenz repräsentieren. Verfahren zur Bestimmung des Pitch-Koeffizienten sind zahlreich in der Literatur verfügbar. Beispielsweise kann zur Bestimmung des Koeffizienten der Pitch derjenige Koeffizient gewählt werden, dessen Index zwischen µ' = 16 und µ' = 160 liegt und der die maximale Amplitude aller Koeffizienten in diesem Indexbereich aufweist. Für die verbleibenden Transformationskoeffizienten mit Indizes µ'= M/2 + 1 ... M - 1 gilt die Symmetriebedingung β<sub>M-µ'</sub> = β<sub>µ'</sub>. Die Werte sind für die Standardtransformationen sowie Kurzzeitspektren, die aus Signalen mit <i>f<sub>s</sub></i> = 8000 Hz entstanden sind, geeignet. Sie sind durch verhältnismäßige Umrechnung an andere Systeme anpassbar. Die Wahl β<sub>µ'</sub> = 0 bedeutet, dass die betreffenden Koeffizienten nicht geglättet werden. Es ist eine entscheidende Eigenschaft der Erfindung, dass Koeffizienten, die den groben Verlauf des Kurzzeitspektrums beschreiben, möglichst wenig geglättet werden, wenn es sich um die Entrauschung von Sprachsignalen handelt. So werden die groben Strukturen des breitbandigen Sprachspektrums vor Glättungseffekten geschützt. Die feinen Strukturen von Fluktuationen bzw. spektralen Ausreißern bilden sich bei den Standardtransformationen in den Transformationskoeffizienten zwischen µ' = 4 und µ' = M/2 ab, weshalb diese bis auf den Pitch der Sprache stark geglättet werden.</p>
<p id="p0031" num="0031">Vorteilhafterweise wird das Glättungsverfahren auf den Betrag oder eine Potenz des Betrags der Kurzzeitspektren angewendet.</p>
<p id="p0032" num="0032">Besonders vorteilhaft ist es, wenn zum Glätten der jeweiligen Transformationskoeffizienten unterschiedliche Zeitkonstanten verwendet werden. Die Zeitkonstanten können so gewählt werden, dass die Transformationskoeffizenten, die vornehmlich Sprache repräsentieren, wenig geglättet werden. Zweckmäßigerweise können die Transformationskoeffizenten, die hauptsächlich fluktuierende Hintergrundgeräusche und<!-- EPO <DP n="12"> --> Artefakte der Geräuschreduktionsalgorithmen beschreiben, stark geglättet werden.</p>
<p id="p0033" num="0033">Als Kurzzeitspektrum kann die spektrale Gewichtungsfunktion eines Geräuschreduktionsalgorithmus bereitgestellt werden. Vorteilhaft kann als Kurzzeitspektrum auch die spektrale Gewichtungsfunktion eines Postfilters für mehrkanalige Verfahren zur Geräuschreduktion verwendet werden. Zweckmäßigerweise ergibt sich die spektrale Gewichtungsfunktion hierbei aus der Minimierung eines Fehlerkriteriums.</p>
<p id="p0034" num="0034">Als Kurzzeitspektrum kann auch ein gefiltertes Kurzzeitspektrum bereitgestellt werden.</p>
<p id="p0035" num="0035">Nach einer anderen Weiterbildung des Verfahrens, wird als Kurzzeitspektrum eine spektrale Gewichtungsfunktion eines mehrkanaligen Verfahrens zur Geräuschreduktion bereitgestellt.</p>
<p id="p0036" num="0036">Als Kurzzeitspektrum kann auch eine geschätzte Kohärenz oder eine geschätzte "Magnitude Squared Coherence" zwischen wenigstens zwei Mikrofonkanälen bereitgestellt werden.</p>
<p id="p0037" num="0037">Vorteilhaft wird als Kurzzeitspektrum eine spektrale Gewichtungsfunktion eines mehrkanaligen Verfahrens zur Sprecher- oder Quellentrennung bereitgestellt.</p>
<p id="p0038" num="0038">Weiterhin ist vorgesehen, dass als Kurzzeitspektrum eine spektrale Gewichtungsfunktion eines mehrkanaligen Verfahrens zur Sprechertrennung auf Basis von Phasenunterschieden von Signalen in den verschiedenen Kanälen (Phase Transform - PHAT) bereitgestellt wird.</p>
<p id="p0039" num="0039">Ferner ist es möglich, als Kurzzeitspektrum eine spektrale Gewichtungsfunktion eines mehrkanaligen Verfahrens auf Basis einer "Generalized Cross-Correlation" (GCC) zu verwenden.</p>
<p id="p0040" num="0040">Als Kurzzeitspektrum können auch spektrale Größen, die sowohl Sprach- als auch Störanteile enthalten, bereitgestellt werden.<!-- EPO <DP n="13"> --></p>
<p id="p0041" num="0041">So kann als Kurzzeitspektrum auch eine Schätzung des Signal-zu-Rausch-Verhältnisses in den einzelnen Frequenzbins bereitgestellt werden. Ferner kann als Kurzzeitspektrum eine Schätzung der Rauschleistung verwendet werden.</p>
<p id="p0042" num="0042">Das Problem von Fluktuationen in Kurzzeitspektren ist nicht nur in der Audiosignalverarbeitung bekannt. Weitere vorteilhafte Anwendungsgebiete sind die Bild- und die medizinische Signalverarbeitung.</p>
<p id="p0043" num="0043">In der Bildverarbeitung kann z.B. die Zeile eines Bildes als Signalrahmen interpretiert werden, der in den Spektralbereich transformiert werden kann. Die entstehenden Frequenzbins werden hier Ortsfrequenzbins genannt. Bei der Verarbeitung von Bildern im Ortsfrequenzbereich werden Algorithmen verwendet, die denen in der Audiosignalverarbeitung äquivalent sind. Mögliche Fluktuationen, die diese Algorithmen im Ortsfrequenzbereich erzeugen, resultieren im verarbeiteten Bild in optischen Artefakten. Diese sind äquivalent zum tonalen Rauschen in der Audioverarbeitung.</p>
<p id="p0044" num="0044">In der medizinischen Signalverarbeitung werden vom menschlichen Körper Signale abgeleitet, die wie akustische Signale verrauscht sein können. Das verrauschte Signal kann entsprechend rahmenweise in den Spektralbereich transformiert werden. Die entstehenden Spektrogramme lassen sich wie Audiospektren verarbeiten.</p>
<p id="p0045" num="0045">Das Glättungsverfahren kann in einem Telekommunikationsnetzwerk und/oder bei einer Rundfunkübertragung zur Verbesserung der Sprach- und/oder Bildqualität sowie zur Unterdrückung von Artefakten eingesetzt werden. In der mobilen Sprachkommunikation treten Verzerrungen des Sprachsignals auf, die zum einen durch die eingesetzten Sprachcodierverfahren (redundanzvermindernde Sprachkompression) und das damit verbundene Quantisierungsrauschen und zum anderen durch die vom Übertragungskanal hervorgerufenen Störungen bedingt sind. Letztere sind wiederum stark zeitlich und spektral fluktuierend und führen zu einer deutlich wahrnehmbaren Verschlechterung der Sprachqualität. Auch hier muss die empfängerseitig oder im Netzwerk eingesetzte<!-- EPO <DP n="14"> --> Signalverarbeitung sicherstellen, dass die quasi zufälligen Artefakte reduziert werden. Zur Qualitätsverbesserung werden bisher sogenannte Postfilter und Fehlerverdeckungsverfahren eingesetzt. Während das Postfilter überwiegend die Reduktion von Quantisierungsrauschen zur Aufgabe hat, werden Fehlerverdeckungsverfahren zur Unterdrückung von übertragungsbedingten Kanalstörungen eingesetzt. In beiden Anwendungen können Verbesserungen erzielt werden, wenn in das Postfilter oder das Verdeckungsverfahren das erfindungsgemäße Glättungsverfahren integriert wird. Das Glättungsverfahren kann somit als Postfilter, in einem Postfilter, in Kombination mit einem Postfilter, im Rahmen eines Fehlerverdeckungsverfahrens oder in Zusammenhang mit einem Verfahren zur Sprach- und/oder Bildcodierung (Dekompressionsverfahren bzw. Dekodierungsverfahren) insbesondere empfängerseitig eingesetzt werden. Mit der Verwendung des Verfahrens als Postfilter ist dabei gemeint, dass das Verfahren zum Postfiltern eingesetzt wird, dass also mit einem das Verfahren umsetzenden Algorithmus die in den Anwendungen entstehenden Daten prozessiert werden. Weiterhin ist es möglich, die Qualität des Sprachsignals im Telekommunikationsnetzwerk zu verbessern, indem das Sprachsignalspektrum oder eine davon abgeleitete Größe mit dem erfindungsgemäßen Glättungsverfahren geglättet wird.</p>
<p id="p0046" num="0046">Die Erfindung wird nachfolgend anhand von in den Figuren dargestellten Abbildungen näher erläutert. Es zeigen:
<dl id="dl0001">
<dt>Figur 1</dt><dd>ein unverrauschtes Zeitsignal;</dd>
<dt>Figur 2</dt><dd>ein verrauschtes Zeitsignal;</dd>
<dt>Figur 3</dt><dd>einen einzelnen Signalrahmen im Zeitbereich;</dd>
<dt>Figur 4</dt><dd>einen einzelnen Signalrahmen im Spektralbereich;</dd>
<dt>Figur 5</dt><dd>eine Gewichtungsfunktion für einen einzelnen Rahmen;</dd>
<dt>Figur 6</dt><dd>das Spektrogramm eines unverrauschten Signals;</dd>
<dt>Figur 7</dt><dd>das Spektrogramm eines verrauschten Signals;<!-- EPO <DP n="15"> --></dd>
<dt>Figur 8</dt><dd>das Spektrogramm eines mit der ungeglätteten Gewichtungsfunktion gefilterten Signals;</dd>
<dt>Figur 9</dt><dd>das Spektrogramm eines mit einer erfindungsgemäß geglätteten Gewichtungsfunktion gefilterten Signals;</dd>
<dt>Figur 10</dt><dd>ein gefiltertes Zeitsignal mit tonalen Artefakten;</dd>
<dt>Figur 11</dt><dd>ein gemäß der Erfindung gefiltertes Zeitsignal;</dd>
<dt>Figur 12</dt><dd>das Spektrogramm einer ungeglätteten Gewichtungsfunktion;</dd>
<dt>Figur 13</dt><dd>das Spektrogramm einer erfindungsgemäß geglätteten Gewichtungsfunktion;</dd>
<dt>Figur 14</dt><dd>den Betrag des Cepstrums eines unverrauschten Sprachsignals und</dd>
<dt>Figur 15</dt><dd>den Signalflussgraphen gemäß einer bevorzugten Ausführungsform der Erfindung.</dd>
</dl></p>
<p id="p0047" num="0047">In <figref idref="f0001">Figur 1</figref> ist ein unverrauschtes Signal in Form der Amplitude über die Zeit dargestellt. Die Dauer des Signals ist 4 Sekunden, die Amplituden reichen von ca. -0,18 bis ca. 0,18. In <figref idref="f0001">Figur 2</figref> ist das Signal in verrauschter Form dargestellt. Man erkennt ein zufälliges Grundrauschen über dem gesamten Zeitverlauf.</p>
<p id="p0048" num="0048">In <figref idref="f0002">Figur 3</figref> ist das Signal eines einzelnen Signalrahmens λ dargestellt. Der Signalrahmen hat eine Segmentdauer von 32 Millisekunden. Die Amplitude beider Graphen bewegt sich zwischen -0,1 und 0,1. Die einzelnen Abtastwerte der digitalen Signale sind zu Graphen verbunden. Der verrauschte Graph repräsentiert das Eingangssignal, in dem das unverrauschte Signal enthalten ist. Eine Trennung von Signal und Rauschen im verrauschten Signal ist in dieser Repräsentation des Signals kaum möglich.</p>
<p id="p0049" num="0049"><figref idref="f0002">Figur 4</figref> ist eine Darstellung desselben Signalrahmens nach der Transformation in den Frequenzbereich. Die einzelnen Frequenzbins µ sind zu Graphen verbunden. Auch in dieser Figur sind die Frequenzbins verrauscht und unverrauscht dargestellt, wobei wieder das unverrauschte Signal das im<!-- EPO <DP n="16"> --> verrauschten Signal enthaltene Sprachsignal ist. Über der Abszisse sind die Frequenzbins µ von 0 bis 128 eingezeichnet. Sie haben Amplituden von ca. -40 Dezibel (dB) bis ca. 10 dB. Aus dem Vergleich der Graphen ist ersichtlich, dass die Energie des Sprachsignals in einigen Frequenzbins in einer kammartigen Struktur konzentriert ist, während das Rauschen auch in den dazwischenliegenden Bins vorhanden ist.</p>
<p id="p0050" num="0050">In <figref idref="f0003">Figur 5</figref> ist eine Gewichtungsfunktion für den verrauschten Rahmen aus <figref idref="f0002">Figur 4</figref> dargestellt. Für jeden Frequenzbin µ ergibt sich in Abhängigkeit vom Verhältnis aus Sprach- und Rauschenergie ein Faktor zwischen 0 und 1. Die einzelnen Gewichtungsfaktoren sind zu einem Graphen verbunden. Man erkennt die kammartige Struktur des Sprachspektrums wieder.</p>
<p id="p0051" num="0051">In den <figref idref="f0004">Figuren 6 und 7</figref> sind Spektrogramme aus einer Folge von unverrauschten bzw. verrauschten Kurzzeitspektren (<figref idref="f0002">Figur 4</figref>) dargestellt. Auf der Abszisse ist der Rahmenindex λ aufgetragen, über der Ordinate der Frequenzbinindex µ. Die Amplituden der einzelnen Frequenzbins sind als Grauwerte dargestellt. Im Vergleich von <figref idref="f0004">Figur 6 und 7</figref> wird deutlich, wie Sprache in wenigen Frequenzbins konzentriert ist. Sie bildet zudem regelmäßige Strukturen aus. Das Rauschen ist dagegen über alle Frequenzbins verteilt.</p>
<p id="p0052" num="0052">In <figref idref="f0005">Figur 8</figref> ist das Spektrogramm eines gefilterten Signals dargestellt. Die Achsen entsprechen denen aus den <figref idref="f0004">Figuren 6 und 7</figref>. Aus einem Vergleich mit <figref idref="f0004">Figur 6</figref> ist erkennbar, dass durch Schätzfehler in der Gewichtungsfunktion hohe Amplituden in Frequenzbins verbleiben, die keine Sprache enthalten. Diese Ausreißer zu unterdrücken ist Ziel des erfindungsgemäßen Verfahrens.</p>
<p id="p0053" num="0053">In <figref idref="f0005">Figur 9</figref> ist das Spektrogramm eines Signals dargestellt, das gemäß einer bevorzugten Weiterbildung des erfindungsgemäßen Verfahrens mit einer geglätteten Gewichtungsfunktion gefiltert wurde. Die Achsen entsprechen denen der vorangegangenen Spektrogramme. Im Vergleich mit <figref idref="f0005">Figur 8</figref> sind die Ausreißer stark vermindert. Die Sprachanteile im Spektrogramm sind dagegen in ihrer wesentlichen Form erhalten.<!-- EPO <DP n="17"> --></p>
<p id="p0054" num="0054">In den <figref idref="f0006">Figuren 10 und 11</figref> sind die Zeitsignale dargestellt, die sich jeweils aus den gefilterten Spektren der <figref idref="f0005">Figuren 8 und 9</figref> ergeben. Aufgetragen ist die Amplitude über der Zeit. Die Signale sind 4 Sekunden lang und haben Amplituden zwischen ca. -0,18 und 0,18. Die Ausreißer im Spektrogramm aus <figref idref="f0005">Figur 8</figref> ergeben im zugehörigen Zeitsignal in <figref idref="f0006">Figur 10</figref> deutlich sichtbare tonale Artefakte, die im unverrauschten Signal aus <figref idref="f0001">Figur 1</figref> nicht vorhanden sind. Das Zeitsignal in <figref idref="f0006">Figur 11</figref> weist einen deutlich ruhigeren Verlauf des Restrauschens auf. Dieses Zeitsignal ergibt sich aus dem Spektrogramm von <figref idref="f0005">Figur 9</figref>, das durch Filterung mit der geglätteten Gewichtungsfunktion erzeugt wurde.</p>
<p id="p0055" num="0055">In <figref idref="f0007">Figur 12</figref> ist die ungeglättete Gewichtungsfunktion für alle Rahmen dargestellt. Zu jedem Rahmen λ sind entlang der Ordinate Frequenzbins µ aufgetragen. Die Werte der Gewichtungsfunktion sind als Grauton dargestellt. Die Fluktuationen, die aus Schätzfehlern resultieren, sind als unregelmäßige Flecken erkennbar.</p>
<p id="p0056" num="0056">In <figref idref="f0007">Figur 13</figref> ist die geglättete Gewichtungsfunktion für alle Rahmen dargestellt. Die Achsen entsprechen denen aus <figref idref="f0007">Figur 12</figref>. Durch die Glättung werden die Fluktuationen verschmiert und im Wert stark vermindert. Die Struktur der Sprachfrequenzbins bleibt dagegen deutlich erkennbar.</p>
<p id="p0057" num="0057">In <figref idref="f0008">Figur 14</figref> ist der Betrag des Cepstrums eines unverrauschten Signals über alle Rahmen dargestellt. Zu jedem Rahmen λ sind entlang der Ordinate die cepstralen Bins µ' aufgetragen. Die Werte der Beträge der cepstralen Koeffizienten <maths id="math0006" num=""><math display="inline"><msubsup><mi>G</mi><mi mathvariant="italic">μʹ</mi><mi>cepst</mi></msubsup><mfenced><mi>λ</mi></mfenced></math><img id="ib0006" file="imgb0006.tif" wi="20" he="8" img-content="math" img-format="tif" inline="yes"/></maths> sind als Grautöne dargestellt. Ein Vergleich mit <figref idref="f0004">Figur 6</figref> zeigt, dass Sprache im Cepstrum auf eine noch geringere Anzahl von Koeffizienten konzentriert ist. Außerdem sind diese Koeffizienten in ihrer Position weniger variabel. Deutlich erkennbar ist auch der Verlauf des cepstralen Koeffizienten, der die Pitch-Frequenz repräsentiert.</p>
<p id="p0058" num="0058">In <figref idref="f0009">Figur 15</figref> ist ein Signalflussgraph gemäß einer bevorzugten Ausführungsform der Erfindung dargestellt. Ein verrauschtes Eingangssignal wird in eine Folge von Kurzzeitspektren transformiert und daraus über spektrale Zwischengrößen anschließend eine Gewichtungsfunktion zur Filterung geschätzt. Es wird jeweils<!-- EPO <DP n="18"> --> ein Rahmen zur Zeit bearbeitet. Zunächst werden die Kurzzeitspektren der Gewichtungsfunktion einer nicht-linearen, logarithmischen Abbildung unterworfen. Es folgt eine Hintransformation in den cepstralen Bereich. Die so transformierten Kurzzeitspektren werden damit durch Transformationskoeffizienten der Basisfunktionen repräsentiert. Die auf diesem Wege berechneten Transformationskoeffizienten werden getrennt voneinander unter Verwendung von unterschiedlichen Zeitkonstanten geglättet. Der rekursive Charakter der Glättung ist durch die Rückführung der Ausgabe der Glättung zu ihrem Eingang angedeutet. Von den Signalpfaden der insgesamt M Transformationskoeffizienten sind nur 3 dargestellt, die restlichen sind durch drei Punkte "..." ersetzt. Nach der Glättung erfolgen eine Rücktransformation und danach die nicht-lineare Umkehrabbildung. Auf diese Weise erhält man als Ergebnis eine Folge von geglätteten Kurzzeitspektren der Gewichtungsfunktion. Diese geglätteten Kurzzeitspektren der Gewichtungsfunktion können mit den verrauschten Kurzzeitspektren multipliziert werden, wodurch gefilterte Kurzzeitspektren mit wenigen Ausreißern entstehen. Diese können dann in ein Zeitsignal mit verringertem Rauschpegel umgerechnet werden. Der Teil des Signalflussgraphen, der die erfindungsgemäße Glättung beschreibt, ist gestrichelt umrandet.</p>
</description><!-- EPO <DP n="19"> -->
<claims id="claims01" lang="de">
<claim id="c-de-01-0001" num="0001">
<claim-text>Glättungsverfahren zur Unterdrückung von fluktuierenden Artefakten bei der Störgeräuschreduktion mit folgenden Schritten:
<claim-text>• Bereitstellen von Kurzzeitspektren einer Folge von digitalen Abtastwerten umfassenden Signalrahmen,</claim-text>
<claim-text>• Transformieren jedes Kurzzeitspektrums durch eine Hintransformation, die das Kurzzeitspektrum durch Transformationskoeffizienten beschreibt, welche das Kurzzeitspektrum in seine groben und seine feinen Strukturen unterteilt repräsentieren,</claim-text>
<claim-text>• Glätten der Transformationskoeffizienten jeweils gleicher Koeffizientenindizes durch Kombination von wenigstens zwei aufeinanderfolgenden transformierten Kurzzeitspektren und</claim-text>
<claim-text>• Transformieren der geglätteten Transformationskoeffizienten in geglättete Kurzzeitspektren durch eine Rücktransformation.</claim-text></claim-text></claim>
<claim id="c-de-01-0002" num="0002">
<claim-text>Glättungsverfahren nach dem vorhergehenden Anspruch, <b>dadurch gekennzeichnet, dass</b> für die Rücktransformation die Inverse zur Hintransformation verwendet wird.</claim-text></claim>
<claim id="c-de-01-0003" num="0003">
<claim-text>Glättungsverfahren nach Anspruch 1 oder 2, <b>dadurch gekennzeichnet, dass</b> eine Transformation mit orthogonaler Basis verwendet wird.</claim-text></claim>
<claim id="c-de-01-0004" num="0004">
<claim-text>Glättungsverfahren nach Anspruch 1 oder 2, <b>dadurch gekennzeichnet, dass</b> eine Transformation mit nicht-orthogonaler Basis verwendet wird.</claim-text></claim>
<claim id="c-de-01-0005" num="0005">
<claim-text>Glättungsverfahren nach Anspruch 1 oder 2, <b>dadurch gekennzeichnet, dass</b> für die Transformationen die diskrete Fourier-Transformation und ihre Inverse verwendet werden.</claim-text></claim>
<claim id="c-de-01-0006" num="0006">
<claim-text>Glättungsverfahren nach Anspruch 1 oder 2, <b>dadurch gekennzeichnet, dass</b> für die Transformationen die Fast-Fourier-Transformation und ihre Inverse verwendet werden.<!-- EPO <DP n="20"> --></claim-text></claim>
<claim id="c-de-01-0007" num="0007">
<claim-text>Glättungsverfahren nach Anspruch 1 oder 2, <b>dadurch gekennzeichnet, dass</b> für die Transformationen die diskrete Cosinus-Transformation und ihre Inverse verwendet werden.</claim-text></claim>
<claim id="c-de-01-0008" num="0008">
<claim-text>Glättungsverfahren nach Anspruch 1 oder 2, <b>dadurch gekennzeichnet, dass</b> für die Transformationen die diskrete Sinus-Transformation und ihre Inverse verwendet werden.</claim-text></claim>
<claim id="c-de-01-0009" num="0009">
<claim-text>Glättungsverfahren nach einem der vorhergehenden Ansprüche, <b>dadurch gekennzeichnet, dass</b> die Kurzzeitspektren vor der Hintransformation nicht-linear abgebildet werden.</claim-text></claim>
<claim id="c-de-01-0010" num="0010">
<claim-text>Glättungsverfahren nach dem vorhergehenden Anspruch, <b>dadurch gekennzeichnet, dass</b> die geglätteten Kurzzeitspektren nach der Rücktransformation nicht-linear abgebildet werden, wobei die nicht-lineare Abbildung der Rücktransformation die Umkehrung der nicht-linearen Abbildung der Hintransformation ist.</claim-text></claim>
<claim id="c-de-01-0011" num="0011">
<claim-text>Glättungsverfahren nach einem der beiden vorhergehenden Ansprüche, <b>dadurch gekennzeichnet, dass</b> die Kurzzeitspektren vor der Hintransformation durch Logarithmierung nicht-linear abgebildet werden.</claim-text></claim>
<claim id="c-de-01-0012" num="0012">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 11, <b>dadurch gekennzeichnet, dass</b> zum Glätten der Transformationskoeffizienten eine rekursive Glättung verwendet wird.</claim-text></claim>
<claim id="c-de-01-0013" num="0013">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 11, <b>dadurch gekennzeichnet, dass</b> zum Glätten der Transformationskoeffizienten eine nicht-rekursive Glättung verwendet wird.</claim-text></claim>
<claim id="c-de-01-0014" num="0014">
<claim-text>Glättungsverfahren nach einem der vorhergehenden Ansprüche, <b>dadurch gekennzeichnet, dass</b> die Glättung auf den Betrag oder eine Potenz des Betrags der Kurzzeitspektren angewendet wird.<!-- EPO <DP n="21"> --></claim-text></claim>
<claim id="c-de-01-0015" num="0015">
<claim-text>Glättungsverfahren nach einem der vorhergehenden Ansprüche, <b>dadurch gekennzeichnet, dass</b> zum Glätten der jeweiligen Transformationskoeffizienten unterschiedliche Zeitkonstanten verwendet werden.</claim-text></claim>
<claim id="c-de-01-0016" num="0016">
<claim-text>Glättungsverfahren nach dem vorhergehenden Anspruch, <b>dadurch gekennzeichnet, dass</b> Zeitkonstanten so gewählt werden, dass die Transformationskoeffizienten, die typischerweise spektrale Strukturen von Sprache beschreiben, wenig geglättet werden.</claim-text></claim>
<claim id="c-de-01-0017" num="0017">
<claim-text>Glättungsverfahren nach einem der beiden vorhergehenden Ansprüche, <b>dadurch gekennzeichnet, dass</b> Zeitkonstanten so gewählt werden, dass die Transformationskoeffizienten, die spektrale Strukturen von fluktuierenden spektralen Größen und von Artefakten von Geräuschreduktionsalgorithmen beschreiben, stark geglättet werden.</claim-text></claim>
<claim id="c-de-01-0018" num="0018">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum eine spektrale Gewichtungsfunktion eines Geräuschreduktionsalgorithmus bereitgestellt wird.</claim-text></claim>
<claim id="c-de-01-0019" num="0019">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum eine spektrale Gewichtungsfunktion eines Postfilters für mehrkanalige Verfahren zur Geräuschreduktion verwendet wird.</claim-text></claim>
<claim id="c-de-01-0020" num="0020">
<claim-text>Glättungsverfahren nach einem der beiden vorhergehenden Ansprüche, <b>dadurch gekennzeichnet, dass</b> sich die spektrale Gewichtungsfunktion aus der Minimierung eines Fehlerkriteriums ergibt.</claim-text></claim>
<claim id="c-de-01-0021" num="0021">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum ein gefiltertes Kurzzeitspektrum bereitgestellt wird.<!-- EPO <DP n="22"> --></claim-text></claim>
<claim id="c-de-01-0022" num="0022">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum eine spektrale Gewichtungsfunktion eines mehrkanaligen Verfahrens zur Geräuschreduktion bereitgestellt wird.</claim-text></claim>
<claim id="c-de-01-0023" num="0023">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum eine geschätzte Kohärenz oder eine geschätzte "Magnitude Squared Coherence" zwischen wenigstens zwei Mikrofonkanälen bereitgestellt wird.</claim-text></claim>
<claim id="c-de-01-0024" num="0024">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum eine spektrale Gewichtungsfunktion eines mehrkanaligen Verfahrens zur Sprecher- oder Quellentrennung bereitgestellt wird.</claim-text></claim>
<claim id="c-de-01-0025" num="0025">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum eine spektrale Gewichtungsfunktion eines mehrkanaligen Verfahrens zur Sprechertrennung auf Basis von Phasenunterschieden von Signalen in den verschiedenen Kanälen (Phase Transform - PHAT) bereitgestellt wird.</claim-text></claim>
<claim id="c-de-01-0026" num="0026">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum eine spektrale Gewichtungsfunktion eines mehrkanaligen Verfahrens zur Geräuschreduktion auf Basis einer "Generalized Cross-Correlation" (GCC) bereitgestellt wird.</claim-text></claim>
<claim id="c-de-01-0027" num="0027">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum spektrale Größen, die sowohl Sprach- als auch Störanteile enthalten, bereitgestellt werden.</claim-text></claim>
<claim id="c-de-01-0028" num="0028">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum eine Schätzung des Signal-zu-Rausch-Verhältnisses bereitgestellt wird.<!-- EPO <DP n="23"> --></claim-text></claim>
<claim id="c-de-01-0029" num="0029">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 17, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum eine Schätzung der Rauschleistung bereitgestellt wird.</claim-text></claim>
<claim id="c-de-01-0030" num="0030">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 15, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum transformierte Signalrahmen eines Bildsignals bereitgestellt werden und die zeilen- oder spaltenweise oder 2-dimensional berechneten Koeffizienten des transformierten Bildsignals einer räumlichen Glättung mit unterschiedlichen Glättungsparametern unterworfen werden.</claim-text></claim>
<claim id="c-de-01-0031" num="0031">
<claim-text>Glättungsverfahren nach dem vorhergehenden Anspruch, <b>dadurch gekennzeichnet, dass</b> das Bildsignal ein Videosignal ist.</claim-text></claim>
<claim id="c-de-01-0032" num="0032">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 15, <b>dadurch gekennzeichnet, dass</b> als Kurzzeitspektrum ein transformiertes, vom menschlichen Körper abgeleitetes, medizinisches Signal verwendet wird.</claim-text></claim>
<claim id="c-de-01-0033" num="0033">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 32, <b>dadurch gekennzeichnet dass</b> das Glättungsverfahren in einem Postfilter, in Kombination mit einem Postfilter, im Rahmen eines Fehlerverdeckungsverfahrens oder in Zusammenhang mit einem Verfahren zur Sprach- und/oder Bildcodierung insbesondere empfängerseitig eingesetzt wird.</claim-text></claim>
<claim id="c-de-01-0034" num="0034">
<claim-text>Glättungsverfahren nach einem der Ansprüche 1 bis 33, <b>dadurch gekennzeichnet, dass</b> das Glättungsverfahren in einem Telekommunikationsnetzwerk und/oder bei einer Rundfunkübertragung zur Verbesserung der Sprach- und/oder Bildqualität sowie zur Unterdrückung von Artefakten eingesetzt wird.</claim-text></claim>
</claims><!-- EPO <DP n="24"> -->
<claims id="claims02" lang="en">
<claim id="c-en-01-0001" num="0001">
<claim-text>Smoothing method for suppressing fluctuating artifacts during noise reduction, having the following steps:
<claim-text>• short-term spectra for a series of signal frames comprising digital samples are provided,</claim-text>
<claim-text>• each short-term spectrum is transformed by forward transformation, which describes the short-term spectrum using transformation coefficients which represent the short-term spectrum divided into its coarse and its fine structures,</claim-text>
<claim-text>• the transformation coefficients with the same coefficient indices in each case are smoothed by combining at least two successive transformed short-term spectra, and</claim-text>
<claim-text>• the smoothed transformation coefficients are transformed into smoothed short-term spectra by backward transformation.</claim-text></claim-text></claim>
<claim id="c-en-01-0002" num="0002">
<claim-text>Smoothing method according to the preceding claim, <b>characterized in that</b> the inverse of the forward transformation is used for the backward transformation.</claim-text></claim>
<claim id="c-en-01-0003" num="0003">
<claim-text>Smoothing method according to Claim 1 or 2, <b>characterized in that</b> transformation with an orthogonal base is used.<!-- EPO <DP n="25"> --></claim-text></claim>
<claim id="c-en-01-0004" num="0004">
<claim-text>Smoothing method according to Claim 1 or 2, <b>characterized in that</b> transformation with a nonorthogonal base is used.</claim-text></claim>
<claim id="c-en-01-0005" num="0005">
<claim-text>Smoothing method according to Claim 1 or 2, <b>characterized in that</b> the discrete Fourier transformation and the inverse thereof are used for the transformations.</claim-text></claim>
<claim id="c-en-01-0006" num="0006">
<claim-text>Smoothing method according to Claim 1 or 2, <b>characterized in that</b> the fast Fourier transformation and the inverse thereof are used for the transformations.</claim-text></claim>
<claim id="c-en-01-0007" num="0007">
<claim-text>Smoothing method according to Claim 1 or 2, <b>characterized in that</b> the discrete cosine transformation and the inverse thereof are used for the transformations.</claim-text></claim>
<claim id="c-en-01-0008" num="0008">
<claim-text>Smoothing method according to Claim 1 or 2, <b>characterized in that</b> the discrete sine transformation and the inverse thereof are used for the transformations.</claim-text></claim>
<claim id="c-en-01-0009" num="0009">
<claim-text>Smoothing method according to one of the preceding claims, <b>characterized in that</b> the short-term spectra are mapped nonlinearly before the forward transformation.</claim-text></claim>
<claim id="c-en-01-0010" num="0010">
<claim-text>Smoothing method according to the preceding claim, <b>characterized in that</b> the smoothed short-term spectra are mapped nonlinearly after the backward transformation, wherein the nonlinear mapping of the backward transformation is the reversal of the nonlinear mapping of the forward transformation.</claim-text></claim>
<claim id="c-en-01-0011" num="0011">
<claim-text>Smoothing method according to one of the two preceding claims, <b>characterized in that</b> the short-term spectra are mapped nonlinearly before the forward transformation by logarithmization.<!-- EPO <DP n="26"> --></claim-text></claim>
<claim id="c-en-01-0012" num="0012">
<claim-text>Smoothing method according to one of Claims 1 to 11, <b>characterized in that</b> recursive smoothing is used for smoothing the transformation coefficients.</claim-text></claim>
<claim id="c-en-01-0013" num="0013">
<claim-text>Smoothing method according to one of Claims 1 to 11, <b>characterized in that</b> nonrecursive smoothing is used for smoothing the transformation coefficients.</claim-text></claim>
<claim id="c-en-01-0014" num="0014">
<claim-text>Smoothing method according to one of the preceding claims, <b>characterized in that</b> the smoothing is applied to the absolute value or to a power of the absolute value of the short-term spectra.</claim-text></claim>
<claim id="c-en-01-0015" num="0015">
<claim-text>Smoothing method according to one of the preceding claims, <b>characterized in that</b> different time constants are used for smoothing the respective transformation coefficients.</claim-text></claim>
<claim id="c-en-01-0016" num="0016">
<claim-text>Smoothing method according to the preceding claim, <b>characterized in that</b> time constants are chosen such that the transformation coefficients which typically describe spectral structures of voice are smoothed little.</claim-text></claim>
<claim id="c-en-01-0017" num="0017">
<claim-text>Smoothing method according to one of the two preceding claims, <b>characterized in that</b> time constants are chosen such that the transformation coefficients which describe spectral structures of fluctuating spectral magnitudes and of artifacts of noise reduction algorithms are smoothed much.</claim-text></claim>
<claim id="c-en-01-0018" num="0018">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum provided is a spectral weighting function of a noise reduction algorithm.</claim-text></claim>
<claim id="c-en-01-0019" num="0019">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum used is a spectral weighting function of a post filter for multichannel methods for noise reduction.<!-- EPO <DP n="27"> --></claim-text></claim>
<claim id="c-en-01-0020" num="0020">
<claim-text>Smoothing method according to one of the two preceding claims, <b>characterized in that</b> the spectral weighting function results from the minimization of an error criterion.</claim-text></claim>
<claim id="c-en-01-0021" num="0021">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum provided is a filtered short-term spectrum.</claim-text></claim>
<claim id="c-en-01-0022" num="0022">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum provided is a spectral weighting function of a multichannel method for noise reduction.</claim-text></claim>
<claim id="c-en-01-0023" num="0023">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum provided is an estimated coherence or an estimated "Magnitude Squared Coherence" between at least two microphone channels.</claim-text></claim>
<claim id="c-en-01-0024" num="0024">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum provided is a spectral weighting function of a multichannel method for speaker or source separation.</claim-text></claim>
<claim id="c-en-01-0025" num="0025">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum provided is a spectral weighting function of a multichannel method for speaker separation on the basis of phase differences for signals in the different channels (Phase Transform - PHAT).</claim-text></claim>
<claim id="c-en-01-0026" num="0026">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum provided is a spectral weighting function of a multichannel method for noise reduction on the basis of a "Generalized Cross-Correlation" (GCC).<!-- EPO <DP n="28"> --></claim-text></claim>
<claim id="c-en-01-0027" num="0027">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum provided is spectral magnitudes which contain both voice and noise components.</claim-text></claim>
<claim id="c-en-01-0028" num="0028">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum provided is an estimate of the signal-to-noise ratio.</claim-text></claim>
<claim id="c-en-01-0029" num="0029">
<claim-text>Smoothing method according to one of Claims 1 to 17, <b>characterized in that</b> the short-term spectrum provided is an estimate of the noise power.</claim-text></claim>
<claim id="c-en-01-0030" num="0030">
<claim-text>Smoothing method according to one of Claims 1 to 15, <b>characterized in that</b> the short-term spectrum provided is transformed signal frames of an image signal, and the coefficients of the transformed image signal which are calculated row by row or column by column or two-dimensionally are subjected to spatial smoothing with different smoothing parameters.</claim-text></claim>
<claim id="c-en-01-0031" num="0031">
<claim-text>Smoothing method according to the preceding claim, <b>characterized in that</b> the image signal is a video signal.</claim-text></claim>
<claim id="c-en-01-0032" num="0032">
<claim-text>Smoothing method according to one of Claims 1 to 15, <b>characterized in that</b> the short-term spectrum used is a transformed medical signal derived from the human body.</claim-text></claim>
<claim id="c-en-01-0033" num="0033">
<claim-text>Smoothing method according to one of Claims 1 to 32, <b>characterized in that</b> the smoothing method is used in a post filter, in combination with a post filter, as part of an error masking method or in connection with a method for voice and/or image coding, particularly at the receiver end.</claim-text></claim>
<claim id="c-en-01-0034" num="0034">
<claim-text>Smoothing method according to one of Claims 1 to 33, <b>characterized in that</b> the smoothing method is used in a<!-- EPO <DP n="29"> --> telecommunication network and/or during a broadcast transmission to improve the voice and/or image quality and to suppress artifacts.</claim-text></claim>
</claims><!-- EPO <DP n="30"> -->
<claims id="claims03" lang="fr">
<claim id="c-fr-01-0001" num="0001">
<claim-text>Procédé de lissage pour supprimer des artefacts fluctuants lors de la réduction du bruit parasite, comprenant les stades suivants :
<claim-text>• on se procure des spectres de temps court d'une succession de trames de signal comprenant des valeurs numériques d'échantillonnage,</claim-text>
<claim-text>• on transforme chaque spectre de temps court par une transformation, qui décrit le spectre de temps court par des coefficients de transformation, qui représentent le spectre de temps court subdivisé en ses structures grossières et ses structures fines,</claim-text>
<claim-text>• on lisse les coefficients de transformation respectivement de même indice de coefficient par combinaison d'au moins deux spectres de temps court successifs transformés, et</claim-text>
<claim-text>• on transforme par une retransformation les coefficients de transformation lissés en des spectres de temps court lissés.</claim-text></claim-text></claim>
<claim id="c-fr-01-0002" num="0002">
<claim-text>Procédé de lissage suivant la revendication précédente, <b>caractérisé en ce qu'</b>on utilise l'inverse de la transformation pour la retransformation.</claim-text></claim>
<claim id="c-fr-01-0003" num="0003">
<claim-text>Procédé de lissage suivant la revendication 1 ou 2, <b>caractérisé en ce qu'</b>on utilise une transformation de base orthogonale.<!-- EPO <DP n="31"> --></claim-text></claim>
<claim id="c-fr-01-0004" num="0004">
<claim-text>Procédé de lissage suivant la revendication 1 ou 2, <b>caractérisé en ce qu'</b>on utilise une transformation de base non orthogonale.</claim-text></claim>
<claim id="c-fr-01-0005" num="0005">
<claim-text>Procédé de lissage suivant la revendication 1 ou 2, <b>caractérisé en ce qu'</b>on utilise pour la transformation la transformation de Fourier discrète et son inverse.</claim-text></claim>
<claim id="c-fr-01-0006" num="0006">
<claim-text>Procédé de lissage suivant la revendication 1 ou 2, <b>caractérisé en ce qu'</b>on utilise pour la transformation la transformation de Fourier rapide et son inverse.</claim-text></claim>
<claim id="c-fr-01-0007" num="0007">
<claim-text>Procédé de lissage suivant la revendication 1 ou 2, <b>caractérisé en ce qu'</b>on utilise pour la transformation la transformation cosinus discrète et son inverse.</claim-text></claim>
<claim id="c-fr-01-0008" num="0008">
<claim-text>Procédé de lissage suivant la revendication 1 ou 2, <b>caractérisé en ce qu'</b>on utilise pour la transformation la transformation sinus discrète et son inverse.</claim-text></claim>
<claim id="c-fr-01-0009" num="0009">
<claim-text>Procédé de lissage suivant l'une des revendications précédentes, <b>caractérisé en ce qu'</b>on reproduit de manière non linéaire les spectres de temps court avant la transformation.</claim-text></claim>
<claim id="c-fr-01-0010" num="0010">
<claim-text>Procédé de lissage suivant la revendication précédente, <b>caractérisé en ce qu'</b>on reproduit de manière non linéaire, après la retransformation, les spectres de temps court lissés, la reproduction non linéaire de la retransformation étant l'inverse de la reproduction non linéaire de la transformation.</claim-text></claim>
<claim id="c-fr-01-0011" num="0011">
<claim-text>Procédé de lissage suivant l'une des deux revendications précédentes, <b>caractérisé en ce qu'</b>on reproduit de manière<!-- EPO <DP n="32"> --> non linéaire en prenant le logarithme les spectres de temps court avant la transformation.</claim-text></claim>
<claim id="c-fr-01-0012" num="0012">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 11, <b>caractérisé en ce qu'</b>on utilise un lissage récursif pour le lissage des coefficients de transformation.</claim-text></claim>
<claim id="c-fr-01-0013" num="0013">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 11, <b>caractérisé en ce qu'</b>on utilise un lissage non récursif pour le lissage des coefficients de transformation.</claim-text></claim>
<claim id="c-fr-01-0014" num="0014">
<claim-text>Procédé de lissage suivant l'une des revendications précédentes, <b>caractérisé en ce qu'</b>on applique le lissage à la valeur absolue ou à une puissance de la valeur absolue des spectres de temps court.</claim-text></claim>
<claim id="c-fr-01-0015" num="0015">
<claim-text>Procédé de lissage suivant l'une des revendications précédentes, <b>caractérisé en ce qu'</b>on utilise pour le lissage des coefficients de transformation respectifs des constantes de temps différentes.</claim-text></claim>
<claim id="c-fr-01-0016" num="0016">
<claim-text>Procédé de lissage suivant la revendication précédente, <b>caractérisé en ce qu'</b>on choisit des constantes de temps de manière à lisser peu les coefficients de transformation, qui décrivent typiquement des structures spectrales de parole.</claim-text></claim>
<claim id="c-fr-01-0017" num="0017">
<claim-text>Procédé de lissage suivant l'une des revendications précédentes, <b>caractérisé en ce qu'</b>on choisit des constantes de temps de manière à lisser beaucoup les coefficients de transformation, qui décrivent des structures spectrales de grandeurs spectrales fluctuantes et d'artéfacts d'algorithmes de réduction de bruit.<!-- EPO <DP n="33"> --></claim-text></claim>
<claim id="c-fr-01-0018" num="0018">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court une fonction spectrale de pondération d'un algorithme de réduction de bruit.</claim-text></claim>
<claim id="c-fr-01-0019" num="0019">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court une fonction spectrale de pondération d'un post-filtre pour des procédés à plusieurs canaux de réduction du bruit.</claim-text></claim>
<claim id="c-fr-01-0020" num="0020">
<claim-text>Procédé de lissage suivant l'une deux revendications précédentes, <b>caractérisé en ce qu'</b>on obtient la fonction spectrale de pondération à partir de la minimisation d'un critère d'erreur.</claim-text></claim>
<claim id="c-fr-01-0021" num="0021">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court un spectre de temps court filtré.</claim-text></claim>
<claim id="c-fr-01-0022" num="0022">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court une fonction spectrale de pondération d'un procédé à plusieurs canaux de réduction du bruit.</claim-text></claim>
<claim id="c-fr-01-0023" num="0023">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court une cohérence estimée ou une "Magnitude Squared Coherence" estimée entre au moins deux microcanaux radio.</claim-text></claim>
<claim id="c-fr-01-0024" num="0024">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de<!-- EPO <DP n="34"> --> temps court une fonction spectrale d'un procédé à plusieurs canaux pour la séparation de locuteurs ou de sources.</claim-text></claim>
<claim id="c-fr-01-0025" num="0025">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court une fonction spectrale d'un procédé à plusieurs canaux pour la séparation de locuteurs sur la base de différences de phase de signaux dans les divers canaux ( phase Transform - PHAT ).</claim-text></claim>
<claim id="c-fr-01-0026" num="0026">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court une fonction spectrale de pondération d'un procédé à plusieurs canaux pour la réduction du bruit sur la base d'une "Generalized Cross-Correlation" (GCC).</claim-text></claim>
<claim id="c-fr-01-0027" num="0027">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court des grandeurs spectrales, qui contiennent à la fois des parties vocales et des parties parasites.</claim-text></claim>
<claim id="c-fr-01-0028" num="0028">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court une évaluation du rapport du signal au bruit.</claim-text></claim>
<claim id="c-fr-01-0029" num="0029">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 17, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court une évaluation de la puissance du bruit.</claim-text></claim>
<claim id="c-fr-01-0030" num="0030">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 15, <b>caractérisé en ce qu'</b>on se procure comme spectre de temps court des trames transformées d'un signal d'image et on soumet les coefficients ligne par ligne ou colonne<!-- EPO <DP n="35"> --> par colonne ou calculés en deux dimensions du signal d'image transformé à un lissage dans l'espace par des paramètres de lissage différents.</claim-text></claim>
<claim id="c-fr-01-0031" num="0031">
<claim-text>Procédé de lissage suivant la revendication précédente, <b>caractérisé en ce que</b> le signal d'image est un signal vidéo.</claim-text></claim>
<claim id="c-fr-01-0032" num="0032">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 15, <b>caractérisé en ce qu'</b>on utilise comme spectre de temps court un signal médical transformé dérivé du corps humain.</claim-text></claim>
<claim id="c-fr-01-0033" num="0033">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 32, <b>caractérisé en ce qu'</b>on utilise le procédé de lissage dans un post-filtre, en combinaison avec un post-filtre, dans le cas d'un procédé de découverte d'erreur ou en liaison avec un procédé de codage de la voix et/ou de l'image, notamment du côté récepteur.</claim-text></claim>
<claim id="c-fr-01-0034" num="0034">
<claim-text>Procédé de lissage suivant l'une des revendications 1 à 33, <b>caractérisé en ce qu'</b>on utilise le procédé de lissage dans un réseau de télécommunication et/ou dans une radiodiffusion pour améliorer la qualité de la voix et/ou de l'image, ainsi que pour supprimer des artefacts.</claim-text></claim>
</claims><!-- EPO <DP n="36"> -->
<drawings id="draw" lang="de">
<figure id="f0001" num="1,2"><img id="if0001" file="imgf0001.tif" wi="148" he="219" img-content="drawing" img-format="tif"/></figure><!-- EPO <DP n="37"> -->
<figure id="f0002" num="3,4"><img id="if0002" file="imgf0002.tif" wi="147" he="232" img-content="drawing" img-format="tif"/></figure><!-- EPO <DP n="38"> -->
<figure id="f0003" num="5"><img id="if0003" file="imgf0003.tif" wi="152" he="126" img-content="drawing" img-format="tif"/></figure><!-- EPO <DP n="39"> -->
<figure id="f0004" num="6,7"><img id="if0004" file="imgf0004.tif" wi="158" he="228" img-content="drawing" img-format="tif"/></figure><!-- EPO <DP n="40"> -->
<figure id="f0005" num="8,9"><img id="if0005" file="imgf0005.tif" wi="155" he="233" img-content="drawing" img-format="tif"/></figure><!-- EPO <DP n="41"> -->
<figure id="f0006" num="10,11"><img id="if0006" file="imgf0006.tif" wi="157" he="233" img-content="drawing" img-format="tif"/></figure><!-- EPO <DP n="42"> -->
<figure id="f0007" num="12,13"><img id="if0007" file="imgf0007.tif" wi="158" he="233" img-content="drawing" img-format="tif"/></figure><!-- EPO <DP n="43"> -->
<figure id="f0008" num="14"><img id="if0008" file="imgf0008.tif" wi="155" he="116" img-content="drawing" img-format="tif"/></figure><!-- EPO <DP n="44"> -->
<figure id="f0009" num="15"><img id="if0009" file="imgf0009.tif" wi="147" he="233" img-content="drawing" img-format="tif"/></figure>
</drawings>
<ep-reference-list id="ref-list">
<heading id="ref-h0001"><b>IN DER BESCHREIBUNG AUFGEFÜHRTE DOKUMENTE</b></heading>
<p id="ref-p0001" num=""><i>Diese Liste der vom Anmelder aufgeführten Dokumente wurde ausschließlich zur Information des Lesers aufgenommen und ist nicht Bestandteil des europäischen Patentdokumentes. Sie wurde mit größter Sorgfalt zusammengestellt; das EPA übernimmt jedoch keinerlei Haftung für etwaige Fehler oder Auslassungen.</i></p>
<heading id="ref-h0002"><b>In der Beschreibung aufgeführte Patentdokumente</b></heading>
<p id="ref-p0002" num="">
<ul id="ref-ul0001" list-style="bullet">
<li><patcit id="ref-pcit0001" dnum="US5365592A"><document-id><country>US</country><doc-number>5365592</doc-number><kind>A</kind></document-id></patcit><crossref idref="pcit0001">[0012]</crossref></li>
</ul></p>
<heading id="ref-h0003"><b>In der Beschreibung aufgeführte Nicht-Patentliteratur</b></heading>
<p id="ref-p0003" num="">
<ul id="ref-ul0002" list-style="bullet">
<li><nplcit id="ref-ncit0001" npl-type="s"><article><author><name>Tim Fingscheidt</name></author><author><name>Christophe Beaugeant</name></author><author><name>Suhadi Suhadi</name></author><atl>Overcoming the statistical independence assumption w.r.t. frequency in speech enhancement</atl><serial><sertitle>Proceedings, IEEE Int. Conf. Acoustics, Speech, Signal Processing</sertitle><pubdate><sdate>20050000</sdate><edate/></pubdate><vid>1</vid></serial><location><pp><ppf>1081</ppf><ppl>1084</ppl></pp></location></article></nplcit><crossref idref="ncit0001">[0008]</crossref></li>
<li><nplcit id="ref-ncit0002" npl-type="s"><article><author><name>Harald Gustafsson</name></author><author><name>Sven Erik Nordholm</name></author><author><name>Ingvar Claesson</name></author><atl>Spectral subtraction using reduced delay convolution and adaptive averaging</atl><serial><sertitle>IEEE Transactions on Speech and Audio Processing</sertitle><pubdate><sdate>20011100</sdate><edate/></pubdate><vid>9</vid><ino>8</ino></serial><location><pp><ppf>799</ppf><ppl>807</ppl></pp></location></article></nplcit><crossref idref="ncit0002">[0008]</crossref></li>
<li><nplcit id="ref-ncit0003" npl-type="s"><article><author><name>Zenton Goh</name></author><author><name>Kah-Chye Tan</name></author><author><name>B.T.G. Tan</name></author><atl>Postprocessing method for suppressing musical noise generated by spectral subtraction</atl><serial><sertitle>IEEE Transactions on Speech and Audio Processing</sertitle><pubdate><sdate>19980500</sdate><edate/></pubdate><vid>6</vid><ino>3</ino></serial><location><pp><ppf>287</ppf><ppl>292</ppl></pp></location></article></nplcit><crossref idref="ncit0003">[0008]</crossref></li>
<li><nplcit id="ref-ncit0004" npl-type="s"><article><author><name>Andrzej Czyzewski</name></author><atl/><serial><sertitle>Multitask noisy speech enhancement system</sertitle><pubdate><sdate>20040000</sdate><edate/></pubdate></serial></article></nplcit><crossref idref="ncit0004">[0009]</crossref></li>
<li><nplcit id="ref-ncit0005" npl-type="s"><article><author><name>Francois Thibault</name></author><atl/><serial><sertitle>High-level control of singing voice timbre transformations</sertitle><pubdate><sdate>20040000</sdate><edate/></pubdate></serial></article></nplcit><crossref idref="ncit0005">[0009]</crossref></li>
<li><nplcit id="ref-ncit0006" npl-type="s"><article><author><name>Petre Stoica</name></author><author><name>Niclas Sandgren</name></author><atl>Smoothed nonparametric spectral estimation via cepstrum thresholding</atl><serial><sertitle>IEEE Signal Processing Magazine</sertitle><pubdate><sdate>20061100</sdate><edate/></pubdate></serial><location><pp><ppf>34</ppf><ppl>45</ppl></pp></location></article></nplcit><crossref idref="ncit0006">[0011]</crossref></li>
</ul></p>
</ep-reference-list>
</ep-patent-document>
