<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE ep-patent-document PUBLIC "-//EPO//EP PATENT DOCUMENT 1.4//EN" "ep-patent-document-v1-4.dtd">
<ep-patent-document id="EP12170874A1" file="EP12170874NWA1.xml" lang="fr" country="EP" doc-number="2538409" kind="A1" date-publ="20121226" status="n" dtd-version="ep-patent-document-v1-4">
<SDOBI lang="fr"><B000><eptags><B001EP>ATBECHDEDKESFRGBGRITLILUNLSEMCPTIESILTLVFIROMKCYALTRBGCZEEHUPLSKBAHRIS..MTNORSMESM..................</B001EP><B005EP>J</B005EP><B007EP>DIM360 Ver 2.15 (14 Jul 2008) -  1100000/0</B007EP></eptags></B000><B100><B110>2538409</B110><B120><B121>DEMANDE DE BREVET EUROPEEN</B121></B120><B130>A1</B130><B140><date>20121226</date></B140><B190>EP</B190></B100><B200><B210>12170874.7</B210><B220><date>20120605</date></B220><B240><B241><date>20120605</date></B241></B240><B250>fr</B250><B251EP>fr</B251EP><B260>fr</B260></B200><B300><B310>1155377</B310><B320><date>20110620</date></B320><B330><ctry>FR</ctry></B330></B300><B400><B405><date>20121226</date><bnum>201252</bnum></B405><B430><date>20121226</date><bnum>201252</bnum></B430></B400><B500><B510EP><classification-ipcr sequence="1"><text>G10L  21/02        20060101AFI20120806BHEP        </text></classification-ipcr><classification-ipcr sequence="2"><text>H04R   3/00        20060101ALI20120806BHEP        </text></classification-ipcr></B510EP><B540><B541>de</B541><B542>Verfahren zur Geräuschdämpfung für Audio-Gerät mit mehreren Mikrofonen, insbesondere für eine telefonische Freisprechanlage</B542><B541>en</B541><B542>Noise reduction method for multi-microphone audio equipment, in particular for a hands-free telephony system</B542><B541>fr</B541><B542>Procédé de débruitage pour équipement audio multi-microphones, notamment pour un système de téléphonie "mains libres"</B542></B540><B590><B598>6</B598></B590></B500><B700><B710><B711><snm>Parrot</snm><iid>100196133</iid><irf>345P54066EP</irf><adr><str>174 quai de Jemmapes</str><city>75010 Paris</city><ctry>FR</ctry></adr></B711></B710><B720><B721><snm>Fox, Charles</snm><adr><str>4 rue du Douanier Rousseau</str><city>75014 PARIS</city><ctry>FR</ctry></adr></B721></B720><B740><B741><snm>Dupuis-Latour, Dominique</snm><sfx>et al</sfx><iid>101064756</iid><adr><str>Bardehle Pagenberg 
10, boulevard Haussmann</str><city>75009 Paris</city><ctry>FR</ctry></adr></B741></B740></B700><B800><B840><ctry>AL</ctry><ctry>AT</ctry><ctry>BE</ctry><ctry>BG</ctry><ctry>CH</ctry><ctry>CY</ctry><ctry>CZ</ctry><ctry>DE</ctry><ctry>DK</ctry><ctry>EE</ctry><ctry>ES</ctry><ctry>FI</ctry><ctry>FR</ctry><ctry>GB</ctry><ctry>GR</ctry><ctry>HR</ctry><ctry>HU</ctry><ctry>IE</ctry><ctry>IS</ctry><ctry>IT</ctry><ctry>LI</ctry><ctry>LT</ctry><ctry>LU</ctry><ctry>LV</ctry><ctry>MC</ctry><ctry>MK</ctry><ctry>MT</ctry><ctry>NL</ctry><ctry>NO</ctry><ctry>PL</ctry><ctry>PT</ctry><ctry>RO</ctry><ctry>RS</ctry><ctry>SE</ctry><ctry>SI</ctry><ctry>SK</ctry><ctry>SM</ctry><ctry>TR</ctry></B840><B844EP><B845EP><ctry>BA</ctry></B845EP><B845EP><ctry>ME</ctry></B845EP></B844EP></B800></SDOBI>
<abstract id="abst" lang="fr">
<p id="pa01" num="0001">Ce procédé comporte les étapes suivantes, dans le domaine fréquentiel :<br/>
a) estimation (22) d'une probabilité de présence de parole (<i>p</i>);<br/>
b) estimation (46), modulée par la probabilité de présence de parole (<i>p</i>), d'une matrice spectrale de covariance (<i>R<sub>n</sub></i>) des bruits recueillis par les capteurs ;<br/>
c) estimation (28, 38), modulée par la probabilité de présence de parole (<i>p</i>), de la fonction de transfert (<i>H</i>) des canaux acoustiques entre la source de parole et au moins certains des capteurs, par rapport à une référence constituée par le signal recueilli par l'un des capteurs ;<br/>
d) calcul (48) d'un projecteur linéaire optimal donnant un signal combiné unique à partir des signaux <i>(X<sub>1</sub>... X<sub>n</sub>)</i> recueillis par au moins certains des capteurs, de la matrice spectrale de covariance (<i>R<sub>n</sub></i>), et des fonctions de transfert estimées <i>(H<sub>1</sub>...H<sub>n</sub>);</i> et<br/>
e) à partir de la probabilité de présence de parole (<i>p</i>) et du signal combiné de sortie du projecteur, réduction sélective du bruit (50) par application d'un gain variable.
<img id="iaf01" file="imgaf001.tif" wi="121" he="93" img-content="drawing" img-format="tif"/></p>
</abstract>
<description id="desc" lang="fr"><!-- EPO <DP n="1"> -->
<p id="p0001" num="0001">L'invention concerne le traitement de la parole en milieu bruité.</p>
<p id="p0002" num="0002">Elle concerne notamment, mais de façon non limitative, le traitement des signaux de parole captés par des dispositifs de téléphonie pour véhicules automobiles.</p>
<p id="p0003" num="0003">Ces appareils comportent un ou plusieurs microphones ("micros") sensible non seulement à la voix de l'utilisateur, mais captant aussi le bruit environnant ainsi que l'écho dû au phénomène de réverbération par l'environnement, typiquement l'habitacle du véhicule. La composante utile (le signal de parole du locuteur proche) se trouve ainsi noyée dans une composante parasite de bruit (bruits externes et réverbération) pouvant aller, souvent, jusqu'à rendre incompréhensible pour le locuteur distant (celui qui est à l'autre bout de la voie de transmission du signal téléphonique) les paroles du locuteur proche.</p>
<p id="p0004" num="0004">Il en est de même si l'on veut mettre en oeuvre des techniques de reconnaissance vocale, car il est très difficile d'opérer une reconnaissance de forme sur des mots noyés dans un niveau de bruit élevé.</p>
<p id="p0005" num="0005">Cette difficulté liée aux bruits environnants est particulièrement contraignante dans le cas des dispositifs "mains-libres". En particulier, la distance importante entre le micro et le locuteur entraîne un niveau relatif de bruit élevé qui rend difficile l'extraction du signal utile noyé dans le bruit. De plus, le milieu très bruité typique de l'environnement automobile présente des caractéristiques spectrales non stationnaires, c'est-à-dire qui évoluent de manière imprévisible en fonction des conditions de conduite : passage sur des chaussées déformées ou pavées, autoradio en fonctionnement, etc.</p>
<p id="p0006" num="0006">Certains de ces dispositifs prévoient l'utilisation de plusieurs micros et utilisent la moyenne des signaux captés, ou d'autres opérations plus complexes, pour obtenir un signal avec un niveau de perturbations moindre. En particulier, des techniques dites de <i>beamforming</i> permettent de créer par des moyens logiciels une directivité qui améliore le rapport signal/bruit. Mais les performances de cette technique sont très limitées lorsque seulement deux micros sont utilisés (concrètement, on estime qu'une telle méthode ne fournit de bons résultats qu'à condition de disposer d'un réseau d'au moins huit micros). Les performances sont en outre très dégradées lorsque l'environnement est réverbérant.<!-- EPO <DP n="2"> --></p>
<p id="p0007" num="0007">Le but de l'invention est de proposer une solution de débruitage des signaux audio captés par un tel système multicanal, multi-microphones, dans un environnement très bruyant et très réverbérant, typiquement l'habitacle d'une voiture.</p>
<p id="p0008" num="0008">La principale difficulté liée aux méthodes de traitement de la parole par des systèmes multicanal est la difficulté d'estimation des paramètres utiles pour les traitements à appliquer, car les estimateurs sont fortement liés à l'environnement ambiant.</p>
<p id="p0009" num="0009">La plupart des techniques se basent sur l'hypothèse que le signal utile et/ou les bruits parasites présentent une certaine directivité, et combinent les signaux issus des différents micros de manière à améliorer le rapport signal/bruit en fonction de ces conditions de directivité.</p>
<p id="p0010" num="0010">Ainsi, le <patcit id="pcit0001" dnum="EP2293594A1"><text>EP 2 293 594 A1</text></patcit> (Parrot SA) décrit un procédé à détection spatiale et filtrage des bruits non stationnaires et directifs tels que coups de klaxon, passage d'un scooter, dépassement par une voiture, etc. La technique proposée consiste à associer les propriétés de non-stationnarité temporelle et fréquentielle, d'une part, et de directivité spatiale, d'autre part, pour détecter un type de bruit qu'il est d'ordinaire difficile de discriminer de la parole, afin d'assurer un filtrage efficace de ce bruit et de déduire par ailleurs une probabilité de présence de parole qui permettra d'améliorer encore l'atténuation du bruit.</p>
<p id="p0011" num="0011">Le <patcit id="pcit0002" dnum="EP2309499A1"><text>EP 2 309 499 A1</text></patcit> (Parrot SA) décrit un système à deux micros opérant une analyse de cohérence spatiale du signal capté de manière à déterminer une direction d'incidence. Le système calcule deux références de bruits selon des méthodes différentes, l'une en fonction de la cohérence spatiale des signaux captés (qui intègre les bruits non stationnaires peu directifs) et une autre en fonction de la direction principale d'incidence des signaux (qui intègre surtout les bruits non stationnaires directifs). Cette technique de débruitage repose sur l'hypothèse que la parole présente généralement une cohérence spatiale supérieure au bruit et que, par ailleurs, la direction d'incidence de la parole est généralement bien définie et peut être supposée connue : dans le cas d'un véhicule automobile, elle est définie par la position du conducteur, vers lequel sont tournés les micros.<!-- EPO <DP n="3"> --></p>
<p id="p0012" num="0012">Ces techniques prennent cependant mal en compte l'effet de réverbération typique de l'habitacle d'une voiture, où les réflexions puissantes et nombreuses rendent difficile le calcul d'une direction d'arrivée, avec pour conséquence une dégradation notable de l'efficacité du débruitage.</p>
<p id="p0013" num="0013">En outre, avec ces techniques le signal débruité obtenu en sortie restitue de façon satisfaisante l'amplitude du signal de parole initial, mais non sa phase, ce qui peut entraîner une déformation de la voix reproduite par le dispositif.</p>
<p id="p0014" num="0014">Le problème de l'invention est la prise en compte d'un environnement réverbérant ne permettant pas de calculer de façon satisfaisante une direction d'arrivée du signal utile et, subsidiairement, l'obtention d'un débruitage qui restitue à la fois l'amplitude et la phase du signal initial, en ne déformant donc pas la voix du locuteur lorsque celle-ci est reproduite par le dispositif.</p>
<p id="p0015" num="0015">L'invention propose une technique mise en oeuvre dans le domaine fréquentiel, pour une pluralité de <i>bins</i> du signal capté (c'est-à-dire pour chaque bande de fréquences de chaque trame temporelle du signal). Le traitement consiste essentiellement à :
<ul id="ul0001" list-style="dash" compact="compact">
<li>calculer une probabilité de présence de parole dans le signal bruité recueilli ;</li>
<li>estimer la fonction de transfert du canal acoustique entre la source de parole (le locuteur proche) et chacun des capteurs du réseau de micros ;</li>
<li>calculer une projection optimale pour déterminer un canal unique à partir des fonctions de transfert des canaux multiples estimés ; et</li>
<li>réduire sélectivement le bruit sur ce canal unique, pour chaque <i>bin,</i> en fonction de la probabilité de présence de parole.</li>
</ul></p>
<p id="p0016" num="0016">Plus précisément, le procédé de l'invention est un procédé de débruitage pour un dispositif comprenant un réseau formé d'une pluralité de capteurs microphoniques disposés selon une configuration prédéterminée.</p>
<p id="p0017" num="0017">Ce procédé comporte les étapes de traitement suivantes dans le domaine fréquentiel, pour une pluralité de bandes de fréquences définies pour des trames temporelles successives de signal :
<ol id="ol0001" compact="compact" ol-style="">
<li>a) estimation d'une probabilité de présence de parole dans le signal bruité recueilli ;<!-- EPO <DP n="4"> --></li>
<li>b) estimation d'une matrice spectrale de covariance des bruits recueillis par les capteurs, cette estimation étant modulée par la probabilité de présence de parole ;</li>
<li>c) estimation de la fonction de transfert des canaux acoustiques entre la source de parole et au moins certains des capteurs, cette estimation étant opérée par rapport à une référence de signal utile constituée par le signal recueilli par l'un des capteurs, et étant en outre modulée par la probabilité de présence de parole ;</li>
<li>d) calcul d'un projecteur linéaire optimal, donnant un signal combiné débruité unique à partir des signaux recueillis par au moins certains des capteurs, de la matrice spectrale de covariance estimée à l'étape b), et des fonctions de transfert estimées à l'étape c) ; et</li>
<li>e) à partir de la probabilité de présence de parole et du signal combiné donné par le projecteur calculé à l'étape d), réduction sélective du bruit par application d'un gain variable propre à chaque bande de fréquences et à chaque trame temporelle.</li>
</ol></p>
<p id="p0018" num="0018">De préférence, le calcul du projecteur linéaire optimal de l'étape d) est opéré par un traitement de type <i>beamforming</i> de Capon à réponse sans distorsion à variance minimale MVDR.</p>
<p id="p0019" num="0019">De préférence également, la réduction sélective de bruit de l'étape e) est opérée par un traitement de type gain à amplitude log-spectrale modifié optimisé OM-LSA.</p>
<p id="p0020" num="0020">Dans une première forme de mise en oeuvre, l'estimation de la fonction de transfert de l'étape c) est opérée par calcul d'un filtre adaptatif visant à annuler la différence entre le signal recueilli par le capteur dont on cherche à évaluer la fonction de transfert et le signal recueilli par le capteur de la référence de signal utile, avec modulation par la probabilité de présence de parole.</p>
<p id="p0021" num="0021">Le filtre adaptatif peut notamment être un filtre à algorithme de prédiction linéaire de type moindres carrés moyens LMS et la modulation par la probabilité de présence de parole, une modulation par variation du pas d'itération du filtre adaptatif.<!-- EPO <DP n="5"> --></p>
<p id="p0022" num="0022">Dans une deuxième forme de mise en oeuvre, l'estimation de la fonction de transfert de l'étape c) est opérée par un traitement de diagonalisation comprenant :
<ul id="ul0002" list-style="none" compact="compact">
<li>c1) la détermination d'une matrice spectrale de corrélation des signaux recueillis par les capteurs du réseau par rapport au capteur de la référence de signal utile,</li>
<li>c2) le calcul de la différence entre, d'une part, la matrice déterminée à l'étape c1) et, d'autre part, la matrice spectrale de covariance des bruits modulée par la probabilité de présence de parole, calculée à l'étape b), et</li>
<li>c3) la diagonalisation de la matrice différence calculée à l'étape c2). Par ailleurs, le spectre du signal à débruiter est avantageusement divisé en une pluralité de parties de spectre distinctes, les capteurs étant regroupés en une pluralité de sous-réseaux associés chacun à l'une des parties du spectre. Le traitement de débruitage est alors opéré de façon différenciée, pour chacune des parties du spectre, sur les signaux recueillis par les capteurs du sous-réseau correspondant à la partie du spectre considérée.</li>
</ul></p>
<p id="p0023" num="0023">En particulier, dans le cas où le réseau de capteurs est un réseau linéaire de capteurs alignés, le spectre du signal à débruiter peut être divisé en une partie basse fréquence et une partie haute fréquence. Pour la partie basse fréquence, les étapes du traitement de débruitage sont alors opérées seulement sur les signaux recueillis par les capteurs les plus éloignés du réseau.</p>
<p id="p0024" num="0024">Il est également possible, toujours avec un spectre de signal à débruiter divisé en une pluralité de parties de spectre distinctes, d'estimer de manière différenciée, à l'étape c), la fonction de transfert des canaux acoustiques par application de traitements différents pour chacune des parties du spectre.</p>
<p id="p0025" num="0025">En particulier, dans le cas où le réseau de capteurs est un réseau linéaire de capteurs alignés et où les capteurs sont regroupés en une pluralité de sous-réseaux associés chacun à l'une des parties du spectre : pour la partie basse fréquence, le traitement de débruitage est opéré seulement sur les signaux recueillis par les capteurs les plus éloignés du réseau et l'estimation de la fonction de transfert est opérée par calcul d'un filtre adaptatif<!-- EPO <DP n="6"> --> ; et pour la partie haute fréquence, le traitement de débruitage est opéré sur les signaux recueillis par tous les capteurs du réseau, et l'estimation de la fonction de transfert est opérée par un traitement de diagonalisation.</p>
<p id="p0026" num="0026">On va maintenant décrire un exemple de mise en oeuvre du dispositif de l'invention, en référence aux dessins annexés où les mêmes références numériques désignent d'une figure à l'autre des éléments identiques ou fonctionnellement semblables.
<ul id="ul0003" list-style="none" compact="compact">
<li>La <figref idref="f0001">Figure 1</figref> est une représentation schématique des différents phénomènes acoustiques impliqués dans le recueil de signaux bruités.</li>
<li>La <figref idref="f0001">Figure 2</figref> est une représentation schématique par blocs fonctionnels d'un filtre adaptatif pour l'estimation de la fonction de transfert d'un canal acoustique.</li>
<li>La <figref idref="f0001">Figure 3</figref> est une caractéristique montrant les variations de la corrélation entre deux capteurs pour un champ de bruit diffus, en fonction de la fréquence.</li>
<li>La <figref idref="f0002">Figure 4</figref> illustre de façon schématique un réseau de quatre micros utilisables de façon sélective, en fonction de la fréquence, pour la mise en oeuvre de l'invention.</li>
<li>La <figref idref="f0002">Figure 5</figref> est un schéma d'ensemble, sous forme de blocs fonctionnels, montrant les différents traitements selon l'invention pour le débruitage des signaux recueillis pas le réseau de micros de la <figref idref="f0002">Figure 4</figref>.</li>
<li>La <figref idref="f0002">Figure 6</figref> illustre plus précisément, sous forme de schéma par blocs, les fonctions mises en oeuvre, dans le domaine fréquentiel, pour le traitement selon l'invention illustré <figref idref="f0002">Figure 5</figref>.</li>
</ul></p>
<p id="p0027" num="0027">On va maintenant décrire en détail la technique de débruitage proposée par l'invention.</p>
<p id="p0028" num="0028">On considérera, comme illustré <figref idref="f0001">Figure 1</figref>, un ensemble de n capteurs microphoniques, chaque capteur pouvant être assimilé à un micro unique M<sub>1</sub> ... M<sub>n</sub> captant une version réverbérée d'un signal de parole émis par<!-- EPO <DP n="7"> --> une source de signal utile S (la parole d'un locuteur proche 10), signal auquel vient s'ajouter un bruit.</p>
<p id="p0029" num="0029">Chaque micro capte donc :
<ul id="ul0004" list-style="dash" compact="compact">
<li>une composante du signal utile (le signal de parole),</li>
<li>une composante de la réverbération de ce signal de parole par l'habitacle du véhicule, et</li>
<li>une composante du bruit parasite environnant, sous toutes ses formes (directif ou diffus, stationnaire ou évoluant de manière imprévisible, etc.).</li>
</ul></p>
<heading id="h0001"><i>Modélisation des signaux captés</i></heading>
<p id="p0030" num="0030">Il s'agit de traiter les (multiples) signaux de ces micros en opérant un débruitage (bloc 12) donnant en sortie un signal (unique) : on reconnaît dans ce schéma un modèle MISO (<i>Multiple Input Single Output</i>).</p>
<p id="p0031" num="0031">Le signal de sortie devra être le plus proche possible du signal de parole émis par le locuteur 10, c'est-à-dire :
<ul id="ul0005" list-style="dash" compact="compact">
<li>contenir le moins de bruit possible, et</li>
<li>déformer le moins possible la voix du locuteur restituée en sortie.</li>
</ul></p>
<p id="p0032" num="0032">Sur le capteur de rang i, le signal recueilli sera : <maths id="math0001" num=""><math display="block"><msub><mi>x</mi><mi>i</mi></msub><mfenced><mi>t</mi></mfenced><mo>=</mo><msub><mi>h</mi><mi>i</mi></msub><mo>⊗</mo><mi>s</mi><mfenced><mi>t</mi></mfenced><mo>+</mo><msub><mi>b</mi><mi>i</mi></msub><mfenced><mi>t</mi></mfenced></math><img id="ib0001" file="imgb0001.tif" wi="57" he="12" img-content="math" img-format="tif"/></maths><br/>
x<sub>i</sub> étant le signal capté, <i>h<sub>i</sub></i> étant la réponse impulsionnelle entre la source de signal utile S et le capteur M<sub>i</sub>, <i>s</i> étant le signal utile produit par la source S (signal de parole du locuteur proche 10) et <i>b<sub>i</sub></i> étant le bruit additif.</p>
<p id="p0033" num="0033">Pour l'ensemble des capteurs, on peut utiliser la notation vectorielle : <maths id="math0002" num=""><math display="block"><mi mathvariant="bold-italic">x</mi><mfenced><mi>t</mi></mfenced><mo>=</mo><mi mathvariant="bold-italic">h</mi><mo>⊗</mo><mi>s</mi><mfenced><mi>t</mi></mfenced><mo>+</mo><mi mathvariant="bold-italic">b</mi><mfenced><mi>t</mi></mfenced></math><img id="ib0002" file="imgb0002.tif" wi="55" he="7" img-content="math" img-format="tif"/></maths></p>
<p id="p0034" num="0034">Dans le domaine fréquentiel, cette expression devient : <maths id="math0003" num=""><math display="block"><mi mathvariant="bold-italic">X</mi><mfenced><mi mathvariant="normal">ω</mi></mfenced><mo>=</mo><mi mathvariant="bold-italic">H</mi><mfenced><mi mathvariant="normal">ω</mi></mfenced><mo>⁢</mo><mi mathvariant="bold-italic">S</mi><mfenced><mi mathvariant="normal">ω</mi></mfenced><mo>+</mo><mi mathvariant="bold-italic">B</mi><mfenced><mi mathvariant="normal">ω</mi></mfenced></math><img id="ib0003" file="imgb0003.tif" wi="68" he="8" img-content="math" img-format="tif"/></maths></p>
<p id="p0035" num="0035">On fera une première hypothèse selon laquelle la voix ainsi que le bruit sont gaussiens centrés.</p>
<p id="p0036" num="0036">Ceci se traduit dans le domaine fréquentiel par les conditions suivantes, pour toutes les fréquences ω:<!-- EPO <DP n="8"> -->
<ul id="ul0006" list-style="dash" compact="compact">
<li><b><i>S</i></b> est gaussien centré de puissance φ<i><sub>s</sub></i></li>
<li><b><i>B</i></b> est un vecteur gaussien centré de matrice de covariance <i><b>R</b><sub>n</sub></i></li>
<li><b><i>S</i></b> et <b><i>B</i></b> sont décorrélés et chacun est décorrélé lorsque les fréquences sont différentes</li>
</ul></p>
<p id="p0037" num="0037">On fera par ailleurs une deuxième hypothèse selon laquelle les bruits et la voix sont décorrélés. Cela se traduit par le fait que <b><i>S</i></b> est décorrélé avec toutes les composantes de <b><i>B</i></b>. De plus, pour des fréquences ω<i><sub>i</sub></i> et ω<i><sub>j</sub></i> différentes, <i>S</i>(ω<i><sub>i</sub></i>) et <i>S</i>(ω<i><sub>j</sub></i>) sont décorrélés. Cette hypothèse est également valable pour le vecteur de bruit <b><i>B</i></b>.</p>
<heading id="h0002"><i>Calcul d'un projecteur optimal</i></heading>
<p id="p0038" num="0038">La technique proposée consiste, sur la base des éléments que l'on vient d'exposer, à rechercher dans le domaine temporel un projecteur linéaire optimal pour chaque fréquence.</p>
<p id="p0039" num="0039">On entendra par "projecteur" un opérateur correspondant à une transformation d'une pluralité de signaux, recueillis concurremment par un dispositif multicanal, en un signal unique monocanal.</p>
<p id="p0040" num="0040">Cette projection est une projection linéaire "optimale" en ce sens que la composante de bruit résiduel sur le signal monocanal délivré en sortie soit minimisée (bruit et réverbération) et que la composante utile de parole soit le moins déformée possible.</p>
<p id="p0041" num="0041">Cette optimisation implique de rechercher pour chaque fréquence un vecteur <i>A</i> tel que :
<ul id="ul0007" list-style="dash" compact="compact">
<li>la projection <i><b>A</b><sup>T</sup> <b>X</b></i> contienne le moins de bruit possible, c'est-à-dire que la puissance du bruit résiduel, qui vaut <i>E</i>[<i><b>A</b><sup>T</sup><b>VV</b><sup>T</sup><b>A</b></i>] = <i><b>A</b><sup>T</sup><b>R</b><sub>n</sub><b>A</b></i>, soit minimisée, et</li>
<li>ne déforme pas la voix du locuteur, ce qui se traduit par la contrainte <i><b>A</b><sup>T</sup> <b>H</b>=</i> 1<i>.</i></li>
</ul>
<i><b>R</b><sub>n</sub></i> étant la matrice de corrélation entre les micros, pour chaque fréquence, et</p>
<p id="p0042" num="0042"><b><i>H</i></b> étant le canal acoustique considéré.</p>
<p id="p0043" num="0043">Ce problème est un problème d'optimisation sous contrainte, à savoir la recherche de <i>min</i> (<i><b>A</b><sup>T</sup><b>R</b><sub>n</sub><b>A</b></i>) sous la contrainte <i><b>A</b><sup>T</sup> <b>H</b>=</i>1.<!-- EPO <DP n="9"> --></p>
<p id="p0044" num="0044">Il peut être résolu en utilisant la méthode des multiplieurs de Lagrange, qui conduit à la solution : <maths id="math0004" num=""><math display="block"><msup><mi mathvariant="bold-italic">A</mi><mi mathvariant="bold-italic">T</mi></msup><mo>=</mo><mfrac><mrow><msup><mi mathvariant="bold-italic">H</mi><mi mathvariant="bold-italic">T</mi></msup><mo>⁢</mo><msubsup><mi mathvariant="bold-italic">R</mi><mi mathvariant="bold-italic">n</mi><mrow><mo mathvariant="bold-italic">-</mo><mn>1</mn></mrow></msubsup></mrow><mrow><msup><mi mathvariant="bold-italic">H</mi><mi mathvariant="bold-italic">T</mi></msup><mo>⁢</mo><msubsup><mi mathvariant="bold-italic">R</mi><mi mathvariant="bold-italic">n</mi><mrow><mo mathvariant="bold-italic">-</mo><mn>1</mn></mrow></msubsup><mo>⁢</mo><mi mathvariant="bold-italic">H</mi></mrow></mfrac></math><img id="ib0004" file="imgb0004.tif" wi="36" he="15" img-content="math" img-format="tif"/></maths></p>
<p id="p0045" num="0045">Dans le cas où les transferts <b><i>H</i></b> correspondent à un retard pur, on reconnait la formule du <i>beamforming</i> MVDR (<i>Minimum Variance Distorsionless Response</i>), aussi appelé <i>beamforming</i> de Capon.</p>
<p id="p0046" num="0046">On notera que la puissance de bruit résiduel vaut, après projection : <maths id="math0005" num=""><math display="block"><mfrac><mn>1</mn><mrow><msup><mi mathvariant="bold-italic">H</mi><mi mathvariant="bold-italic">T</mi></msup><mo>⁢</mo><msubsup><mi mathvariant="bold-italic">R</mi><mi mathvariant="bold-italic">n</mi><mrow><mo mathvariant="bold-italic">-</mo><mn>1</mn></mrow></msubsup><mo>⁢</mo><mi mathvariant="bold-italic">H</mi></mrow></mfrac></math><img id="ib0005" file="imgb0005.tif" wi="34" he="14" img-content="math" img-format="tif"/></maths></p>
<p id="p0047" num="0047">De plus, en écrivant des estimateurs de type <i>Minimum Mean-Squared Error</i> sur l'amplitude et la phase du signal à chaque fréquence, on constate que ces estimateurs s'écrivent comme un <i>beamforming</i> de Capon suivi d'un traitement monocanal, comme décrit dans :
<ul id="ul0008" list-style="none" compact="compact">
<li>[1] <nplcit id="ncit0001" npl-type="s"><text>R. C. Hendriks et al., On optimal multichannel mean-squared error estimators for speech enhancement, IEEE Signal Processing Letters, vol. 16, no. 10, 2009</text></nplcit>.<br/>
Le traitement de débruitage sélectif du bruit appliqué au signal monocanal résultant du traitement de <i>beamforming</i> est avantageusement un traitement de type gain à amplitude log-spectrale modifié optimisé OM-LSA tel que décrit par exemple dans :</li>
<li>[2] 1. <nplcit id="ncit0002" npl-type="s"><text>Cohen, Optimal Speech Enhancement Under Signal Presence Uncertainty Using Log-Spectral Amplitude Estimator, IEEE Signal Processing Letters, vol.9, no. 4, pp. 113-116, April 2002</text></nplcit>.</li>
</ul></p>
<heading id="h0003"><i>Estimation des paramètres pour le calcul du projecteur linéaire optimal</i></heading>
<p id="p0048" num="0048">Pour la mise en oeuvre de cette technique, il est nécessaire d'estimer la fonction de transfert acoustique <i><b>H</b><sub>1</sub>, <b>H</b><sub>2</sub> ... <b>H</b><sub>n</sub></i> entre la source de parole S et chacun des micros M<sub>1</sub>, M<sub>2</sub> ... M<sub>n</sub>.</p>
<p id="p0049" num="0049">Il est également nécessaire d'estimer la matrice spectrale de covariance des bruits, notée <i><b>R</b><sub>n</sub></i>.<!-- EPO <DP n="10"> --></p>
<p id="p0050" num="0050">Pour ces estimations, on utilisera une probabilité de présence de parole, notée <i>p</i>.</p>
<p id="p0051" num="0051">La probabilité de présence de parole <i>p</i> est un paramètre pouvant prendre plusieurs valeurs différentes comprises entre 0 et 100 % (et non seulement un valeur binaire 0 ou 1). Ce paramètre est calculé selon une technique en elle-même connue, dont des exemples sont notamment exposés dans :
<ul id="ul0009" list-style="none" compact="compact">
<li>[3] <nplcit id="ncit0003" npl-type="s"><text>I. Cohen et B. Berdugo, Two-Channel Signal Detection and Speech Enhancement Based on the Transient Beam-to-Reference Ratio, Proc. ICASSP 2003, Hong-Kong, pp. 233-236, Apr. 2003</text></nplcit>.</li>
</ul></p>
<p id="p0052" num="0052">On pourra également se référer au <patcit id="pcit0003" dnum="WO2007099222A1"><text>WO 2007/099222 A1</text></patcit>, qui décrit une technique de débruitage mettant en oeuvre un calcul de probabilité de présence de parole.</p>
<p id="p0053" num="0053">En ce qui concerne la matrice spectrale de covariance des bruits <i>R<sub>n</sub>,</i> on peut utiliser un estimateur d'espérance à fenêtre exponentielle, ce qui revient à appliquer un facteur d'oubli : <maths id="math0006" num=""><math display="block"><msub><mi mathvariant="bold-italic">R</mi><mi>n</mi></msub><mo>⁢</mo><mfenced separators=""><mi>k</mi><mo>+</mo><mn>1</mn></mfenced><mo>=</mo><mi>α</mi><mo>⁢</mo><msub><mi mathvariant="bold-italic">R</mi><mi>n</mi></msub><mfenced><mi>k</mi></mfenced><mo>+</mo><mfenced separators=""><mn>1</mn><mo>-</mo><mi mathvariant="normal">α</mi></mfenced><mo>⁢</mo><msup><mi mathvariant="bold-italic">XX</mi><mi mathvariant="bold-italic">T</mi></msup></math><img id="ib0006" file="imgb0006.tif" wi="82" he="14" img-content="math" img-format="tif"/></maths><br/>
<i>k</i>+1 étant le numéro de la trame courante, et<br/>
α est un facteur d'oubli compris entre 0 et 1.</p>
<p id="p0054" num="0054">Pour ne prendre en compte que les éléments où seul le bruit est présent, on module le facteur d'oubli α par la probabilité de présence de parole : <maths id="math0007" num=""><math display="block"><mi mathvariant="normal">α</mi><mo mathvariant="normal">=</mo><msub><mi mathvariant="normal">α</mi><mn mathvariant="normal">0</mn></msub><mo mathvariant="normal">+</mo><mfenced separators=""><mn mathvariant="normal">1</mn><mo mathvariant="normal">-</mo><msub><mi mathvariant="normal">α</mi><mn mathvariant="normal">0</mn></msub></mfenced><mo>⁢</mo><mi>p</mi></math><img id="ib0007" file="imgb0007.tif" wi="47" he="10" img-content="math" img-format="tif"/></maths><br/>
avec α <sub>0</sub>∈[01].</p>
<p id="p0055" num="0055">Pour estimer la fonction de transfert <b><i>H</i></b> du canal acoustique considéré, plusieurs techniques sont utilisables.</p>
<p id="p0056" num="0056">Une première technique consiste à utiliser un algorithme de type LMS dans le domaine fréquentiel.</p>
<p id="p0057" num="0057">Les algorithmes de type LMS - ou NLMS (<i>Normalized LMS</i>) qui est une version normalisée du LMS - sont des algorithmes relativement simples et peu exigeants en termes de ressources de calcul. Il s'agit d'algorithmes en eux-mêmes connus, décrits par exemple dans :<!-- EPO <DP n="11"> -->
<ul id="ul0010" list-style="none" compact="compact">
<li>[4] <nplcit id="ncit0004" npl-type="b"><text>B. Widrow, Adaptative Filters, Aspect of Network and System Theory, R. E. Kalman and N. De Claris Eds., New York: Holt, Rinehart and Winston, pp. 563-587, 1970</text></nplcit> ;</li>
<li>[5] <nplcit id="ncit0005" npl-type="b"><text>J. Prado et E. Moulines, Frequency-domain adaptive filtering with applications to acoustic echo cancellation, Springer, Ed. Annals of Telecommunications, 1994</text></nplcit> ;</li>
<li>[6] <nplcit id="ncit0006" npl-type="s"><text>B. Widrow et S. Stearns, Adaptative Signal Processing, Prentice-Hall Signal Processing Series, Alan V. Oppenheim Series Editor, 1985</text></nplcit>.</li>
</ul></p>
<p id="p0058" num="0058">Le principe de cet algorithme est illustré <figref idref="f0001">Figure 2</figref>.</p>
<p id="p0059" num="0059">De façon caractéristique de l'invention, on prendra l'un des canaux comme référence de signal utile, par exemple le canal du micro M<sub>1</sub>, et l'on calculera les fonctions de transfert <i>H<sub>2</sub></i> ... <i>H<sub>n</sub></i>, pour les autres canaux. Ceci revient à contraindre <i>H<sub>1</sub></i> = 1.</p>
<p id="p0060" num="0060">On notera que bien que l'on prenne comme référence de signal utile la version réverbérée (donc parasitée) du signal de parole S captée par le micro M<sub>1</sub>, la présence de la réverbération dans le signal capté n'est pas gênante car à ce stade on cherche à opérer un débruitage et non une dé-réverbération.</p>
<p id="p0061" num="0061">Comme illustré <figref idref="f0001">Figure 2</figref>, l'algorithme LMS vise (de façon connue) à estimer un filtre H (bloc 14) au moyen d'un algorithme adaptatif, correspondant au signal <i>x<sub>i</sub></i> délivré par le micro M<sub>i</sub>, en estimant le transfert de bruit entre le micro M<sub>i</sub> et le micro M<sub>i</sub> (pris comme référence). La sortie du filtre 14 est soustraite en 16 au signal <i>x<sub>1</sub></i> capté par le micro M<sub>1</sub> pour donner un signal d'erreur de prédiction permettant l'adaptation itérative du filtre 14. Il est ainsi possible de prédire à partir du signal <i>x<sub>i</sub></i> la composante de parole (réverbérée) contenue dans le signal <i>x<sub>i</sub></i>.</p>
<p id="p0062" num="0062">Pour éviter les problèmes liés à la causalité (c'est-à-dire pour être sûr que les signaux <i>x<sub>i</sub></i> n'arrivent pas en avance par rapport à la référence <i>x<sub>1</sub></i>), on retarde légèrement (bloc 18) le signal <i>x<sub>1</sub></i>.</p>
<p id="p0063" num="0063">Par ailleurs, on ajoute un élément 20 permettant de pondérer le signal d'erreur du filtre adaptatif 14 par la probabilité de présence de parole <i>p</i> délivrée en sortie du bloc 22 : il s'agit de procéder à l'adaptation du filtre seulement quand la probabilité de présence de parole est élevée. Cette pondération<!-- EPO <DP n="12"> --> peut être notamment opérée par modification du pas d'adaptation en fonction de la probabilité <i>p</i>.</p>
<p id="p0064" num="0064">L'équation de mise à jour du filtre adaptatif s'écrit, pour chaque trame <i>k</i> et pour chaque capteur <i>i</i>, : <maths id="math0008" num=""><math display="block"><msub><mi mathvariant="bold-italic">H</mi><mi>i</mi></msub><mo>⁢</mo><mfenced separators=""><mi>k</mi><mo>+</mo><mn>1</mn></mfenced><mo>=</mo><msub><mi mathvariant="bold-italic">H</mi><mi>i</mi></msub><mfenced><mi>k</mi></mfenced><mo>+</mo><mi>µ</mi><mo>⁢</mo><mi mathvariant="bold-italic">X</mi><mo>⁢</mo><msubsup><mfenced><mi>k</mi></mfenced><mn>1</mn><mi>T</mi></msubsup><mo>⁢</mo><mfenced separators=""><mi mathvariant="bold-italic">X</mi><mo>⁢</mo><msub><mfenced><mi>k</mi></mfenced><mn>1</mn></msub><mo>-</mo><mi mathvariant="bold-italic">H</mi><mo>⁢</mo><msub><mfenced><mi>k</mi></mfenced><mi>i</mi></msub><mo>⁢</mo><mi mathvariant="bold-italic">X</mi><mo>⁢</mo><msub><mfenced><mi>k</mi></mfenced><mi>i</mi></msub></mfenced></math><img id="ib0008" file="imgb0008.tif" wi="103" he="10" img-content="math" img-format="tif"/></maths></p>
<p id="p0065" num="0065">Le pas µ d'adaptation de l'algorithme, modulé par la probabilité de présence de parole, s'écrit, en normalisant le LMS (le dénominateur correspondant à la puissance spectrale du signal <i>x<sub>1</sub></i> à la fréquence considérée) : <maths id="math0009" num=""><math display="block"><mi>µ</mi><mo>=</mo><mfrac><mi>p</mi><mrow><mi>E</mi><mfenced><msubsup><mi mathvariant="bold-italic">X</mi><mn>1</mn><mn>2</mn></msubsup></mfenced></mrow></mfrac></math><img id="ib0009" file="imgb0009.tif" wi="30" he="14" img-content="math" img-format="tif"/></maths></p>
<p id="p0066" num="0066">L'hypothèse que les bruits sont décorrélés conduit à une prédiction par l'algorithme LMS de la voix, et non du bruit, de sorte que la fonction de transfert estimée correspond effectivement au canal acoustique H entre le locuteur et les micros.</p>
<p id="p0067" num="0067">Une autre technique possible d'estimation du canal acoustique consiste à opérer par diagonalisation de matrice.</p>
<p id="p0068" num="0068">Ce mode d'estimation est basé sur l'utilisation de la matrice spectrale de corrélation du signal observé, que l'on notera <i><b>R</b><sub>x</sub>=E</i>[<i>XX<sup>T</sup></i>]<i>.</i></p>
<p id="p0069" num="0069">On estime cette matrice de la même façon que <i><b>R</b><sub>n</sub></i> : <maths id="math0010" num=""><math display="block"><msub><mi mathvariant="bold-italic">R</mi><mi>n</mi></msub><mo>⁢</mo><mfenced separators=""><mi>k</mi><mo>+</mo><mn>1</mn></mfenced><mo>=</mo><mi mathvariant="normal">α</mi><mo>⁢</mo><msub><mi mathvariant="bold-italic">R</mi><mi>n</mi></msub><mfenced><mi>k</mi></mfenced><mo>+</mo><mfenced separators=""><mn>1</mn><mo>-</mo><mi mathvariant="normal">α</mi></mfenced><mo>⁢</mo><msup><mi mathvariant="bold-italic">XX</mi><mi mathvariant="bold-italic">T</mi></msup></math><img id="ib0010" file="imgb0010.tif" wi="83" he="12" img-content="math" img-format="tif"/></maths><br/>
α étant un facteur d'oubli (fixe, puisque l'on prend en compte tout le signal).</p>
<p id="p0070" num="0070">On peut ensuite estimer <i><b>R</b><sub>x</sub>-<b>R</b><sub>n</sub>=</i>φ<i><sub>s</sub><b>HH</b><sup>T</sup></i> : il s'agit d'une matrice de rang 1, dont la seule valeur propre non nulle est φ<sub>s</sub> , qui est associée au vecteur propre <b><i>H</i></b></p>
<p id="p0071" num="0071">On peut ainsi estimer <b><i>H</i></b> en diagonalisant <i><b>R</b><sub>x</sub>-<b>R</b><sub>n</sub>,</i> mais on ne peut calculer que <i>vect</i>(<b><i>H</i></b>)<i>,</i> autrement dit on n'estime H qu'à un facteur complexe près.</p>
<p id="p0072" num="0072">Pour lever cette ambiguïté, de la même manière que précédemment pour l'estimation par algorithme LMS, on choisit l'un des canaux comme canal de référence, ce qui revient à contraindre <i><b>H</b><sub>1</sub></i> = 1.<!-- EPO <DP n="13"> --></p>
<heading id="h0004"><i>Échantillonnage spatial du champ sonore</i></heading>
<p id="p0073" num="0073">Dans le cas d'un système multi-microphone, qui réalise donc un échantillonnage spatial du champ sonore, le placement relatif des différents micros est un aspect crucial pour l'efficacité du traitement des signaux captés par ces micros.</p>
<p id="p0074" num="0074">En particulier, comme on l'a indiqué au début, on fait l'hypothèse que les bruits présents sur les micros sont décorrélés pour utiliser une identification adaptative de type LMS. Pour être au plus près de cette hypothèse, il conviendrait d'éloigner les micros les uns des autres, car la fonction de corrélation s'écrit, pour un modèle de bruit diffus, comme une fonction décroissante de la distance entre les micros, ce qui rend les estimateurs de canal acoustique plus robustes.</p>
<p id="p0075" num="0075">En effet, la corrélation entre deux capteurs pour un champ de bruit diffus s'écrit : <maths id="math0011" num=""><math display="block"><mi mathvariant="italic">MSC</mi><mfenced><mi>f</mi></mfenced><mo>=</mo><msup><mi mathvariant="italic">sinc</mi><mn>2</mn></msup><mfenced><mfrac><mi mathvariant="italic">fd</mi><mi>c</mi></mfrac></mfenced></math><img id="ib0011" file="imgb0011.tif" wi="56" he="14" img-content="math" img-format="tif"/></maths><br/>
<i>f</i> étant la fréquence considérée,<br/>
<i>d</i> étant la distance entre les capteurs, et<br/>
c étant la vitesse du son.</p>
<p id="p0076" num="0076">La caractéristique correspondante est illustrée <figref idref="f0001">Figure 3</figref>, pour une distance entre micros <i>d</i> = 10 cm.</p>
<p id="p0077" num="0077">L'éloignement des micros, qui permet de décorréler les bruits, présente cependant l'inconvénient de se traduire, dans le domaine spatial, à un échantillonnage à une fréquence plus faible, avec pour conséquence un repliement des hautes fréquences, qui seront moins bien restituées. L'invention propose de résoudre cette difficulté en sélectionnant des configurations de capteurs différentes selon les fréquences traitées.</p>
<p id="p0078" num="0078">Ainsi, sur la <figref idref="f0002">Figure 4</figref>, on a illustré un réseau linéaire de quatre micros alignés M<sub>1</sub> ... M<sub>4</sub> espacés chacun de d = 5 cm.</p>
<p id="p0079" num="0079">Pour la région inférieure du spectre (basses fréquences BF) on choisira par exemple d'utiliser seulement les deux micros extrêmes M<sub>1</sub> et M<sub>4</sub>, éloignés donc de 3<i>d</i> = 15 cm, tandis que pour la partie haute du spectre (hautes fréquences HF) on utilisera les quatre micros M<sub>1</sub>, M<sub>2</sub>, M<sub>3</sub> et M<sub>4</sub> espacés chacun de seulement <i>d</i> = 5 cm.<!-- EPO <DP n="14"> --></p>
<p id="p0080" num="0080">En variante ou en complément, selon un autre aspect de l'invention, on peut aussi sélectionner, pour l'estimation de la fonction de transfert H du canal acoustique, des méthodes différentes en fonction des fréquences traitées. Par exemple, pour les deux méthodes exposées plus haut (traitement fréquentiel par LMS, et traitement par diagonalisation), on peut choisir l'une ou l'autre méthode en fonction de critères tels que :
<ul id="ul0011" list-style="dash" compact="compact">
<li>la corrélation des bruits : pour tenir compte du fait que la méthode par diagonalisation y est moins sensible, mais est moins précise, ou</li>
<li>le nombre de micros employés : pour tenir compte du fait que la méthode par diagonalisation devient très coûteuse en calculs lorsque la dimension des matrices augmente, du fait de l'augmentation du nombre <i>n</i> de micros.</li>
</ul></p>
<heading id="h0005"><i>Description d'un mode de réalisation préférentiel</i></heading>
<p id="p0081" num="0081">Cet exemple est décrit en référence aux <figref idref="f0002">Figures 5 et 6</figref>, et met en oeuvre les différents éléments évoqués plus haut du traitement des signaux, avec leurs différentes variantes possibles.</p>
<p id="p0082" num="0082">La <figref idref="f0002">Figure 5</figref> est un schéma par blocs montrant les différentes étapes de traitement des signaux issus d'un réseau linéaire de quatre micros M<sub>1</sub> ... M<sub>4</sub> tels que celui illustré <figref idref="f0002">Figure 4</figref>.</p>
<p id="p0083" num="0083">Des traitements différents sont opérés pour le haut du spectre (hautes fréquences HF, correspondant aux blocs 24 à 32), et pour le bas du spectre (basses fréquences BF, correspondant aux blocs 34 à 42) :
<ul id="ul0012" list-style="dash" compact="compact">
<li>pour le haut du spectre, sélectionné par un filtre 24, les signaux des quatre micros M<sub>1</sub> ... M<sub>4</sub> sont utilisés conjointement. Ces signaux font d'abord l'objet d'une transformée rapide de Fourier FFT (bloc 26) pour passer dans le domaine fréquentiel, puis d'un traitement 28 (décrit plus bas en référence à la <figref idref="f0002">Figure 6</figref>) impliquant une diagonalisation de matrice. Le signal monocanal résultant <i>S<sub>HF</sub></i> est soumis à une transformée de Fourier rapide inverse iFFT (bloc 30) pour repasser dans le domaine temporel, puis le signal résultant <i>s<sub>HF</sub></i> est appliqué à un filtre de synthèse (bloc 32) pour restituer le haut du spectre du canal de sortie <i>s</i> ;</li>
<li>pour le bas du spectre, sélectionné par le filtre 34, seuls les signaux des deux micros extrêmes M<sub>1</sub> et M<sub>4</sub> sont utilisés. Ces signaux font<!-- EPO <DP n="15"> --> d'abord l'objet d'une transformée rapide de Fourier FFT (bloc 36) pour passer dans le domaine fréquentiel, puis d'un traitement 38 (décrit plus bas en référence à la <figref idref="f0002">Figure 6</figref>) impliquant un filtrage adaptatif LMS. Le signal monocanal résultant <i>S<sub>BF</sub></i> est soumis à une transformée de Fourier rapide inverse iFFT (bloc 40) pour repasser dans le domaine temporel, puis le signal résultant <i>s<sub>BF</sub></i> est appliqué à un filtre de synthèse (bloc 42) pour restituer le bas du spectre du canal de sortie s.</li>
</ul></p>
<p id="p0084" num="0084">On va maintenant décrire en référence à la <figref idref="f0002">Figure 6</figref> les traitements opérés par les blocs 28 ou 38 de la <figref idref="f0002">Figure 5</figref>.</p>
<p id="p0085" num="0085">Le traitement que l'on va décrire est appliqué dans le domaine fréquentiel, à chaque <i>bin</i> de fréquence, c'est-à-dire pour chaque bande de fréquences définie pour les trames temporelles successives du signal recueilli par les micros (les quatre micros M<sub>1</sub>, M<sub>2</sub>, M<sub>3</sub> et M<sub>4</sub> pour le haut du spectre HF, et les deux micros M<sub>1</sub> et M<sub>4</sub> pour le bas du spectre BF).</p>
<p id="p0086" num="0086">A ces signaux correspondent, dans le domaine fréquentiel, des vecteurs <i>X<sub>1</sub></i> ... <i>X<sub>n</sub></i> (<i>X<sub>1</sub>, X<sub>2</sub>, X<sub>3</sub></i> et <i>X<sub>4</sub></i> et <i>X<sub>1</sub>, X<sub>4</sub>,</i> respectivement).</p>
<p id="p0087" num="0087">Un bloc 22 produit à partir des signaux recueillis par les micros une probabilité <i>p</i> de présence de parole. Comme indiqué plus haut, cette estimation est opérée selon une technique en elle-même connue, par exemple celle décrite dans le <patcit id="pcit0004" dnum="WO2007099222A1"><text>WO 2007/099222 A1</text></patcit>, auquel on pourra se référer pour plus de détails.</p>
<p id="p0088" num="0088">Le bloc 44 schématise un sélecteur de la méthode d'estimation du canal acoustique, soit par diagonalisation sur la base des signaux recueillis par les quatre micros M<sub>1</sub>, M<sub>2</sub>, M<sub>3</sub> et M<sub>4</sub> (bloc 28 de la <figref idref="f0002">Figure 5</figref>, pour le haut du spectre HF), soit par filtre adaptatif LMS sur la base des signaux recueillis par les deux micros extrêmes M<sub>1</sub> et M<sub>4</sub> (bloc 38 de la <figref idref="f0002">Figure 5</figref>, pour le bas du spectre BF).</p>
<p id="p0089" num="0089">Le bloc 46 correspond à l'estimation de la matrice spectrale des bruits, désignée <i>R<sub>n</sub>,</i> utilisée pour le calcul du projecteur linéaire optimal, et utilisée également pour le calcul de diagonalisation du bloc 28 lorsque la fonction de transfert du canal acoustique est estimée de cette manière. Le bloc 48 correspond au calcul du projecteur linéaire optimal. Comme on l'a indiqué plus haut, la projection calculée en 48 est une projection linéaire optimale, en ce sens que la composante de bruit résiduel sur le signal monocanal délivré en sortie est minimisée (bruit et réverbération).<!-- EPO <DP n="16"> --> Comme on l'a également indiqué, le projecteur linéaire optimal présente la particularité de recaler les phases des différents signaux d'entrée, ce qui permet d'obtenir en sortie un signal projeté <i>S<sub>pr</sub></i> qui retrouve la phase du signal initial de parole du locuteur (et également l'amplitude de ce signal, bien entendu).</p>
<p id="p0090" num="0090">L'étape finale (bloc 50) consiste à opérer une réduction sélective du bruit par application d'un gain variable propre à chaque bande de fréquences et à chaque trame temporelle au signal projeté <i>S<sub>pr</sub>.</i></p>
<p id="p0091" num="0091">Ce débruitage est également modulé par la probabilité de présence de parole <i>p</i>.</p>
<p id="p0092" num="0092">Le signal <i>S</i><sub><i>HF</i>/<i>BF</i></sub> délivré en sortie par le bloc 50 de débruitage fera ensuite l'objet d'une transformation de Fourier rapide inverse iFFT (blocs 30, 40 de la <figref idref="f0002">Figure 5</figref>) pour obtenir dans le domaine temporel le signal de parole débruitée <i>S<sub>HF</sub></i> ou <i>S<sub>BF</sub></i> recherché donnant, après reconstitution du spectre complet, le signal de parole débruitée final s.</p>
<p id="p0093" num="0093">On peut avantageusement utiliser pour le débruitage du bloc 50 une méthode de type OM-LSA (<i>Optimally Modified - Log Spectral Amplitude</i>) telle que celle décrite par la référence précitée :
<ul id="ul0013" list-style="none" compact="compact">
<li>[2] <nplcit id="ncit0007" npl-type="s"><text>I. Cohen, Optimal Speech Enhancement Under Signal Presence Uncerlainty Using Log-Spectral Amplitude Estimator, IEEE Signal Processing Letters, Vol. 9, No 4, April 2002</text></nplcit>.</li>
</ul></p>
<p id="p0094" num="0094">Essentiellement, l'application d'un gain nommé "gain LSA" (<i>Log-Spectral Amplitude</i>) permet de minimiser la distance quadratique moyenne entre le logarithme de l'amplitude du signal estimé et le logarithme de l'amplitude du signal de parole originel. Ce second critère se montre supérieur au premier car la distance choisie est en meilleure adéquation avec le comportement de l'oreille humaine et donne donc qualitativement de meilleurs résultats. Dans tous les cas, l'idée essentielle est de diminuer l'énergie des composantes fréquentielles très parasitées en leur appliquant un gain faible, tout en laissant intactes (par l'application d'un gain égal à 1) celles qui le sont peu ou pas du tout.</p>
<p id="p0095" num="0095">L'algorithme "OM-LSA" (<i>Optimally-Modified Log-Spectral Amplitude)</i> améliore le calcul du gain LSA à appliquer en le pondérant par la probabilité conditionnelle de présence de parole <i>p</i>.<!-- EPO <DP n="17"> --></p>
<p id="p0096" num="0096">Dans cette méthode, la probabilité de présence de parole <i>p</i> intervient à deux niveaux importants :
<ul id="ul0014" list-style="dash" compact="compact">
<li>pour l'estimation de l'énergie du bruit, la probabilité vient moduler le facteur d'oubli dans le sens d'une mise à jour plus rapide de l'estimation du bruit sur le signal bruité lorsque la probabilité de présence de parole est faible ;</li>
<li>pour le calcul du gain final, elle joue également un grand rôle, car la réduction de bruit appliquée est d'autant plus importante (c'est-à-dire que le gain appliqué est d'autant plus faible) que la probabilité de présence de parole est faible.</li>
</ul></p>
</description>
<claims id="claims01" lang="fr"><!-- EPO <DP n="18"> -->
<claim id="c-fr-0001" num="0001">
<claim-text>Un procédé de débruitage d'un signal acoustique bruité pour un dispositif audio multi-microphone opérant dans un milieu bruité, notamment un dispositif téléphonique "mains libres",<br/>
le signal acoustique bruité comprenant une composante utile issue d'une source de parole (S) et une composante parasite de bruit,<br/>
ledit dispositif comprenant un réseau de capteurs formé d'une pluralité de capteurs microphoniques (M<sub>1</sub>...M<sub>n</sub>) disposés selon une configuration prédéterminée et aptes à recueillir le signal bruité,<br/>
<b>caractérisé en ce qu'</b>il comporte les étapes de traitement suivantes dans le domaine fréquentiel, pour une pluralité de bandes de fréquences définies pour des trames temporelles successives de signal :
<claim-text>a) estimation (22) d'une probabilité de présence de parole (<i>p</i>) dans le signal bruité recueilli ;</claim-text>
<claim-text>b) estimation (46) d'une matrice spectrale de covariance (<i>R<sub>n</sub></i>) des bruits recueillis par les capteurs, cette estimation étant modulée par la probabilité de présence de parole (<i>p</i>) ;</claim-text>
<claim-text>c) estimation de la fonction de transfert (<i>H<sub>1</sub>..H<sub>n</sub></i>) des canaux acoustiques entre la source de parole (S) et au moins certains des capteurs (M<sub>1</sub>...M<sub>n</sub>), cette estimation étant opérée par rapport à une référence de signal utile constituée par le signal recueilli par l'un des capteurs (M<sub>1</sub>), et étant en outre modulée par la probabilité de présence de parole (<i>p</i>) ;</claim-text>
<claim-text>d) calcul (48) d'un projecteur linéaire optimal donnant un signal combiné débruité unique à partir des signaux (<i>X<sub>1</sub>...X<sub>n</sub></i>) recueillis par au moins certains des capteurs, de la matrice spectrale de covariance (<i>R<sub>n</sub></i>) estimée à l'étape b), et des fonctions de transfert (<i>H<sub>1</sub>...H<sub>n</sub></i>) estimées à l'étape c) ; et</claim-text>
<claim-text>e) à partir de la probabilité de présence de parole (<i>p</i>) et du signal combiné donné par le projecteur calculé à l'étape d), réduction sélective du bruit (50) par application d'un gain variable propre à chaque bande de fréquences et à chaque trame temporelle.</claim-text><!-- EPO <DP n="19"> --></claim-text></claim>
<claim id="c-fr-0002" num="0002">
<claim-text>Le procédé de la revendication 1, dans lequel le calcul (48) du projecteur linéaire optimal de l'étape d) est opéré par un traitement de type <i>beamforming</i> de Capon à réponse sans distorsion à variance minimale MVDR.</claim-text></claim>
<claim id="c-fr-0003" num="0003">
<claim-text>Le procédé de la revendication 1, dans lequel la réduction sélective de bruit (50) de l'étape e) est opérée par un traitement de type gain à amplitude log-spectrale modifié optimisé OM-LSA.</claim-text></claim>
<claim id="c-fr-0004" num="0004">
<claim-text>Le procédé de la revendication 1, dans lequel l'estimation de la fonction de transfert de l'étape c) est opérée par calcul (38) d'un filtre adaptatif (14) visant à annuler la différence entre le signal (<i>X<sub>i</sub></i>) recueilli par le capteur dont on cherche à évaluer la fonction de transfert et le signal (<i>X<sub>1</sub></i>) recueilli par le capteur de ladite référence de signal utile, avec modulation par la probabilité de présence de parole (<i>p</i>).</claim-text></claim>
<claim id="c-fr-0005" num="0005">
<claim-text>Le procédé de la revendication 4, dans lequel le filtre adaptatif (14) est un filtre à algorithme de prédiction linéaire de type moindres carrés moyens LMS.</claim-text></claim>
<claim id="c-fr-0006" num="0006">
<claim-text>Le procédé de la revendication 4, dans lequel ladite modulation par la probabilité de présence de parole (<i>p</i>) est une modulation par variation du pas d'itération du filtre adaptatif (14).</claim-text></claim>
<claim id="c-fr-0007" num="0007">
<claim-text>Le procédé de la revendication 1, dans lequel l'estimation de la fonction de transfert de l'étape c) est opérée par un traitement de diagonalisation (28) comprenant :
<claim-text>c1) la détermination d'une matrice spectrale de corrélation (<i>R<sub>x</sub></i>) des signaux recueillis par les capteurs du réseau par rapport au capteur de ladite référence de signal utile,</claim-text>
<claim-text>c2) le calcul de la différence entre, d'une part, la matrice (<i>R<sub>x</sub></i>) déterminée à l'étape c1) et, d'autre part, ladite matrice spectrale de covariance (<i>R<sub>n</sub></i>) des bruits modulée par la probabilité de présence de parole (<i>p</i>), calculée à l'étape b), et</claim-text>
<claim-text>c3) la diagonalisation de la matrice différence calculée à l'étape c2).</claim-text><!-- EPO <DP n="20"> --></claim-text></claim>
<claim id="c-fr-0008" num="0008">
<claim-text>Le procédé de la revendication 1, dans lequel :
<claim-text>- le spectre du signal à débruiter est divisé en une pluralité de parties de spectre distinctes (BF, HF),</claim-text>
<claim-text>- les capteurs sont regroupés en une pluralité de sous-réseaux (M<sub>1</sub>...M<sub>4</sub> ; M<sub>1</sub>,M<sub>4</sub>) associés chacun à l'une desdites parties du spectre, et</claim-text>
<claim-text>- le traitement de débruitage est opéré de façon différenciée, pour chacune desdites parties du spectre, sur les signaux recueillis par les capteurs du sous-réseau correspondant à la partie du spectre considérée.</claim-text></claim-text></claim>
<claim id="c-fr-0009" num="0009">
<claim-text>Le procédé de la revendication 8, dans lequel :
<claim-text>- le réseau de capteurs est un réseau linéaire de capteurs alignés (M<sub>1</sub>...M<sub>4</sub>),</claim-text>
<claim-text>- le spectre du signal à débruiter est divisé en une partie basse fréquence (BF) et une partie haute fréquence (HF), et</claim-text>
<claim-text>- pour la partie basse fréquence, les étapes du traitement de débruitage sont opérées seulement sur les signaux recueillis par les capteurs les plus éloignés du réseau (M<sub>1</sub>,M<sub>4</sub>).</claim-text></claim-text></claim>
<claim id="c-fr-0010" num="0010">
<claim-text>Le procédé de la revendication 1, dans lequel :
<claim-text>- le spectre du signal à débruiter est divisé en une pluralité de parties de spectre distinctes (BF, HF), et</claim-text>
<claim-text>- l'étape c) d'estimation de la fonction de transfert des canaux acoustiques est opérée de manière différenciée par application de traitements différents (28, 38) pour chacune desdites parties du spectre.</claim-text></claim-text></claim>
<claim id="c-fr-0011" num="0011">
<claim-text>Le procédé de la revendication 10, dans lequel :
<claim-text>- le réseau de capteurs est un réseau linéaire de capteurs alignés (M<sub>1</sub>...M<sub>4</sub>),</claim-text>
<claim-text>- les capteurs sont regroupés en une pluralité de sous-réseaux (M<sub>1</sub>...M<sub>4</sub> ; M<sub>1</sub>,M<sub>4</sub>) associés chacun à l'une desdites parties du spectre,</claim-text>
<claim-text>- pour la partie basse fréquence (BF), le traitement de débruitage est opéré seulement sur les signaux recueillis par les capteurs (M<sub>1</sub>,M<sub>4</sub>) les plus éloignés du réseau, et l'estimation de la fonction de transfert est opérée par calcul d'un filtre adaptatif (38), et<!-- EPO <DP n="21"> --></claim-text>
<claim-text>- pour la partie haute fréquence, le traitement de débruitage est opéré sur les signaux recueillis par tous les capteurs du réseau (M<sub>1</sub>...M<sub>4</sub>), et l'estimation de la fonction de transfert est opérée par un traitement de diagonalisation (28).</claim-text></claim-text></claim>
</claims>
<drawings id="draw" lang="fr"><!-- EPO <DP n="22"> -->
<figure id="f0001" num="1,2,3"><img id="if0001" file="imgf0001.tif" wi="151" he="233" img-content="drawing" img-format="tif"/></figure><!-- EPO <DP n="23"> -->
<figure id="f0002" num="4,5,6"><img id="if0002" file="imgf0002.tif" wi="157" he="233" img-content="drawing" img-format="tif"/></figure>
</drawings>
<search-report-data id="srep" lang="fr" srep-office="EP" date-produced=""><doc-page id="srep0001" file="srep0001.tif" wi="159" he="233" type="tif"/><doc-page id="srep0002" file="srep0002.tif" wi="157" he="233" type="tif"/></search-report-data><search-report-data date-produced="20120801" id="srepxml" lang="fr" srep-office="EP" srep-type="ep-sr" status="n"><!--
 The search report data in XML is provided for the users' convenience only. It might differ from the search report of the PDF document, which contains the officially published data. The EPO disclaims any liability for incorrect or incomplete data in the XML for search reports.
 -->

<srep-info><file-reference-id>345P54066EP</file-reference-id><application-reference><document-id><country>EP</country><doc-number>12170874.7</doc-number></document-id></application-reference><applicant-name><name>Parrot</name></applicant-name><srep-established srep-established="yes"/><srep-invention-title title-approval="yes"/><srep-abstract abs-approval="yes"/><srep-figure-to-publish figinfo="by-applicant"><figure-to-publish><fig-number>6</fig-number></figure-to-publish></srep-figure-to-publish><srep-info-admin><srep-office><addressbook><text>MN</text></addressbook></srep-office><date-search-report-mailed><date>20120810</date></date-search-report-mailed></srep-info-admin></srep-info><srep-for-pub><srep-fields-searched><minimum-documentation><classifications-ipcr><classification-ipcr><text>G10L</text></classification-ipcr><classification-ipcr><text>H04R</text></classification-ipcr></classifications-ipcr></minimum-documentation></srep-fields-searched><srep-citations><citation id="sr-cit0001"><patcit dnum="EP2309499A1" id="sr-pcit0001" url="http://v3.espacenet.com/textdoc?DB=EPODOC&amp;IDX=EP2309499&amp;CY=ep"><document-id><country>EP</country><doc-number>2309499</doc-number><kind>A1</kind><name>PARROT [FR]</name><date>20110413</date></document-id></patcit><category>A,D</category><rel-claims>1-11</rel-claims><rel-passage><passage>* figure 1 *</passage></rel-passage></citation><citation id="sr-cit0002"><nplcit id="sr-ncit0001" npl-type="s"><article><author><name>COHEN I ET AL</name></author><atl>Speech enhancement based on a microphone array and log-spectral amplitude estimation</atl><serial><sertitle>ELECTRICAL AND ELECTRONICS ENGINEERS IN ISRAEL, 2002. THE 22ND CONVENT ION OF DEC. 1, 2002, PISCATAWAY, NJ, USA,IEEE</sertitle><pubdate>20020101</pubdate><isbn>978-0-7803-7693-9</isbn></serial><location><pp><ppf>4</ppf><ppl>6</ppl></pp></location><refno>XP010631024</refno></article></nplcit><category>A</category><rel-claims>1-11</rel-claims><rel-passage><passage>* le document en entier *</passage></rel-passage></citation><citation id="sr-cit0003"><nplcit id="sr-ncit0002" npl-type="s"><article><author><name>HENDRIKS R C ET AL</name></author><atl>On Optimal Multichannel Mean-Squared Error Estimators for Speech Enhancement</atl><serial><sertitle>IEEE SIGNAL PROCESSING LETTERS, IEEE SERVICE CENTER, PISCATAWAY, NJ, US</sertitle><pubdate>20091001</pubdate><vid>16</vid><ino>10</ino><doi>10.1109/LSP.2009.2026205</doi><issn>1070-9908</issn></serial><location><pp><ppf>885</ppf><ppl>888</ppl></pp></location><refno>XP011269912</refno></article></nplcit><category>A,D</category><rel-claims>1-11</rel-claims><rel-passage><passage>* le document en entier *</passage></rel-passage></citation><citation id="sr-cit0004"><patcit dnum="US2004150558A1" id="sr-pcit0002" url="http://v3.espacenet.com/textdoc?DB=EPODOC&amp;IDX=US2004150558&amp;CY=ep"><document-id><country>US</country><doc-number>2004150558</doc-number><kind>A1</kind><name>LI JIAN [US] ET AL</name><date>20040805</date></document-id></patcit><category>A</category><rel-claims>1-11</rel-claims><rel-passage><passage>* le document en entier *</passage></rel-passage></citation></srep-citations><srep-admin><examiners><primary-examiner><name>Chétry, Nicolas</name></primary-examiner></examiners><srep-office><addressbook><text>Munich</text></addressbook></srep-office><date-search-completed><date>20120801</date></date-search-completed></srep-admin><!--
							The annex lists the patent family members relating to the patent documents cited in the above mentioned European search report.
							The members are as contained in the European Patent Office EDP file on
							The European Patent Office is in no way liable for these particulars which are merely given for the purpose of information.
							For more details about this annex : see Official Journal of the European Patent Office, No 12/82
						--><srep-patent-family><patent-family><priority-application><document-id><country>EP</country><doc-number>2309499</doc-number><kind>A1</kind><date>20110413</date></document-id></priority-application><family-member><document-id><country>AT</country><doc-number>529860</doc-number><kind>T</kind><date>20111115</date></document-id></family-member><family-member><document-id><country>EP</country><doc-number>2309499</doc-number><kind>A1</kind><date>20110413</date></document-id></family-member><family-member><document-id><country>ES</country><doc-number>2375844</doc-number><kind>T3</kind><date>20120306</date></document-id></family-member><family-member><document-id><country>FR</country><doc-number>2950461</doc-number><kind>A1</kind><date>20110325</date></document-id></family-member><family-member><document-id><country>US</country><doc-number>2011070926</doc-number><kind>A1</kind><date>20110324</date></document-id></family-member></patent-family><patent-family><priority-application><document-id><country>US</country><doc-number>2004150558</doc-number><kind>A1</kind><date>20040805</date></document-id></priority-application><text>AUCUN</text></patent-family></srep-patent-family></srep-for-pub></search-report-data>
<ep-reference-list id="ref-list">
<heading id="ref-h0001"><b>RÉFÉRENCES CITÉES DANS LA DESCRIPTION</b></heading>
<p id="ref-p0001" num=""><i>Cette liste de références citées par le demandeur vise uniquement à aider le lecteur et ne fait pas partie du document de brevet européen. Même si le plus grand soin a été accordé à sa conception, des erreurs ou des omissions ne peuvent être exclues et l'OEB décline toute responsabilité à cet égard.</i></p>
<heading id="ref-h0002"><b>Documents brevets cités dans la description</b></heading>
<p id="ref-p0002" num="">
<ul id="ref-ul0001" list-style="bullet">
<li><patcit id="ref-pcit0001" dnum="EP2293594A1"><document-id><country>EP</country><doc-number>2293594</doc-number><kind>A1</kind></document-id></patcit><crossref idref="pcit0001">[0010]</crossref></li>
<li><patcit id="ref-pcit0002" dnum="EP2309499A1"><document-id><country>EP</country><doc-number>2309499</doc-number><kind>A1</kind></document-id></patcit><crossref idref="pcit0002">[0011]</crossref></li>
<li><patcit id="ref-pcit0003" dnum="WO2007099222A1"><document-id><country>WO</country><doc-number>2007099222</doc-number><kind>A1</kind></document-id></patcit><crossref idref="pcit0003">[0052]</crossref><crossref idref="pcit0004">[0087]</crossref></li>
</ul></p>
<heading id="ref-h0003"><b>Littérature non-brevet citée dans la description</b></heading>
<p id="ref-p0003" num="">
<ul id="ref-ul0002" list-style="bullet">
<li><nplcit id="ref-ncit0001" npl-type="s"><article><author><name>R. C. HENDRIKS et al.</name></author><atl>On optimal multichannel mean-squared error estimators for speech enhancement</atl><serial><sertitle>IEEE Signal Processing Letters</sertitle><pubdate><sdate>20090000</sdate><edate/></pubdate><vid>16</vid><ino>10</ino></serial></article></nplcit><crossref idref="ncit0001">[0047]</crossref></li>
<li><nplcit id="ref-ncit0002" npl-type="s"><article><author><name>COHEN</name></author><atl>Optimal Speech Enhancement Under Signal Presence Uncertainty Using Log-Spectral Amplitude Estimator</atl><serial><sertitle>IEEE Signal Processing Letters</sertitle><pubdate><sdate>20020400</sdate><edate/></pubdate><vid>9</vid><ino>4</ino></serial><location><pp><ppf>113</ppf><ppl>116</ppl></pp></location></article></nplcit><crossref idref="ncit0002">[0047]</crossref></li>
<li><nplcit id="ref-ncit0003" npl-type="s"><article><author><name>I. COHEN</name></author><author><name>B. BERDUGO</name></author><atl>Two-Channel Signal Detection and Speech Enhancement Based on the Transient Beam-to-Reference Ratio</atl><serial><sertitle>Proc. ICASSP 2003, Hong-Kong</sertitle><pubdate><sdate>20030400</sdate><edate/></pubdate></serial><location><pp><ppf>233</ppf><ppl>236</ppl></pp></location></article></nplcit><crossref idref="ncit0003">[0051]</crossref></li>
<li><nplcit id="ref-ncit0004" npl-type="b"><article><atl/><book><author><name>B. WIDROW</name></author><book-title>Adaptative Filters, Aspect of Network and System Theory</book-title><imprint><name>Rinehart and Winston</name><pubdate>19700000</pubdate></imprint><location><pp><ppf>563</ppf><ppl>587</ppl></pp></location></book></article></nplcit><crossref idref="ncit0004">[0057]</crossref></li>
<li><nplcit id="ref-ncit0005" npl-type="b"><article><atl>Frequency-domain adaptive filtering with applications to acoustic echo cancellation</atl><book><author><name>J. PRADO</name></author><author><name>E. MOULINES</name></author><book-title>Annals of Telecommunications</book-title><imprint><name>Springer</name><pubdate>19940000</pubdate></imprint></book></article></nplcit><crossref idref="ncit0005">[0057]</crossref></li>
<li><nplcit id="ref-ncit0006" npl-type="s"><article><author><name>B. WIDROW</name></author><author><name>S. STEARNS</name></author><atl>Adaptative Signal Processing, Prentice-Hall Signal Processing Series</atl><serial><sertitle>Alan V. Oppenheim Series Editor</sertitle><pubdate><sdate>19850000</sdate><edate/></pubdate></serial></article></nplcit><crossref idref="ncit0006">[0057]</crossref></li>
<li><nplcit id="ref-ncit0007" npl-type="s"><article><author><name>I. COHEN</name></author><atl>Optimal Speech Enhancement Under Signal Presence Uncerlainty Using Log-Spectral Amplitude Estimator</atl><serial><sertitle>IEEE Signal Processing Letters</sertitle><pubdate><sdate>20020400</sdate><edate/></pubdate><vid>9</vid><ino>4</ino></serial></article></nplcit><crossref idref="ncit0007">[0093]</crossref></li>
</ul></p>
</ep-reference-list>
</ep-patent-document>
