(19)
(11) EP 0 710 947 B1

(12) FASCICULE DE BREVET EUROPEEN

(45) Mention de la délivrance du brevet:
08.01.2003  Bulletin  2003/02

(21) Numéro de dépôt: 95402385.9

(22) Date de dépôt:  25.10.1995
(51) Int. Cl.7G10L 21/02

(54)

Procédé et dispositif de suppression de bruit dans un signal de parole, et système avec annulation d'écho correspondant

Verfahren und Apparat zur Geräuschunterdrückung in einem Sprachsignal und korrespondierendes System mit Echounterdrückung

Method and apparatus for noise suppression in a speech signal and corresponding system with echo cancellation


(84) Etats contractants désignés:
AT BE CH DE DK ES FR GB IT LI NL SE

(30) Priorité: 28.10.1994 FR 9412964

(43) Date de publication de la demande:
08.05.1996  Bulletin  1996/19

(73) Titulaire: ALCATEL
75008 Paris (FR)

(72) Inventeurs:
  • Bourmeyster, Ivan
    F-75014 Paris (FR)
  • Lejay, Frédéric
    F-44380 Pornichet (FR)

(74) Mandataire: Lamoureux, Bernard et al
Compagnie Financière Alcatel Département Propriété Industrielle 30, Avenue Kléber
75116 Paris
75116 Paris (FR)


(56) Documents cités: : 
EP-A- 0 438 174
EP-A- 0 556 992
   
  • SPEECH COMMUNICATION, vol. 12, no. 1, Mars 1993 AMSTERDAM, pages 41-56, F.M.WANG ET AL. 'Frequency domain adaptive postfiltering for enhancement of noisy speech'
   
Il est rappelé que: Dans un délai de neuf mois à compter de la date de publication de la mention de la délivrance de brevet européen, toute personne peut faire opposition au brevet européen délivré, auprès de l'Office européen des brevets. L'opposition doit être formée par écrit et motivée. Elle n'est réputée formée qu'après paiement de la taxe d'opposition. (Art. 99(1) Convention sur le brevet européen).


Description


[0001] La présente invention concerne de manière générale des procédé et dispositif de suppression d'un signal de bruit dans un signal de parole, typiquement pour une application à la radiotéléphonie main-libre. Elle a trait également à un système mettant en oeuvre un tel dispositif en combinaison avec un annuleur d'écho.

[0002] Dans un environnement bruité, le signal électrique résultant d'une conversion acousto-électrique d'un signal de parole est mélangé à un signal de bruit. Dès lors que le niveau du signal de bruit dans cet environnement est élevé, par exemple dans l'habitacle d'un véhicule, il est nécessaire de mettre en oeuvre des traitements visant à supprimer le signal de bruit dans le signal électrique de parole. Typiquement, deux types de traitement de suppression de bruit sont distingués selon la technique antérieure : le traitement par soustraction spectrale et le traitement dit par banc de filtres.

[0003] Le traitement par banc de filtres, tel que décrit dans le brevet américain US-A-4 628 529 et dans la demamde EP 0556992 consiste en une étape de séparation du signal d'entrée en une pluralité de signaux temporels représentatifs chacun d'une bande de fréquences prédéterminée respective, une étape d'estimation d'un rapport signal sur bruit pour chacun de ces signaux temporels, une étape de pondération de ces signaux temporels par des coefficients respectifs qui sont chacun fonction de l'un respectif des rapports signal sur bruit pour le signal temporel considéré, et une étape d'addition de ces signaux temporels pondérés en un signal résultant consistant en un signal de parole dans lequel le signal de bruit est supprimé. Typiquement, chacun des rapports signal sur bruit est estimé en fonction de la variation de la puissance du signal temporel considéré dans sa bande de fréquences respective. Un tel traitement par banc de filtres nécessite des moyens de calcul considérables en raison du fait que toutes les étapes de séparation, estimation, pondération et addition précitées sont réalisées dans le domaine temporel. En pratique, dans un radiotéléphone, les moyens de calcul étant limités, en termes de Millions d'Instructions Par Seconde (Mips), par la capacité du processeur de traitement de signal numérique (DSP en terminologie anglo-saxonne pour Digital Signal Processor), il est alors proposé de réduire le traitement de suppression de signal de bruit à des bandes de fréquences grossières, et donc réduire la finesse, ou précision, de ce traitement.

[0004] Le traitement par soustraction spectrale recourt pour sa part au domaine fréquentiel, typiquement par utilisation de transformée de Fourier Rapide FFT (Fast Fourier Transform en terminologie anglo-saxonne). Il présente l'inconvénient principal d'induire une distorsion non linéaire dans le signal de parole traité qui résulte de la perte d'information de phase de ce signal. En effet ce traitement par soustraction spectrale produit une telle distorsion car il applique aux échantillons résultant de la Transformée de Fourier Rapide du signal de parole bruité à traiter des fonctions de module au carré qui suppriment l'information de phase, rendant ainsi ce traitement non linéaire. En outre, le défaut de linéarité du traitement par soustraction spectrale empêche son utilisation efficacement en combinaison avec un traitement d'annulation d'écho, telle que proposée par l'invention, car le dispositif d'annulation d'écho est perturbé dans son fonctionnement par cette perte d'information de phase.

[0005] Un premier objectif de la présente invention est de fournir un procédé de suppression de bruit dans un signal de parole qui a pour avantage de réduire considérablement la puissance de calcul nécessaire en termes de Nombre d'Instructions par Seconde, comparativement à un traitement par banc de filtres.

[0006] Un second objectif de l'invention est de fournir un procédé n'induisant pas une distorsion non linéaire dans le signal de parole à traiter, par contraste avec le traitement par soustraction spectrale.

[0007] Un autre objectif de l'invention est de fournir un système comprenant un dispositif de suppression de bruit mettant en oeuvre les étapes du procédé, en combinaison avec un dispositif d'annulation d'écho.

[0008] A cette fin, un procédé de suppression d'un signal de bruit dans un signal de parole bruité qui est échantillonné selon l'invention comprend les étapes de :
  • traitement fréquentiel numérique dudit signal de parole bruité, pour produire des coefficients temporels de filtrage, et
  • traitement temporel numérique dudit signal de parole bruité en fonction desdits coefficients de filtrage, en un signal de parole dans lequel ledit signal de bruit est sensiblement supprimé.


[0009] Le procédé définit, pour un cycle de traitement donné, les étapes de traitement fréquentiel numérique de:
  • extraction d'une pluralité de composantes énergétiques fréquentielles dans ledit signal de parole bruité,
  • estimation, pour chacune des composantes énergétiques fréquentielles extraites, d'un rapport entre un niveau d'énergie du signal de parole bruité et un niveau d'énergie du signal de bruit,
  • détermination d'un gain respectif pour ladite chacune des composantes énergétiques fréquentielles extraites, en fonction dudit rapport estimé entre le niveau d'énergie du signal de parole bruité et le niveau d'énergie du signal de bruit pour ladite chacune sélectionnée des composantes fréquentielles, et
  • synthèse desdits coefficients de filtrage en fonction desdits gains.


[0010] De préférence, l'étape d'extraction de composantes énergétiques fréquentielles comprend les sous-étapes de
  • production de K groupes comprenant chacun une pluralité de composantes fréquentielles, respectivement pour K blocs entrelacés du signal de parole bruité, avec K entier, et
  • calcul d'une moyenne énergétique de K composantes fréquentielles de même rang respectivement dans les K groupes, en l'une respective des composantes énergétiques fréquentielles extraites.


[0011] Typiquement, l'étape de calcul est précédée, pour chacun des K groupes de composantes fréquentielles, par une étape de sélection d'une partie des composantes fréquentielles ayant des rangs prédéterminés respectifs dans ledit chacun des groupes, ladite partie sélectionnée présentant un caractère de symétrie par rapport au complémentaire de cette partie parmi la pluralité des composantes fréquentielles extraites. Par ailleurs, les étapes de production et synthèse sont mises en oeuvre respectivement au moyen de Transformée de Fourier Rapide et Transformée de Fourier Inverse.

[0012] Un dispositif pour la mise en oeuvre du procédé comprend, pour chacun de cycles de traitement successifs,:
  • des moyens pour extraire une pluralité de composantes énergétiques fréquentielles dans ledit signal de parole bruité,
  • des moyens pour estimer, pour chacune des composantes énergétiques fréquentielles extraites, un rapport entre un niveau d'énergie du signal de parole bruité et un niveau d'énergie de signal de bruit,
  • des moyens pour déterminer un gain respectif pour ladite chacune des composantes énergétiques fréquentielles extraites, en fonction dudit rapport estimé entre le niveau d'énergie du signal de parole bruité et le niveau d'énergie du signal de bruit pour ladite chacune sélectionnée des composantes fréquentielles,
  • des moyens pour synthétiser lesdits coefficients de filtrage en fonction desdits gains, et
  • des moyens de filtrage temporel dudit signal de parole bruit en fonction desdits coefficients de filtrage, en un signal de parole dans lequel ledit signal de bruit est sensiblement supprimé.


[0013] L'invention fournit également deux variantes de système combiné d'annulation d'écho et de suppression de bruit.

[0014] Selon une première variante, le système comprend:
  • un dispositif de suppression de bruit pour supprimer un signal de bruit dans un signal de parole à transmettre, en un signal de parole débruité,
  • un annuleur d'écho comprenant un premier moyen pour produire un signal d'écho estimé en fonction d'un signal de parole donné et d'un signal de différence, et un second moyen pour soustraire ledit signal d'écho estimé audit signal de parole débruité, en ledit signal de différence.


[0015] Il est caractérisé en ce que ledit dispositif de suppression de bruit est sous la forme de:
  • un moyen de traitement fréquentiel numérique dudit signal de parole à transmettre, pour produire des coefficients temporels de filtrage, et
  • un premier moyen de traitement temporel numérique pour traiter ledit signal de parole à transmettre en fonction desdits coefficients de filtrage, en ledit signal de parole débruité dans lequel ledit signal de bruit est sensiblement supprimé, et en ce que ledit système comprend en outre:
  • un second moyen de traitement temporel numérique, strictement similaire audit premier moyen de traitement temporel, pour traiter un signal de parole reçu d'un terminal distant en fonction desdits coefficients de filtrage, en ledit signal de parole donné.


[0016] Selon une seconde variante, le système comprend
  • un annuleur d'écho comprenant un premier moyen pour produire un signal d'écho estimé en fonction d'un signal de parole reçu d'un terminal distant et d'un signal de différence, et un second moyen pour soustraire ledit signal d'écho estimé à un signal de parole à transmettre, en ledit signal de différence,


[0017] Il est caractérisé en ce qu'il comprend en outre:
  • un dispositif de suppression de bruit pour supprimer un signal de bruit dans le signal de différence, en un signal de parole débruité, ledit dispositif de suppression de bruit étant sous la forme de:
  • un moyen de traitement fréquentiel numérique pour traiter ledit signal de parole à transmettre, afin de produire des coefficients temporels de filtrage, et
  • un moyen de traitement temporel numérique pour traiter ledit signal de différence en fonction desdits coefficients de filtrage, en un signal de parole débruité dans lequel ledit signal de bruit est sensiblement supprimé.


[0018] Dans ces 2 variantes, le moyen de traitement fréquentiel numérique comporte :
  • des moyens pour extraire une pluralité de composantes énergétiques fréquentielles dans ledit signal de parole bruité,
  • des moyens pour estimer, pour chacune des composantes énergétiques fréquentielles extraites, un rapport entre un niveau d'énergie du signal de parole bruité et un niveau d'énergie de signal de bruit,
  • des moyens pour déterminer un gain respectif pour ladite chacune des composantes énergétiques fréquentielles extraites, en fonction dudit rapport estimé entre le niveau d'énergie du signal de parole bruité et le niveau d'énergie du signal de bruit pour ladite chacune sélectionnée des composantes fréquentielles,
  • des moyens pour synthétiser lesdits coefficients de filtrage en fonction desdits gains, et
  • des moyens de filtrage temporel dudit signal de parole bruit en fonction desdits coefficients de filtrage, en un signal de parole dans lequel ledit signal de bruit est sensiblement supprimé.


[0019] D'autres caractéristiques et avantages de la présente invention apparaîtront puis clairement à la lecture de la description suivante, en référence aux dessins annexés correspondants dans lesquels :
  • la figure 1 montre sous la forme d'un bloc-diagramme un dispositif selon l'invention de suppression de bruit dans un signal de parole;
  • la figure 2 schématise des étapes de traitement mises en oeuvre dans un circuit du dispositif de la figure 1;
  • la figure 3 montre, sous forme de bloc-diagramme, une première réalisation selon l'invention d'un système mettant en oeuvre le dispositif de la figure 1 en combinaison avec un annuleur d'écho; et
  • la figure 4 montre, sous forme de bloc-diagramme, une seconde réalisation selon l'invention d'un système mettant en oeuvre le dispositif de la figure 1 en combinaison avec un annuleur d'écho


[0020] En référence à la figure 1, un dispositif selon l'invention de suppression d'un signal de bruit dans un signal de parole 1 comprend un circuit d'échantillonnage la, une unité de traitement fréquentiel 100, et un circuit de traitement temporel 14. L'unité de traitement fréquentiel 100 comprend en cascade un circuit d'extraction de composantes énergétiques 10, un circuit d'estimation de rapport signal sur bruit 11, un circuit de calcul de gain 12 et un circuit de synthèse de coefficients de filtrage 13. Le circuit de traitement temporel 14 est un filtre temporel, de type filtre à réponse impulsionnelle finie (FIR Filter en terminologie anglo-saxonne pour Finite Impulse Response Filter).

[0021] Le circuit d'échantillonnage la échantillonne à une fréquence F=1/T un signal analogique de parole bruité s(t) constitué d'un signal de bruit additionné à un signal de parole. Le signal de parole bruité échantillonné s(nT) résultant de cet échantillonnage est appliqué, d'une part, à une entrée du circuit d'extraction de composantes énergétiques 10 dans l'unité de traitement fréquentiel 100, et, d'autre part, à une entrée du filtre temporel 14. La figure 2 schématise les traitements effectués dans le circuit 10 qui reçoit le signal de parole bruité s(nT). Ce signal de parole bruité échantillonné s(nT) se présente sous la forme de trames successives d'échantillons, quatre d'entr'elles T(n-2), T(n-1), T(n) et T(n+1) étant représentées à une première ligne de la figure 2. Une trame T(n) est formée, selon la réalisation décrite, par M = 128 échantillons, notés e(n)m, l'indice m variant entre O et 127. Pour chaque trame de rang n, T(n), associée à un cycle de traitement donné du procédé selon l'invention, sont produits K=3 blocs d'échantillons B(1), B(2) et B(3), K étant un nombre entier. Ces K=3 blocs d'échantillons sont formés selon la réalisation décrite à partir, d'une part, de cette trame de rang n, T(n), et, d'autre part, des 2 trames T(n-2) et T(n-1), de rangs respectifs (n-2) et (n-1). Les K=3 blocs d'échantillons B(1) à B(3) sont entrelacés et comprennent chacun 2.M= 256 échantillons successifs dans les trames T(n-2) à T(n), à compter de K=3 premiers échantillons respectifs de rangs 0 et M/2=64 dans la trame T(n-2) et de rang O dans la trame T(n-1). Les groupes respectifs de 2.M échantillons formant les blocs B(1), B(2) et B(3) sont notés b(1)i, b(2)i; et b(3)i, i variant de 0 à (2.M - 1)=255. A ces groupes respectifs d'échantillons b(1)i, b(2)i, b(3)i, 0 ≤i ≤255, sont appliquées respectivement trois transformées de Fourier rapides identiques selon les étapes notées 100a, 100b, et 100c. Ces étapes de transformée de Fourier rapide peuvent éventuellement être précédées par une opération de fenétrage temporel. Par ces transformées de Fourier rapides, à chacun des K=3 groupes d'échantillons b(1)i, b(2)i et b(3)i, est associé l'un respectif de K=3 groupes de composantes fréquentielles, notés E(1)i, E(2)i et E(3)i, l'indice i variant de 0 à 255. L'étape notée 101 dans cette figure 2 vise à simplifier la mise en oeuvre des traitements ultérieurs en sélectionnant seulement une partie des composantes fréquentielles dans chaque groupe E(1)i à E(3)i, 0 ≤i ≤255. Cette étape se fonde sur la propriété suivante. La Transformée de Fourier Rapide d'un signal réel présente une pseudo-symétrie. En effet, en sachant que les échantillons formant le signal de parole sont réels, chaque groupe de composantes fréquentielles E(k)i, k= 1, 2 ou 3, peut s'écrire sous la forme:



[0022] L'étape de traitement 101 sélectionne, dans chaque groupe E(k=1)i ,E(k=2)i et E(k=3)i, 0 ≤i ≤255, une partie des composantes fréquentielles le constituant, à savoir les composantes fréquentielles E(k)O à E(k)128 de rang 0 à 128, qui forment un groupe de composantes fréquentielles sélectionnées. Ces 129 premières composantes fréquentielles sélectionnées sont suffisantes pour décrire chaque groupe E(k)i, 0≤i ≤255, de façon complète puisque les autres composantes fréquentielles dans le groupe, à savoir les 127 dernières composantes E(k)129 à E(k)255, se déduisent par symétrie. Les composantes fréquentielles E(k)O à E(k)128 qui sont sélectionnées dans chaque groupe présentent en effet un caractère de symétrie par rapport au complémentaire E(k)129 à E(k)255 de ces composantes sélectionnées parmi toutes les composantes fréquentielles dans le groupe qui sont produites initialement. En sortie du traitement 101, sont ainsi produites les composantes fréquentielles E(k)O à E(k)128 pour chaque groupe. Selon l'étape 102, les 129 composantes fréquentielles sélectionnées dans chaque groupe sont décimées par 2, en vue de ne retenir qu'une composante sur deux parmi chaque groupe de composantes sélectionné. Cette décimation par deux 102 vise à écarter sélectivement une composante sur deux, relative à une fréquence donnée, en vue d'inhiber l'effet d'interaction que produit sur cette composante chacune des deux composantes fréquentielles situées à deux fréquences respectives de part et d'autre de ladite fréquence donnée. En pratique, sont retenues les 65 composantes fréquentielles E(k)i, avec i=1, 3, 5,.., 127,128, sachant que la composante fréquentielle E(k)0 ne présente aucun intérêt à être retenue puisqu'il s'agit d'une composante continue. A des fins de simplification de notation, ces composantes fréquentielles E(k)i, avec i=1, 3, 5,..,127,128 sont notées E(k)j, avec 0 ≤j ≤64. En résultat des étapes 101 et 102, est ainsi produite pour chaque groupe initial de composantes E(1)i ,E(2)i et E(3)i, 0 ≤i ≤255, un groupe de composantes sélectionnées et décimées.

[0023] Selon l'étape 103, il est opéré un calcul de la moyenne énergétique de chaque triplet de K=3 composantes fréquentielles de même rang j dans les K=3 groupes de composantes fréquentielles sélectionnées et décimées E(1)j, E(2)j et E(3)j, l'indice j variant de 0 à 64, pour produire 65 composantes énergétiques moyennées Emj, j variant de 0 à 64. Ce calcul comprend l'élévation au carré du module de chaque composante fréquentielle de même rang j dans les K=3 groupes de composantes sélectionnées et décimées, en K=3 composantes énergétiques, puis la moyenne de ces K=3 composantes énergétiques.

[0024] Ainsi le dispositif 10 extrait pour un cycle relatif à une trame T(n) de traitement du signal de parole bruité s(nT), 65 composantes énergétiques Emj, chacune représentative d'une énergie, ou puissance, du signal de parole bruité s(nT) pour la fréquence, ou bande de fréquence, considérée. Il est à noter que toutes les étapes 100, 101 et 102 décrites relativement à la figure 2, bien qu'améliorant la mise en oeuvre du procédé selon l'invention, peuvent être réduites à une seule étape consistant en l'application d'une unique transformée de Fourier FFT aux M = 128 échantillons de la trame T(n) retenue pour le cycle de traitement considéré. En outre, l'étape de sélection 101 peut ou bien être opérée ou bien ne pas être opérée, et cela directement sur les composantes fréquentielles résultant du(des) traitement(s) FFT.

[0025] En revenant à la figure 1, les 65 composantes énergétiques Emj, 0 ≤j ≤64, sont appliquées à une entrée du circuit d'estimation de rapport signal sur bruit 11. Pour chacune de ces 65 composantes énergétiques extraites Emj, le circuit 11 estime un rapport de signal sur bruit SNRj entre le signal de parole bruité s(nT) et un signal de bruit inclus dans ce signal de parole bruité, pour la composante énergétique considérée Emj. Un tel rapport signal sur bruit est donné par:

   dans laquelle l'exposant n repère le cycle de traitement relatif à la trame T(n) de rang n et Bj dénote une composante d'énergie de bruit dans la composante énergétique Emj de rang j.

[0026] En pratique, une telle estimation du rapport signal sur bruit se base sur le calcul de la composante d'énergie de bruit estimée dans chaque composante énergétique donnée. Elle utilise par exemple le rapport entre la composante énergétique Emjn extraite et la composante énergétique de bruit Bjn-1 calculée précédemment au cours d'un cycle de traitement ayant précédé le cycle considéré de traitement de suppression de signal de bruit dans la trame T(n). Plus ce rapport est élevé, plus il traduit l'existence d'un signal de parole pour la composante énergétique fréquentielle Emjn considérée, auquel cas la composante de bruit Bj(n-1) calculée relativement à la composante énergétique Emj(n-1) pour le rang (n-1) est maintenue en la composante de bruit Bjn . Plus ce rapport est faible, plus il traduit le fait que la composante énergétique se résume à un signal de bruit, auquel cas la composante de bruit Bjn varie par calcul en conséquence. Le circuit 11 attribue un rapport signal sur bruit SNRj, 0 ≤j ≤64, à chaque composante énergétique extraite Emj, 0 ≤j ≤64, selon un algorithme d'estimation utilisant un tel principe. En fonction de ces 65 rapports signal sur bruit SNRj, le circuit 12 calcule pour chacun d'eux, un gain Gj, prenant par exemple une valeur comprise sensiblement entre 0 et 1, qui est directement lié au rapport signal sur bruit SNRj pour la composante fréquentielle correspondante. Pour une composante énergétique fréquentielle donnée Emj, plus le rapport SNRj du signal de parole bruité s(nT) sur signal de bruit est élevé, plus le gain Gj est faible, et plus le rapport SNRj du signal de parole bruité sur le signal de bruit est faible, plus le gain Gj est élevé. Ainsi est atténuée la composante de signal de bruit pour chaque composante énergétique fréquentielle Emj. Ces gains Gj sont tels que la pondération des composantes énergétiques Emj respectivement par ces gains donnerait un spectre discret de composantes énergétiques fréquentielles pondérées, qui serait représentatif du signal de parole bruité s(nT) dans lequel le signal de bruit est sensiblement supprimé.

[0027] Une sortie du circuit 12 produisant les gains Gj est appliquée à une entrée du circuit de synthèse des coefficients de filtrage 13. Ce circuit 13 comprend un premier circuit (non représenté) de duplication des 65 gains calculés Gj, en conformité avec l'équation donnée en (1). Ce circuit reçoit 65 gains, notés G0, G1,..,G64, et produit 128 gains pouvant s'écrire sous la forme d'un groupe de gains Gj, j compris entre 0 et 127, tel que suit:



[0028] Un second circuit (non représenté) dans le circuit de synthèse 13, sous la forme d'une Transformée de Fourier Inverse TFD-1, synthétise 128 coefficients C(nT) du filtre 14 par transformée de Fourier inverse des 128 gains Gj. Ces coefficients notés C(nT), au nombre de 128, sont appliquées à une première entrée de commande du filtre 14, typiquement filtre FIR. Une seconde entrée du filtre 14 reçoit le signal de parole bruité s(nT). Le filtre 14 opère une convolution des coefficients C(nT) avec les 128 échantillons de la trame T(n), en une trame débruitée de 128 échantillons formant partie du signal de parole débruité s*(nT). Le procédé résultant du dispositif décrit ci-dessus est naturellement "adaptatif" en ce sens que les coefficients C(nT) appliqués à l'entrée de commande du filtre FIR 14 sont modifiés pour chaque trame T(n), de rang n donné, en fonction des traitements 10, 11, 12 et 13 des échantillons formant le signal de parole à traiter.

[0029] En résumé de ce qui précède, la caractéristique principale du procédé de suppression de bruit selon l'invention est d'utiliser, d'une part, un traitement fréquentiel numérique 100 du signal de parole bruité, pour produire des coefficients temporels de filtrage C(nT), et, d'autre part, un traitement temporel numérique 14 du signal de parole bruité s(nT) en fonction des coefficients de filtrage C(nT), pour produire un signal de parole s*(nT) dans lequel le signal de bruit est sensiblement supprimé.

[0030] En référence à la figure 3, un système combiné de suppression de bruit et d'annulation d'écho selon une première variante de l'invention qui est inclus dans un terminal, typiquement un radiotéléphone main-libre, comprend un microphone 2, un haut parleur 4, un dispositif de suppression de bruit selon l'invention 1, tel que décrit précédemment, un circuit de traitement temporel 14' et un annuleur d'écho 3. Le dispositif de suppression de bruit 1 est identique au dispositif montré à la figure 1, et comprend principalement une unité de traitement fréquentiel 100 et un circuit de traitement temporel 14. L'annuleur d'écho est formé d'un soustracteur 30 et d'un circuit 31 qui produit un signal d'écho estimé. Le microphone 2 reçoit un signal de parole à transmettre [s(t)+e(t)] formé d'un signal de parole sonore bruité s(t) additionné à un signal d'écho e(t). Ce signal d'écho résulte du couplage acoustique entre les haut-parleur 4 et microphone 2. Le dispositif de suppression de bruit 1 traite, tel que décrit précédemment, le signal de parole à transmettre en un signal de parole transmis débruité [s*(nT)+e*(nT)] qui est appliqué à une première entrée du soustracteur 30 dont une seconde entrée reçoit la sortie du circuit 31. Un signal de parole reçu r(t) en provenance d'un terminal distant est appliqué, d'une part à une entrée du haut-parleur, et, d'autre part, à une entrée du circuit 31 à travers le circuit de traitement temporel 14' précédé par un échantillonneur 14a'. Selon une caractéristique importante de l'invention, le circuit de traitement temporel 14' est à chaque instant strictement similaire au circuit de traitement temporel 14 dans le dispositif de suppression de bruit 1 (FIG.1). Cette caractéristique se base sur le fait que l'écho estimé du signal reçu r(t) produit par le circuit 31 est à soustraire, dans le soustracteur 30, au signal d'écho traité par suppression de bruit e*(nT) dans le circuit 1 et non au signal d'écho original e(nT). Ce circuit 14' est donc une duplication pure et simple du circuit de traitement temporel 14 dans le dispositif 1, comme indiqué par la flèche en trait discontinu à deux extrémités dans la figure 3. Le circuit de traitement temporel 14' est donc associé à chaque instant aux mêmes 128 coefficients de filtrage C(nT) que le circuit 14 dans le dispositif 1. Il traite le signal de parole reçu r(t) en un signal de parole reçu débruité r*(nT). Ce traitement résulte de la convolution, par cycle de 128, des coefficients C(nT) et des échantillons r(nT) du signal reçu r(t). Le circuit 31 produit un signal d'estimation ê*(nT) du signal d'écho débruité e*(nT) à partir du signal de parole reçu débruité r*(nT) et de coefficients d'annulation d'écho w(nT). En sortie du soustracteur 30 est donc produit un signal de différence [s*(nT)+e*(nT)-ê*(nT)] dans lequel le signal d'écho est sensiblement supprimé. Les coefficients d'annulation d'écho w(nT) sont obtenus à partir de ce signal de différence.

[0031] En référence à la figure 4, un système combiné de suppression de bruit et d'annulation d'écho selon une seconde variante de l'invention comprend un microphone 2, un haut parleur 4, un annuleur d'écho 3, une unité de traitement fréquentiel 100, un circuit de traitement temporel 14 et un échantillonneur 5. Les unité 100 et circuit 14 sont identiques à ceux décrits dans la figure 1. L'annuleur d'écho 3 est formé d'un soustracteur 30 et d'un circuit 31 qui produit un signal d'écho estimé ê(nT). Le microphone 2 reçoit un signal de parole transmis [s(t)+e(t)] formé d'un signal de parole sonore bruité s(t) additionné à un signal d'écho e(t). Ce signal d'écho résulte du couplage acoustique entre les haut-parleur 4 et microphone 2. Le signal de parole transmis [s(t)+e(t)] est échantillonné dans l'échantillonneur 5 en le signal [s(nT)+e(nT)]. Ce signal échantillonné est appliqué, d'une part, à une entrée de l'unité 100, et, d'autre part, à une entrée du circuit 14 à travers le soustracteur 30. Un signal de parole reçu en provenance d'un terminal distant r(t) est appliqué, d'une part, à une entrée du circuit 31, et, d'autre part, à une entrée du haut-parleur 4. Le circuit 31, recevant le signal r(t), produit en réponse un signal d'écho estimé ê(nT) appliqué à une première entrée du soustracteur 30 dont une seconde entrée reçoit le signal de parole transmis [s(nT)+e(nT)]. En sortie du soustracteur 30, est produit un signal de différence [s(nT)+e(nT)-ê(nT)] appliqué au circuit 14. Selon cette variante, d'une part les traitements fréquentiels mis en oeuvre dans l'unité 100 s'opèrent sur le signal de parole transmis [s(nT)+e(nT)], et d'autre part le traitement temporel dans le circuit 14, à partir des coefficients C(nT) produits par l'unité 100, s'opère sur le signal de différence, ou signal de parole transmis traité par annulation d'écho, [s(nT)+e(nT)-ê(nT)]. Cette variante évite de "dupliquer" le circuit 14 dans la branche incluant le circuit 31, comme représenté par la flèche en trait discontinu dans la figure 3 pour la variante précédente.


Revendications

1. Procédé de suppression d'un signal de bruit dans un signal de parole bruité (s(nT)) qui est échantillonné, comprenant les étapes de :

- traitement fréquentiel numérique (100) dudit signal de parole bruité, pour produire des coefficients temporels de filtrage (C(nT)), comportant les sous-étapes de :

- extraction (10) d'une pluralité de composantes énergétiques fréquentielles (Emj) dans ledit signal de parole bruité (s(nT)),

- estimation (11), pour chacune des composantes énergétiques fréquentielles extraites, d'un rapport (SNRj) entre un niveau d'énergie du signal de parole bruité (s(nT)) et un niveau d'énergie du signal de bruit,

- détermination (12) d'un gain (Gj) respectif pour ladite chacune des composantes énergétiques fréquentielles extraites (Emj), en fonction dudit rapport (SNRj) estimé entre le niveau d'énergie du signal de parole bruité (s(nT)) et le niveau d'énergie du signal de bruit pour ladite chacune sélectionnée des composantes fréquentielles, et

- synthèse (13) desdits coefficients de filtrage (C(nT)) en fonction desdits gains (Gj).

- traitement temporel numérique (14) dudit signal de parole bruité (s(nT)) en fonction desdits coefficients de filtrage (C(nT)), en un signal de parole (s*(nT)) dans lequel ledit signal de bruit est sensiblement supprimé.


 
2. Procédé conforme à la revendication précédente, dans lequel ladite étape d'extraction de composantes énergétiques fréquentielles comprend les sous-étapes de:

- production (100a, 100b, 100c) de K groupes comprenant chacun une pluralité de composantes fréquentielles (E(1)i, E(2)i, E(3)i), respectivement pour K blocs (B(1), B(2), B(3)) entrelacés du signal de parole bruité (s(nT)), avec K entier, et

- calcul (103) d'une moyenne énergétique de K composantes fréquentielles de même rang (j) respectivement dans les K groupes, en l'une respective des composantes énergétiques fréquentielles extraites.


 
3. Procédé conforme à la revendication 2, dans lequel ladite étape de calcul (103) est précédée, pour chacun des K groupes de composantes fréquentielles, par une étape de sélection (101) d'une partie des composantes fréquentielles ayant des rangs prédéterminés respectifs dans ledit chacun des groupes (E(1)i, E(2)i, E(3)i), ladite partie sélectionnée présentant un caractère de symétrie par rapport au complémentaire de cette partie parmi la pluralité des composantes fréquentielles extraites.
 
4. Procédé conforme à l'une quelconque des revendications 1 à 3, dans lequel lesdites étapes de production (100a, 100b, 100c) et de synthèse (13) sont mises en oeuvre respectivement au moyen de Transformée de Fourier Rapide et Transformée de Fourier Inverse.
 
5. Dispositif (1) de suppression d'un signal de bruit dans un signal de parole bruité (s(nT)) qui est échantillonné, comprenant, pour chacun de cycles de traitement successifs,:

- des moyens (10) pour extraire une pluralité de composantes énergétiques fréquentielles (Emj) dans ledit signal de parole bruité (s(nT)),

- des moyens (11) pour estimer, pour chacune des composantes énergétiques fréquentielles extraites, un rapport (SNRj) entre un niveau d'énergie du signal de parole bruité (s(nT)) et un niveau d'énergie de signal de bruit,

- des moyens pour déterminer (12) un gain (Gj) respectif pour ladite chacune des composantes énergétiques fréquentielles extraites (Emj), en fonction dudit rapport (SNRj) estimé entre le niveau d'énergie du signal de parole bruité (s(nT)) et le niveau d'énergie du signal de bruit pour ladite chacune sélectionnée des composantes fréquentielles,

- des moyens (13) pour synthétiser lesdits coefficients de filtrage (C(nT)) en fonction desdits gains (Gj), et

- des moyens de traitement temporel numérique (14) dudit signal de parole bruité (s(nT)) en fonction desdits coefficients de filtrage (C(nT)), en un signal de parole (s(nT)) dans lequel ledit signal de bruit est sensiblement supprimé.


 
6. Système combiné d'annulation d'écho (3) et de suppression de bruit (1), comprenant :

- un dispositif de suppression de bruit (1) pour supprimer un signal de bruit dans un signal de parole à transmettre (s(nT)+e(nT)), en un signal de parole débruité,

- un annuleur d'écho (3) comprenant un premier moyen (31) pour produire un signal d'écho estimé (ê*(t)) en fonction d'un signal de parole donné (r*(nT)) et d'un signal de différence (s*(nT)+e*(nT)-ê*(nT)), et un second moyen (30) pour soustraire ledit signal d'écho estimé (ê*(t)) audit signal de parole débruité (s*(nT)+e*(nT)), en ledit signal de différence (s*(nT)+e*(nT)-ê*(nT)),

   caractérisé en ce que ledit dispositif de suppression de bruit comprend un moyen de traitement fréquentiel numérique (100) dudit signal de parole à transmettre, pour produire des coefficients temporels de filtrage (C(nT)), comportant:

- des moyens (10) pour extraire une pluralité de composantes énergétiques fréquentielles (Emj) dans ledit signal de parole bruité (s(nT)),

- des moyens (11) pour estimer, pour chacune des composantes énergétiques fréquentielles extraites, un rapport (SNRj) entre un niveau d'énergie du signal de parole bruité (s(nT)) et un niveau d'énergie de signal de bruit,

- des moyens pour déterminer (12) un gain (Gj) respectif pour ladite chacune des composantes énergétiques fréquentielles extraites (Emj), en fonction dudit rapport (SNRj) estimé entre le niveau d'énergie du signal de parole bruité (s(nT)) et le niveau d'énergie du signal de bruit pour ladite chacune sélectionnée des composantes fréquentielles,

- des moyens (13) pour synthétiser lesdits coefficients de filtrage (C(nT)) en fonction desdits gains (Gj),

   et en ce que ledit dispositif de suppression de bruit comporte en outre :

- un premier moyen de traitement temporel numérique (14) pour traiter ledit signal de parole à transmettre (s(nT)) en fonction desdits coefficients de filtrage (C(nT)), en ledit signal de parole débruité (s*(nT)+e*(nT)) dans lequel ledit signal de bruit est sensiblement supprimé

- un second moyen de traitement temporel numérique (14'), strictement similaire audit premier moyen de traitement temporel (14), pour traiter un signal de parole reçu d'un terminal distant (r(t)) en fonction desdits coefficients de filtrage (C(nT)), en ledit signal de parole donné (r*(nT)),


 
7. Système combiné d'annulation d'écho (3) et de suppression de bruit (1) dans un signal de parole à transmettre (s(nT)+e(nT)), comprenant

- un annuleur d'écho (3) comprenant un premier moyen (31) pour produire un signal d'écho estimé (ê(t)) en fonction d'un signal de parole (r(t)) reçu d'un terminal distant et d'un signal de différence (s(nT)+e(nT)-ê(nT)), et un second moyen (30) pour soustraire ledit signal d'écho estimé (ê(t)) à un signal de parole à transmettre (s(nT)+e(nT)), en ledit signal de différence (s(nT)+e(nT)-ê(nT)),

   caractérisé en ce qu'il comprend un dispositif de suppression de bruit (1) pour supprimer un signal de bruit dans le signal de différence (s(nT)+e(nT)-ê(nT)), en un signal de parole débruité (s*(nT)+e*(nT)-ê*(nT)), ledit dispositif de suppression de bruit comprenant d'une part :

- un moyen de traitement fréquentiel numérique (100) pour traiter ledit signal de parole à transmettre (s(nT)+e(nT)), afin de produire des coefficients temporels de filtrage (C(nT)), comportant :

- des moyens (10) pour extraire une pluralité de composantes énergétiques fréquentielles (Emj) dans ledit signal de parole bruité (s(nT)),

- des moyens (11) pour estimer, pour chacune des composantes énergétiques fréquentielles extraites, un rapport (SNRj) entre un niveau d'énergie du signal de parole bruité (s(nT)) et un niveau d'énergie de signal de bruit,

- des moyens pour déterminer (12) un gain (Gj) respectif pour ladite chacune des composantes énergétiques fréquentielles extraites (Emj), en fonction dudit rapport (SNRj) estimé entre le niveau d'énergie du signal de parole bruité (s(nT)) et le niveau d'énergie du signal de bruit pour ladite chacune sélectionnée des composantes fréquentielles,

- des moyens (13) pour synthétiser lesdits coefficients de filtrage (C(nT)) en fonction desdits gains (Gj), et

- et d'autre part un moyen de traitement temporel numérique (14) pour traiter ledit signal de différence (s(nT)+e(nT)-ê(nT)) en fonction desdits coefficients de filtrage (C(nT)), en un signal de parole débruité (s*(nT)+e*(nT)-ê*(nT)) dans lequel ledit signal de bruit est sensiblement suppprimé.


 


Ansprüche

1. Verfahren zum Unterdrücken eines Rauschsignals in einem abgetasteten verrauschten Sprachsignal (s(nT)), mit den Schritten:

digitale Verarbeitung (100) des verrauschten Sprachsignals im Frequenzbereich zum Erzeugen von zeitlichen Filterkoeffizienten (C(nT)), mit den Unterschritten:

- Extraktion einer Mehrzahl von Frequenzenergiekomponenten (Emj) in dem verrauschten Sprachsignal (s(nT)),

- Abschätzen (11), für jede der extrahierten Frequenzenergiekomponenten, eines Verhältnisses (SNRj) zwischen einem Energieniveau des verrauschten Sprachsignals (s(nT)) und einem Energieniveau des Rauschsignals,

- Bestimmen (12) einer jeweiligen Verstärkung (Gj) für jede der extrahierten Frequenzenergiekomponenten (Emj) in Abhängigkeit von dem abgeschätzen Verhältnis (SNRj) zwischen dem Energieniveau des verrauschten Sprachsignals (s(nT)) und dem Energieniveau des Rauschsignals für jede jeweils ausgewählte Frequenzkomponenten, und

- Synthese (13) der Filterkoeffizienten (C(nT)) in Abhängigkeit von den Verstärkungen (Gj) ;

digitale Verarbeitung (14) des verrauschten Sprachsignals (s(nT)) im Zeitbereich in Abhängigkeit von den Filterkoeffizienten (C(nT)) zu einem Sprachsignal (s*(nT)), bei dem das Rauschsignal im wesentlichen unterdrückt ist.


 
2. Verfahren nach dem vorhergenden Anspruch, bei dem der Schritt der Extraktion der Frequenzenergiekomponenten die folgenden Unterschritte umfasst:

Erzeugen (100a, 100b, 100c) von K Gruppen mit jeweils einer Mehrzahl von Frequenzkomponenten (E(1)i, E(2)i, E(3)i für jeweils K verschachtelte Blöcke (B(1), B(2), B(3)) des verrauschten Sprachsignals (s(nT)), wobei K eine ganze Zahl ist, und

Berechnen (103) eines Energiemittels von K Frequenzkomponenten von jeweils gleichem Rang (j) in den K Gruppen für die jeweils eine der extrahierten Frequenzenergiekomponenten.


 
3. Verfahren nach Anspruch 2, bei dem dem Schritt des Berechnens (103) für jede der K Gruppen von Frequenzkomponenten ein Schritt des Auswählens (101) eines Teils der Frequenzkomponenten mit jeweils vorgegebenen Rängen in jeder der Gruppen (E(1)i, E(2)i, E(3)i) vorangeht, wobei der ausgewählte Teil eine Symmetrieeigenschaft in Bezug auf das Komplement dieses Teils unter der Mehrzahl der extrahierten Frequenzkomponenten aufweist.
 
4. Verfahren nach einem beliebigen der Ansprüche 1 bis 3, bei dem die Schritte des Erzeugens (100a, 100b, 100c) und der Synthese (13) jeweils durch schnelle Fourier-Transformation und inverse schnelle Fourier-Transformation durchgeführt werden.
 
5. Vorrichtung zur Unterdrückung eines Rauschsignals in einem abgetasteten verrauschten Sprachsignal (s(nT)), welche für jeden von aufeinanderfolgenden Verarbeitungszyklen umfasst:

Mittel (10) zum Extrahieren einer Mehrzahl von Frequenzenergiekomponenten (Emj) in dem verrauschten Sprachsignal (s(nT)),

Mittel (11) zum Abschätzen, für jede der extrahierten Frequenzenergiekomponenten, eines Verhältnisses (SNRj) zwischen einem Energieniveau des verrauschten Sprachsignals (s(nT)) und einem Energieniveau des Rauschsignals,

Mittel zum Bestimmen (12) einer jeweiligen Verstärkung (Gj) für jede der extrahierten Frequenzenergiekomponenten (Emj) in Abhängigkeit von dem abgeschätzten Verhältnis (SNRj) zwischen dem Energieniveau des verrauschten Sprachsignals (s(nT)) und dem Energieniveau des Rauschsignals für jede jeweils ausgewählte Frequenzkomponente,

Mittel (13) zum Synthetisieren der Filterkoeffizienten (C(nT)) in Abhängigkeit von den Verstärkungen (Gj), und

Mittel zur digitalen Verarbeitung im Zeitbereich (14) des verrauschten Sprachsignals (s(nT)) in Abhängkeit von den Filterkoeffizienten (C(nT)) zu einem Sprachsignal (s(nT)), bei dem das Rauschsignal im wesentlichen unterdrückt ist.


 
6. Kombiniertes System zur Echoaufhebung (3) und Rauschunterdrückung (1), mit:

einer Rauschunterdrückungsvorrichtung (1) zum Unterdrücken eines Rauschsignals in einem zu übertragenden Sprachsignal (s(nT)+e(nT)), um ein entrauschtes Sprachsignal zu bilden,

einem Echoaufheber (3) mit einem ersten Mittel (31) zum Erzeugen eines abgeschätzten Echosignals (ê* (t)) als Funktion eines gegebenen Sprachsignals r*(nT)) und eines Differenzsignals (s*(nT)+e*(nT)-ê*(nT)) und einem zweiten Mittel (30) zum Subtrahieren des abgeschätzten Echosignals (ê*(t)) von dem entrauschten Sprachsignal (s*(nT)+e*(nT)), um das Differenzsignal (s*(nT)+e*(nT)-ê*(nT)) zu bilden,

   dadurch gekennzeichnet, dass die Rauschunterdrückungsvorrichtung ein Mittel zur digitalen Frequenzverarbeitung (100) des zu übertragenden Sprachsignals zum Erzeugen von Filterkoeffizienten (C(nT)) im Zeitbereich umfasst, mit:

Mitteln (10) zum Extrahieren einer Mehrzahl von Frequenzenergiekomponenten (Emj) in dem verrauschten Sprachsignal (s(nT)),

Mitteln (11) zum Abschätzen, für jede der extrahierten Frequenzenergiekomponenten, eines Verhältnisses (SNRj) zwischen einem Energieniveau des verrauschten Sprachsignals (s(nT)) und einem Energieniveau des Rauschsignals,

Mitteln zum Bestimmen (12) einer jeweiligen Verstärkung (Gj) für eine jede der extrahierten Frequenzenergiekomponenten (Emj) in Abhängigkeit von dem abgeschätzten Verhältnis (SNRj) zwischen dem Energieniveau des verrauschten Sprachsignals (s(nT)) und dem Energieniveau des Rauschsignals für die jede jeweils ausgewählte Frequenzkomponente,

Mitteln (13) zum Synthetisieren der Filterkoeffizienten (C(nT)) in Abhängigkeit von den Verstärkungen (Gj),

   und dass die Rauschunterdrückungsvorrichtung ferner umfasst:

- ein erstes Mittel zur digitalen Verarbeitung im Zeitbereich (14) zur Verarbeitung des zu übertragenden Sprachsignals (s(nT)) in Abhängkeit von den Filterkoeffizienten (C(nT)) zu dem entrauschten Sprachsignal (s*(nT) + e*(nT)), bei dem das Rauschsignal im wesentlichen unterdrückt ist,

   ein zweites Mittel zur digitalen Verarbeitung im Zeitbereich (14'), des dem ersten Mittel zur Verarbeitung im Zeitbereich (14) genau entspricht, zum Verarbeiten eines von einem entfernten Endgerät empfangenen Sprachsignals (r(nT)) in Abhängigkeit von den Filterkoeffizienten (C(nT)) zu dem gegebenen Sprachsignal (r*(nT))
 
7. Kombiniertes System zur Echoaufhebung (3) und Rauschunterdrückung (1) in einem zu übertragenden Sprachsignal (s(nT)+e(nT)) mit
   einem Echoaufheber (3) mit einem ersten Mittel (31) zum Erzeugen eines geschätzten Echosignals (ê*(t)) als Funktion eines von einem entfernten Endgerät empfangenen Sprachsignals (r(nT)) und eines Differenzsignals (s(nT)+e(nT)-ê(nT)) und einem zweiten Mittel (30) zum Subtrahieren des abgeschätzten Echosignals (ê*(t)) von einem zu übertragenden Sprachsignal (s(nT)+e(nT)), um das Differenzsignal (s(nT)+e(nT)-ê(nT)) zu erhalten,
   dadurch gekennzeichnet, dass es eine Rauschunterdrückungsvorrichtung (1) zum Erzeugen eines entrauschten Sprachsignals (s*(nT)+e*(nT)-ê*(nT)) durch Unterdrücken eines Rauschsignals in dem Differenzsignal s(nT)+e(nT)-ê(nT)) umfasst, wobei die Rauschunterdrückungsvorrichtung umfasst:

- einerseits ein Mittel zur digitalen Verarbeitung (100) im Frequenzbereich zum Verarbeiten des zu übertragenden Sprachsignals (s(nT)+ enT)), um zeitliche Filterkoeffizienten (C(nT)) zu erzeugen, mit:

- Mitteln (10) zum Extrahieren einer Mehrzahl von Frequenzenergiekomponenten (Emj) in dem verrauschten Sprachsignal (s(nT)),

- Mitteln (11) zum Abschätzen, für jede der extrahierten Frequenzenergiekomponenten, eines Verhältnisses (SNRj) zwischen einem Energieniveau des verrauschten Sprachsignals (s(nT)) und einem Energieniveau des Rauschsignals,

- Mitteln zum Bestimmen (12) einer jeweiligen Verstärkung (Gj) für jede jeweils extrahierte Frequenzenergiekomponente (Emj) in Abhängigkeit von dem abgeschätzen Verhältnis (SNRj) zwischen dem Energieniveau des verrauschten Sprachsignals (s(nT)) und dem Energieniveau des Rauschsignals für besagte jeweils ausgewählte Frequenzkomponente,

- Mitteln (13) zum Sythetisieren der Filterkoeffizienten (C(nT)) in Abhängigkeit von den Verstärkungen (Gj), und

andererseits ein Mittel zur digitalen Verarbeitung im Zeitbereich (14) zur Verarbeitung des Differenzsignals s(nT)+e(nT)-ê(nT)) in Abhängigkeit von den Filterkoeffizienten (C(nT)) zu einem entrauschten Sprachsignal (s*(nT)+e*(nT)-ê*(nT)), in dem das Rauschsignal im wesentlichen unterdrückt ist.
 


Claims

1. A method of suppressing a background noise signal in a sampled noisy voice signal (s(nT)), comprising the following steps:

- digital frequency-domain processing (100) of said noisy voice signal to produce time-domain filter coefficients (C(nT)), comprising the following substeps:

- extraction (10) of a plurality of frequency-domain energy components (Emj) in said noisy voice signal (s(nT)),

- for each of the extracted frequency-domain energy components, estimation (11) of a ratio (SNRj) between an energy level of the noisy voice signal (s(nT)) and an energy level of the background noise signal,

- determination (12) of a respective gain (Gj) for each extracted frequency-domain energy component (Emj) according to said estimated ratio (SNRj) between the energy level of the noisy voice signal (s(nT)) and the energy level of the background noise signal for each selected frequency-domain component, and

- synthesis (13) of said filter coefficients (C(nT)) in accordance with said gains (Gj).

- digital time-domain processing (14) of said noisy voice signal (s(nT)) in accordance with said filter coefficients (C(nT)) to produce a voice signal (s*(nT)) in which said background noise signal is substantially suppressed.


 
2. A method according to the preceding claim wherein said step of extraction of frequency-domain energy components comprises the following substeps:

- production (100a, 100b, 100c) of K groups each comprising a plurality of frequency-domain components (E(1)i, E(2)i, E(3)i) for K respective interleaved blocks (B(1), B(2), B(3)) of the noisy voice signal (s(nT)), where K is an integer, and

- calculation (103) of an energy mean of K frequency-domain components of the same rank (j) in the respective K groups to produce a respective extracted frequency-domain energy component.


 
3. A method according to claim 2 wherein said calculation step (103) is preceded, for each of the K groups of frequency-domain components, by a step of selecting (101) some of the frequency-domain components having respective predetermined ranks in each group (E(1)i, E(2)i, E(3)i), said set of selected frequency-domain components being symmetrical to the counterpart thereof in the plurality of extracted frequency-domain components.
 
4. A method according to any of claims 1 to 3 wherein said production (100a, 100b, 100c) and synthesis (13) steps are respectively implemented by means of Fast Fourier Transformation and Inverse Fourier Transformation.
 
5. A device (1) for suppressing a background noise signal in a sampled noisy voice signal (s(nT)), comprising for each successive processing cycle:

- means (10) for extracting a plurality of frequency-domain energy components (Emj) in said noisy voice signal (s(nT)),

- means (11) for estimating for each of the extracted frequency-domain energy components a ratio (SNRj) between an energy level of the noisy voice signal (s(nT)) and an energy level of the background noise signal,

- means (12) for determining a respective gain (Gj) for each of said extracted frequency-domain energy components (Emj) according to said estimated ratio (SNRj) between the energy level of the noisy voice signal (s(nT)) and the energy level of the background noise signal for each selected frequency-domain component,

- means (13) for synthesizing said filter coefficients (C(nT)) according to said gains (Gj), and

- means for digital time-domain filtering (14) of said noisy voice signal (s(nT)) in accordance with said filter coefficients (C(nT)) to produce a voice signal (s(nT)) in which said background noise signal is substantially suppressed.


 
6. A combined echo cancellation (3) and background noise suppression (1) system comprising:

- a noise suppression device (1) for suppressing a background noise signal in a voice signal to be transmitted (s(nT) + e(nT)) to produce a noise suppressed voice signal,

- an echo canceller (3) comprising first means (31) for producing an estimated echo signal (ê*(t)) on the basis of a given voice signal (r*(nT)) and a difference signal (s(*(nT) + e*(nT) - ê*(nT)), and second means (30) for subtracting said estimated echo signal (ê*(t)) from said noise suppressed voice signal (s*(nT) + e*(nT)) to produce said difference signal (s*(nT) + e*(nT) - ê*(nT)),

characterized in that said background noise suppression device comprises digital frequency-domain processing means (100) for processing said voice signal to be transmitted to produce time-domain filter coefficients (C(nT)), comprising

- means (10) for extracting a plurality of frequency-domain energy components (Emj) in said noisy voice signal (s(nT)),

- means (11) for estimating for each of the extracted frequency-domain energy components a ratio (SNRj) between an energy level of the noisy voice signal (s(nT)) and an energy level of the background noise signal,

- means (12) for determining a respective gain (Gj) for each of said extracted frequency-domain energy components (Emj) according to said estimated ratio (SNRj) between the energy level of the noisy voice signal (s(nT)) and the energy level of the background noise signal for each selected frequency-domain component,

- means (13) for synthesizing said filter coefficients (C(nT) according to said gains (Gj),

and in that said background noise suppression device further comprises:

- first digital time-domain processing means (14) for processing said voice signal to be transmitted (s(nT)) in accordance with said filter coefficients (C(nT)) to produce said noise suppressed voice signal (s*(nT) + e*(nT)) in which said background noise signal is substantially suppressed, and

- second digital time-domain processing means (14') closely similar to said first time-domain processing means (14) for processing a voice signal received from a remote terminal (r(t)) in accordance with said filter coefficients (C(nT)) to produce said given voice signal (n*(nT)).


 
7. A combined echo cancellation (3) and background noise suppression (1) system for a voice signal to be transmitted (s(nT) + e(nT)), comprising:

- an echo canceller (3) comprising first means (31) for producing an estimated echo signal (ê(t)) on the basis of a voice signal (r(t)) received from a remote terminal and a difference signal (s(nT) + e(nT) - ê(nT)), and second means (30) for subtracting said estimated echo signal (ê(t)) from a voice signal to be transmitted (s(nT) + e(nT)) to produce said difference signal (s(nT) + e(nT) - ê(nT)),

characterized in that it comprises a background noise suppression device (1) for suppressing a background noise signal in the difference signal (s(nT) + e(nT) - ê(nT)) to produce a noise suppressed voice signal (s*(nT) + e*(nT)- ê*(nT)), said background noise suppression device comprising:

- digital frequency-domain processing means (100) for processing said voice signal to be transmitted (s(nT) + e(nT)) to produce time-domain filter coefficients (C(nT)), comprising:

- means (10) for extracting a plurality of frequency-domain energy components (Emj) in said noisy voice signal (s(nT)),

- means (11) for estimating for each of the extracted frequency-domain energy components a ratio (SNRj) between an energy level of the noisy voice signal (s(nT)) and an energy level of the background noise signal,

- means (12) for determining a respective gain (Gj) for each of said extracted frequency-domain energy components (Emj) according to said estimated ratio (SNRj) between the energy level of the noisy voice signal (s(nT)) and the energy level of the background noise signal for each selected frequency-domain component,

- means (13) for synthesizing said filter coefficients (C(nT) according to said gains (Gj), and

- digital time-domain processing means (14) for processing said difference signal (s(nT) + e(nT) - ê(nT)) in accordance with said filter coefficients (C(nT)) to produce a noise suppressed voice signal (s*(nT) + e*(nT) - ê*(nT)) in which said background noise signal is substantially suppressed.


 




Dessins