|
(11) | EP 2 490 426 B1 |
| (12) | EUROPEAN PATENT SPECIFICATION |
|
|
| (54) |
METHOD, APPARATUS AND SYSTEM FOR IMPLEMENTING AUDIO MIXING VERFAHREN, VORRICHTUNG UND SYSTEM ZUR IMPLEMENTIERUNG EINER AUDIOMISCHUNG PROCÉDÉ, APPAREIL ET SYSTÈME POUR L'IMPLÉMENTATION DE MIXAGE AUDIO |
|
|
|||||||||||||||||||||||||||||||
| Note: Within nine months from the publication of the mention of the grant of the European patent, any person may give notice to the European Patent Office of opposition to the European patent granted. Notice of opposition shall be filed in a written reasoned statement. It shall not be deemed to have been filed until the opposition fee has been paid. (Art. 99(1) European Patent Convention). |
FIELD OF THE INVENTION
BACKGROUND OF THE INVENTION
With an existing audio channel-based audio mixing method, in the same conference, only a conventional conference terminal is compatible, but a next generation multi channel-based terminal and a next generation audio object-based terminal are not compatible.
SUMMARY OF THE INVENTION
A method for implementing audio mixing includes:
receiving an audio signal sent by each sending conference site, where the received audio signals include an audio channel-based audio signal sent by an audio channel-based sending conference site and an audio object-based audio signal sent by an audio object-based sending conference site;
selecting audio signals for each receiving conference site from the received audio signals;
processing the selected audio signals according to types of receiving conference sites, where the receiving conference sites include an audio channel-based receiving conference site and an audio object-based receiving conference site; and
sending the processed audio signal to each receiving conference site respectively according to the type of the receiving conference site;
wherein when the receiving conference site is an audio channel-based receiving conference site, the processing the selected audio signals according to the types of the receiving conference sites comprises: converting the selected audio signals into audio signals wherein number of channels of each converted audio signal is consistent with the number of audio channels of the receiving conference site; and performing, based on the audio channel of the receiving conference site, audio mixing on the converted audio signals; and
when the receiving conference site is an audio object-based receiving conference site, the processing the selected audio signals according to the types of the receiving conference sites comprises: converting the selected audio signals into audio objects according to a presentation mode of the receiving conference site; and combining the converted audio objects into one audio object stream.
a receiving module, configured to receive an audio signal sent by each sending conference site, where the received audio signals include an audio channel-based audio signal sent by an audio channel-based sending conference site and an audio object-based audio signal sent by an audio object-based sending conference site;
a selecting module, configured to select audio signals for each receiving conference site from the received audio signals;
a processing module, configured to process the selected audio signals according to types of receiving conference sites, where the receiving conference sites include an audio channel-based receiving conference site and an audio object-based receiving conference site; and
a sending module, configured to send the processed audio signal to each receiving conference site respectively according to the type of the receiving conference site;
wherein the processing module comprises: a first converting unit, configured to convert the selected audio signals into audio signals wherein number of channels of each converted audio signal is consistent with the number of audio channels of the receiving conference site; and an audio mixing unit, configured to perform, based on the audio channel of the receiving conference site, audio mixing on the converted audio signals; or
the processing module further comprises: a second converting unit, configured to convert the selected audio signals into audio objects according to a presentation mode of the receiving conference site; and a combining unit, configured to combine the converted audio objects into one audio object stream.
BRIEF DESCRIPTION OF THE DRAWINGS
FIG. 1 is a flowchart of a method for implementing audio mixing according to a first embodiment of the present invention;
FIG. 2 and FIG 3 are flowcharts of a method for implementing audio mixing according to a second embodiment of the present invention;
FIG. 4 is a flowchart of converting a selected audio signal into an audio signal that is consistent with the number of audio channels at an audio channel-based receiving conference site according to the second embodiment of the present invention;
FIG 5 is a schematic diagram of an audio presentation mode of a TelePresence terminal according to the second embodiment of the present invention;
FIG 6 is a schematic structural diagram of an apparatus for implementing audio mixing according to a third embodiment of the present invention;
FIG 7 and FIG 8 are schematic structural diagrams of an apparatus for implementing audio mixing according to a fourth embodiment of the present invention; and
FIG 9 is a schematic structural diagram of a system for implementing audio mixing according to a fifth embodiment of the present invention.
DETAILED DESCRIPTION OF THE EMBODIMENTS
Embodiment 1
101: Receive an audio signal sent by each sending conference site, where the received audio signals include an audio channel-based audio signal and an audio object-based audio signal.
102: Select an audio signal for each receiving conference site from the received audio signals.
103: Process the selected audio signals according to types of receiving conference sites, where the receiving conference sites include an audio channel-based receiving conference site and an audio object-based receiving conference site.
104: Send the processed audio signal to each receiving conference site respectively according to the type of the receiving conference site.
Embodiment 2
201: An MCU receives an audio signal sent by each sending conference site, where the received audio signals include an audio channel-based audio signal and an audio object-based audio signal. A type of the audio signal is determined according to a type of a sending conference site. If the sending conference site is an audio channel-based sending conference site, an audio signal sent by the sending conference site is an audio channel-based audio signal. If the sending conference site is an audio object-based sending conference site, an audio signal sent by the sending conference site is an audio object-based audio signal. The audio channel-based sending conference site may be a mono channel-based or multi channel-based sending conference site. Accordingly, the audio channel-based audio signal may be a mono channel-based or multi channel-based audio signal. The audio object refers to an audio source that is regarded as an object. In addition to an audio signal, one audio object further includes auxiliary information. The auxiliary information includes information of the audio object, such as maximum absolute energy, an energy ratio, space information, position information, different playback modes, and corresponding parameters of the different playback modes.
202: The MCU selects an audio signal for each receiving conference site from the received audio signals.
202a: The MCU respectively calculates energy of the audio channel-based audio signal and/or energy of the audio object-based audio signal.
(1) Calculate the energy of the audio channel-based audio signal.
(2) Calculate the energy of the audio object-based audio signal.
| Receiving conference site | Selected audio signals |
| A | B1, C1, D1 |
| B | C1, D1 |
| C | B1, D1 |
| D | B1, C1 |
| E | B1, C1, D1 |
| Receiving conference site | Selected audio signals |
| A | B1 C1, D1 |
| B | A1, C1, D1 |
| C | D1 |
| D | D C1 |
| E | C1, D1 |
203a: Convert the selected audio signals into audio signals that are consistent with the number of audio channels of the receiving conference site.
L1: Judge a type of the selected audio signals, and if the selected audio signals are audio channel-based audio signals, perform step L2; and if the selected audio signals are audio object-based audio signals, perform step L3.
L2: Convert the audio channel-based audio signals into signals that are consistent with the number of audio channels of the receiving conference site.
(2) When the receiving conference site is an audio object-based receiving conference site, as shown in FIG 3, the processing the selected audio signals according to the type of the receiving conference site includes:
203c: Convert the selected audio signals into audio objects according to a presentation mode of the receiving conference site.
S1: Set a presentation mode of the selected audio signals according to the presentation mode of the receiving conference site.
Embodiment 3
Embodiment 4
a calculating unit 621, configured to respectively calculate energy of the audio channel-based audio signal and/or energy of the audio object-based audio signal; and
a selecting unit 622, configured to select audio signals according to the energy of the audio channel-based audio signal and/or the energy of the audio object-based audio signal, where the selecting unit 622 may select, according to magnitude of the energy of the audio channel-based audio signal and/or the energy of the audio object-based audio signal, multiple audio signals that have higher audio signal energy for each receiving conference site; and the audio signals selected by the selecting unit 622 for each receiving conference site may be the same, and may also be different.
a first converting unit 631, configured to convert the selected audio signals into audio signals that are consistent with the number of audio channels of the receiving conference site; and
an audio mixing unit 632, configured to perform, based on the audio channel of the receiving conference site, audio mixing on the converted audio signals.
a first judging sub-unit 6311, configured to judge a type of the selected audio signals;
a first converting sub-unit 6312, configured to, when the selected audio signals are audio channel-based audio signals, convert the audio channel-based audio signals into signals that are consistent with the number of audio channels of the receiving conference site;
a second judging sub-unit 6313, configured to, when the selected audio signals are audio object-based audio signals, judge whether auxiliary information of the audio object carries a playback mode that is consistent with the number of audio channels of the receiving conference site;
a second converting sub-unit 6314, configured to, when the auxiliary information of the audio object carries a playback mode that is consistent with the number of audio channels of the receiving conference site, convert, according to a parameter of a corresponding playback mode in the auxiliary information, the audio object into an audio signal that is consistent with the number of audio channels of the receiving conference site; and
a third converting sub-unit 6315, configured to, when the auxiliary information of the audio objects does not carry a playback mode that is consistent with the number of audio channels of the receiving conference site, convert, according to position information of the audio object, the audio object into a signal that is consistent with the number of audio channels of the receiving conference site, where the position information is carried in the auxiliary information of the audio object.
a second converting unit 633, configured to convert the selected audio signals into audio objects according to a presentation mode of the receiving conference site; and
a combining unit 634, configured to combine the converted audio objects into one audio object stream.
a setting sub-unit 6331, configured to set a presentation mode of the selected audio signals according to the presentation mode of the receiving conference site;
a fourth converting sub-unit 6332, configured to, when the selected audio signals are audio channel-based audio signals, convert the selected audio signals into audio objects according to the set presentation mode; and
a modifying sub-unit 6333, configured to, when the selected audio signals are audio object-based audio signals, modify a parameter of the audio object according to the set presentation mode.
Embodiment 5
receiving (101) an audio signal sent by each sending conference site, wherein the received audio signals comprise an audio channel-based audio signal sent by an audio channel-based sending conference site and an audio object-based audio signal sent by an audio object-based sending conference site;
selecting (102) audio signals for each receiving conference site from the received audio signals;
processing (103) the selected audio signals according to types of receiving conference sites, wherein the receiving conference sites comprises an audio channel-based receiving conference site and an audio object-based receiving conference site; and
sending (104) the processed audio signal to each receiving conference site respectively according to the type of the receiving conference site;
wherein when the receiving conference site is an audio channel-based receiving conference site, the processing of the selected audio signals according to the types of the receiving conference sites comprises: converting the selected audio signals into audio signals wherein the number of channels of each converted audio signal is consistent with the number of audio channels of the receiving conference site; and performing, based on the audio channel of the receiving conference site, audio mixing on the converted audio signals; and
when the receiving conference site is an audio object-based receiving conference site, the processing of the selected audio signals according to the types of the receiving conference sites comprises: converting the selected audio signals into audio objects according to a presentation mode of the receiving conference site; and combining the converted audio objects into one audio object stream.
respectively calculating energy of the audio channel-based audio signal and/or energy of the audio object-based audio signal; and
selecting an audio signal according to the energy of the audio channel-based audi.o signal and/or the energy of the audio object-based audio signal.
when the audio channel is a mono channel, taking the energy of the audio channel-based audio signal as energy of the mono channel; and
when the audio channel is a multi channel, calculating energy of each audio channel respectively, and taking maximum audio channel energy as the energy of the audio channel-based audio signal, or taking an average value of energy of each audio channel as the energy of the audio channel-based audio signal.
calculating absolute energy of the audio object according to maximum absolute energy and a ratio of energy of the audio object to the maximum absolute energy, wherein the maximum absolute energy and the ratio of energy of the audio object to the maximum absolute energy are carried in auxiliary information of the audio object.
judging a type of the selected audio signals;
if the selected audio signals are audio channel-based audio signals, converting the audio channel-based audio signals into signals wherein the number of channels of each converted signal is consistent with the number of audio channels of the receiving conference site;
if the selected audio signals are audio object-based audio signals, judging whether auxiliary information of the audio object carries a playback mode that is consistent with the number of audio channels of the receiving conference site;
if the auxiliary information of the audio object carries a playback mode that is consistent with the number of audio channels of the receiving conference site, converting, according to a parameter of a corresponding playback mode in the auxiliary information, the audio object into an audio signal wherein the number of channels of the converted audio signal is consistent with the number of audio channels of the receiving conference site; and
if the auxiliary information of the audio object does not carry a playback mode that is consistent with the number of audio channels of the receiving conference site, converting, according to position information of the audio object, the audio object into a signal wherein the number of channels of the converted signal is consistent with the number of audio channels of the receiving conference site, wherein the position information is carried in the auxiliary information of the audio object.
determining, according to a position of the audio object and a location of a loudspeaker that is corresponding to each audio channel of the receiving conference site, a loudspeaker that is closest to the audio object; and
copying the audio object-based audio signal to an audio channel corresponding to the loudspeaker that is closest to the audio object.
setting a presentation mode of the selected audio signals according to the presentation mode of the receiving conference site;
when the selected audio signals are audio channel-based audio signals, converting the selected audio signals into audio objects according to the set presentation mode; and
when the selected audio signals are audio object-based audio signals, modifying a parameter of the audio object according to the set presentation mode.
a receiving module(61), configured to receive an audio signal sent by each sending conference site, wherein the audio signals comprise an audio channel-based audio signal sent by an audio channel-based sending conference site and an audio object-based audio signal sent by an audio object-based sending conference site;
a selecting module(62), configured to select audio signals for each receiving conference site from the received audio signals;
a processing module(63), configured to process the selected audio signals according to types of receiving conference sites, wherein the receiving conference sites comprise an audio channel-based receiving conference site and an audio object-based receiving conference site; and
a sending module(64), configured to send the processed audio signal to each receiving conference site respectively according to the type of the receiving conference site;
wherein
the processing module (63) comprises: a first converting unit(631), configured to convert the selected audio signals into audio signals wherein the number of channels of each converted audio signal is consistent with the number of audio channels of the receiving conference, site; and an audio mixing unit(632), configured to perform, based on the audio channel of the receiving conference site, audio mixing on the converted audio signals;
or
the processing module (63) comprises: a second converting unit(633), configured to convert the selected audio signals into audio objects according to a presentation mode of the receiving conference site; and a combining unit(634), configured to combine the converted audio objects into one audio object stream.
a calculating unit(62 1), configured to respectively calculate energy of the audio channel-based audio signal and energy of the audio object-based audio signal; and
a selecting unit(622), configured to select audio signals according to the energy of the audio channel-based audio signal and the energy of the audio object-based audio signal.
a first judging sub-unit(6311), configured to judge a type of the selected audio signals;
a first converting sub-unit(6312), configured to, when the selected audio signals are audio channel-based audio signals, convert the audio channel-based audio signals into signals wherein the number of channels of each converted audio signal is consistent with the number of audio channels of the receiving conference site;
a second judging sub-unit(6313), configured to, when the selected audio signals are audio object-based audio signals, judge whether auxiliary information of the audio object carries a playback mode that is consistent with the number of audio channels of the receiving conference site;
a second converting sub-unit(6314), configured to, when the auxiliary information of the audio object carries a playback mode that is consistent with the number of audio channels of the receiving conference site, convert, according to a parameter of a corresponding playback mode in the auxiliary information, the audio object into an audio signal wherein the number of channels of the converted audio signal is consistent with the number of audio channels of the receiving conference site; and
a third converting sub-unit(6315), configured to, when the auxiliary information of the audio object does not carry a playback mode that is consistent with the number of audio channels of the receiving conference site, convert, according to position information of the audio object, the audio object into a signal wherein the number of channels of the signal is consistent with the number of audio channels of the receiving conference site, wherein the position information is carried in the auxiliary information of the audio object.
a setting sub-unit(6331), configured to set a presentation mode of the selected audio signals according to the presentation mode of the receiving conference site;
a fourth converting sub-unit(6332), configured to, when the selected audio signals are audio channel-based audio signals, convert the selected audio signals into audio objects according to the set presentation mode; and
a modifying sub-unit(6333), configured to, when the selected audio signals are audio object-based audio signals, modify a parameter of the audio object according to the set presentation mode.
the sending conference sites(91) are configured to send audio signals to the multipoint control unit(92), wherein the audio signals comprise an audio channel-based audio signal sent by an audio channel-based sending conference site and an audio object-based audio signal sent by an audio object-based sending conference site;
the multipoint control unit(92) is configured to receive the audio signals sent by the sending conference sites(91), select audio signals for each receiving conference site from the received audio signals, process the selected audio signals according to types of receiving conference sites(93), and send the processed audio signal to each receiving conference site respectively according to the type of the receiving conference site, wherein the receiving conference sites(93) comprise an audio channel-based receiving conference site and an audio object-based receiving conference site; and
the receiving conference sites(93) are configured to receive the processed audio signals from the multipoint control unit(92);
wherein when the receiving conference site is an audio channel-based receiving conference site, the processing of the selected audio signals according to the types of the receiving conference sites(93) comprises: converting the selected audio signals into audio signals wherein the number of channels of each converted audio signal is consistent with the number of audio channels of the receiving conference site; and performing, based on the audio channel of the receiving conference site, audio mixing on the converted audio signals; and
when the receiving conference site is an audio object-based receiving conference site, the processing of the selected audio signals according to the types of the receiving conference sites(93) comprises: converting the selected audio signals into audio objects according to a presentation mode of the receiving conference site; and combining the converted audio objects into one audio object stream.
Empfangen (101) eines Audiosignals, das von jedem sendenden Konferenzstandort gesendet wird, wobei die empfangenen Audiosignale ein durch einen audiokanalbasierten sendenden Konferenzstandort gesendetes audiokanalbasiertes Audiosignal und ein durch einen audioobjektbasierten sendenden Konferenzstandort gesendetes audioobjektbasiertes Audiosignal umfassen;
Auswählen (102) von Audiosignalen für jeden empfangenden Konferenzstandort aus den empfangenen Audiosignalen;
Verarbeiten (103) der ausgewählten Audiosignale gemäß Typen von empfangenden Konferenzstandorten, wobei die empfangenden Konferenzstandorte einen audiokanalbasierten empfangenden Konferenzstandort und einen audioobjektbasierten empfangenden Konferenzstandort umfassen; und
jeweiliges Senden (104) des verarbeiteten Audiosignals zu jedem empfangenden Konferenzstandort gemäß dem Typ des empfangenden Konferenzstandorts;
wobei dann, wenn der empfangende Konferenzstandort ein audiokanalbasierter empfangender Konferenzstandort ist, das Verarbeiten der ausgewählten Audiosignale gemäß den Typen der empfangenden Konferenzstandorte Folgendes umfasst: Umsetzen der ausgewählten Audiosignale in Audiosignale, wobei die Anzahl von Kanälen jedes umgesetzten Audiosignals mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist; und Ausführen einer Audiomischung auf den umgesetzten Audiosignalen basierend auf dem Audiokanal des empfangenden Konferenzstandorts; und
dann, wenn der empfangende Konferenzstandort ein audioobjektbasierter empfangender Konferenzstandort ist, das Verarbeiten der ausgewählten Audiosignale gemäß den Typen der empfangenden Konferenzstandorte Folgendes umfasst: Umsetzen der ausgewählten Audiosignale in Audioobjekte gemäß einem Präsentationsmodus des empfangenden Konferenzstandorts; und Kombinieren der umgesetzten Audioobjekte in einen Audioobjektdatenstrom.
jeweils Berechnen der Energie des audiokanalbasierten Audiosignals und/oder der Energie des audioobjektbasierten Audiosignals; und
Auswählen eines Audiosignals gemäß der Energie des audiokanalbasierten Audiosignals und/oder der Energie des audioobjektbasierten Audiosignals.
wenn der Audiokanal ein Monokanal ist, Übernehmen der Energie des audioobjektbasierten Audiosignals als Energie des Monokanals; und
wenn der Audiokanal ein Multikanal ist, jeweils Berechnen der Energie jedes Audiokanals und Übernehmen der maximalen Audiokanalenergie als die Energie des audiokanalbasierten Audiosignals oder Übernehmen eines Mittelwerts der Energie jedes Audiokanals als die Energie des audiokanalbasierten Audiosignals.
Berechnen der absoluten Energie des Audioobjekts gemäß der maximalen absoluten Energie und eines Verhältnisses der Energie des Audioobjekts zu der maximalen absoluten Energie, wobei die maximale absolute Energie und das Verhältnis der Energie des Audioobjekts zu der maximalen absoluten Energie in Zusatzinformationen des Audioobjekts geführt werden.
Beurteilen eines Typs der ausgewählten Audiosignale;
falls die ausgewählten Audiosignale audiokanalbasierte Audiosignale sind, Umsetzen der audiokanalbasierten Audiosignale in Signale, wobei die Anzahl von Kanälen jedes umgesetzten Signals mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist;
falls die ausgewählten Audiosignale audioobjektbasierte Audiosignale sind, Beurteilen, ob Zusatzinformationen des Audioobjekts einen Wiedergabemodus führen, der mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist;
falls die Zusatzinformationen des Audioobjekts einen Wiedergabemodus führen, der mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist, Umsetzen des Audioobjekts gemäß einem Parameter eines entsprechenden Wiedergabemodus in den Zusatzinformationen in ein Audiosignal, wobei die Anzahl von Kanälen des umgesetzten Audiosignals mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist; und
falls die Zusatzinformationen des Audioobjekts keinen Wiedergabemodus führen, der mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist, Umsetzen des Audioobjekts gemäß Positionsinformationen des Audioobjekts in ein Signal, wobei die Anzahl von Kanälen des umgesetzten Signals mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist, wobei die Positionsinformationen in den Zusatzinformationen des Audioobjekts geführt sind.
Bestimmen eines Lautsprechers, der dem Audioobjekt am nähesten ist, gemäß einer Position des Audioobjekts und eines Orts eines Lautsprechers, der jedem Audiokanal des empfangenden Konferenzstandorts entspricht; und
Kopieren des audioobjektbasierten Audiosignals in einen Audiokanal, der dem Lautsprecher, der dem Audioobjekt am nähesten ist, entspricht.
Einstellen eines Präsentationsmodus der ausgewählten Audiosignale gemäß dem Präsentationsmodus des empfangenden Konferenzstandorts;
wenn die ausgewählten Audiosignale audiokanalbasierte Audiosignale sind, Umsetzen der ausgewählten Audiosignale in Audioobjekte gemäß dem eingestellten Präsentationsmodus; und
wenn die ausgewählten Audiosignale audioobjektbasierte Audiosignale sind, Modifizieren eines Parameters des Audioobjekts gemäß dem eingestellten Präsentationsmodus.
ein Empfangsmodul (61), das konfiguriert ist, ein von jedem sendenden Konferenzstandort gesendetes Audiosignal zu empfangen, wobei die Audiosignale ein durch einen audiokanalbasierten sendenden Konferenzstandort gesendetes audiokanalbasiertes Audiosignal und ein durch einen audioobjektbasierten sendenden Konferenzstandort gesendetes audioobjektbasiertes Audiosignal umfassen;
ein Auswahlmodul (62), das konfiguriert ist, Audiosignale für jeden empfangenden Konferenzstandort aus den empfangenen Audiosignalen auszuwählen;
ein Verarbeitungsmodul (63), das konfiguriert ist, die ausgewählten Audiosignale gemäß Typen der empfangenden Konferenzstandorte zu verarbeiten, wobei die empfangenden Konferenzstandorte einen audiokanalbasierten empfangenden Konferenzstandort und einen audioobjcktbasierten empfangenden Konferenzstandort umfassen; und
ein Sendemodul (64), das konfiguriert ist, das verarbeitete Audiosignal jeweils zu jedem empfangenden Konferenzstandort gemäß dem Typ des empfangenden Konferenzstandorts zu senden;
wobei
das Verarbeitungsmodul (63) Folgendes umfasst: eine erste Umsetzungseinheit (631), die konfiguriert ist, die ausgewählten Audiosignale in Audiosignale umzusetzen, wobei die Anzahl von Kanälen jedes umgesetzten Audiosignals mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist; und
eine Audiomischungseinheit (632), die konfiguriert ist, basierend auf dem Audiokanal des empfangenden Konferenzstandorts Audiomischung auf den umgesetzten Audiosignalen auszuführen;
oder
das Verarbeitungsmodul (63) Folgendes umfasst: eine zweite Umsetzungseinheit (633), die konfiguriert ist, die ausgewählten Audiosignale in Audioobjekte gemäß einem Präsentationsmodus des empfangenden Konferenzstandorts umzusetzen; und eine Kombinierungseinheit (634), die konfiguriert ist, die umgesetzten Audioobjekte in einen Audioobjektdatenstrom zu kombinieren.
eine Berechnungseinheit (621), die konfiguriert ist, die Energie des audiokanalbasierten Audiosignals bzw, die Energie des audioobjektbasierten Audiosignals zu berechnen; und
eine Auswahleinheit (622), die konfiguriert ist, Audiosignale gemäß der Energie des audiokanalbasierten Audiosignals und der Energie des audioobjektbasierten Audiosignals auszuwählen.
eine erste Beurteilungsuntereinheit (6311), die konfiguriert ist, einen Typ der ausgewählten Audiosignale zu beurteilen;
eine erste Umsetzungsuntereinheit (6312), die konfiguriert ist, dann, wenn die ausgewählten Audiosignale audiokanalbasierte Audiosignale sind, die audiokanalbasierten Audiosignale in Signale umzusetzen, wobei die Anzahl von Kanälen jedes umgesetzten Audiosignals mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist;
eine zweite Beurteilungsuntereinheit (6313), die konfiguriert ist, dann, wenn die auswählten Audiosignale audioobjektbasierte Audiosignale sind, zu beurteilen, ob Zusatzinformationen des Audioobjekts einen Wiedergabemodus führen, der mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist;
eine zweite Umsetzungsuntereinheit (6314), die konfiguriert ist, dann, wenn die Zusatzinformationen des Audioobjekts einen Wiedergabemodus führen, der mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist, das Audioobjekt gemäß einem Parameter eines entsprechenden Wiedergabemodus in den Zusatzinformationen in ein Audiosignal umzusetzen, wobei die Anzahl von Kanälen des umgesetzten Audiosignals mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist; und
eine dritte Umsetzungsuntereinheit (6315), die konfiguriert ist, dann, wenn die Zusatzinformationen des Audioobjekts keinen Wiedergabemodus führen, der mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts konsistent ist, das Audioobjekt gemäß Positionsinformationen des Audioobjekts in ein Signal umzusetzen, wobei die Anzahl von Kanälen des Signals mit der Anzahl von Audiokanälan des empfangenden Konferenzstandorts konsistent ist, wobei die Positionsinformationen in den Zusatzinformationen des Audioobjekts geführt sind.
eine Einstellungsuntereinheit (6331), die konfiguriert ist, einen Präsentationsmodus der ausgewählten Audiosignale gemäß dem Präsentationsmodus des empfangenden Konferenzstandorts einzustellen;
eine vierte Umsetzungsuntereinheit (6332), die konfiguriert ist, dann, wenn die ausgewählten Audiosignale audiokanalbasierte Audiosignale sind, die ausgewählten Audiosignale gemäß dem eingestellten Präsentationsmodus in Audioobjekte umzusetzen; und
eine Modifizierungsuntereinheit (6333), die konfiguriert ist, dann, wenn die ausgewählten Audiosignale audioobjektbasierte Audiosignale sind, einen Parameter des Audioobjekts gemäß dem eingestellten Präsentationsmodus zu modifizierten.
die sendenden Konferenzstandorte (91) konfiguriert sind, Audiosignale zu der Mehrpunktsteuereinheit (92) zu senden, wobei die Audiosignale ein durch einen audiokanalbasierten sendenden Konferenzstandort gesendetes audiokanalbasiertes Audiosignal und ein durch einen audioobjektbasierten sendenden Konferenzstandort gesendetes audioobjektbasiertes Audiosignal umfassen;
die Mehrpunktsteuereinheit (92) konfiguriert ist, die von den sendenden Konferenzstandorten (91) gesendeten Audiosignale zu empfangen, Audiosignale für jeden empfangenden Konferenzstandort aus den empfangenen Audiosignalen auszuwählen, die ausgewählten Audiosignale gemäß Typen der empfangenden Konferenzstandorte (93) zu verarbeiten und die verarbeiteten Audiosignale zu jedem empfangenden Konferenzstandort jeweils entsprechend dem Typ des empfangenden Konferenzstandorts zu senden, wobei die empfangenden Konferenzstandorte (93) einen audiokanalbasierten empfangenden Konferenzstandort und einen audioobjektbasierten empfangenden Konferenzstandort umfassen; und
die empfangenden Konferenzstandorte (93) konfiguriert sind, die verarbeiteten Audiosignale von der Mehrpunktsteuercinheit (92) zu empfangen;
wobei dann, wenn der empfangende Konferenzstandort ein audiokanalbasierter empfangender Konferenzstandort ist, das Verarbeiten der ausgewählten Audiosignale gemäß den Typen der empfangenden Konferenzstandorte (93) Folgendes umfasst: Umsetzen der ausgewählten Audiosignale in Audiosignale, wobei die Anzahl von Kanälen jedes umgesetzten Audiosignals konsistent mit der Anzahl von Audiokanälen des empfangenden Konferenzstandorts ist; und Ausführen von Audiomischung auf den umgesetzten Audiosignalen basierend auf dem Audiokanal des empfangenden Konferenzstandorts; und
dann, wenn der empfangende Konferenzstandort ein audioobjektbasierter empfangender Konferenzstandort ist, das Verarbeiten der ausgewählten Audiosignale gemäß den Typen der empfangenden Konfetenzstandorte (93) Folgendes umfasst:
Umsetzen der ausgewählten Audiosignale in Audioobjekte gemäß einem Präsentationsmodus des empfangenden Konferenzstandorts; und Kombinieren der umgesetzten Audioobjekte in einen Audioobjektdatenstrom.
recevoir (101) un signal audio émis par chaque site de conférence émetteur, où les signaux audio reçus comprennent un signal audio basé sur des canaux audio émis par un site de conférence émetteur basé sur des canaux audio et un signal audio basé sur des objets audio émis par un site de conférence émetteur basé sur des objets audio ;
sélectionner (102) des signaux audio pour chaque site de conférence récepteur à partir des signaux audio reçus ;
traiter (103) les signaux audio sélectionnés selon les types des sites de conférence récepteurs, où les sites de conférence récepteurs comprennent un site de conférence récepteur basé sur des canaux audio et un site de conférence récepteur basé sur des objets audio ; et
envoyer (104) le signal audio traité à chaque site de conférence récepteur, respectivement, selon le type du site de conférence récepteur ;
où, lorsque le site de conférence récepteur est un site de conférence récepteur basé sur des canaux audio, le traitement des signaux audio sélectionnés selon les types des sites de conférence récepteurs comprend les étapes suivantes : convertir les signaux audio sélectionnés en signaux audio où le nombre de canaux de chaque signal audio converti est cohérent avec le nombre de canaux audio du site de conférence récepteur ; et effectuer, sur la base du canal audio du site de conférence récepteur, un mixage audio sur les signaux audio convertis ; et
lorsque le site de conférence récepteur est un site de conférence récepteur basé sur des objets audio, le traitement des signaux audio sélectionnés selon les types des sites de conférence récepteurs comprend les étapes suivantes : convertir les signaux audio sélectionnés en objets audio conformément à un mode de présentation du site de conférence récepteur ; et combiner les objets audio convertis en un flux d'objet audio.
calculer, respectivement, l'énergie du signal audio basé sur des canaux audio et/ou l'énergie du signal audio basé sur des objets audio ; et
sélectionner un signal audio en fonction de l'énergie du signal audio basé sur des canaux audio et/ou de l'énergie du signal audio basé sur des objets audio.
lorsque le canal audio est un monocanal, prendre l'énergie du signal audio basé sur des canaux audio comme énergie du monocanal ; et
lorsque le canal audio est un canal multiple, calculer l'énergie de chaque canal audio respectivement, et prendre l'énergie du canal audio maximum comme énergie du signal audio basé sur des canaux audio, ou prendre une valeur moyenne de l'énergie de chaque canal audio comme énergie du signal audio basé sur des canaux audio.
calculer l'énergie absolue de l'objet audio selon une énergie absolue maximum et un rapport de l'énergie de l'objet audio sur l'énergie absolue maximum, où l'énergie absolue maximum et le rapport de l'énergie de l'objet audio sur l'énergie absolue maximum sont acheminés dans les informations auxiliaires de l'objet audio.
juger un type des signaux audio sélectionnés ;
si les signaux audio sélectionnés sont des signaux audio basés sur des canaux audio, convertir les signaux audio basés sur des canaux audio en signaux, où le nombre de canaux de chaque signal converti est cohérent avec le nombre de canaux audio du site de conférence récepteur ;
si les signaux audio sélectionnés sont des signaux audio basés sur des objets audio, juger si les informations auxiliaires de l'objet audio acheminent un mode de lecture qui est cohérent avec le nombre de canaux audio du site de conférence récepteur ;
si les informations auxiliaires de l'objet audio acheminent un mode de lecture qui est cohérent avec le nombre de canaux audio du site de conférence récepteur, convertir, conformément à un paramètre d'un mode de lecture correspondant dans les informations auxiliaires, l'objet audio en un signal audio où le nombre de canaux du signal audio converti est cohérent avec le nombre de canaux audio du site de conférence récepteur : et
si les informations auxiliaires de l'objet audio n'acheminent pas un mode de lecture qui est cohérent avec le nombre de canaux audio du site de conférence récepteur, convertir, conformément à des informations de position de l'objet audio, l'objet audio en un signal où le nombre de canaux du signal converti est cohérent avec le nombre de canaux audio du site de conférence récepteur, où les informations de position sont acheminées dans les informations auxiliaires de l'objet audio.
déterminer, conformément à une position de l'objet audio et à un emplacement d'un haut-parleur qui correspond à chaque canal audio du site de conférence récepteur, un haut-parleur qui est le plus proche de l'objet audio ; et
copier le signal audio basé sur des objets audio sur un canal audio correspondant au haut-parleur qui est le plus proche de l'objet audio.
définir un mode de présentation des signaux audio sélectionnés conformément au mode de présentation du site de conférence récepteur ;
lorsque les signaux audio sélectionnés sont des signaux audio basés sur des canaux audio, convertir les signaux audio sélectionnés en objets audio conformément au mode de présentation défini ; et
lorsque les signaux audio sélectionnés sont des signaux audio basés sur des objets audio, modifier un paramètre de l'objet audio conformément au mode de présentation définir.
un module de réception (61), configuré pour recevoir un signal audio émis par chaque site de conférence émetteur, ou les signaux audio comprennent un signal audio basé sur des canaux audio émis par un site de conférence émetteur basé sur des canaux audio et un signal audio basé sur des objets audio émis par un site de conférence émetteur basé sur des objets audio ;
un module de sélection (62), configuré pour sélectionner des signaux audio pour chaque site de conférence récepteur à partir des signaux audio reçus ;
un module de traitement (63), configuré pour traiter les signaux audio sélectionnés selon les types des sites de conférence récepteurs, où les sites de conférence récepteurs comprennent un site de conférence récepteur basé sur des canaux audio et un site de conférence récepteur basé sur des objets audio ; et
un module d'envoi (64), configuré pour envoyer le signal audio traité à chaque site de conférence récepteur, respectivement, selon le type du site de conférence récepteur ; où
le module de traitement (63) comprend : une première unité de conversion (631), configurée pour convertir les signaux audio sélectionnés en signaux audio, où le nombre de canaux de chaque signal audio converti est cohérent avec le nombre de canaux audio du site de conférence récepteur ; et une unité de mixage audio (632), configurée pour effectuer, sur la base du canal audio du site de conférence récepteur, un mixage audio sur les signaux audio convertis ;
ou
le module de traitement (63) comprend : une seconde unité de conversion (633), configurée pour convertir les signaux audio sélectionnés en objets audio conformément à un mode de présentation du site de conférence récepteur ; et une unité de combinaison (634), configurée pour combiner les objets audio convertis en un flux d'objet audio.
une unité de calcul (621), configurée pour calculer, respectivement, l'énergie du signal audio basé sur des canaux audio et l'énergie du signal audio basé sur des objets audio ; et
une unité de sélection (622), configurée pour sélectionner des signaux audio en fonction de l'énergie du signal audio basé sur des canaux audio et de l'énergie du signal audio basé sur des objets audio.
une première sous-unité de jugement (6311), configurée pour juger un type des signaux audio sélectionnés ;
une première sous-unité de conversion (6312), configurée pour, lorsque les signaux audio sélectionnés sont des signaux audio basés sur des canaux audio, convertir les signaux audio basés sur des canaux audio en signaux où le nombre de canaux de chaque signal audio converti est cohérent avec le nombre de canaux audio du site de conférence récepteur ;
une seconde sous-unité de jugement (6313), configurée pour, lorsque les signaux audio sélectionnés sont des signaux audio basés sur des objets audio, juger si des informations auxiliaires de l'objet audio acheminent un mode de lecture qui est cohérent avec le nombre de canaux audio du site de conférence récepteur ;
une seconde sous-unité de conversion (6314), configurée pour, lorsque les informations auxiliaires de l'objet audio acheminent un mode de lecture qui est cohérent avec le nombre de canaux audio du site de conférence récepteur, convertir, conformément à un paramètre d'un mode de lecture correspondant dans les informations auxiliaires, l'objet audio en un signal audio où le nombre de canaux du signal audio converti est cohérent avec le nombre de canaux audio du site de conférence récepteur ; et
une troisième sous-unité de conversion (6315), configurée pour, lorsque les informations auxiliaires de l'objet audio n'acheminent pas un mode de lecture qui est cohérent avec le nombre de canaux audio) du site de conférence récepteur, convertir,
conformément à des informations de position de l'objet audio, l'objet audio en un signal où le nombre de canaux du signal est cohérent avec le nombre de canaux audio du site de conférence récepteur, où les informations de position sont acheminées dans les informations auxiliaires de l'objet audio.
une sous-unité de définition (6331), configurée pour définir un mode de présentation des signaux audio sélectionnés conformément au mode de présentation du site de conférence récepteur ;
une quatrième sous-unité de conversion (6332), configurée pour, lorsque les signaux audio sélectionnés sont des signaux audio basés sur des canaux audio, convertir les signaux audio sélectionnés en objets audio conformément au mode de présentation défini ; et
une sous-unité de modification (6333), configurée pour, lorsque les signaux audio sélectionnés sont des signaux audio basés sur des objets audio, modifier un paramètre de l'objet audio conformément au mode de présentation défini.
les sites de conférence émetteurs (91) sont configurés pour envoyer des signaux audio à l'unité de contrôle de points multiples (92), où les signaux audio comprennent un signal audio basé sur des canaux audio émis par un site de conférence émetteur basé sur des canaux audio et un signal audio basé sur des objets audio émis par un site de conférence émetteur basé sur des objets audio ;
l'unité de contrôle de points multiples (92) est configurée pour recevoir les signaux audio émis par les sites de conférence émetteurs (91), sélectionner des signaux audio pour chaque site de conférence récepteur à partir des signaux audio reçus, traiter les signaux audio sélectionnés conformément aux types des sites de conférence récepteurs (93), et envoyer le signal audio traité à chaque site de conférence récepteur, respectivement, selon le type du site de conférence récepteur, où les sites de conférence récepteurs (93) comprennent un site de conférence récepteur basé sur des canaux audio et un site de conférence récepteur basé sur des objets audio ; et
les sites de conférence récepteurs (93) sont configurés pour recevoir les signaux audio traités depuis l'unité de contrôle de points multiples (92) ;
où, lorsque le site de conférence récepteur est un site de conférence récepteur basé sur des canaux audio, le traitement des signaux audio sélectionnés selon les types des sites de conférence récepteurs (93) comprend les étapes suivantes : convertir les signaux audio sélectionnés en signaux audio où le nombre de canaux de chaque signal audio converti est cohérent avec le nombre de canaux audio du site de conférence récepteur ; et effectuer, sur la base du canal audio du site de conférence récepteur, un mixage audio sur les signaux audio convertis , et
lorsque le site de conférence récepteur est un site de conférence récepteur basé sur des objets audio, le traitement des signaux audio sélectionnés selon les types des sites de conférence récepteurs (93) comprend les étapes suivantes : convertir les signaux audio sélectionnés en objets audio conformément à un mode de présentation du site de conférence récepteur ; et combiner les objets audio convertis en un flux d'objet audio.
REFERENCES CITED IN THE DESCRIPTION
Patent documents cited in the description