<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE ep-patent-document PUBLIC "-//EPO//EP PATENT DOCUMENT 1.7//EN" "ep-patent-document-v1-7.dtd">
<!--This XML data has been generated under the supervision of the European Patent Office -->
<ep-patent-document id="EP21154227B1" file="EP21154227NWB1.xml" lang="de" country="EP" doc-number="4035969" kind="B1" date-publ="20241113" status="n" dtd-version="ep-patent-document-v1-7">
<SDOBI lang="de"><B000><eptags><B001EP>ATBECHDEDKESFRGBGRITLILUNLSEMCPTIESILTLVFIROMKCYALTRBGCZEEHUPLSK..HRIS..MTNORS..SM..................</B001EP><B005EP>J</B005EP><B007EP>0009210-RPUB02</B007EP></eptags></B000><B100><B110>4035969</B110><B120><B121>EUROPÄISCHE PATENTSCHRIFT</B121></B120><B130>B1</B130><B140><date>20241113</date></B140><B190>EP</B190></B100><B200><B210>21154227.9</B210><B220><date>20210129</date></B220><B240><B241><date>20230120</date></B241></B240><B250>de</B250><B251EP>de</B251EP><B260>de</B260></B200><B400><B405><date>20241113</date><bnum>202446</bnum></B405><B430><date>20220803</date><bnum>202231</bnum></B430><B450><date>20241113</date><bnum>202446</bnum></B450><B452EP><date>20240715</date></B452EP></B400><B500><B510EP><classification-ipcr sequence="1"><text>B61L  15/00        20060101AFI20240614BHEP        </text></classification-ipcr><classification-ipcr sequence="2"><text>B61L  27/20        20220101ALI20240614BHEP        </text></classification-ipcr><classification-ipcr sequence="3"><text>B61L  27/60        20220101ALI20240614BHEP        </text></classification-ipcr></B510EP><B520EP><classifications-cpc><classification-cpc sequence="1"><text>B61L  27/60        20220101 LI20220101RHEP        </text></classification-cpc><classification-cpc sequence="2"><text>B61L  27/20        20220101 LI20220101RHEP        </text></classification-cpc><classification-cpc sequence="3"><text>B61L  15/0062      20240101 FI20240101RHEP        </text></classification-cpc></classifications-cpc></B520EP><B540><B541>de</B541><B542>VERFAHREN ZUM TRAINIEREN EINER STEUERUNG FÜR EIN SCHIENENFAHRZEUG, STEUERUNG UND SCHIENENFAHRZEUG</B542><B541>en</B541><B542>CONTROLLER, RAILWAY VEHICLE AND METHOD FOR TRAINING A CONTROLLER FOR A RAILWAY VEHICLE</B542><B541>fr</B541><B542>PROCÉDÉ D'APPRENTISSAGE D'UN DISPOSITIF COMMANDE POUR VÉHICULE FERROVIAIRE, DISPOSITIF DE COMMANDE ET VÉHICULE FERROVIAIRE</B542></B540><B560><B561><text>EP-A1- 3 552 921</text></B561><B561><text>EP-B1- 3 552 921</text></B561><B561><text>DE-A1- 102017 215 802</text></B561><B562><text>SHUANBAO YAO ET AL: "Optimization design for aerodynamic elements of high speed trains", COMPUTERS AND FLUIDS, PERGAMON PRESS, NEW YORK, NY, GB, vol. 95, 3 March 2014 (2014-03-03), pages 56 - 73, XP028844629, ISSN: 0045-7930, DOI: 10.1016/J.COMPFLUID.2014.02.018</text></B562></B560></B500><B700><B720><B721><snm>Palmer, Andrew</snm><adr><city>Spring Hill, 4004</city><ctry>AU</ctry></adr></B721><B721><snm>Weber, Marc Christian</snm><adr><city>80339 München</city><ctry>DE</ctry></adr></B721></B720><B730><B731><snm>Siemens Mobility GmbH</snm><iid>101769576</iid><irf>2020P25972EP</irf><adr><str>Otto-Hahn-Ring 6</str><city>81739 München</city><ctry>DE</ctry></adr></B731></B730><B740><B741><snm>Siemens Patent Attorneys</snm><iid>101840188</iid><adr><str>Postfach 22 16 34</str><city>80506 München</city><ctry>DE</ctry></adr></B741></B740></B700><B800><B840><ctry>AL</ctry><ctry>AT</ctry><ctry>BE</ctry><ctry>BG</ctry><ctry>CH</ctry><ctry>CY</ctry><ctry>CZ</ctry><ctry>DE</ctry><ctry>DK</ctry><ctry>EE</ctry><ctry>ES</ctry><ctry>FI</ctry><ctry>FR</ctry><ctry>GB</ctry><ctry>GR</ctry><ctry>HR</ctry><ctry>HU</ctry><ctry>IE</ctry><ctry>IS</ctry><ctry>IT</ctry><ctry>LI</ctry><ctry>LT</ctry><ctry>LU</ctry><ctry>LV</ctry><ctry>MC</ctry><ctry>MK</ctry><ctry>MT</ctry><ctry>NL</ctry><ctry>NO</ctry><ctry>PL</ctry><ctry>PT</ctry><ctry>RO</ctry><ctry>RS</ctry><ctry>SE</ctry><ctry>SI</ctry><ctry>SK</ctry><ctry>SM</ctry><ctry>TR</ctry></B840></B800></SDOBI>
<description id="desc" lang="de"><!-- EPO <DP n="1"> -->
<p id="p0001" num="0001">Die Erfindung betrifft ein Verfahren zum Trainieren einer Steuerung für ein Schienenfahrzeug. Die Erfindung betrifft ferner eine Steuerung und ein Schienenfahrzeug mit einer Steuerung.</p>
<p id="p0002" num="0002">Für den automatischen Zugbetrieb ist eine Steuerung erforderlich, die eine gewünschte Trajektorie von einer übergeordneten Planungseinheit in die zum Fahren der Trajektorie erforderlichen Beschleunigungs- und Bremsbefehle übersetzen kann. Typischerweise erfordern die verwendeten Steuerungen einen erheblichen Abstimmungsaufwand, um sich an die spezifischen Eigenschaften der einzelnen Fahrzeuge anzupassen.</p>
<p id="p0003" num="0003">Typische Ansätze für Steuerungen basieren auf Proportional-Integral-Derivative (PID)-Reglern und Model Predictive Control (MPC)-Reglern. PID-Regler werden sehr häufig verwendet, da sie sehr einfach zu implementieren sind. Sie erfordern jedoch einen erheblichen Abstimmungsaufwand, wenn sie in einem neuen Fahrzeug eingesetzt werden. Außerdem berücksichtigen sie nicht mehr als den aktuellen Zeitschritt und können daher bei Systemen, bei denen es eine Verzögerung in der Reaktion des Systems auf die Steuereingaben gibt, eine schlechte Leistung aufweisen. In diesen Fällen werden typischerweise MPC-Regler eingesetzt. Die MPC-Steuerung setzt jedoch ein genaues Modell des zu steuernden Systems voraus. Bei komplexen Systemen kann dieses jedoch aufwändig sein beziehungsweise nicht mit ausreichender Präzision erreicht werden.</p>
<p id="p0004" num="0004">Aus der <patcit id="pcit0001" dnum="EP3552921A1"><text>EP 3 552 921 A1</text></patcit> ist eine AUTONOME GESCHWINDIGKEITS-PLANUNG EINES AUF EINEN VORBESTIMMTEN PFAD BESCHRÄNKTEN BEWEGLICHEN AKTEURS bekannt.</p>
<p id="p0005" num="0005">Ferner ist in der <patcit id="pcit0002" dnum="DE102017215802A1"><text>DE 10 2017 215 802 A1</text></patcit> ein Fahrerassistenzsystem für Schienenfahrzeuge beschrieben.<!-- EPO <DP n="2"> --></p>
<p id="p0006" num="0006">Weiterhin wird über das Design von Hochgeschwindigkeitzügen in <nplcit id="ncit0001" npl-type="b"><text>SHUANBAO YAO ET AL: "Optimization design for aerodynamic elements of high speed trains", COMPUTERS AND FLUIDS, PERGAMON PRESS, NEW YORK, NY, GB, Bd. 95, 3. März 2014 (2014-03-03), Seiten 56-73</text></nplcit>, berichtet.</p>
<p id="p0007" num="0007">Der Erfindung liegt die Aufgabe zugrunde, ein verbessertes Verfahren zum Trainieren einer Steuerung für ein Schienenfahrzeug, eine verbesserte Steuerung und ein Schienenfahrzeug mit einer Steuerung bereitzustellen.<!-- EPO <DP n="3"> --></p>
<p id="p0008" num="0008">Diese Aufgabe wird erfindungsgemäß durch ein Verfahren zum Trainieren einer Steuerung eines Schienenfahrzeugs, eine entsprechend trainierte Steuerung und ein Schienenfahrzeug mit einer trainierten Steuerung gemäß den unabhängigen Ansprüchen gelöst. Vorteilhafte Ausgestaltungen sind in den Unteransprüchen angegeben.</p>
<p id="p0009" num="0009">Nach einem Aspekt der Erfindung wird ein Verfahren zum Trainieren einer Steuerung eines Schienenfahrzeugs bereitgestellt, wobei das Verfahren umfasst:
<ul id="ul0001" list-style="dash" compact="compact">
<li>Bereitstellen von Trainingsdaten basierend auf Sensordaten eines Schienenfahrzeugs;</li>
<li>Trainieren eines Surrogat-Modells des Schienenfahrzeugs basierend auf den Trainingsdaten bezüglich einer Relation zwischen einer Ansteuerung eines Antriebs des Schienenfahrzeugs und einer resultierenden Geschwindigkeit des Schienenfahrzeugs;</li>
<li>Trainieren einer Aktionsauswahlregel basierend auf den Trainingsdaten und dem Surrogat-Modell unter Verwendung von maschinellem Lernen und unter Berücksichtigung wenigstens eines objektiven Steuerungsziels, wobei die Aktionsauswahlregel Steuerungsanweisungen zum Ansteuern des Antriebs des Schienenfahrzeugs umfasst, die eingerichtet sind, das Schienenfahrzeug aus einem ersten Geschwindigkeitszustand in einen zweiten Geschwindigkeitszustand zu beschleunigen; und</li>
<li>Generieren einer trainierten Aktionsauswahlregel, wobei die trainierte Aktionsauswahlregel Steuerungsanweisungen umfasst, die eingerichtet sind, das Schienenfahrzeug zu beschleunigen und das Steuerungsziel zu erfüllen.</li>
</ul></p>
<p id="p0010" num="0010">Hierdurch kann der technische Vorteil erreicht werden, dass ein verbessertes Verfahren zum Trainieren einer Steuerung eines Schienenfahrzeugs bereitgestellt werden kann. Die Steuerung des Schienenfahrzeugs wird hierbei unter Berücksichtigung von Techniken des Maschinenlernens trainiert. Hierzu werden auf Sensordaten eines Schienenfahrzeugs basierende Trainingsdaten bereitgestellt. Basierend auf den Trainingsdaten wird darauffolgend ein Surrogat-Modell des Schienenfahrzeugs<!-- EPO <DP n="4"> --> in Bezug auf eine Relation zwischen einer Ansteuerung eines Antriebs des Schienenfahrzeugs und einer hieraus resultierenden Geschwindigkeit des Schienenfahrzeugs trainiert. Darauffolgend wird eine Aktionsauswahlregel basierend auf den Trainingsdaten und dem trainierten Surrogat-Modell mittels Techniken des bestärkenden Lernens und unter Berücksichtigung wenigstens eines Steuerungsziels trainiert und eine trainierte Aktionsauswahlregel generiert. Basierend auf der trainierten Aktionsauswahlregel kann das Schienenfahrzeug gesteuert und das jeweils vorbestimmte Steuerungsziel erreicht werden.</p>
<p id="p0011" num="0011">Ein Surrogat-Modell eines Schienenfahrzeugs ist im Sinne der Anmeldung ein virtuelles Modell eines realen Schienenfahrzeugs, das alle relevanten Merkmale des realen Schienenfahrzeugs darstellt. Ein Surrogat-Modell kann analog zu einem virtuellen Zwilling einer realen Maschine ausgebildet sein und den Betrieb einer realen Maschine bzw. eines Schienenfahrzeugs virtuell simulieren. Das Surrogat-Modell ist somit eingerichtet, ein Verfahren eines Schienenfahrzeugs durch eine entsprechende Ansteuerung zu simulieren. Das Surrogat-Modell kann beispielsweise als ein entsprechend trainiertes neuronales Netz ausgebildet sein, und kann darauf trainiert sein, das Fahrverhalten bzw. die steuerungsrelevanten Eigenschaften des Schienenfahrzeugs zu simulieren bzw. darzustellen.</p>
<p id="p0012" num="0012">Eine Aktionsauswahlregel im Sinne der Anmeldung ist eine Mehrzahl von Steuerungsanweisungen, die eingerichtet sind, das Schienenfahrzeug aus einem ersten Geschwindigkeitszustand in einen zweiten Geschwindigkeitszustand zu beschleunigen. Die ersten und zweiten Geschwindigkeitszustände können hierbei ein Ist-Zustand, in dem sich das Schienenfahrzeug zu einem bestimmten Zeitpunkt befindet, und ein Soll-Zustand sein, in den das Schienenfahrzeug durch Ansteuern des Antriebs zu überführen ist. Die ersten und zweiten Geschwindigkeitszustände können alternativ hierzu zwei zeitlich nacheinander folgende Zustände des Schienenfahrzeugs sein, in die das Schienenfahrzeug beim Ansteuern durch die Steuerung überführt<!-- EPO <DP n="5"> --> wird. Durch Ausführen der Steuerungsanweisungen der Aktionsauswahlregel durch die Steuerung kann das jeweilige Schienenfahrzeug somit unter Berücksichtigung des zu erreichenden Steuerungsziels gesteuert werden.</p>
<p id="p0013" num="0013">Steuerungsanweisung sind im Sinne der Anmeldung Anweisung bzw. Befehle zum Steuern des Schienenfahrzeugs. Steuerungsanweisungen können beispielsweise das Beschleunigen oder Abbremsen des Schienenfahrzeugs inklusive detaillierter Ansteuerung des Antriebs umfassen. Darüber hinaus können Steuerungsanweisungen das Schalten in verschiedene Gänge oder in einen Energiesparmodus des Antriebs umfassen. Darüber hinaus können in den Steuerungsanweisungen verschiedene steuerungsrelevante Aspekte in Form entsprechender Anweisungen berücksichtigt sein.</p>
<p id="p0014" num="0014">Steuerungsziele sind im Sinne der Anmeldung Ziele, die durch das Ansteuern der Steuerung zu erreichen sind. Steuerungsziele können beispielsweise eine Geschwindigkeit sein, auf die durch Ansteuern der Steuerung das Schienenfahrzeug beschleunigt werden soll. Steuerungsziele können alternativ oder zusätzlich für verschiedene zukünftige Zeitpunkte definiert sein, beispielsweise über Geschwindigkeitstrajektorien definiert sein. Alternativ können Steuerungsziele einen Energieverbrauch definieren, der bei der Ansteuerung des Schienenfahrzeugs zu erreichen oder nicht zu überschreiten ist. Die Steuerungsziele sind im Sinne der Anmeldung basierend auf den Trainingsdaten definiert, die wiederum basierend auf Sensordaten eines Schienenfahrzeugs generiert sind. Steuerungsziele können hierbei aus den Sensordaten des Schienenfahrzeugs generiert sein. Die Steuerungsziele können sich aus den Sensordaten ergeben und beispielsweise zu erzielende Geschwindigkeiten oder Energieverbräuche beschreiben, gemäß denen das Schienenfahrzeug während der Aufnahme der Sensordaten gesteuert würde. Steuerungsziele können auch während der Ausführung der trainierten Aktionsauswahlregel zur Steuerung des Schienenfahrzeugs durch übergeordnete Systeme, beispielsweise entsprechende<!-- EPO <DP n="6"> --> Planungsmodule zur Steuerung des Schienenfahrzeugs, definiert oder geändert werden.</p>
<p id="p0015" num="0015">Nach einer Ausführungsform ist das maschinelle Lernen als bestärkendes Lernen ausgebildet.</p>
<p id="p0016" num="0016">Hierdurch kann der technische Effekt erreicht werden, dass ein effizientes Trainieren der Aktionsauswahlregel ermöglicht ist.</p>
<p id="p0017" num="0017">Bestärkendes Lernen (Reinforcement Learning) ist im Sinne der Anmeldung ein Bereich des maschinellen Lernens, der sich mit dem Trainieren von operationellen Teilnehmern beschäftigt, gewünschte Aktionen auszuführen, um somit den Teilnehmer aus einem Ist-Zustand in einen gewünschten Soll-Zustand zu überführen. Das Trainieren des Teilnehmers wird hierbei unter Berücksichtigung eines Steuerungsziels getätigt, das durch die Ausführung der Handlung des Teilnehmers zu erreichen ist. Das Training kann ein Maximieren einer Belohnungsfunktion berücksichtigen, durch die dem Teilnehmer die ausführende Handlung und das zu erreichende Ziel dargestellt ist.</p>
<p id="p0018" num="0018">Nach einer Ausführungsform umfasst das Trainieren: Randomisiertes Abändern des wenigstens einen auf den Trainingsdaten basierenden objektiven Steuerungsziels und Definieren von abgeänderten Steuerungszielen; und Trainieren der Aktionsauswahlregel in Bezug auf Erfüllung der abgeänderten Steuerungsziele.</p>
<p id="p0019" num="0019">Hierdurch kann der technische Vorteil erreicht werden, dass ein präziseres Training der Steuerung des Schienenfahrzeugs bereitgestellt werden kann. Durch das randomisierte Abändern des wenigstens einen Steuerungsziels und das damit verbundene Definieren von abgeänderten Steuerungszielen können die Trainingsdaten zum Trainieren der Steuerung effektiver ausgenutzt werden. Durch das Abändern der Steuerungsziele und das Generieren bzw. Definieren von abgeänderten Steuerungszielen können<!-- EPO <DP n="7"> --> Steuerungsziele definiert werden, die durch die Trainingsdaten gestützt, jedoch nicht auf diese beschränkt sind.</p>
<p id="p0020" num="0020">Die geänderten Steuerungsziele ergeben somit Steuerungsziele, die nicht auf Trainingsdaten basieren, sondern Steuerungsziele darstellen, die über die Steuerungsziele hinausgehen, gemäß denen das Schienenfahrzeug während der Aufnahme der Sensordaten angesteuert wurde. Durch das Trainieren der Aktionsauswahlregel basierend auf den abgeänderten Steuerungszielen kann eine verbesserte trainierte Aktionsauswahlregel generiert werden, die Steuerungsanweisungen für eine erhöhte Anzahl verschiedener Steuerungsziele definiert. Hierdurch kann eine verbesserte Steuerung bereitgestellt werden.</p>
<p id="p0021" num="0021">Nach einer Ausführungsform umfasst das Trainieren der Aktionsauswahlregel ein Maximieren einer Belohnungsfunktion, wobei die Belohnungsfunktion für eine Aktionsauswahlregel maximal ist, die das objektive Steuerungsziel und/oder die abgeänderten Steuerungsziele erfüllt.</p>
<p id="p0022" num="0022">Hierdurch kann der technische Vorteil erreicht werden, dass ein möglichst präzises Training der Aktionsauswahlregel gemäß den Techniken des bestärkenden Lernens erreicht werden kann.</p>
<p id="p0023" num="0023">Nach einer Ausführungsform berücksichtigt die Belohnungsfunktion eine Differenz zwischen einem durch Ausführen einer Steuerungsaktion der Aktionsauswahlregel erzielten Geschwindigkeitszustand und dem objektiven Steuerungsziel und/oder den abgeänderten Steuerungszielen.</p>
<p id="p0024" num="0024">Hierdurch kann der technische Vorteil erreicht werden, dass ein effizientes Training der Aktionsauswahlregel und eine präzise trainierte Aktionsauswahlregel bereitgestellt werden kann, die präzise das zu erreichende Steuerungsziel erfüllt.</p>
<p id="p0025" num="0025">Nach einer Ausführungsform wird das Maximieren der Belohnungsfunktion durch ein künstliches neuronales Netz ausgeführt.<!-- EPO <DP n="8"> --></p>
<p id="p0026" num="0026">Hierdurch kann der technische Vorteil erreicht werden, dass ein effizientes Training der Aktionsauswahlregel bzw. der Steuerung des Schienenfahrzeugs bereitgestellt werden kann.</p>
<p id="p0027" num="0027">Nach einer Ausführungsform umfasst das Steuerungsziel eine Sollgeschwindigkeit des Schienenfahrzeugs und/oder einen Sollenergieverbrauch und/oder eine Sollbeschleunigung und/oder ein verschleißarmes Beschleunigungs- und/oder Bremsverhalten.</p>
<p id="p0028" num="0028">Hierdurch kann der technische Vorteil erreicht werden, dass eine effizient trainierte Aktionsauswahlregel und damit verbunden eine effizient trainierte Steuerung eines Schienenfahrzeugs bereitgestellt werden kann. Die derart trainierte Aktionsauswahlregel umfasst hierbei Steuerungsanweisungen, die geeignet sind, das Schienenfahrzeug unter Berücksichtigung der genannten Steuerungsziele zu steuern.</p>
<p id="p0029" num="0029">Nach einer Ausführungsform werden die Trainingsdaten während eines Verfahrens des Schienenfahrzeugs aufgenommen und umfassen Sensordaten von Zustandsvariablen, Steuerungsaktionen und Geschwindigkeitstrajektorien, wobei die Zustandsvariablen Geschwindigkeitsdaten, Beschleunigungsdaten, Ortsdaten, Spezifikationsdaten des Antriebs und/oder des Schienenfahrzeugs umfassen, wobei die Steuerungsaktionen Antriebs- und/oder Bremsbetätigungen umfassen, und wobei die Geschwindigkeitstrajektorien entsprechende zeitliche Geschwindigkeitsentwicklungen des Schienenfahrzeugs beschreiben.</p>
<p id="p0030" num="0030">Hierdurch kann der technische Vorteil erreicht werden, dass durch umfassende Trainingsdaten ein präzises Training der Steuerung ermöglicht ist.</p>
<p id="p0031" num="0031">Nach einem zweiten Aspekt der Erfindung wird eine Steuerung für ein Schienenfahrzeug bereitgestellt, wobei die Steuerung nach einem Verfahren zum Trainieren einer Steuerung eines Schienenfahrzeugs nach einer der voranstehenden Ausführungsformen<!-- EPO <DP n="9"> --> trainiert ist, und wobei die Steuerung eingerichtet ist, das Schienenfahrzeug unter Ausführung der trainierten Aktionsauswahlregel zu steuern.</p>
<p id="p0032" num="0032">Hierdurch kann eine verbesserte Steuerung für ein Schienenfahrzeug bereitgestellt werden, die unter Verwendung von Methoden des maschinellen Lernens, insbesondere des bestärkenden Lernens, trainiert ist. Die Steuerung weist hierzu eine trainierte Aktionsauswahlregel auf, die gemäß dem erfindungsgemäßen Verfahren zum Trainieren einer Steuerung eines Schienenfahrzeugs gemäß den oben genannten Ausführungsformen trainiert ist. Basierend auf der trainierten Aktionsauswahlregel, die eine Mehrzahl von Steuerungsanweisungen zum Steuern des Schienenfahrzeugs unter Berücksichtigung verschiedener Steuerungsziele aufweist, kann das Schienenfahrzeug zum Erreichen der jeweiligen Steuerungsziele angesteuert werden. Durch das Trainieren der Aktionsauswahlregel basierend auf dem Surrogat-Modell des Schienenfahrzeugs kann die Steuerung für beliebige Schienenfahrzeuge, die dem Surrogat-Modell entsprechen, trainiert werden, sodass bei einem neuen Schienenfahrzeug eine aufwändige Anpassung des zur Steuerung verwendeten Modells einer Steuerung, wie dies bei einem Model Predictive Control (MPC)-Regler notwendig ist, entfallen kann. Hierdurch kann eine präzise, zuverlässige und variable Steuerung für Schienenfahrzeuge bereitgestellt werden.</p>
<p id="p0033" num="0033">Nach einem dritten Aspekt wird ein Schienenfahrzeug mit einer Steuerung nach einer der voranstehenden Ausführungsformen bereitgestellt.</p>
<p id="p0034" num="0034">Hierdurch kann ein Schienenfahrzeug mit einer verbesserten Steuerung mit den obengenannten Vorteilen bereitgestellt werden.</p>
<p id="p0035" num="0035">Nach einem vierten Aspekt wird ein Computerprogrammprodukt umfassend Befehle bereitgestellt, die bei der Ausführung des Programms durch eine Datenverarbeitungseinheit diese veranlassen, das Verfahren zum Trainieren einer Steuerung für ein<!-- EPO <DP n="10"> --> Schienenfahrzeug nach einer der voranstehenden Ausführungsformen auszuführen.</p>
<p id="p0036" num="0036">Die oben beschriebenen Merkmale und Vorteile dieser Erfindung sowie die Art und Weise, wie diese erreicht werden, werden klarer und deutlicher verständlich durch die Erläuterungen der folgenden, stark vereinfachten, schematischen Darstellungen bevorzugter Ausführungsbeispiele. Hierbei zeigen:
<dl id="dl0001">
<dt>FIG 1</dt><dd>ein Flussdiagramm eines Verfahrens zum Trainieren einer Steuerung eines Schienenfahrzeugs gemäß einer Ausführungsform;</dd>
<dt>FIG 2</dt><dd>eine schematische Darstellung eines Schienenfahrzeugs mit einer Steuerung nach einer Ausführungsform; und</dd>
<dt>FIG 3</dt><dd>eine schematische Darstellung eines Computerprogrammprodukts.</dd>
</dl></p>
<p id="p0037" num="0037"><figref idref="f0001">FIG 1</figref> zeigt ein Flussdiagramm eines Verfahrens 100 zum Trainieren einer Steuerung 200 eines Schienenfahrzeugs 201 gemäß einer Ausführungsform.</p>
<p id="p0038" num="0038">Zum Trainieren der Steuerung 200 des Schienenfahrzeugs 201 werden zunächst in einem ersten Verfahrensschritt 101 Trainingsdaten bereitgestellt. Die Trainingsdaten basieren hierbei auf Sensordaten eines Schienenfahrzeugs 201 und umfassen in der gezeigten Ausführungsform Zustandsvariablen 217, Steuerungsaktionen 219 und Geschwindigkeitstrajektorien 221. Die Trainingsdaten 203, insbesondere die Sensordaten des Schienenfahrzeugs 201, können beispielsweise während eines Fahrens des Schienenfahrzeugs 201 oder eines vergleichbaren Schienenfahrzeugs durch eine entsprechende Sensorik aufgenommen sein.</p>
<p id="p0039" num="0039">Zustandsvariablen 217 beschreiben im Sinne der Anmeldung Punkte innerhalb eines Zustandsraums, der verschiedene Zustände des Schienenfahrzeugs 201 beschreibt. Insbesondere können die Zustandsvariablen 217 Geschwindigkeitsdaten, Beschleunigungsdaten<!-- EPO <DP n="11"> --> und/oder Ortsdaten des Schienenfahrzeugs 201 umfassen, die während des Verfahrens des Schienenfahrzeugs 201 oder des vergleichbaren Schienenfahrzeugs aufgenommen wurden. Das vergleichbare Schienenfahrzeug kann beispielsweise ein Schienenfahrzeug identischen Typs sein. Darüber hinaus können die Zustandsvariablen 217 Spezifikationsdaten des Antriebs und/oder des Schienenfahrzeugs 201 umfassen, die beispielsweise die Art des Antriebs, maximale Leistung bzw. Drehzahl und andere Parameter des Antriebs oder eine Größe bzw. ein Gewicht des Schienenfahrzeugs 201 umfassen.</p>
<p id="p0040" num="0040">Steuerungsaktionen 219 sind im Sinne der Anmeldung Aktionen, die während des Verfahrens des Schienenfahrzeugs 201 zum Steuern des Schienenfahrzeugs 201 durch die Steuerung 200 ausgeführt werden. Steuerungsaktionen 219 können beispielsweise die Betätigung des Gaspedals oder des Steuerungshebels eines Schienenfahrzeugs bzw. die Betätigung der Bremse des Schienenfahrzeugs 201 umfassen.</p>
<p id="p0041" num="0041">Geschwindigkeitstrajektorien 221 sind im Sinne der Anmeldung durch den Zustandsraum verlaufende Spuren von zeitlich aufeinander folgenden Geschwindigkeitswerten, die während des Verfahrens des Schienenfahrzeugs 201 erreicht wurden.</p>
<p id="p0042" num="0042">Nach Bereitstellen der Trainingsdaten 203 wird in einem weiteren Verfahrensschritt 103 ein Surrogat-Modell 205 des Schienenfahrzeugs 201 generiert bzw. trainiert und dem Surrogat-Modell 205 eine Relation zwischen Ansteuerungen eines Antriebs 207 des Schienenfahrzeugs 201 und einer hieraus resultierenden Geschwindigkeit des Schienenfahrzeugs 201 gelernt.</p>
<p id="p0043" num="0043">Basierend auf den Trainingsdaten 203, die während des Verfahrens des Schienenfahrzeugs 201 aufgenommen wurden, wird dem Surrogat-Modell 205, das eine virtuelle Kopie des Schienenfahrzeugs 201 darstellt, mittels Methoden des Maschinenlernens trainiert, welche Steuerungsaktionen 219, Betätigung des Gaspedals oder Betätigung der Bremse, zu welchen Endgeschwindigkeiten des Schienenfahrzeugs 201, die basierend auf den<!-- EPO <DP n="12"> --> entsprechenden Zustandsvariablen 217 ermittelt werden, führen. Das derart trainierte Surrogat-Modell 205 ermöglicht somit eine Simulation der Steuerung 200 des Schienenfahrzeugs 201, bei der durch Ausführung entsprechender Steuerungsfunktionen 219 entsprechende Geschwindigkeitstrajektorien 221 erzielt werden können.</p>
<p id="p0044" num="0044">In einem weiteren Verfahrensschritt 105 wird eine Aktionsauswahlregel 209 basierend auf den Trainingsdaten 203 und dem trainierten Surrogat-Modell 205 unter Verwendung von Methoden des bestärkenden Lernens und unter Berücksichtigung wenigstens eines objektiven Steuerungsziels 211 trainiert. Die Aktionsauswahlregel 209 umfasst hierbei Steuerungsanweisungen zum Steuern des Antriebs 207 des Schienenfahrzeugs 201. Die Steuerungsanweisungen sind hierbei eingerichtet, das Schienenfahrzeug 201 aus einem ersten Geschwindigkeitszustand in einen zweiten Geschwindigkeitszustand zu beschleunigen.</p>
<p id="p0045" num="0045">Die Steuerungsanweisungen können beispielsweise den Steuerungsaktionen 219 entsprechen, die als Trainingsdaten 203 während des Verfahrens des Schienenfahrzeugs 201 aufgenommen wurden, und das Beschleunigen bzw. Abbremsen des Schienenfahrzeugs umfassen. Die Aktionsauswahlregel 209 kann hierzu eine Mehrzahl von Steuerungsanweisungen aufweisen, mittels denen der Antrieb 207 des Schienenfahrzeugs 201 angesteuert werden kann. Die Steuerungsanweisungen sind hierbei derart ausgebildet, dass während des Ansteuerns des Antriebs 207 des Schienenfahrzeugs 201 das objektive Steuerungsziel 211 erreicht wird. Das objektive Steuerungsziel 211 kann hierbei beispielsweise eine zu erreichende Endgeschwindigkeit, ein gewünschter Energieverbrauch oder eine maximale Beschleunigung des Schienenfahrzeugs 201 sein, die jeweils während des Ansteuerns des Schienenfahrzeugs 201 zu erreichen bzw. einzuhalten sind. Das objektive Steuerungsziel 211 kann ebenfalls durch die Trainingsdaten 203 bereitgestellt sein. Beispielsweise kann das Steuerungsziel 211 durch die aufgezeichneten Geschwindigkeitstrajektorien 221 der Trainingsdaten 203 dargestellt sein.<!-- EPO <DP n="13"> --></p>
<p id="p0046" num="0046">Die ersten und zweiten Geschwindigkeitszustände können hierbei jeweils ein Ist-Zustand bzw. ein Soll-Zustand des Schienenfahrzeugs 201 sein, wobei das Schienenfahrzeug 201 durch das Ansteuern gemäß den Steuerungsanweisungen der Aktionsauswahlregel 209 aus dem Ist-Zustand in den Soll-Zustand zu überführen ist. Alternativ hierzu können die ersten und zweiten Geschwindigkeitszustände zwei zeitlich nacheinander eintretende Zustände des Zustandsraums sein, in die das Schienenfahrzeug 201 durch Ansteuern gemäß den Steuerungsanweisungen der Aktionsauswahlregel zu überführen ist.</p>
<p id="p0047" num="0047">Zum Trainieren der Aktionsauswahlregel 209 durch bestärkendes Lernen wird eine beliebig ausgewählte Aktionsauswahlregel mit beliebigen Steuerungsanweisungen basierend auf den Trainingsdaten 203 inklusive der Zustandsvariablen 217 des Zustandsraums des Schienenfahrzeugs 201 und unter Berücksichtigung des jeweils ausgewählten Steuerungsziels 211 trainiert bzw. optimiert, sodass die Aktionsauswahlregel 209 eingerichtet ist, das ausgewählte Steuerungsziel 211 zu erreichen. In der gezeigten Ausführungsform wird das Training der beliebig gewählten Aktionsauswahlregel 209 in einem weiteren Verfahrensschritt 111 durch ein Maximieren einer entsprechend eingerichteten Belohnungsfunktion ausgeführt. Die Belohnungsfunktion kann hierbei beispielsweise eine Differenz zwischen einem durch Ausführen einer Steuerungsaktion 219 der Aktionsauswahlregel 209 erzielten Geschwindigkeitszustand und dem objektiven Steuerungsziel 211 definiert sein. Das Training der Aktionsauswahlregel 209 erfolgt somit dadurch, dass die Steuerungsanweisungen bzw. die Aktionsauswahlregel 209 derart modifiziert werden, dass die entsprechend definierte Belohnungsfunktion einen maximalen Wert erreicht. Eine Aktionsauswahlregel 209 mit einer maximalen Belohnungsfunktion ist demzufolge in der Lage, das ausgewählte Steuerungsziel 211 zu erreichen. Durch das derartige Trainieren der Aktionsauswahlregel 209 kann der durch die Trainingsdaten 203 definierte Zustandsraum des Schienenfahrzeugs 201, in dem verschiedene Zustände des Schienenfahrzeugs 201 angeführt sind, durchquert<!-- EPO <DP n="14"> --> werden, um die optimale Aktionsauswahlregel 209 zu bestimmen, die eingerichtet ist, durch Ausführung der entsprechenden Steuerungsanweisungen das Schienenfahrzeug 201 in einer optimierten Trajektorie in Zustände zu überführen, die eine optimale Steuerung 200 und das Erreichen des vorbestimmten objektiven Steuerungsziels 211 gewährleisten.</p>
<p id="p0048" num="0048">Gemäß der gezeigten Ausführungsform wird zum Trainieren der Aktionsauswahlregel 209 in einem Verfahrensschritt 109 das objektive Steuerungsziel 211 randomisiert geändert und geänderte Steuerungsziele 215 generiert. Durch das randomisierte Ändern des Steuerungsziels 211 können geänderte Steuerungsziele 215 generiert werden, die von den Trainingsdaten 203 abweichen können.</p>
<p id="p0049" num="0049">Beispielsweise kann das objektive Steuerungsziel 211 durch eine Geschwindigkeitstrajektorie 221 der Trainingsdaten 203 gebildet sein. Die jeweilige Geschwindigkeitstrajektorie 221 kann hierbei durch die Sensordaten des Schienenfahrzeugs 201 gestützt sein, die während des Verfahrens des Schienenfahrzeugs 201 aufgenommen wurden. Durch Verändern einzelner Werte der Geschwindigkeitstrajektorie 221 können somit abgeänderte Geschwindigkeitstrajektorien 221 als abgeänderte Steuerungsziele 215 generiert werden, wobei die abgeänderten Geschwindigkeitstrajektorien 221 nicht vollständig durch die Trainingsdaten 203 gestützt sind und Geschwindigkeitswerte aufweisen, die während des Verfahrens des Schienenfahrzeugs 201 und der Aufnahme der jeweiligen Geschwindigkeitswerte des Schienenfahrzeugs 201 abweichen. Durch das Ändern der Geschwindigkeitstrajektorie 221 können somit Punkte im Zustandsraum des Schienenfahrzeugs 201 erreicht werden, für die keine expliziten Trainingsdaten 203 generiert wurden.</p>
<p id="p0050" num="0050">Alternativ hierzu können auch mehrere Steuerungsziele 211, 215 beim Training der Aktionsauswahlregel 209 berücksichtigt werden, sodass die Aktionsauswahlregel 209 eingerichtet ist, eine Mehrzahl von Steuerungszielen 211, 215 zu erfüllen. Die Steuerungsziele können hierbei neben der zu erreichenden Endgeschwindigkeit<!-- EPO <DP n="15"> --> des Schienenfahrzeugs 201 beispielsweise ein Energieverbrauch des Schienenfahrzeugs 201 oder eine maximal zulässige Beschleunigung des Schienenfahrzeugs 201 umfassen, die während der Steuerung 200 des Schienenfahrzeugs 201 zu erfüllen bzw. zu berücksichtigen sind.</p>
<p id="p0051" num="0051">Nach dem Trainieren der Aktionsauswahlregel 209 im Verfahrensschritt 105 wird basierend auf der Ausgangs-Aktionsauswahlregel 209 eine entsprechend trainierte Aktionsauswahlregel 213 generiert, die Steuerungsanweisungen umfasst, die eingerichtet sind, das Schienenfahrzeug 201 zu beschleunigen und das Steuerungsziel 211 bzw. die abgeänderten Steuerungsziele 215 zu erfüllen.</p>
<p id="p0052" num="0052">Das Trainieren der Aktionsauswahlregel 209 bzw. das Maximieren der Belohnungsfunktion kann durch eine trainierte künstliche Intelligenz, beispielsweise durch ein entsprechend trainiertes neuronales Netz, durchgeführt werden. Durch Maximieren der entsprechend eingerichteten Belohnungsfunktion kann somit eine Aktionsauswahlregel 213 generiert werden, die die entsprechenden Steuerungsziele 211, 215 erfüllt und somit eine optimierte Steuerung 200 des Schienenfahrzeugs 201 gewährleistet.</p>
<p id="p0053" num="0053"><figref idref="f0002">FIG 2</figref> zeigt eine schematische Darstellung eines Schienenfahrzeugs 201 mit einer Steuerung 200 nach einer Ausführungsform.</p>
<p id="p0054" num="0054"><figref idref="f0002">Fig. 2</figref> zeigt ein Schienenfahrzeug 201 mit einer Steuerung 200, wobei die Steuerung 200 eine gemäß dem erfindungsgemäßen Verfahren 100 zum Trainieren einer Steuerung 200 eines Schienenfahrzeugs 201 trainierte Aktionsauswahlregel 213 umfasst. Das Schienenfahrzeug 201 umfasst ferner einen Antrieb 207 und einen Sensor 223. Über den Sensor 223 können Sensorwerte des Antriebs 207 aufgenommen werden, um eine Ansteuerung des Antriebs 207 mittels der Steuerung 200 zu verfolgen. Das Schienenfahrzeug 201 umfasst ferner eine Planungseinheit 225, die mit der Steuerung 200 verbunden ist. Zur Ansteuerung des Schienenfahrzeugs 201 kann somit die Steuerung 200 von der<!-- EPO <DP n="16"> --> Planungseinheit 225 eine entsprechende Geschwindigkeitstrajektorie 221 empfangen, die einen geplanten Geschwindigkeitsverlauf des Verfahrens des Schienenfahrzeugs 201 beschreibt. Durch Ausführen der durch die trainierte Aktionsauswahlregel 213 definierten Steuerungsanweisungen kann somit die Steuerung 200 die entsprechenden Steuerungsanweisungen ausführen, die geeignet sind, das Schienenfahrzeug 201 gemäß der geplanten Geschwindigkeitstrajektorie 221 der Planungseinheit 225 zu beschleunigen. Die Steuerung 200 des Schienenfahrzeugs 201 kann hierbei verschiedene Steuerungsziele 211, 215 berücksichtigen. Beispielsweise kann das Schienenfahrzeug 201 unter einem vorbestimmten maximalen Energieverbrauch angesteuert werden. Alternativ oder zusätzlich hierzu kann das Schienenfahrzeug 201 unter Berücksichtigung einer maximal zulässigen Beschleunigung angesteuert werden. Indem die entsprechend trainierte Aktionsauswahlregel 213 für eine Vielzahl verschiedener Steuerungsziele 211, 215 entsprechende Steuerungsanweisungen umfasst, die geeignet sind, das Schienenfahrzeug 201 unter Berücksichtigung der jeweiligen Steuerungsziele 211, 215 anzusteuern, können während des Betriebs des Schienenfahrzeugs 201 und insbesondere bei bereits installierter Steuerung 200 entsprechende Steuerungsziele 211, 215 abgeändert werden, die während des Steuerns des Schienenfahrzeugs 201 erreicht werden sollen. Eine Änderung der Steuerung 200 und insbesondere eine Anpassung der jeweiligen definierten Steuerungsanweisungen ist aufgrund des Trainings der trainierten Aktionsauswahlregel 213 nicht erforderlich.</p>
<p id="p0055" num="0055"><figref idref="f0002">FIG 3</figref> zeigt eine schematische Darstellung eines Computerprogrammprodukts 300.</p>
<p id="p0056" num="0056"><figref idref="f0002">Figur 3</figref> zeigt ein Computerprogrammprodukt 300, umfassend Befehle, die bei der Ausführung des Programms durch eine Recheneinheit dieses veranlassen, das Verfahren 100 nach einer der oben genannten Ausführungsformen auszuführen. Das Computerprogrammprodukt 300 ist in der gezeigten Ausführungsform auf einem Speichermedium 301 gespeichert. Das Speichermedium<!-- EPO <DP n="17"> --> 301 kann hierbei ein beliebiges aus dem Stand der Technik bekanntes Speichermedium sein.</p>
<p id="p0057" num="0057">Obwohl die Erfindung im Detail durch das bevorzugte Ausführungsbeispiel näher illustriert und beschrieben wurde, so ist die Erfindung nicht durch die offenbarten Beispiele eingeschränkt und andere Variationen können vom Fachmann hieraus abgeleitet werden, ohne den Schutzumfang der Erfindung zu verlassen, der durch die Ansprüche definiert ist.</p>
</description>
<claims id="claims01" lang="de"><!-- EPO <DP n="18"> -->
<claim id="c-de-01-0001" num="0001">
<claim-text>Verfahren (100) zum Trainieren einer Steuerung (200) eines Schienenfahrzeugs (201), umfassend:
<claim-text>- Bereitstellen (101) von Trainingsdaten (203) basierend auf Sensordaten eines Schienenfahrzeugs (201);</claim-text>
<claim-text>- Trainieren (103) eines Surrogat-Modells (205) des Schienenfahrzeugs (201) basierend auf den Trainingsdaten (203) bezüglich einer Relation zwischen einer Ansteuerung eines Antriebs (207) des Schienenfahrzeugs (201) und einer resultierenden Geschwindigkeit des Schienenfahrzeugs (201);</claim-text>
<claim-text>- Trainieren (105) einer Aktionsauswahlregel (209) basierend auf den Trainingsdaten (203) und dem Surrogat-Modell (205) unter Verwendung von maschinellem Lernen und unter Berücksichtigung wenigstens eines objektiven Steuerungsziels (211), wobei die Aktionsauswahlregel (209) Steuerungsanweisungen zum Ansteuern des Antriebs (207) des Schienenfahrzeugs (201) umfasst, die eingerichtet sind, das Schienenfahrzeug (201) aus einem ersten Geschwindigkeitszustand in einen zweiten Geschwindigkeitszustand zu beschleunigen; und</claim-text>
<claim-text>- Generieren (107) einer trainierten Aktionsauswahlregel (213), wobei die trainierte Aktionsauswahlregel (213) Steuerungsanweisungen umfasst, die eingerichtet sind, das Schienenfahrzeug (201) zu beschleunigen und das Steuerungsziel (211) zu erfüllen.</claim-text></claim-text></claim>
<claim id="c-de-01-0002" num="0002">
<claim-text>Verfahren (100) nach Anspruch 1, wobei das maschinelle Lernen als bestärkendes Lernen ausgebildet ist.</claim-text></claim>
<claim id="c-de-01-0003" num="0003">
<claim-text>Verfahren (100) nach Anspruch 1 oder 2, wobei das Trainieren (105) der Aktionsauswahlregel (209) umfasst:
<claim-text>Randomisiertes Abändern (109) des wenigstens einen auf den Trainingsdaten (203) basierenden objektiven Steuerungsziels (211) und Definieren von abgeänderten Steuerungszielen (215); und</claim-text>
<claim-text>Trainieren der Aktionsauswahlregel (209) in Bezug auf Erfüllung der abgeänderten Steuerungsziele (215).</claim-text><!-- EPO <DP n="19"> --></claim-text></claim>
<claim id="c-de-01-0004" num="0004">
<claim-text>Verfahren (100) nach Anspruch 3, wobei das Trainieren (105) der Aktionsauswahlregel (209) umfasst:<br/>
Maximieren (111) einer Belohnungsfunktion, wobei die Belohnungsfunktion für eine Aktionsauswahlregel (209) maximal ist, die das objektive Steuerungsziel (211) und/oder die abgeänderten Steuerungsziele (215) erfüllt.</claim-text></claim>
<claim id="c-de-01-0005" num="0005">
<claim-text>Verfahren (100) nach Anspruch 4, wobei die Belohnungsfunktion eine Differenz zwischen einem durch Ausführen einer Steuerungsanweisung der Aktionsauswahlregel (209) erzielten Geschwindigkeitszustand und dem objektiven Steuerungsziel (211) und/oder den abgeänderten Steuerungszielen (215) berücksichtigt.</claim-text></claim>
<claim id="c-de-01-0006" num="0006">
<claim-text>Verfahren (100) nach Anspruch 1 oder 2, wobei das Trainieren (105) der Aktionsauswahlregel (209) umfasst:<br/>
Maximieren (111) einer Belohnungsfunktion, wobei die Belohnungsfunktion für eine Aktionsauswahlregel (209) maximal ist, die das objektive Steuerungsziel (211) erfüllt.</claim-text></claim>
<claim id="c-de-01-0007" num="0007">
<claim-text>Verfahren (100) nach Anspruch 6, wobei die Belohnungsfunktion eine Differenz zwischen einem durch Ausführen einer Steuerungsanweisung der Aktionsauswahlregel (209) erzielten Geschwindigkeitszustand und dem objektiven Steuerungsziel (211) berücksichtigt.</claim-text></claim>
<claim id="c-de-01-0008" num="0008">
<claim-text>Verfahren (100) nach einem der Ansprüche 4 bis 7, wobei das Maximieren (111) der Belohnungsfunktion durch ein künstliches neuronales Netz ausgeführt wird.</claim-text></claim>
<claim id="c-de-01-0009" num="0009">
<claim-text>Verfahren (100) nach einem der voranstehenden Ansprüche 3, 4 oder 5, wobei das Steuerungsziel (211) und/oder die abgeänderten Steuerungsziele (215) eine Sollgeschwindigkeit des Schienenfahrzeugs (201) und/oder einen Sollenergieverbrauch und/oder eine Sollbeschleunigung und/oder ein verschleißarmes Beschleunigungs- und/oder Bremsverhalten umfasst.<!-- EPO <DP n="20"> --></claim-text></claim>
<claim id="c-de-01-0010" num="0010">
<claim-text>Verfahren (100) nach einem der voranstehenden Ansprüche 6, 7 oder 8, wobei das Steuerungsziel (211) eine Sollgeschwindigkeit des Schienenfahrzeugs (201) und/oder einen Sollenergieverbrauch und/oder eine Sollbeschleunigung und/oder ein verschleißarmes Beschleunigungs- und/oder Bremsverhalten umfasst.</claim-text></claim>
<claim id="c-de-01-0011" num="0011">
<claim-text>Verfahren (100) nach einem der voranstehenden Ansprüche, wobei die Trainingsdaten (203) während eines Verfahrens des Schienenfahrzeugs (201) aufgenommen werden und Sensordaten von Zustandsvariablen (217), Steuerungsaktionen (219) und Geschwindigkeitstrajektorien (221) umfassen, wobei die Zustandsvariablen (217) Geschwindigkeitsdaten, Beschleunigungsdaten, Ortsdaten, Spezifikationsdaten des Antriebs und/oder des Schienenfahrzeugs (201) umfassen, wobei die Steuerungsaktionen (219) Antriebs- und/oder Bremsbetätigungen umfassen, und wobei die Geschwindigkeitstrajektorien (221) entsprechende zeitliche Geschwindigkeitsentwicklungen des Schienenfahrzeugs (201) beschreiben.</claim-text></claim>
<claim id="c-de-01-0012" num="0012">
<claim-text>Steuerung (200) für ein Schienenfahrzeug (201), wobei die Steuerung (200) nach einem Verfahren (100) zum Trainieren einer Steuerung (200) eines Schienenfahrzeugs (201) nach einem der voranstehenden Ansprüche 1 bis 11 trainiert ist, und wobei die Steuerung (200) eingerichtet ist, das Schienenfahrzeug (201) unter Ausführung der trainierten Aktionsauswahlregel (213) zu steuern.</claim-text></claim>
<claim id="c-de-01-0013" num="0013">
<claim-text>Schienenfahrzeug (201) mit einer Steuerung (200) nach Anspruch 12.</claim-text></claim>
<claim id="c-de-01-0014" num="0014">
<claim-text>Computerprogrammprodukt (300) umfassend Befehle, die bei der Ausführung des Programms durch eine Datenverarbeitungseinheit diese veranlassen, das Verfahren (100) nach einem der voranstehenden Ansprüche 1 bis 11 auszuführen.</claim-text></claim>
</claims>
<claims id="claims02" lang="en"><!-- EPO <DP n="21"> -->
<claim id="c-en-01-0001" num="0001">
<claim-text>Method (100) for training a controller (200) of a rail vehicle (201) including:
<claim-text>- providing (101) training data (203) based on sensor data for a rail vehicle (201);</claim-text>
<claim-text>- training (103) a surrogate model (205) of the rail vehicle (201) based on the training data (203) with respect to a relationship between an actuation of a drive (207) of the rail vehicle (201) and a resulting speed of the rail vehicle (201);</claim-text>
<claim-text>- training (105) an action selection rule (209) based on the training data (203) and the surrogate model (205) using machine learning and taking into account at least one objective control target (211), wherein the action selection rule (209) includes control instructions for actuating the drive (207) of the rail vehicle (201) configured to accelerate the rail vehicle (201) from a first speed state into a second speed state; and</claim-text>
<claim-text>- generating (107) a trained action selection rule (213), wherein the trained action selection rule (213) includes control instructions configured to accelerate the rail vehicle (201) and to meet the control target (211).</claim-text></claim-text></claim>
<claim id="c-en-01-0002" num="0002">
<claim-text>Method (100) according to claim 1, wherein the machine learning is embodied as reinforcement learning.</claim-text></claim>
<claim id="c-en-01-0003" num="0003">
<claim-text>Method (100) according to claim 1 or 2, wherein the training (105) of the action selection rule (209) includes:
<claim-text>randomised modification (109) of the at least one objective control target (211) based on the training data (203) and the definition of modified control targets (215); and</claim-text>
<claim-text>training the action selection rule (209) in terms of meeting the modified control targets (215).</claim-text><!-- EPO <DP n="22"> --></claim-text></claim>
<claim id="c-en-01-0004" num="0004">
<claim-text>Method (100) according to claim 3, wherein the training (105) of the action selection rule (209) includes:<br/>
maximising (111) a reward function, wherein the reward function is maximum for an action selection rule (209) that meets the objective control target (211) and/or the modified control targets (215).</claim-text></claim>
<claim id="c-en-01-0005" num="0005">
<claim-text>Method (100) according to claim 4, wherein the reward function takes account of a difference between a speed state achieved by executing a control instruction of the action selection rule (209) and the objective control target (211) and/or the modified control targets (215).</claim-text></claim>
<claim id="c-en-01-0006" num="0006">
<claim-text>Method (100) according to claim 1 or 2, wherein the training (105) of the action selection rules (209) includes: maximising (111) a reward function, wherein the reward function is maximum for an action selection rule (209) that meets the objective control target (211).</claim-text></claim>
<claim id="c-en-01-0007" num="0007">
<claim-text>Method (100) according to claim 6, wherein the reward function takes into account a difference between a speed state achieved by executing a control instruction of the action selection rule (209) and the objective control target (211).</claim-text></claim>
<claim id="c-en-01-0008" num="0008">
<claim-text>Method (100) according to one of claims 4 to 7, wherein the maximisation (111) of the reward function is executed by an artificial neural network.</claim-text></claim>
<claim id="c-en-01-0009" num="0009">
<claim-text>Method (100) according to one of the preceding claims 3, 4 or 5, wherein the control target (211) and/or the modified control targets (215) include a target speed of the rail vehicle (201) and/or a target energy consumption and/or a<!-- EPO <DP n="23"> --> target acceleration and/or low-wear acceleration behaviour and/or braking behaviour.</claim-text></claim>
<claim id="c-en-01-0010" num="0010">
<claim-text>Method (100) according to one of the preceding claims 6, 7 or 8, wherein the control target (211) includes a target speed of the rail vehicle (201) and/or a target energy consumption and/or a target acceleration and/or low-wear acceleration behaviour and/or braking behaviour.</claim-text></claim>
<claim id="c-en-01-0011" num="0011">
<claim-text>Method (100) according to one of the preceding claims, wherein the training data (203) is recorded while the rail vehicle (201) is moving and includes sensor data for state variables (217), control actions (219) and speed trajectories (221), wherein the state variables (217) include speed data, acceleration data, location data, specification data for the drive and/or the rail vehicle (201), wherein the control actions (219) include drive and/or brake actuations, and wherein the speed trajectories (221) describe corresponding temporal speed developments of the rail vehicle (201).</claim-text></claim>
<claim id="c-en-01-0012" num="0012">
<claim-text>Controller (200) for a rail vehicle (201), wherein the controller (200) is trained in accordance with a method (100) for training a controller (200) of a rail vehicle (201) according to one of the preceding claims 1 to 11, and wherein the controller (200) is configured to control the rail vehicle (201) by executing the trained action selection rule (213).</claim-text></claim>
<claim id="c-en-01-0013" num="0013">
<claim-text>Rail vehicle (201) with a controller (200) according to claim 12.</claim-text></claim>
<claim id="c-en-01-0014" num="0014">
<claim-text>Computer program product (300) including commands which, when the program is executed by a data processing unit, cause<!-- EPO <DP n="24"> --> it to execute the method (100) according to one of the preceding claims 1 to 11.</claim-text></claim>
</claims>
<claims id="claims03" lang="fr"><!-- EPO <DP n="25"> -->
<claim id="c-fr-01-0001" num="0001">
<claim-text>Procédé (100) d'apprentissage d'un dispositif (200) de commande d'un véhicule (201) ferroviaire, comprenant :
<claim-text>- se procurer (101) des données (203) d'apprentissage reposant sur des données de capteur d'un véhicule (201) ferroviaire ;</claim-text>
<claim-text>- faire subir un apprentissage (103) à un modèle (205) de substitution du véhicule (201) ferroviaire sur la base des données (203) d'apprentissage en ce qui concerne une relation entre une commande d'un entraînement (207) du véhicule (201) ferroviaire et une vitesse qui s'ensuit du véhicule (201) ferroviaire ;</claim-text>
<claim-text>- faire subir un apprentissage (105) à une règle (209) de sélection d'action sur la base des données (203) d'apprentissage et du modèle (205) de substitution en utilisant de l'enseignement automatique et en tenant compte d'au moins une cible (211) de commande objective, dans lequel la règle (209) de sélection d'action comprend des instructions de commande pour la commande de l'entraînement (207) du véhicule (201) ferroviaire, qui sont agencées pour accélérer le véhicule (201) ferroviaire d'un premier état de vitesse à un deuxième état de vitesse ; et</claim-text>
<claim-text>- création (107) d'une règle (213) de sélection d'action ayant subi un apprentissage, dans lequel la règle (213) de sélection d'action ayant subi un apprentissage comprend des instructions de commande, qui sont agencées pour accélérer le véhicule (201) ferroviaire et satisfaire la cible (211) de commande.</claim-text></claim-text></claim>
<claim id="c-fr-01-0002" num="0002">
<claim-text>Procédé (100) suivant la revendication 1, dans lequel l'apprentissage automatique est constitué sous la forme d'un apprentissage par renforcement.<!-- EPO <DP n="26"> --></claim-text></claim>
<claim id="c-fr-01-0003" num="0003">
<claim-text>Procédé (100) suivant la revendication 1 ou 2, dans lequel l'apprentissage (105) de la règle (209) de sélection d'action comprend :
<claim-text>modification (109) aléatoire de la cible (211) de commande objective reposant sur les données (203) d'apprentissage et définition de cibles (215) de commande modifiées ;<br/>
et</claim-text>
<claim-text>faire subir un apprentissage à la règle (209) de sélection d'action par rapport à la satisfaction des cibles (215) de commande modifiées.</claim-text></claim-text></claim>
<claim id="c-fr-01-0004" num="0004">
<claim-text>Procédé (100) suivant la revendication 3, dans lequel l'apprentissage (105) de la règle (209) de sélection d'action comprend :<br/>
rendre maximum (111) une fonction de rétribution, dans lequel la fonction de rétribution est maximum pour une règle (209) de sélection d'action, qui satisfait la cible (211) de commande objective et/ou les cibles (215) de commande modifiées.</claim-text></claim>
<claim id="c-fr-01-0005" num="0005">
<claim-text>Procédé (100) suivant la revendication 4, dans lequel la fonction de rétribution tient compte d'une différence entre un état de vitesse atteint en exécutant une instruction de commande de la règle (209) de sélection d'action et la cible (211) de commande objective et/ou les cibles (215) de commande modifiées.</claim-text></claim>
<claim id="c-fr-01-0006" num="0006">
<claim-text>Procédé (100) suivant la revendication 1 ou 2, dans lequel l'apprentissage (105) subi par la règle (209) de sélection d'action comprend :<br/>
rendre maximum (111) une fonction de rétribution, dans lequel la fonction de rétribution est maximum pour une règle (209) de sélection d'action, qui satisfait la cible (211) de commande objective.<!-- EPO <DP n="27"> --></claim-text></claim>
<claim id="c-fr-01-0007" num="0007">
<claim-text>Procédé (100) suivant la revendication 6, dans lequel la fonction de rétribution tient compte d'une différence entre un état de vitesse obtenu en exécutant une instruction de commande de la règle (209) de sélection d'action et la cible (211) de commande objective.</claim-text></claim>
<claim id="c-fr-01-0008" num="0008">
<claim-text>Procédé (100) suivant l'une des revendications 4 à 7, dans lequel on rend maximum (111) la fonction de rétribution par un réseau neuronal artificiel.</claim-text></claim>
<claim id="c-fr-01-0009" num="0009">
<claim-text>Procédé (100) suivant l'une des revendications 3, 4 ou 5 précédentes, dans lequel la cible (211) de commande et/ou les cibles (215) de commande modifiées comprennent une vitesse de consigne du véhicule (201) ferroviaire et/ou une consommation d'énergie de consigne et/ou une accélération de consigne et/ou un comportement d'accélération et/ou de freinage avec peu d'usure.</claim-text></claim>
<claim id="c-fr-01-0010" num="0010">
<claim-text>Procédé (100) suivant l'une des revendications 6, 7 ou 8 précédentes, dans lequel la cible (211) de commande comprend une vitesse de consigne du véhicule (201) ferroviaire et/ou une consommation d'énergie de consigne et/ou une accélération de consigne et/ou un comportement en accélération et/ou en freinage avec peu d'usure.</claim-text></claim>
<claim id="c-fr-01-0011" num="0011">
<claim-text>Procédé (100) suivant l'une des revendications précédentes, dans lequel on enregistre les données (203) d'apprentissage pendant un déplacement du véhicule (201) ferroviaire et des données de capteur comprennent des variables (217) d'état, des actions (219) de commande et des trajectoires (221) de vitesse, dans lequel les variables (217) d'état comprennent des données de vitesse, des données d'accélération, des données de localisation, des données de spécification de l'entraînement et/ou du véhicule (201) ferroviaire, dans lequel<!-- EPO <DP n="28"> --> les actions (219) de commande comprennent des actionnements d'entraînement et/ou de frein, et dans lequel les trajectoires (221) de vitesse décrivent des déroulements de vitesse correspondants dans le temps du véhicule (201) ferroviaire.</claim-text></claim>
<claim id="c-fr-01-0012" num="0012">
<claim-text>Dispositif (200) de commande d'un véhicule (201) ferroviaire, dans lequel le dispositif (200) de commande subit un apprentissage par un procédé (100) d'apprentissage d'un dispositif (200) de commande d'un véhicule (201) ferroviaire suivant l'une des revendications 1 à 11 précédentes, et dans lequel le dispositif (200) de commande est agencé pour commander le véhicule (201) ferroviaire en exécutant la règle (213) de sélection d'action ayant subi un apprentissage.</claim-text></claim>
<claim id="c-fr-01-0013" num="0013">
<claim-text>Véhicule (201) ferroviaire comprenant un dispositif (200) de commande suivant la revendication 12.</claim-text></claim>
<claim id="c-fr-01-0014" num="0014">
<claim-text>Produit (300) de programme d'ordinateur, comprenant des instructions qui, lors de l'exécution du programme par une unité de traitement de données, fait que celle-ci exécute le procédé (100) suivant l'une des revendications 1 à 11 précédentes.</claim-text></claim>
</claims>
<drawings id="draw" lang="de"><!-- EPO <DP n="29"> -->
<figure id="f0001" num="1"><img id="if0001" file="imgf0001.tif" wi="164" he="136" img-content="drawing" img-format="tif"/></figure><!-- EPO <DP n="30"> -->
<figure id="f0002" num="2,3"><img id="if0002" file="imgf0002.tif" wi="100" he="194" img-content="drawing" img-format="tif"/></figure>
</drawings>
<ep-reference-list id="ref-list">
<heading id="ref-h0001"><b>IN DER BESCHREIBUNG AUFGEFÜHRTE DOKUMENTE</b></heading>
<p id="ref-p0001" num=""><i>Diese Liste der vom Anmelder aufgeführten Dokumente wurde ausschließlich zur Information des Lesers aufgenommen und ist nicht Bestandteil des europäischen Patentdokumentes. Sie wurde mit größter Sorgfalt zusammengestellt; das EPA übernimmt jedoch keinerlei Haftung für etwaige Fehler oder Auslassungen.</i></p>
<heading id="ref-h0002"><b>In der Beschreibung aufgeführte Patentdokumente</b></heading>
<p id="ref-p0002" num="">
<ul id="ref-ul0001" list-style="bullet">
<li><patcit id="ref-pcit0001" dnum="EP3552921A1"><document-id><country>EP</country><doc-number>3552921</doc-number><kind>A1</kind></document-id></patcit><crossref idref="pcit0001">[0004]</crossref></li>
<li><patcit id="ref-pcit0002" dnum="DE102017215802A1"><document-id><country>DE</country><doc-number>102017215802</doc-number><kind>A1</kind></document-id></patcit><crossref idref="pcit0002">[0005]</crossref></li>
</ul></p>
<heading id="ref-h0003"><b>In der Beschreibung aufgeführte Nicht-Patentliteratur</b></heading>
<p id="ref-p0003" num="">
<ul id="ref-ul0002" list-style="bullet">
<li><nplcit id="ref-ncit0001" npl-type="b"><article><atl>Optimization design for aerodynamic elements of high speed trains</atl><book><author><name>SHUANBAO YAO et al.</name></author><book-title>COMPUTERS AND FLUIDS</book-title><imprint><name>PERGAMON PRESS</name><pubdate>20140303</pubdate></imprint><vid>95</vid><location><pp><ppf>56</ppf><ppl>73</ppl></pp></location></book></article></nplcit><crossref idref="ncit0001">[0006]</crossref></li>
</ul></p>
</ep-reference-list>
</ep-patent-document>
