Training von Wahrnehmungssystemen mit AV elevate - Teil 2

Im ersten Teil unserer dreiteiligen Blog-Serie über die AV elevate™-Plattformvon rFpro haben wir untersucht, wie die Simulation die Abstimmung von Sensorsystemen für autonome Fahrzeuge verändert. In diesem Beitrag richten wir unseren Fokus auf den nächsten wichtigen Schritt in der AV-Entwicklung: das Training des Wahrnehmungssystems. Wir sprachen mit Josh Wreford, AV elevate Product Manager bei rFpro, um zu erfahren, wie die Simulation dabei helfen kann, maschinelle Lernalgorithmen mit der Vielfalt und Präzision zu trainieren, die sie benötigen, um in der realen Welt zuverlässig zu funktionieren.

F: Was verstehen wir zunächst unter der Ausbildung eines Wahrnehmungssystems?

Beim Training eines Wahrnehmungssystems geht es darum, ihm beizubringen, die Welt um es herum zu verstehen und zu interpretieren. Das ist sehr ähnlich wie beim Lernen von Kindern. Man würde einem Kind nicht einfach einen Hund zeigen und erwarten, dass es alle Hunde erkennt. Man setzt es vielen verschiedenen Beispielen aus, und mit der Zeit lernt es die gemeinsamen Merkmale.

Beim maschinellen Lernen machen wir genau das Gleiche. Wir präsentieren dem System eine breite Palette von Eingaben, die alle mit den richtigen Antworten versehen sind, damit es die wichtigen Muster erkennen kann. Das Ziel ist, dass der Algorithmus versteht, was etwas ist, unabhängig von den Bedingungen oder dem Kontext, in dem es auftritt.

F: Was genau muss das System wahrnehmen?

Es muss nicht nur physische Objekte wie Fußgänger, Radfahrer und Fahrzeuge erkennen, sondern auch "Konzepte" wie Straßenränder, Fahrbahnbegrenzungen und Bürgersteige, und diese nicht nur identifizieren, sondern vor allem auch verstehen, was sie bedeuten. Es geht nicht nur um die Kennzeichnung von Formen, sondern um die Vermittlung eines funktionalen Verständnisses. Zum Beispiel können zwei Bereiche des Asphalts ähnlich aussehen, aber einer ist die Fahrspur für das Fahrzeug und der andere ist für den Gegenverkehr.

Wir nennen dies funktionale Segmentierung. Sie ist die Brücke zwischen Wahrnehmung und Planung. Es geht nicht nur darum, eine visuelle Karte zu erstellen, sondern zu verstehen, wie sich das Fahrzeug in diesem freien Raum verhalten kann. Das ermöglicht eine sichere und logische Entscheidungsfindung.

F: Warum ist Vielfalt bei der Schulung von Wahrnehmungssystemen so wichtig?

Wenn wir auf die Analogie zurückkommen, Kindern etwas über Hunde beizubringen, dann wird das Kind, wenn es nur einen schwarzen Hund gesehen hat, annehmen, dass die Farbe ein Merkmal ist, das einen Hund zu einem Hund macht. Die einzige Möglichkeit, dem maschinellen Lernalgorithmus beizubringen, dass dies nicht der Fall ist, besteht darin, ihm eine möglichst große Vielfalt an Hunden zu zeigen. Das Problem, dass nicht genug Variation gezeigt wird, nennt man Overfitting.

Dieses Problem tritt auch auf einer viel feineren Ebene auf. Wenn die synthetischen Daten, mit denen ein Algorithmus gefüttert wird, beispielsweise nur neu aufgemalte Straßenmarkierungen oder saubere Straßenschilder zeigen, könnte das Modell versagen, sobald etwas davon abweicht. In diesem Fall verlässt sich das System zu sehr auf enge Muster in den Daten und hat Schwierigkeiten, diese zu verallgemeinern. Indem wir den Wahrnehmungsstapel einer breiten Palette von Eingaben aussetzen, wie z. B. verschmutzte Schilder oder verblasste Farbmarkierungen, schaffen wir mehr Vertrauen in das System. Ziel ist es, ein möglichst breites Spektrum zu trainieren, damit das System auch unter weniger idealen Bedingungen zuverlässige Ergebnisse liefert.

F: Wie trägt AV elevate zur Einführung dieser Vielfalt bei?

Die Simulation gibt uns eine unglaubliche Menge an Kontrolle. Mit AV elevate können wir fast jeden Parameter variieren. Die Beleuchtung, das Wetter, die Tages- und Jahreszeit, das Aussehen von Objekten, Fußgängermodelle, Fahrzeugtypen und -farben können variiert werden, was eine riesige Bandbreite an Variationen ermöglicht.

In den Anfängen waren unsere Fahrzeugfarben auf nur fünf Optionen beschränkt. Das war für die Entwicklung der Fahrzeugdynamik einfach nicht nötig. Jetzt haben wir AV elevate und arbeiten mit großen Erstausrüstern zusammen, um ADAS- und AD-Systeme zu entwickeln, und wir ermöglichen die vollständige RGB-Farbsteuerung von Fahrzeugen. Das sind über 16 Millionen Farboptionen. Wir haben auch Funktionen wie Schmutzmasken eingeführt, so dass Autos und Straßenoberflächen verwittert oder schmutzig erscheinen können. Es geht darum, eine datenintensive Umgebung zu schaffen, die das Wahrnehmungssystem in jeder Hinsicht herausfordert.

F: Gilt das gleiche Maß an Variation auch für die Sensormodelle selbst?

Ja, und das ist ein wichtiger Bestandteil einer realistischen Ausbildung. Sensoren in der realen Welt sind nicht perfekt. Kameraobjektive variieren von Kamera zu Kamera, sie verschlechtern sich mit der Zeit oder werden einfach schmutzig. Mit AV elevate können Sie dies simulieren, indem Sie den synthetischen Daten Bildunschärfe und Linsenfehler hinzufügen.

Sie trainieren nicht nur für die ideale Hardware. Sie bereiten das System auf die unvermeidlichen Unzulänglichkeiten vor, die bei der Nutzung in der realen Welt auftreten, und zwar während der gesamten Lebensdauer des Fahrzeugs.

F: Kann die Simulation reale Trainingsdaten wirklich ersetzen?

Synthetische Daten sind kein vollständiger Ersatz. Korrelation wird immer ein kritischer Schritt im Entwicklungsprozess sein, aber sie ist jetzt ein wichtiger Teil der Mischung. Es gibt einige Dinge, die man mit realen Daten einfach nicht machen kann, aber mit synthetischen Daten schon. Einer der größten Vorteile der Simulation ist der Zugang zu den tatsächlichen Gegebenheiten. Bei AV elevate kennen wir die genaue 3D-Position und Klassifizierung jedes Objekts. Das ist für das Training unglaublich wichtig, denn es bedeutet, dass Sie perfekt beschriftete Daten mit 100 %iger Genauigkeit erzeugen können.

So können wir zum Beispiel für jeden Radarrücklauf oder jeden Punkt in der LiDAR-Punktwolke eine panoptische Segmentierung für die Kamera- und Objektkategorisierung vornehmen.

F: Wie werden die Trainingsdaten in AV elevate erzeugt?

Es gibt zwei Möglichkeiten, Trainingsdaten zu generieren: ein spezifisches Szenario und verschiedene Variationen. Die Generierung von Daten für ein bestimmtes Szenario ermöglicht dem Benutzer eine gezielte Entwicklung. Das Szenario könnte zum Beispiel ein Auto sein, das vor dem Testfahrzeug einfährt. Sobald das Basisszenario entwickelt wurde, können mit dem Szenario-Editor zahlreiche Variationen eingeführt werden, z. B. die Geschwindigkeit des Testfahrzeugs, die Einfahrstrecke, das Wetter und die Tageszeit.

Bei vielfältigen Variationsdaten besteht das Ziel darin, den Wert der Datenerzeugung zu maximieren, indem Aspekte wie Objekttypen, Positionen, Verhaltensweisen und Umgebungsbedingungen für jedes Bild geändert werden. Dies ist ein weniger fokussierter Ansatz, der jedoch eine viel breitere Abdeckung bietet. Die intelligente Kombination der beiden Methoden gewährleistet ein umfassendes Modelltraining für eine optimale Leistung in realen Anwendungen.

AV elevate basiert auf der High-Fidelity-Simulationsplattform von rFpro und nutzt deren Raytracing-Rendering-Technologie. Das bedeutet, dass jedes Bild der Trainingsdaten realistische Effekte wie Bewegungsunschärfe und Rolling-Shutter-Effekt enthält. Was der Sensor "sieht", kommt also dem, was er in der realen Welt sehen würde, so nahe wie möglich.

F: Können synthetische Daten für verschiedene Wahrnehmungsanwendungen maßgeschneidert werden?

Ganz genau. Die besten Trainingsdaten sind immer anwendungsspezifisch. Wenn Sie an Menschenerkennungssystemen arbeiten, brauchen Sie viele verschiedene menschliche Formen, Posen, Kleidungsstücke und Bewegungsarten. Wenn es um Navigationsplanung geht, dann geht es eher um unterschiedliche Straßenlayouts, Kreuzungen und Fahrbahnmarkierungen. Wir verfügen über eine Bibliothek mit mehr als 180 digitalen Zwillingen von realen Orten. Das bedeutet, dass Sie Ihren Algorithmus für maschinelles Lernen von Ihrem Büro aus auf den belebten Straßen von L.A., den Hochgeschwindigkeitsautobahnen in Deutschland oder den hügeligen Landstraßen in Großbritannien testen können.

F: Wie fügt sich das Wahrnehmungstraining in den allgemeinen AV-Entwicklungsprozess ein?

Sie liegt genau in der Mitte. Zunächst stellen Sie Ihre Sensoren so ein, dass sie die bestmöglichen Daten erfassen. Dann trainieren Sie Ihr Wahrnehmungssystem anhand dieser Daten, idealerweise in einem breiten Spektrum von Szenarien mit vielen Variationen. Sobald dies abgeschlossen ist, testen Sie die gesamte Technologie unter realistischen und schwierigen Bedingungen.

 

 

Diesen Artikel teilen

// Related News