rFproのAV elevate™プラットフォームに関する3部構成のブログシリーズの第1部では、シミュレーションが自律走行車のセンサーシステムのチューニングをどのように変革するかを探りました。この記事では、AV開発の次の大きなステップである知覚システムのトレーニングに焦点を当てます。rFproのAV elevateプロダクトマネジャーであるJosh Wreford氏に、シミュレーションが、実世界で確実に動作するために必要な多様性と精度を備えた機械学習アルゴリズムのトレーニングにどのように役立つかを伺いました。
Q:そもそも、知覚システムを鍛えるとはどういうことですか?
知覚システムのトレーニングとは、周囲の世界を理解し解釈するように教えることだ。これは子供が学習する方法とよく似ている。子供に1匹の犬を見せただけで、すべての犬を見分けられるとは思わないだろう。多くの異なる例に触れさせ、時間をかけて共通の特徴を学ばせるのだ。
機械学習もまったく同じことを行っている。システムにさまざまな入力を与え、すべて正しい答えでラベル付けし、重要なパターンを識別できるようにする。ゴールは、アルゴリズムが、それがどのような条件や文脈で現れるかに関係なく、何かが何であるかを理解することである。
Q:システムは具体的に何を感知する必要があるのですか?
歩行者、自転車、自動車といった物理的な物体だけでなく、道路の端、車線の境界、歩道といった「概念」を認識し、単に識別するだけでなく、それらが何を意味するのかを理解する必要がある。私たちは単に形にラベルを貼るだけでなく、機能的な理解を教えているのだ。例えば、舗装路の2つの領域は似ているように見えるかもしれないが、一方は車の車線であり、もう一方は対向車線である。
私たちはこれを機能的セグメンテーションと呼んでいる。知覚とプランニングの橋渡しだ。単に視覚的な地図を作るのではなく、その自由な空間で車両がどのように行動できるかを理解するのです。それが安全で論理的な意思決定を可能にするのだ。
Q:知覚システムをトレーニングする際に、なぜバラエティが重要なのでしょうか?
子供に犬を教える例えに戻れば、子供が黒い犬しか見たことがなければ、犬は色が犬の特徴だと思い込んでしまう。そうではないことを機械学習アルゴリズムに教える唯一の方法は、可能な限り多種多様な犬を見せることだ。十分なバリエーションを示さないというこの問題は、オーバーフィッティングと呼ばれる。
この問題はもっと細かいレベルでも発生する。例えば、アルゴリズムに供給される合成データが、新しくペイントされた道路標識やきれいな道路標識しか示していない場合、そこから外れた瞬間にモデルが失敗する可能性がある。この場合、システムはデータの狭いパターンに依存しすぎ、一般化するのに苦労する。知覚スタックを、汚れた標識や色あせたペイントマークのような幅広い入力にさらすことで、システムの信頼性を高めることができる。その目的は、可能な限り広い範囲にわたって訓練することであり、そうすることで、理想的な条件でないときでも、システムは自信に満ちた出力を出し続けることができるのです。

Q:AVエレベーターは、そのバラエティの導入にどのように役立っていますか?
シミュレーションは信じられないほどのコントロールを与えてくれる。AV elevateでは、ほとんどすべてのパラメーターを変化させることができます。照明、天候、時間帯、オブジェクトの外観、歩行者モデル、車両の種類や色など、すべてを変化させることができ、膨大なバリエーションを生み出すことができます。
その昔、私たちの車の色は5色に限られていた。ビークルダイナミクスの開発には必要なかったからです。現在ではAVエレベートがあり、ADASとADシステムを開発するために主要なOEMと協力しています。これは1,600万以上のカラーオプションです。また、ダートマスクのような機能も導入し、車や路面が風化したり、汚れているように見えるようにしています。あらゆる方法で知覚システムに挑戦するデータ豊富な環境を作り出すことがすべてなのです。
Q:センサーのモデル自体にも同じレベルのばらつきがあるのでしょうか?
そう、そしてそれは現実的なトレーニングの重要な部分だ。現実世界のセンサーは完璧ではありません。カメラのレンズはカメラによって異なり、時間とともに劣化したり、単に汚れたりします。AV elevateは、合成データに画像のブレやレンズ収差を導入することで、これをシミュレートすることができます。
理想的なハードウェアのためにトレーニングしているのではありません。車の寿命が尽きるまで、実世界での使用に伴う避けられない不完全性に備えてシステムを準備しているのだ。
Q:シミュレーションは本当に実世界のトレーニングデータに取って代わることができるのでしょうか?
合成データは完全な代替物ではなく、相関関係は常に開発プロセスにおいて重要なステップであるが、今やミックスの重要な一部となっている。実際のデータではできないことでも、合成データではできることがあります。シミュレーションの最大の利点の1つは、グラウンドトゥルースへのアクセスです。AVエレベートでは、すべての物体の正確な3D位置と分類がわかる。つまり、100%の精度で完璧にラベル付けされたデータを生成することができるのです。
例えば、各レーダーリターンやLiDAR点群内の各点に対して、カメラや物体を分類するためのパノプティックセグメンテーションを提供することができる。

Q: AV elevateのトレーニングデータはどのように生成されるのですか?
トレーニングデータの生成には、特定のシナリオと多様なバリエーションの2つの主要な方法がある。特定のシナリオのデータを生成することで、ユーザーは開発に集中することができます。例えば、テスト車両の前に車が割り込んでくるようなシナリオです。ベースシナリオが作成されると、シナリオエディタでは、テスト車両の走行速度、割り込み距離、天候や時間帯など、多くのバリエーションを導入することができます。
多様なバリエーションデータでは、オブジェクトのタイプ、位置、行動、環境条件などの側面をフレームごとに変えることによって、データ生成の価値を最大化することを目的とする。これは、あまり焦点を絞らないアプローチですが、はるかに広い範囲をカバーします。この2つの方法をインテリジェントに組み合わせることで、実世界のアプリケーションで最適なパフォーマンスを発揮するための包括的なモデルトレーニングが可能になります。
AV elevateはrFproの高忠実度シミュレーション・プラットフォーム上に構築され、レイトレーシングのレンダリング技術を活用しています。つまり、トレーニングデータの各フレームには、モーションブラーやローリングシャッター効果のようなリアルなエフェクトが含まれています。つまり、センサーが「見る」ものは、現実世界で見るものに限りなく近いのです。
Q: 合成データをさまざまな知覚の用途に合わせて調整することは可能ですか?
もちろんだ。最良のトレーニングデータは、常に用途に特化したものです。人体検知システムに取り組んでいるのであれば、さまざまな人間の姿、ポーズ、服装、動きの種類が必要です。ナビゲーション・プランニングであれば、さまざまな道路レイアウト、交差点、車線標識が必要になります。私たちは、現実世界の場所の180以上のデジタル・ツインのライブラリを持っています。つまり、ロサンゼルスの賑やかな通り、ドイツの高速アウトバーン、イギリスの起伏に富んだ田舎道を、オフィスにいながら機械学習アルゴリズムに適用できるのです。
Q:パーセプション・トレーニングは、より広いAV開発プロセスの中でどのような位置づけにあるのでしょうか?
そのちょうど真ん中に位置する。まず、可能な限り最高のデータを取得するためにセンサーを調整する。そして、そのデータを使って知覚システムを訓練する。理想的には、バリエーションに富んだ幅広いシナリオで。それが完了したら、現実的で厳しい条件下でテクノロジー・スタック全体のテストに移る。



