3부로 구성된 블로그 시리즈 중 첫 번째 파트에서는 시뮬레이션이 자율 주행 차량의 센서 시스템 튜닝을 어떻게 변화시키는지 살펴봤습니다. 이번 포스팅에서는 자율주행차 개발의 다음 주요 단계인 인지 시스템 훈련에 초점을 맞춥니다. 시뮬레이션이 실제 환경에서 안정적으로 작동하는 데 필요한 다양성과 정밀도를 갖춘 머신러닝 알고리즘을 훈련하는 데 어떻게 도움이 되는지 알아보기 위해 rFpro의 AV 엘리베이트 제품 매니저인 Josh Wreford와 이야기를 나눴습니다.
Q: 우선 인식 시스템을 훈련한다는 것은 무엇을 의미하나요?
지각 시스템을 훈련한다는 것은 주변 세계를 이해하고 해석하도록 가르치는 것입니다. 이는 아이들이 학습하는 방식과 매우 유사합니다. 아이에게 개 한 마리만 보여주고 모든 개를 알아볼 것이라고 기대할 수는 없습니다. 다양한 사례에 노출시키고 시간이 지남에 따라 공통된 특징을 배우게 됩니다.
머신러닝에서도 똑같은 작업을 하고 있습니다. 우리는 시스템에 정답이 표시된 다양한 입력을 제공하여 중요한 패턴을 식별할 수 있도록 합니다. 목표는 알고리즘이 조건이나 맥락에 관계없이 어떤 것이 무엇인지 이해하는 것입니다.
질문: 시스템이 정확히 무엇을 인식해야 하나요?
보행자, 자전거, 차량과 같은 물리적 물체뿐만 아니라 도로 가장자리, 차선 경계, 포장 도로와 같은 '개념'도 인식해야 하며, 단순히 식별하는 데 그치지 않고 그 의미를 이해해야 합니다. 단순히 도형에 라벨을 붙이는 것이 아니라 기능적 이해를 가르칩니다. 예를 들어, 아스팔트의 두 영역이 비슷해 보일 수 있지만 하나는 차량의 차선이고 다른 하나는 마주 오는 차량의 차선이며, 이러한 차이는 안전에 매우 중요합니다.
우리는 이를 기능적 세분화라고 부릅니다. 이는 인식과 계획 사이의 다리 역할을 합니다. 단순히 시각적 지도를 구축하는 것이 아니라 차량이 그 자유 공간에서 어떻게 작동할 수 있는지 이해하는 것입니다. 이를 통해 안전하고 논리적인 의사결정을 내릴 수 있습니다.
Q: 인식 시스템을 훈련할 때 다양성이 중요한 이유는 무엇인가요?
아이들에게 개를 비유로 가르치는 경우로 돌아가서, 아이가 검은 개만 본 적이 있다면 색깔이 개를 개로 만드는 특징이라고 가정할 것입니다. 그렇지 않다는 것을 머신러닝 알고리즘에 가르치는 유일한 방법은 가능한 한 다양한 개를 보여주는 것입니다. 충분한 변형을 보여주지 않는 이 문제를 과적합이라고 합니다.
이 문제는 훨씬 더 세분화된 수준에서도 발생합니다. 예를 들어 알고리즘에 공급되는 합성 데이터가 새로 칠해진 도로 표지판이나 깨끗한 도로 표지판만 표시하는 경우, 여기서 벗어나는 순간 모델이 실패할 수 있습니다. 이 경우 시스템은 데이터의 좁은 패턴에 지나치게 의존하게 되고 일반화에 어려움을 겪게 됩니다. 인식 스택을 더러운 표지판, 희미한 페인트 자국과 같은 다양한 입력에 노출시킴으로써 시스템에 대한 신뢰도를 높일 수 있습니다. 목표는 가능한 한 가장 넓은 범위에서 훈련하는 것이므로 조건이 이상적이지 않은 경우에도 시스템이 계속해서 자신감 있는 결과를 제공할 수 있습니다.

Q: AV 엘리베이트는 이러한 다양성을 도입하는 데 어떻게 도움이 되나요?
시뮬레이션은 엄청난 양의 제어 기능을 제공합니다. AV 엘리베이트를 사용하면 거의 모든 파라미터를 변경할 수 있습니다. 조명, 날씨, 시간, 계절, 물체 모양, 보행자 모델, 차량 유형 및 색상을 모두 변경하여 다양한 변형을 만들어낼 수 있습니다.
초창기에는 차량 색상이 5가지 옵션으로 제한되어 있었습니다. 차량의 역동성을 개발하는 데 필요한 옵션이 아니었죠. 이제 우리는 AV 엘리베이트가 있고 주요 OEM과 협력하여 ADAS 및 AD 시스템을 개발하고 있으며, 차량의 전체 RGB 색상 제어를 허용하고 있습니다. 이는 1,600만 가지가 넘는 색상 옵션입니다. 또한 더트 마스크와 같은 기능도 도입하여 차량과 도로 표면을 풍화되거나 지저분하게 보이게 할 수 있습니다. 모든 면에서 인식 시스템에 도전하는 데이터가 풍부한 환경을 만드는 것이 핵심입니다.
Q: 센서 모델 자체에도 동일한 수준의 변동이 적용되나요?
예, 그리고 이는 실제와 같은 훈련의 중요한 부분입니다. 실제 센서는 완벽하지 않습니다. 카메라 렌즈는 카메라마다 다르며 시간이 지남에 따라 성능이 저하되거나 더러워지기도 합니다. AV 엘리베이트를 사용하면 합성 데이터에 이미지 블러와 렌즈 수차를 도입하여 이를 시뮬레이션할 수 있습니다.
이상적인 하드웨어를 위한 훈련만 하는 것이 아닙니다. 차량의 수명이 다할 때까지 실제 사용에서 발생하는 불가피한 불완전성에 대비하여 시스템을 준비해야 합니다.
Q: 시뮬레이션이 실제 훈련 데이터를 대체할 수 있나요?
합성 데이터가 실제 데이터를 완전히 대체할 수는 없으며, 상관관계는 항상 개발 프로세스에서 중요한 단계이지만 이제는 필수적인 요소입니다. 실제 데이터로는 할 수 없지만 합성 데이터로는 할 수 있는 몇 가지 작업이 있습니다. 시뮬레이션의 가장 큰 장점 중 하나는 실측 데이터에 대한 접근성입니다. AV 엘리베이트에서는 모든 물체의 정확한 3D 위치와 분류를 알고 있습니다. 이는 100% 정확도로 완벽하게 레이블이 지정된 데이터를 생성할 수 있다는 의미이므로 교육에 매우 유용합니다.
예를 들어, 이를 통해 각 레이더 리턴에 대한 카메라 및 객체 분류를 위한 파노라마 세분화 또는 LiDAR 포인트 클라우드의 모든 지점을 제공할 수 있습니다.

Q: AV에서 생성되는 훈련 데이터는 어떻게 향상되나요?
훈련 데이터를 생성하는 방법에는 특정 시나리오와 다양한 변형이라는 두 가지 주요 방법이 있습니다. 특정 시나리오 데이터 생성을 통해 사용자는 개발에 집중할 수 있습니다. 예를 들어, 시나리오는 테스트 차량보다 앞서가는 차량이 끼어드는 상황일 수 있습니다. 기본 시나리오가 개발되면 시나리오 편집기에서 테스트 차량의 주행 속도, 끼어들기 거리, 날씨와 시간 등 다양한 변수를 도입할 수 있습니다.
다양한 변형 데이터를 통해 각 프레임의 물체 유형, 위치, 행동 및 환경 조건과 같은 측면을 변경하여 데이터 생성의 가치를 극대화하는 것이 목표입니다. 이는 덜 집중적인 접근 방식이지만 훨씬 더 광범위한 범위를 제공합니다. 이 두 가지 방법을 지능적으로 결합하면 실제 애플리케이션에서 최적의 성능을 발휘할 수 있도록 포괄적인 모델 학습을 보장합니다.
AV 엘리베이트는 rFpro의 고충실도 시뮬레이션 플랫폼을 기반으로 구축되었으며 레이 트레이싱 렌더링 기술을 활용합니다. 즉, 훈련 데이터의 모든 프레임에는 모션 블러 및 롤링 셔터 효과와 같은 사실적인 효과가 포함됩니다. 따라서 센서가 '보는' 것은 실제 세계에서 볼 수 있는 것과 최대한 가깝습니다.
Q: 합성 데이터를 다양한 인식 애플리케이션에 맞게 조정할 수 있나요?
당연하죠. 최고의 훈련 데이터는 항상 애플리케이션에 따라 다릅니다. 사람 감지 시스템을 개발하는 경우 다양한 사람의 형태, 포즈, 옷차림, 움직임 유형이 필요합니다. 내비게이션 계획이라면 다양한 도로 레이아웃, 교차로, 차선 표시가 더 중요합니다. 유니티에는 180개가 넘는 실제 장소의 디지털 트윈 라이브러리가 있습니다. 따라서 사무실에서도 LA의 번화한 거리, 독일의 고속 고속도로, 영국의 구불구불한 시골길을 모두 머신러닝 알고리즘에 적용할 수 있습니다.
Q: 인식 훈련은 전체 AV 개발 프로세스 중 어디에 적합하나요?
바로 중간에 위치합니다. 먼저 가능한 최상의 데이터를 캡처하도록 센서를 조정합니다. 그런 다음 이 데이터를 사용하여 다양한 시나리오에서 다양한 변수가 있는 광범위한 시나리오에서 인식 시스템을 훈련합니다. 이 작업이 완료되면 현실적이고 까다로운 조건에서 전체 기술 스택을 테스트하는 단계로 넘어갑니다.



