제조 공장, 원전 해체 현장, 영하의 북극 광산 등 가장 가혹한 산업 현장에서 보스턴 다이내믹스의 4족 보행 로봇 스팟(SPOT)은 이미 누적 25만 km 이상을 주행하며 압도적인 기동성을 증명하고 있습니다.
하지만 기름때가 낀 미끄러운 바닥이나 불규칙한 장애물이 산재한 현실의 산업 현장은 사전 예측이나 모델링만으로는 완벽히 통제하기 어려운 돌발 변수들로 가득합니다. 예측 불가능한 환경에서도 로봇이 미끄러지거나 넘어지지 않고 자율 순찰 임무를 완벽히 수행하도록 만들기 위해, 최근 스팟의 제어 시스템에 전격 도입된 혁신적인 인공지능 기술인 '강화학습'에 대해 상세히 살펴보고자 합니다.
기존 제어 방식(MPC)의 한계와 병목 현상
전통적으로 스팟은 '모델 예측 제어(MPC)'라는 방식을 사용해 왔습니다. 이는 1밀리초(0.001초)도 안 되는 찰나의 순간에 지형의 거칠기나 장애물 유무 등을 판단하여, 수십 개의 개별 예측 경로를 동시에 평가하고 최적의 걸음걸이를 선택하는 기술입니다.

이 방식은 수백 시간 동안 단 한 번의 낙상도 허용하지 않을 만큼 훌륭한 안정성을 제공했지만, 분명한 한계도 존재했습니다. 수많은 제어 모델을 병렬로 연산해야 하므로 로봇 내부의 컴퓨팅 자원과 배터리가 크게 소모되었습니다. 또한, 미끄러운 바닥과 같은 새로운 돌발 변수에 대응하기 위해 제어 로직을 수동으로 변경하면, 자칫 다른 정상적인 주행 상황에서 성능이 저하되는 부작용이 발생할 위험이 있었습니다.
100만 번의 시뮬레이션, 인공지능이 스스로 깨우친 '강화학습(RL)'
이러한 한계를 극복하기 위해 스팟에 도입된 것이 바로 강화학습(RL)입니다.

엔지니어가 로봇의 행동을 일일이 소스 코드(C++)로 프로그래밍하는 대신, 로봇 스스로 시뮬레이터 내에서 무수한 '시행착오'를 겪으며 최적의 행동 전략(인공신경망 정책)을 학습하게 만드는 방식입니다. 보스턴 다이내믹스는 기존의 안정적인 MPC 제어기와 RL 정책을 혼합한 하이브리드 아키텍처를 구축했습니다.

스팟은 거친 지형, 미끄러운 바닥, 다양한 계단 등 무작위로 생성된 100만 개 이상의 시뮬레이션 환경에서 훈련을 거쳤습니다. 넘어지지 않고 목표 지점에 도달할 때마다 '보상'을 주며 훈련한 결과, 인간이 일일이 코딩하기 까다로운 극한의 돌발 상황에 대한 완벽한 대처 능력을 로봇 스스로 깨우치게 되었습니다. 불필요한 병렬 연산이 줄어들어 컴퓨팅 효율 역시 극대화되었습니다.
현장의 리스크를 지우는 철저한 강건성 검증
아무리 훌륭한 시뮬레이션이라도 실제 산업 현장에서 완벽하게 작동하지 않는다면 의미가 없습니다. 보스턴 다이내믹스는 학습된 RL 정책을 고객에게 배포하기 전, 가혹한 자체 검증을 거쳤습니다.
보스턴 다이내믹스의 자체 테스트용 스팟 군단은 실내외, 다양한 계단 및 바닥 재질, 극한의 기후 조건에서 매주 2,000시간 이상 24시간 내내 쉼 없이 주행 테스트를 받습니다. 이 과정에서 발견된 미끄러짐이나 낙상 문제는 즉각 시뮬레이션 환경에 다시 반영되어 로봇을 재학습시킵니다. 이처럼 수천 시간의 가혹한 테스트를 통과해 검증된 '완벽한 정책'만이 비로소 현장의 고객 로봇에 배포됩니다.

기업 고객을 위한 실질적 비즈니스 임팩트와 미래
가장 최신의 소프트웨어 업데이트를 통해 이 RL 정책을 적용받은 고객들은 명확한 비즈니스 가치를 경험하고 있습니다. 이제 스팟은 극도로 미끄럽거나 불규칙한 표면에서도 넘어질 확률이 획기적으로 줄어들었습니다.
이러한 주행 안정성 향상은 현장의 리스크 최소화로 직결됩니다. 과거에는 진입을 망설였던 복잡하고 열악한 구역에도 안심하고 스팟을 투입할 수 있으며, 로봇이 넘어짐으로써 발생하는 작업자의 개입이나 2차 사고의 위험이 완전히 사라졌습니다.

나아가 보스턴 다이내믹스는 NVIDIA 등과 협력하여 'Spot RL Researcher Kit'를 발표했습니다. 로봇 제어 권한, NVIDIA Jetson AGX Orin 기반의 고성능 엣지 컴퓨팅 페이로드, 그리고 시뮬레이터를 하나의 패키지로 제공하여, 외부 개발자들도 스팟의 자율 보행 속도를 높이거나 새로운 동작을 직접 학습시킬 수 있는 길을 열었습니다.
머신러닝과 함께 끊임없이 진화하는 스마트 관제 시스템
방대한 데이터로 끊임없이 진화하는 스팟은 예측 불가능한 산업 현장의 난관을 스스로 극복하며, 멈추지 않는 가장 완벽한 스마트 관제 시스템을 완성해 나가고 있습니다. 보스턴 다이내믹스의 국내 파트너사인 클로봇과 함께, 기름때나 잔해물로 인해 기존 방식으로는 접근조차 까다로웠던 귀사의 고위험 구역에 가장 신뢰할 수 있는 지능형 로봇 자동화를 구축해 보십시오.
출처: https://bostondynamics.com/blog/starting-on-the-right-foot-with-reinforcement-learning/