AI 추천 뉴스
MS도 '피지컬 AI' 뒤늦게 참전…"지능에 촉각까지 더했다" [영상]
MS리서치는 21일(현지시간) 공식 홈페이지를 통해 로보틱스 모델 '로-알파'를 공개했다. MS에 따르면 이 모델은 비전언어모델(VLM)인 '파이' 시리즈를 기반으로 제작됐다. ‘로-알파’는 기존의 비전-언어-행동(VLA) 모델을 한 단계 확장한 ‘VLA+’ 모델로 정의된다. 단순히 눈(비전)으로 보고 명령을 이해해 움직이는 것을 넘어 로봇 손끝에 전해지는 촉각(터치) 데이터까지 실시간으로 처리할 수 있는 것이 핵심이다.
그동안 로봇 AI의 고질적 난제였던 ‘오클루전(물체가 가려지는 현상)’ 문제를 촉각 센싱으로 해결했다. 예를 들어 로봇이 콘센트에 플러그를 꽂을 때 손에 가려 구멍이 보이지 않더라도 손가락에 느껴지는 저항력과 촉감을 데이터로 인식해 정교한 삽입 작업을 완수하는 방식이다. 시각과 언어, 촉각을 통합해, “플러그 꽂아줘”“노브를 5로 돌려” 같은 자연어 지시를 실제 로봇 동작 시퀀스로 바꾼다.
로봇 학습의 최대 걸림돌이었던 실제 구동 데이터 부족 문제에 대해서는 MS의 클라우드 인프라와 엔비디아의 시뮬레이션 기술이 결합된 하이브리드 전략을 택했다. MS는 엔비디아 아이작 심을 활용해 가상 환경에서 '합성 데이터'를 생성하고, 이를 실제 로봇의 궤적 데이터와 결합해 학습시켰다. 로봇이 작업 중 실수할 경우 인간이 3D 마우스 등을 통해 즉각 교정하면, 이를 실시간 피드백으로 흡수해 성능을 개선하는 ‘인간 개입형 학습(휴먼인더루프)’ 구조도 갖췄다.
업계에서는 MS의 이번 발표를 구글(RT 시리즈), 피지컬 인텔리전스(Pi-0) 등 로봇 AI 선두 주자들과의 전면전 선포로 보고 있다. 윈도우와 오피스로 PC 환경을 장악했던 MS가 이젠 로봇용 ‘범용 지능 OS’ 역할을 할 파운데이션 모델을 선점해 로보틱스 생태계의 주도권을 쥐겠다는 전략이다. 제조·물류 등 산업 현장 쓸 수 있는 애저, 코파일럿, VLA까지 통합한 피지컬AI 패키지를 내놓을 것이란 전망도 나온다.
고은이 기자 koko@hankyung.com