AI 추천 뉴스
"34년 걸릴 일을 하루 만에?"…美 로봇기업이 선택한 韓 AI
피지컬 AI 시장 공략 나선 트웰브랩스
로봇 학습용 1인칭 영상 폭발적으로 증가
영상 1시간 정리에 수작업 155시간 들기도
AI가 행동 구분하고 학습용 데이터로 가공
美 로보틱스 기업, 하루 수십만 시간 영상 처리
미디어 영상 분석 기술 로봇·제조로 확장
로봇 학습용 1인칭 영상 폭발적으로 증가
영상 1시간 정리에 수작업 155시간 들기도
AI가 행동 구분하고 학습용 데이터로 가공
美 로보틱스 기업, 하루 수십만 시간 영상 처리
미디어 영상 분석 기술 로봇·제조로 확장
피지컬 인공지능(AI) 시대를 맞아 로봇에 가르칠 영상은 쌓이고 있지만, 정작 이를 '교과서'로 만드는 작업이 기술 발전의 걸림돌로 떠오르고 있다. 국내 AI 스타트업 트웰브랩스가 이 문제를 해결하기 위해 나섰다.
트웰브랩스는 7일 1인칭 영상 이해 능력을 강화한 비전언어모델(VLM) '페가수스 1.6'을 출시했다고 밝혔다. 그동안 방송·영화 등 미디어 분야에서 축적한 영상 분석 기술을 로봇과 휴머노이드 등 피지컬 AI 시장으로 확대하기 위한 제품이다.
최근 로봇업계에서는 사람의 시선에서 촬영한 '에고센트릭(1인칭) 영상'이 핵심 학습 자원으로 주목받고 있다. 작업자가 스마트 글라스나 액션캠을 착용하고 공장에서 부품을 조립하거나 물건을 옮기는 과정을 촬영하는 방식이다. 로봇이 실제 인간의 작업 방식을 익히는 데 활용할 수 있다.
문제는 영상이 많다고 곧바로 학습에 활용할 수 있는 것은 아니라는 점이다. 실제 공개 영상 데이터셋인 'Ego-Exo4D'에서는 1286시간 분량의 영상에 행동과 작업 과정을 표시하는 데 20만 시간 이상의 노동력이 투입됐다. 영상 1시간을 학습용으로 정리하는 데 약 155시간의 사람 손이 필요했던 셈이다.
페가수스 1.6은 이런 작업을 AI에 맡길 수 있도록 설계됐다. 영상 속 행동을 시간 순서대로 잘게 나누고, 각 구간에서 어떤 사물을 집었는지, 무슨 도구를 사용했는지, 작업 결과는 어땠는지를 분석한다. 단순히 영상에 등장하는 사물을 식별하는 수준을 넘어 행동의 흐름과 전후 맥락까지 파악하는 게 핵심이다.
예컨대 작업자가 부품을 집어 조립하고 완성품을 옮기는 영상을 입력하면 '부품 집기→도구 사용→조립→완성품 이동' 등의 행동을 구분해 설명을 붙이는 식이다. 기업별로 필요한 정보의 종류와 형식을 지정하면 행동이 발생한 시점까지 기록할 수 있다.
학습에 적합한 영상만 골라내는 기능도 갖췄다. 촬영 구도가 나쁘거나 작업자의 행동이 제대로 보이지 않는 영상을 걸러내고, 필요한 작업 장면을 자연어 검색으로 찾아낼 수 있다. 영상에 등장하는 얼굴과 개인정보 등 검토가 필요한 부분을 식별하는 기능도 지원한다.
이미 미국 로보틱스 업계에서는 트웰브랩스의 기술을 활용하고 있다. 회사에 따르면 공장 작업자들의 1인칭 영상을 수집하는 미국의 한 로보틱스 학습 데이터 기업은 페가수스를 이용해 원본 영상의 품질을 평가하고, 선별된 영상에 상세한 행동 설명을 붙이고 있다.
이 기업이 하루에 처리하는 영상은 수십만 시간 분량에 달한다는 설명이다. 30만 시간만 해도 한 사람이 하루 24시간 쉬지 않고 시청할 경우 34년 이상 걸리는 분량이다. 사람이 일일이 영상을 확인하고 설명을 붙이는 방식으로는 감당하기 어려운 규모다.
트웰브랩스의 사업 영역도 달라지고 있다. 그동안 방송 아카이브에서 특정 장면을 찾거나 스포츠 경기 영상을 분석하는 데 활용됐던 기술이 이제 로봇 학습 데이터 구축과 제조 현장으로 확장되는 것이다. 영상 속에서 '무슨 일이 벌어졌는지' 이해하는 기술이 로봇에게 '사람이 어떻게 일하는지' 가르치는 데 쓰이는 셈이다.
이재성 트웰브랩스 최고경영자(CEO)는 "물건이 미끄러졌을 때 바로잡는 것과 같이 사람들이 현실 세계에서 체득한 경험은 대부분 기계가 학습할 수 있는 형태로 기록되지 않았다"며 "페가수스 1.6은 영상을 구조화된 지식으로 바꿔 피지컬 AI와 로보틱스 기업들이 실제 인간의 경험을 학습에 활용할 수 있도록 할 것"이라고 말했다.