업스테이지의 최신 인공지능(AI) 모델이 오픈AI보다 비용이 약 5배 더 많이 든다는 조사 결과가 나왔다. 한국 AI 모델이 글로벌 경쟁력을 높이려면 벤치마크 성능을 넘어 실제 업무 환경에서의 비용 효율까지 입증해야 한다는 지적이 나온다.
'고성능' 업스테이지 AI, 높은 연산비용은 과제
4일 업계에 따르면 글로벌 AI 평가기관 아티피셜애널리시스(AA)는 최근 업스테이지의 경량 AI 모델 ‘솔라 미니4’를 평가한 결과, 코딩과 정보 분석 추론 등으로 구성된 자체 벤치마크 과제 한 건을 처리하는 데 평균 0.36달러가 들었다고 밝혔다. 오픈AI가 대량 업무 처리를 겨냥해 내놓은 GPT-6 Luna(max)는 같은 평가에서 0.07달러였다. 두 모델의 기본 사용료 격인 토큰당 가격은 입력 100만 개 기준 0.10달러로 같지만, 실제 업무 한 건을 끝내는 데 든 비용은 크게 차이가 났다.

솔라 미니4는 정보 검색과 자료 정리, 외부 도구 사용 등 반복 업무를 저렴하게 처리하기 위해 내놓은 모델이다. 전체 350억 개 파라미터 가운데 실제 작업에는 30억 개만 활용한다. AA도 적은 연산 자원으로 높은 성능을 내는 것은 긍정적으로 평가했다. 종합 성능지수에서 24점을 받아 알리바바의 ‘큐웬(Qwen)3.6 35B A3B’, 엔비디아의 ‘네모트론(Nemotron) 3.5 Lightning’ 등 비슷한 규모의 모델 가운데 최고 수준에 올랐다.

하지만 실제 업무에 투입하면 결과가 달라졌다. AA에 따르면 솔라 미니4는 이전 단계에서 처리한 정보를 다시 활용한 비율이 48%에 그친 반면 GPT-6 Luna(max)는 99%에 달했다. 이미 읽은 내용을 다시 처리하는 비중이 높다는 뜻이다. 이 때문에 솔라 미니4의 업무당 비용 0.36달러 가운데 0.30달러가 반복 입력을 처리하는 데 쓰였다.

답을 내놓기까지 사용한 정보량도 많았다. 솔라 미니4는 업무 한 건당 평균 8만8000개의 출력 토큰을 썼고, 이 가운데 7만2000개가 추론 과정에서 발생했다. 토큰 생성 속도는 초당 208개로 GPT-6 Luna(max)의 152개보다 빨랐지만, 처리해야 할 양이 많아 업무 완료 시간은 평균 7.1분으로 GPT-6 Luna(max)의 5.8분보다 길었다.

업계는 AI 경쟁의 기준이 ‘모델 성능’에서 ‘실제 업무 비용’으로 옮겨가고 있다는 점에 주목하고 있다. 기업 입장에선 벤치마크에서 몇 점을 더 받는 것보다 고객 문의와 문서 작성, 개발 업무 한 건을 처리하는 데 실제 얼마가 드는지가 AI 도입 여부를 좌우할 수 있다. 특히 AI 에이전트가 하루 수만~수십만 건의 업무를 처리하게 되면 작은 비용 차이도 전체 운영비에서는 큰 격차로 이어진다.

이에 따라 자체 파운데이션 모델 개발 능력을 인정받은 기업의 최신 상용 모델에서 이 같은 비용 격차가 나타난 것은 눈여겨볼 필요가 있다는 평가가 나온다. 모델을 직접 만드는 기술력과 이를 글로벌 빅테크와 경쟁할 수 있는 가격에 서비스하는 역량은 또 다른 문제이기 때문이다.

AI업계 관계자는 “업스테이지는 LG AI연구원, SK텔레콤과 함께 정부의 ‘독자 AI 파운데이션 모델’ 프로젝트 3개 정예팀에 포함되며 기술력을 인정받은 기업”이라며 “이제는 벤치마크 점수뿐 아니라 실제 고객이 쓸 때의 비용에서도 경쟁력을 증명해야 할 단계”라고 말했다.

안정훈 기자 ajh6321@hankyung.com