출처=로이터
출처=로이터
엔비디아가 인공지능(AI) 에이전트의 행동을 실시간으로 감시하고 통제 범위를 벗어날 경우 즉시 격리할 수 있는 안전 소프트웨어 플랫폼을 내놨다. 최근 주요 AI 기업의 에이전트가 개발자 통제를 벗어난 사례가 잇따르면서 AI 안전 통제 기술의 중요성도 커지고 있다는 평가다.

28일 월스트리트저널(WSJ)에 따르면 엔비디아는 개발자들이 AI 에이전트를 시험하고 실제 환경에 배치하는 과정에서 이를 안전한 범위 안에 둘 수 있도록 지원하는 ‘엔비디아 오픈 에이전트 세이프티 플랫폼’을 출시했다. 이 플랫폼은 개발자가 AI의 행동을 지속적으로 감시하고 관리하면서 에이전트가 사전에 정해진 규칙을 따르도록 하는 도구들을 제공한다.

핵심 기능 가운데 하나는 AI 에이전트가 허용된 경계를 벗어나려 할 경우 이를 격리할 수 있는 감시 장치다. 에이전트가 무엇을 보고 어떤 행동을 할 수 있는지, 또 어떤 대상과 상호작용할 수 있는지를 제한하는 소프트웨어도 포함됐다. 엔비디아는 최근 발생한 여러 사고에서 공통적으로 AI에이전트가 개발자들이 모델을 시험하는 ‘샌드박스’의 안전 통제를 우회한 뒤 작업을 수행했다는 점에 주목했다.

이번 발표는 오픈AI와 앤트로픽, 메타, 알파벳의 구글 등 주요 AI 기업의 에이전트가 최근 몇 달 사이 통제를 벗어난 사례가 이어진 뒤 나왔다. 이런 사고가 반복되자 샘 올트먼과 다리오 아모데이, 일론 머스크 등 AI 업계 주요 인사들도 AI가 인간의 통제 범위를 넘어서는 수준까지 발전하기 전에 개발 속도를 늦춰야 한다는 데 이례적으로 한 목소리를 냈다.

다만 젠슨 황 엔비디아 최고경영자(CEO)는 AI가 인류 멸종으로 이어질 수 있다는 일부 AI 연구자들의 경고에는 동의하지 않는다는 입장을 밝힌 바 있다. 그는 최근 CBS뉴스와의 인터뷰에서 이 같은 견해를 드러냈다. 엔비디아는 AI의 장기적 위험론과 별개로 현재 실제 개발 현장에서 발생하고 있는 에이전트 통제 실패를 막는 기술에 초점을 맞춘 셈이다.

AI 에이전트 안전 문제가 구체적인 보안 사고로 번지고 있다는 점도 이번 플랫폼 출시의 배경이다. 앤서니 앨버니지 호주 총리는 뉴욕에서 열린 유엔 회의에서 올여름 오픈AI 에이전트가 호주 정부 서비스 웹사이트에 침투한 적이 있다고 밝혔다. 오픈AI의 에이전트는 AI 플랫폼 기업 허깅페이스를 상대로 서비스에 큰 차질을 일으킨 해킹도 벌였다.

경쟁사인 앤트로픽도 지난 7월 자사가 시험 중이던 소프트웨어가 인터넷에 접속해 회사가 인지하지 못한 상태에서 기업들을 해킹한 사례가 있었다고 밝혔다. 관련 사건은 4월 이후 모두 세 차례 발생했다. 엔비디아는 이런 사례들이 서로 다른 기업에서 발생했지만, 에이전트가 샌드박스의 안전 통제를 우회하고 스스로 과업을 완수했다는 점에서는 같은 패턴을 보였다고 설명했다.

엔비디아의 대응은 AI 에이전트 개발 경쟁이 성능뿐 아니라 통제와 보안 기술 경쟁으로 확대되고 있음을 보여준다. 젠슨 황 CEO는 “AI 역량의 최전선을 계속 발견하는 것과 마찬가지로 AI 안전의 최전선을 발견하는 일도 가속해야 한다”고 말했다. 앞으로 AI 에이전트의 자율성이 높아질수록 개발 단계에서 행동 범위를 어디까지 제한하고, 통제 이탈 시 얼마나 빠르게 차단할 수 있는지가 안전 기술의 핵심 과제로 부상할 전망이다.

김동현 기자 3code@hankyung.com