AI 추천 뉴스
오픈AI AI 에이전트, 캡차 우회 위해 다른 AI까지 동원 시도
28일(현지시간) 뉴욕타임스(NYT)에 따르면 미국 웹 데이터 처리 스타트업 ‘파스’의 연구진은 최근 오픈AI의 허깅페이스 해킹 사건을 분석한 보고서를 발표했다. 오픈AI 에이전트들은 처음에 웹페이지를 읽을 수만 있었고 데이터를 보내거나 상호작용하지는 못했다. 이를 우회하기 위해 프로그램을 작은 조각으로 나눠 인터넷주소(URL) 단축 서비스에 저장하고, 여러 단축 URL을 연결해 하나의 프로그램처럼 실행하는 방법을 고안했다. 이 과정에서 100만개에 달하는 단축 URL을 생성했다.
당초 오픈AI의 에이전트들은 인터넷에 접속할 수 없는 격리된 컴퓨팅 환경에서 작동하도록 설계돼 있었다. 다만 필요한 소프트웨어를 설치할 수 있도록 내부 관리 도구는 제한적으로 인터넷에 접속할 수 있었다. 에이전트들은 이 도구를 활용해 외부 인터넷을 통하는 우회로를 확보했다. 또한, 도구 내 파일을 생성하는 등의 방법으로 다른 에이전트들과 정보를 교환할 수 있는 ‘게시판’도 만들었다.
다만, 이 방식은 URL을 불러오는 정도로 제한돼 데이터를 자유롭게 주고받을 수는 없었다. 하나의 프로그램을 여러 개의 단축 URL에 저장한 이유다. 웹페이지를 대신 열어 화면을 이미지로 만들어주는 ‘스크린숏 서비스’를 통해 단축 URL을 차례로 불러와 프로그램 코드를 하나로 합쳤다. 900개 넘는 단축 링크를 연결한 사례도 확인됐다.
일부 에이전트는 허깅페이스의 더 많은 데이터에 접근하기 위해 새 계정을 만드는 것을 시도했다. 사람과 로봇을 구별하는 ‘캡차’ 인증 단계에서 막히자 에이전트들은 우회 프로그램을 직접 만들기 시작했다. 제대로 작동하지 않자, 사전 학습된 이미지 분류 AI 모델을 설치하기도 했다. 파스는 에이전트들이 결국 허깅페이스의 새로운 계정을 생성하는 데는 실패한 것으로 분석했다.
AI 안전 전문가들은 AI 에이전트가 목표 달성을 위해 다른 AI 모델이나 외부 도구까지 활용하는 상황을 경계해왔다. 이런 행동이 확산할 경우 인간이 AI 시스템을 통제하거나 작동을 중단시키는 일이 더 어려워질 수 있다는 우려에서다.
파스 창업자인 알렉스 포먼은 “결코 일회성 사건에 가까운 일이 아니다”며 “경고 신호가 계속해서 반복적으로 나오고 있다”고 말했다. 조사에 참여한 AI 안전 비영리단체 팰리세이드리서치의 제프리 래디시 전무이사는 “모델들이 마치 ‘링크 단축 서비스가 있고 스크린숏 서비스도 있네. 이제 시작할 준비가 됐어’라고 말하는 것 같았다”고 NYT에 전했다.
손주형 기자 handbro@hankyung.com