사진=게티이미지뱅크
사진=게티이미지뱅크
판결문 공개 확대의 '걸림돌'로 손꼽히는 개인정보 비실명화 작업에 인공지능(AI)을 활용하려는 움직임이 본격화하고 있다. 연간 50만 건이 넘는 판결문을 사람이 일일이 비실명 처리하는 데 한계가 있는 만큼, AI를 활용해 개인정보를 보다 빠르고 정확하게 가려내려는 시도다.

7일 법원행정처에 따르면 판결문 비실명화 처리 건수는 매년 50만 건 안팎에 달한다. 2022년 50만842건에서 2023년 56만1470건, 지난해 54만5118건을 기록했고 올해도 지난달 말까지 33만2396건을 처리했다. 판결문 한 건당 처리에 걸리는 기간은 평균 42.12일이었다.

비실명화에 투입되는 인력도 적지 않다. 올해 기준 법원 직원 8명과 외부 용역 직원 102.9명 등 110명가량이 투입되고 있다. 외부 용역 인력은 2022년 76.2명에서 올해 처음 100명을 넘어섰다.

판결문은 법원이 어떤 사실관계를 인정하고 법률을 어떻게 해석하고 적용했는지를 보여주는 사법부의 핵심 공공데이터다. 충분히 공개돼야 국민이 재판 결과와 근거를 검증할 수 있고, 변호사와 기업도 기존 판례를 토대로 법적 위험과 분쟁 결과를 예측할 수 있다. 최근 법률 AI가 빠르게 확산하면서 판결문은 AI의 정확도를 좌우하는 핵심 학습 데이터로서 중요성도 커졌다.

하지만 국내에서는 개인정보 보호가 판결문 공개 확대의 현실적인 걸림돌로 꼽혀왔다. 판결문에는 당사자의 이름과 주소뿐 아니라 직장, 가족관계, 질병, 범죄 피해 사실 등 민감한 정보가 담긴다. 현행 민사·형사소송법도 판결서 공개 전 사건 관계인의 개인정보가 드러나지 않도록 보호조치를 하도록 규정하고 있다. 공개 대상을 늘릴수록 개인정보를 찾아 가리는 작업량도 함께 증가하는 구조다.

이재명 대통령이 지난 6월 하급심 판결문 공개 확대 필요성을 강조하면서 이 같은 '비실명화 병목'을 어떻게 해소할지도 사법부의 과제로 떠올랐다. 일선 법원에서는 판결문 제공 요청이 들어올 때 사람이 직접 문서를 읽으며 개인정보를 찾아 마스킹하고 있다.

한 지방법원 공보판사는 "판결문 한 건을 비실명 처리하는 작업 자체에는 통상 5~10분가량 걸린다"며 "사람이 직접 하다 보니 일부 정보가 덜 가려지는 경우도 있다"고 말했다.

AI는 0.3초 만에 개인정보 탐지


이 같은 한계를 AI로 풀려는 연구도 본격화하고 있다. 이재진 서울대 데이터사이언스대학원장이 이끄는 '초거대 AI 모델 및 플랫폼 최적화 센터' 연구팀은 판결문 속 직접·간접 식별정보를 상위 8개, 중간 43개, 세부 195개 범주로 분류해 탐지하는 비식별화 AI ‘썬더디아디플러스(Thunder-DeID+)’를 개발했다. 28개 사건 유형의 판결서 5872건을 학습에 활용했다.

핵심은 이름이나 주민등록번호처럼 명확한 개인정보만 찾는 데 그치지 않는다는 점이다. 직장, 사건 장소, 날짜 등 그 자체로는 개인정보가 아니더라도 다른 정보와 결합하면 개인을 특정할 수 있는 '간접 식별정보'까지 문맥을 토대로 찾아낸다.

특히 연구팀은 한국어 문법 특성을 반영해 개인정보가 시작하고 끝나는 지점을 정밀하게 구분하는 '경계 인식 토크나이저'를 개발했다. 이를 적용하자 개인정보와 주변 문자를 정확히 분리한 비율은 기존 70.8%에서 99.7%로 높아졌다. 약 4500자 분량 판결문 한 건에서 개인정보를 탐지하는 데 걸리는 시간은 0.1~0.3초 수준이다.

이름만 지워선 안 된다…남은 난제는 ‘재식별’

사진=게티이미지뱅크
사진=게티이미지뱅크
기술적으로 개인정보를 빠르게 찾아낼 수 있다고 해서 문제가 모두 해결되는 것은 아니다. 이름과 주민등록번호를 삭제하더라도 직업과 차량, 사건 장소, 날짜, 구체적인 사실관계 등을 조합하면 당사자를 알아낼 수 있는 '재식별' 위험이 남아서다.

김정민 법무법인 LKB평산 변호사는 "비실명화 기술의 성능 못지않게 누가 원본 데이터를 다루고 외부 유출 가능성을 어떻게 차단할지가 중요하다"며 "원본 데이터 접근 권한을 엄격히 제한하고 폐쇄형 샌드박스에서 처리하는 등 보안 장치를 갖춰야 한다"고 말했다.

해외에서는 판결문을 대규모로 축적·가공해 검색과 법률 분석에 활용하는 시스템이 일찍부터 자리 잡았다. 미국에서는 연방법원의 전자기록 공개 시스템 등을 통해 재판 기록에 접근할 수 있고 웨스트로·렉시스넥시스 등 민간 법률정보 사업자도 판례를 가공해 검색·분석 서비스를 제공한다. 영국 역시 주요 법원과 재판소의 판결을 공공 데이터베이스를 통해 제공한다. 판결문을 단순히 읽는 문서가 아니라 검색·분석할 수 있는 사법 데이터로 활용하는 생태계가 형성된 것이다.

서울고등법원의 한 부장판사는 "20여 년 전부터 미국의 웨스트로·렉시스넥시스처럼 민간이나 별도 재단이 판결문 데이터를 가공하는 방안이 거론돼왔다"며 "다만 판결문 원문처럼 민감한 데이터를 맡길 만큼 신뢰할 수 있는 외부 조직이 부족하다는 게 현실적인 한계"라고 말했다.

이에 판결문 원문을 외부에 넘기는 대신 비실명화 AI를 법원 내부에서 활용하는 방식이 대안으로 거론된다. 민감한 판결문 원문을 외부 업체에 넘기지 않고 법원 내부 시스템에서 AI가 개인정보를 먼저 찾아 가린 뒤 담당자가 결과를 확인하는 방식이다.

이 교수팀은 향후 행정 문서, 의료 데이터 등 여러 유형의 문서 비식별화 기술 개발에 나설 예정이다. 의료기록은 이름과 주민등록번호를 없애더라도 질환과 나이, 거주지역, 진료일, 검사 수치 등을 조합하면 환자를 특정할 가능성이 있어 업계에서는 판결문보다 더 강화된 비식별화 기술이 요구된다.

한 의료 데이터 활용 업계 관계자는 "의료 데이터는 의료영상, 음성, 심전도 등 정형 데이터뿐 아니라 환자가 의사에게 말로 설명한 비정형 데이터까지 포함된다"며 "과도하게 비식별화하면 활용 또한 위축될 수 있어 정교함이 요구된다"고 말했다.

김유진 기자 magiclamp@hankyung.com,
최영총 기자 youngchoi@hankyung.com