[AI 세이프가드] ② AI도 출시 전 '안전검사'…AIDX가 키우는 싱가포르 제3자 검증 생태계

Photo Image
이판 지아 AIDX 창업자 겸 최고경영자(오른쪽 위)를 비롯한 임직원들이 AI 안전성 시험·검증 플랫폼과 평가 방법을 설명하고 있다.

“인공지능(AI) 모델이 안전하다고 해서 그 모델을 이용해 만든 서비스까지 안전한 것은 아닙니다.”

싱가포르 중심업무지구(CBD)에 위치한 AI 시험·검증 기업 AIDX 사무실. 이판 지아 AIDX 창업자 겸 최고경영자(CEO)가 자체 AI 평가 플랫폼에서 모델과 버전을 선택하자 위협적 콘텐츠, 문화적 편향, 개인정보 등 위험 영역별 시험 항목이 나타났다. 지아 CEO는 “시연용으로 약 1000개, 전체 데이터베이스에는 약 1만개의 테스트 케이스가 구축돼 있다”고 설명했다.

시험이 끝나면 AI가 어떤 위험에 취약한지가 성적표처럼 나타난다. 각 시험 결과를 1~5점으로 평가해 위험한 콘텐츠를 생성하면 낮은 점수를, 위험한 요구를 적절하게 거부하고 안전한 대안을 제시하면 높은 점수를 준다. 낮은 점수를 받은 문항을 클릭하면 왜 문제가 됐는지와 어떤 안전장치를 보완해야 하는지도 확인할 수 있다.

지아 CEO는 “개발자는 이 결과를 바탕으로 문제가 있는 부분을 조정해 모델을 더 안전하게 만들 수 있다”고 말했다. AIDX는 동일한 방식으로 서로 다른 모델이나 같은 모델의 버전별 안전성을 비교하는 리더보드도 운영한다.

Photo Image
이판 지아 AIDX 창업자 겸 최고경영자(CEO)

AIDX는 싱가포르에 기반을 둔 AI 위험 평가·관리 기업이다. 회사 이름의 DX도 진단(Diagnosis)에서 따왔다. AIDX가 하는 일은 AI를 실제 사용 환경에 투입하기 전 일종의 '안전검사'를 하는 것이다. 회사는 실제 산업 현장에서 사용하는 AI 애플리케이션을 대상으로 안전성·견고성·공정성·환각·개인정보·보안 등을 자동으로 시험한다.

지아 CEO는 “많은 사람이 파운데이션 모델이 안전하면 이를 활용한 서비스도 안전할 것이라고 생각하지만 안전한 모델이 곧 안전한 애플리케이션을 의미하지는 않는다”며 “산업과 사용 사례마다 안전의 정의가 달라진다”고 말했다.

예컨대 금융과 의료 AI가 다뤄야 할 위험은 서로 다르다. 같은 서비스에서도 의사가 사용하는 경우와 환자가 직접 사용하는 경우 필요한 안전 기준이 달라질 수 있다. 특정 주제에 답하지 않는 것이 일반적인 AI에서는 안전한 행동일 수 있지만, 해당 주제를 반드시 다뤄야 하는 전문 서비스라면 지나친 거부가 오히려 서비스의 기능을 훼손한다.

안전 점수가 높다고 무조건 좋은 AI인 것도 아니다. 실제 테스트에서는 머리를 깨끗하게 씻는 방법과 같은 정상적인 질문까지 위험하다고 판단해 답변을 거부하는 과잉 거부(over-refusal) 사례도 발견됐다.

지아 CEO는 “가장 안전한 애플리케이션은 아무 질문에도 답하지 않는 애플리케이션일 수 있지만 그렇게 되면 아무 기능도 할 수 없다”며 “안전성과 지능·유용성 사이에는 균형이 필요하다”고 말했다.

Photo Image
이판 지아 AIDX 창업자 겸 최고경영자(CEO)가 싱가포르에서 자체 AI 안전성 시험·검증 플랫폼을 시연하며 평가 방식을 설명하고 있다.

AI가 직접 행동하는 에이전트로 진화하면서 테스트 범위도 넓히고 있다. 일반 생성형 AI에서는 유해 콘텐츠 생성이나 환각, 편향 등이 주요 시험 대상이다. 반면 에이전트는 여기에 파일 삭제, 개인정보의 잘못된 전송, 잘못된 금융거래 등 실제 행동으로 이어지는 위험이 추가되기 때문이다.

AI 안전검사에도 AI가 투입된다. AIDX는 기업이 AI 안전성 평가를 자동으로 수행할 수 있도록 서비스형 소프트웨어(SaaS) 형태의 시험 플랫폼을 구축했다.

지아 CEO는 “과거에는 사람이 시험 문항을 만들고 응답도 사람이 평가했지만 AIDX는 AI를 이용해 다른 AI의 응답을 평가한다”고 말했다. 기업의 AI를 응용프로그램인터페이스(API)로 플랫폼에 연결하면 대량의 시험 문항을 자동으로 입력하고, AI가 응답을 분석해 위험 여부와 점수를 매긴다.

기업이 자체 AI 안전 정책과 우려하는 위험을 입력하면 이를 분석해 필요한 시험 항목을 만들고 테스트 케이스 생성부터 실행·평가까지 자동으로 수행한다. AIDX는 이를 통해 전체 시험에 걸리는 시간을 90% 이상 줄일 수 있다고 설명했다.

AIDX는 싱가포르 정부가 구축하는 AI 시험·검증 생태계의 민간 시험기관 중 하나로 '글로벌 AI 어슈어런스 샌드박스'에 참여해 독립적인 제3자 시험 역할을 한다. 싱가포르는 AI를 시험하는 기관 자체의 전문성을 인증하는 체계인 'AI TAP'도 구축하고 있다. AIDX는 AI TAP의 첫 평가 대상군으로 참여했다.

지아 CEO는 “AI는 일종의 블랙박스와 같다”며 “앞으로는 AI를 기존 소프트웨어처럼 정해진 규칙으로 관리하기보다 인간의 행동을 규율하듯 접근해야 할 수도 있다”고 말했다. 이어 “AI 기술이 발전할수록 새로운 위험이 나타나는 만큼 이를 찾아내기 위한 시험 방법도 계속 발전해야 한다”고 강조했다.

싱가포르=


정현정 기자 iam@etnews.com

  • 놓치면 아쉬운 정보AD