
인공지능(AI)이 만들어낸 환각과 편향, 보안 취약점 등을 국민이 직접 찾아 제보하는 AI 안전 모니터링 체계가 가동된다. 전문가 중심의 AI 안전성 평가를 넘어 실제 생성형 AI 이용 과정에서 발생하는 위험 사례를 발굴하고 데이터로 축적하기 위한 시도다.
과학기술정보통신부 산하 인공지능안전연구소는 생성형 AI의 위험·오류 사례를 발굴하는 'AI 안전 지킴이'를 오는 27일까지 모집한다.
AI 안전 지킴이는 국민들이 생성형 AI 서비스를 이용 과정에서 발견한 잘못된 정보부터 편향·차별, 보안 취약점, 기술적 오류까지 다양한 사례를 직접 찾아 제보하는 참여형 프로젝트다.
생성형 AI와 AI 안전 분야에 관심이 있고 AI 답변의 오류나 위험 요소를 논리적으로 설명할 수 있는 국민을 대상으로 30명 내외 인원을 선발한다. 활동기간은 위촉일로부터 최대 1년으로 이 기간 중 약 30건의 제보를 수행하게 된다.
제보 대상은 크게 △사실 왜곡(환각) △편향·차별 △보안 취약점 △기술적 결함 등 4개 분야다.
환각 분야에서는 AI가 잘못된 사실·수치·날짜·인물 정보, 존재하지 않거나 확인되지 않은 정보를 사실처럼 생성하는 사례 등을 찾는다. 또 성별·연령·지역·직업·인종 등 특정 집단에 대한 고정관념, 비하 또는 불공정한 판단·표현 등 편향·차별 사례도 제보할 수 있다.
프롬프트 인젝션·탈옥 등을 통한 안전장치 우회할 수 있는 경우나 불법·위험 행위에 대한 구체적인 정보를 제공하는 경우, 개인정보·민감정보 노출 위험 등 보안 취약점도 제보 대상이다. AI 서비스가 정상적으로 응답하지 않거나 요구한 출력 형식과 다르게 답변하는 포맷 오류, 동일한 답변이나 동작이 계속 반복되는 루프 현상 같은 기술적 결함도 수집한다.
참여자는 사용한 AI 서비스와 AI에 입력한 질문·명령어, 생성된 전체 답변과 문제가 발생한 부분을 제출해야 한다. 문제라고 판단한 이유와 예상 위험도뿐 아니라 재현 방법과 발생 과정, 화면 캡처 등 증빙자료도 함께 제출한다. 다른 사람이 동일한 조건에서 사례를 확인할 수 있는 재현성이 요구된다.
국민이 제보한 사례는 3단계의 전문가 검증 과정을 거쳐 최종 확정된다. 전문 인력이 사례의 정확성과 위험도, 재현 가능성, 활용 가능성을 검토하고 확정 사례를 선정한다. 검증을 통과한 제보에는 건당 포인트가 지급되며 향후 현금으로 정산될 예정이다.
일반 국민들이 실제 사용 과정에서 발견한 위험을 향후 AI 위험 평가와 안전 가이드라인 마련, AI 서비스 안전성 개선 등에 활용할 수 있을지 주목된다.
업계 관계자는 “생성형 AI가 일상으로 확산되고 AI 에이전트가 실제 행동까지 수행하게 되면 기존 시험 환경만으로 모든 위험을 사전에 발견하기 어려워질 것”이라면서 “연구실이나 벤치마크를 통한 모델 평가와 더불어 다양한 이용자가 서비스를 사용하는 과정에서 발생하는 예상치 못한 위험과 오류를 찾아내는 활동이 의미가 있을 것”이라고 말했다.
정현정 기자 iam@etnews.com











