[AI 세이프가드] ③ AI도 '스트레스 테스트' 한다……한국의 'AI 안전 시험장' 가보니

인공지능(AI) 경쟁의 기준이 모델의 성능만으로 결정되던 것에서 실제 서비스의 신뢰성과 안전성까지 검증하는 단계로 이동하고 있다. 한국에서도 'AI를 얼마나 잘 만드느냐'를 넘어 '얼마나 믿고 쓸 수 있게 만드느냐'를 둘러싼 경쟁이 시작됐다.

전자신문은 민간 AI 신뢰성 평가기업 셀렉트스타와 국가 차원의 AI 안전평가 체계를 구축하는 인공지능안전연구소를 찾았다. 기업이 실제로 사용하는 AI 서비스를 대상으로 맞춤형 평가와 레드티밍을 통해 취약점을 찾아내고, 국내외 최신 AI 모델의 사이버보안·국가안보·에이전트 자율행동 등 잠재적 위험 능력을 시험하는 현장에서 한국의 AI 안전·신뢰 생태계를 들여다봤다.

◇ 글 싣는 순서

① 틀린 답 넘어 제멋대로 행동하는 AI로…위험의 공식이 바뀌었다

② AI도 출시 전 '시험대' 오른다…싱가포르서 본 안전 산업의 최전선

③ 한국의 AI 안전망은 어디까지 왔나

④ “인류는 AI를 통제할 수 있는가”…글로벌 석학에게 묻다

⑤ 안전이 곧 AI 경쟁력…대한민국 '신뢰 생태계' 어떻게 만들까


Photo Image
경기 성남시 인공지능안전연구소에서 직원들이 모델 안전성 평가 플랫폼을 시연하고 있다.김민수기자 mskim@etnews.com

경기도 판교 인공지능안전연구소 AI안전평가실. 모니터에서 AI 안전성 평가 프레임워크를 띄우자 여러 AI 모델의 평가 결과가 한눈에 펼쳐졌다. 모델 하나를 선택하자 사이버보안과 국가안보, AI 에이전트 자율성부터 유해 콘텐츠, 차별·편향, 개인정보 유출까지 위험 유형별 결과가 그래프로 나타났다.

평가는 AI에게 단순히 위험한 질문을 던지고 답변을 보는 데 그치지 않는다. 코드에 숨어 있는 취약점을 얼마나 찾아낼 수 있는지 측정하고, 여러 차례 질문을 이어가며 안전장치가 제대로 작동하는지 살핀다. AI 에이전트 평가에서는 컴퓨터와 외부 도구를 활용해 과업을 수행하는 과정까지 평가 대상이 된다. 일종의 'AI 스트레스 테스트'다.

인공지능안전연구소는 새로운 AI가 등장했을 때 그 위험을 독립적으로 시험하고 검증할 수 있는 국가 차원의 평가 역량을 구축하고 있다. 국내에서 접근 가능한 주요 국내외 AI 모델을 대상으로 한다. 발생할 수 있는 다양한 위험 요소를 평가하고 이를 체계적으로 검증할 국가 차원의 평가 기반을 만드는 것이 연구소의 역할이다.

◇똑똑한 AI, 어디서 위험해지나…AI 능력 '양날의 검' 시험한다

예를 들어 사이버보안 평가라면 AI에 소프트웨어의 취약점을 찾아내고 재현하도록 한 뒤 얼마나 성공하는지를 측정한다. 여기서 일반적인 AI 성능평가와 안전평가의 차이가 드러난다. 취약점을 잘 찾는 AI는 개발자의 보안 업무를 돕는 유용한 도구다. 하지만 같은 능력을 공격자가 사용하면 소프트웨어를 공격하는 데 활용할 수도 있다.

일반적인 성능평가가 “AI가 무엇을 얼마나 잘할 수 있는가”를 측정한다면 안전평가는 “그 능력이 어떤 상황에서 위험으로 이어질 수 있는가”를 확인한다. 안전장치 우회를 시도하는 상황을 만들거나 여러 차례 대화를 통해 위험한 정보를 얻으려 하고, 높은 수준의 권한과 도구를 제공해 어디까지 가면 안전장치가 무너지는가를 시험한다.

평가 대상에는 화학·생물학·방사선·핵(CBRN) 등 국가안보와 관련된 영역도 포함된다. AI가 위험한 지식이나 작업을 어느 수준까지 수행할 수 있는지를 측정한다. 사이버보안과 마찬가지로 유용한 능력과 위험한 능력의 경계가 겹칠 수 있는 이중용도 영역이다.

시험 방식은 위험의 종류에 따라 달라진다. 유해 콘텐츠나 편향은 모델이 만들어낸 답변을 분석하고, 개인정보는 AI가 민감정보를 추론하거나 노출하는지 살핀다. 사이버보안은 격리된 실험환경에서 AI가 실제 취약점을 발견하거나 공격 단계를 수행할 수 있는지까지 시험한다.

Photo Image
경기 성남시 인공지능안전연구소에서 직원들이 모델 안전성 평가 플랫폼을 시연하고 있다.김민수기자 mskim@etnews.com

◇AI 에이전트에는 직접 도구 쥐여준다

기존 거대언어모델(LLM) 평가는 비교적 단순했다. AI에 질문을 입력하고 어떤 답변을 내놓는지를 평가하면 됐다. AI 에이전트는 다르다. 브라우저를 열고 파일을 읽으며 코드를 실행할 수 있다. 외부 시스템과 연결되면 실제 행동까지 한다.

안전평가의 대상도 말에서 행동으로 넓어지고 있다. 연구소는 통제된 평가환경에서 에이전트에 실제 도구와 과제를 제공하고 어떤 계획을 세웠는지, 어떤 도구를 호출했는지, 어떤 파일이나 정보에 접근했는지 등을 추적한다. 주어진 권한을 넘어선 행동을 하지는 않는지도 살핀다.

김용수 인공지능안전연구소 AI안전평가실 선임연구원은 “과거에는 한 차례 질문과 답변을 평가하는 방식이 중심이었다면 최근에는 여러 차례 대화를 거치는 멀티턴 평가로 발전하고 있다”며 “에이전트가 컴퓨터와 외부 도구까지 직접 사용하면서 평가 대상도 답변에서 실제 행동과 작업 과정으로 넓어지고 있다”고 설명했다.

앞으로는 평가 난이도가 더 높아질 것으로 전망된다. AI가 자신이 평가받고 있다는 사실을 인식해 평소와 다른 행동을 하거나, 감독 시스템이 자신의 행동을 파악하지 못하도록 하는 상황까지 고려해야 한다. 단순한 질의응답 시험을 넘어 실제와 유사한 환경과 권한을 주고 장시간 행동을 관찰하는 시나리오형 평가가 필요한 이유다.

◇영어로는 안전한 AI, 한국어로 물어도 안전할까

평가 방법을 만드는 것도 연구소의 주요 업무다. 글로벌 AI 안전평가 분야에서는 공개된 벤치마크가 폭넓게 활용되지만 문제가 있다. 새로운 AI의 성능이 빠르게 높아지면서 기존 시험문제를 손쉽게 풀어버리는 이른바 '벤치마크 포화'가 발생할 수 있다.

연구소는 공개 벤치마크를 활용하는 동시에 자체 평가 방법과 데이터도 개발하고 있다. 영국 AI안전연구소가 만든 오픈소스 평가 프레임워크 'Inspect'도 활용하고 있다.

반복되는 평가 작업을 자동화하기 위한 자체 프레임워크 개발도 진행 중이다. 한 모델의 평가를 수행하고 결과를 분석해 보고서까지 작성하는 데는 통상 일주일가량 걸리는데, AI 모델의 발전 속도가 빠르고 신규 출시 주기도 짧아지면서 평가 부담도 빠르게 커지고 있다. 평가 실행부터 결과 분석까지 걸리는 시간을 줄이기 위해 자체 평가 프레임워크에도 자동화 기능을 넣고 있다.

한국어와 한국 문화에 맞는 시험 방법도 필요한 부분이다. 해외에서 만들어진 안전성 벤치마크 상당수는 영어와 서구권 환경을 기반으로 하기 때문에 한국 사회에서 중요한 위험을 충분히 포착하지 못할 수 있기 때문이다.

김 연구원은 “영어에서 안전한 모델이라고 해서 반드시 한국어에서도 동일하게 안전하다고 볼 수는 없다”고 설명했다. 같은 의미라도 한국어의 은어나 우회 표현을 사용하면 안전장치가 다르게 작동할 수 있다는 얘기다. 편향과 가치 판단은 정치·사회·문화적 환경의 영향을 더욱 크게 받는다. 한국의 법·제도와 문화적 표현, 개인정보 유형 등을 반영한 자체 평가 데이터가 필요한 이유다.

Photo Image
김용수 한국전자통신연구원 인공지능안전연구소 선임연구원 공학박사김민수기자 mskim@etnews.com

◇'독파모'도 같은 시험대 오른다…한국만의 평가 역량 필요

국내 모델도 평가 대상이다. 가능하면 국내외 모델에 동일한 데이터와 평가기준을 적용한다. 국내 AI의 안전성을 확인하는 동시에 글로벌 프런티어 모델과 비교해 어느 정도 수준인지를 객관적으로 파악하기 위해서다.

정부가 추진하는 독자 AI 파운데이션 모델(독파모) 역시 안전·신뢰성 평가 대상에 포함돼 있다. 연구소는 국내 기업의 모델을 평가한 경험을 축적해왔고, 현재 독파모 평가에서도 안전·신뢰성 분야 평가에 참여하고 있다.

다만 한국의 AI 안전평가 역량은 아직 기반을 구축하는 단계다. 미국과 영국 등이 프런티어 AI 기업에 대한 접근성, 대규모 컴퓨팅 자원, 전문인력 등에 먼저 투자하면서 평가 연구와 인프라를 빠르게 축적한 것과 비교해 아직 부족한 부분이 많다.

김 연구원은 “현재 한국이 모든 분야에서 선도국들과 동일한 수준의 평가 인프라를 갖추고 있다고 보기는 어렵다”면서도 “안전평가 방법론 자체가 세계적으로 빠르게 변하고 있어 한국에도 기회가 있다”고 말했다. 그러면서 “한국어와 한국의 사회·문화적 맥락을 반영한 평가, 국내 AI 생태계와 연계된 시험 역량을 경쟁력으로 확보할 수 있다”고 강조했다.

궁극적인 목표는 새로운 AI가 등장할 때마다 모델의 안전성을 독립적이고 객관적으로 검증할 수 있는 국가적 역량을 갖추는 것이다. 사이버보안·AI 에이전트·국가안보 등 새로운 위험에 맞춰 평가법을 개발하고, 모델의 응답과 행동 로그, 평가조건과 결과를 체계적으로 축적한다. 해외 AI안전연구소와 평가방법과 결과를 공유하고 교차검증하는 국제협력도 확대한다.

김 연구원은 “AI 기술의 발전을 막는 것이 아니라 AI가 더 강력해지는 만큼 우리 사회가 그 능력을 안심하고 활용할 수 있도록 이를 시험하고 검증하는 역량도 함께 발전시키는 것이 궁극적인 방향”이라고 밝혔다.


정현정 기자 iam@etnews.com

  • 놓치면 아쉬운 정보AD