
빅테크 인공지능(AI) 기업의 통제를 벗어난 AI 에이전트가 외부 사이트나 시스템에 침투한 사실이 지속 확인되고 있다.
개인정보 유출 등 실제 피해로 이어진 사례는 아직 확인되지 않았지만, AI 에이전트가 스스로 인간 지시를 우회할 수단을 찾았다는 점에서 AI 통제 불능 문제를 드러낸 것으로 평가된다.
위키미디어재단은 5일(현지시간) 온라인 백과사전 '위키백과' 플랫폼에서 오픈AI 에이전트의 무단 활동을 확인했다고 발표했다. 앞서 지난 5월 플랫폼에서 발생한 일부 서비스 장애도 AI 에이전트가 위키백과 내용 수백만건을 가져가고 데이터 수십만건을 조회하는 과정에서 발생한 것으로 보고 있다.
재단은 AI 에이전트들이 백과사전 내용 무단 편집 등 백과사전 도구를 변경·탈취하려는 것으로 해석되는 행위까지 했다고 진단했다. 이어 AI 에이전트의 무단 접속 등에 따른 트래픽 급증으로 서버 비용과 인력 부담이 급증하고 있다며 AI기업의 책임 있는 자세를 촉구했다.
이번 사건뿐 아니라 인간 통제를 상실한 AI 에이전트의 사이버 침해는 몇 달째 지속 발견되고 있다.
오픈AI의 내부 사이버 보안 평가를 수행하던 에이전트들이 대표적이다. 격리된 시험환경을 벗어나 글로벌 오픈소스 AI 플랫폼 허깅페이스 인프라에 침투한 사실이 먼저 알려졌다. 호주 정부의 메디케어 통계 시스템과 빅토리아주 보건당국 등 공공 시스템에 비정상적으로 접근한 사실도 드러났다.
자국 정부 사이트에 대한 침해 시도도 나타났다. 미국 증권거래위원회(SEC)와 인구조사국·교육부 웹사이트에 침투를 시도했지만 시스템 변조나 취약점 악용 등 문제는 아직 발견되지 않았다.
구글과 앤트로픽 AI 에이전트도 통제를 잃은 경우 비슷한 행태를 보였다. 구글 에이전트는 보안평가 업체 이레귤러의 사이버 보안 시험 과정에서 실수로 인터넷 연결이 허용되자 외부 기업 3곳 시스템에 접근했다. 가상의 표적을 공격하는 시험이었지만 같은 이름을 가진 실제 기업을 찾아 접속한 것이다.
앤트로픽 내부 연구 모델은 사이버 보안 테스트 중 의도치 않은 인터넷에 연결되면서 외부 기업 3곳의 시스템에 무단 접근했다. 지난 1월 공개를 앞두고 사이버 보안 테스트 중이던 '클로드 오퍼스 4.6'까지 포함하면 총 4건의 사례가 발견됐다. 메타도 사이버 보안 테스트 관련 1건의 사례가 확인됐다.
빅테크 기업들은 이같은 침해 사실을 인정·보고하면서도 예기치 않은 인터넷 연결 등 평가 환경상의 문제였다고 일축하고 있다. AI가 인터넷 환경에 있다는 단서를 제대로 판단하지 못한 편향된 추론과 목표 달성을 위해 위험을 감수하는 무모한 행동이 결합돼 문제를 일으켰다는 것이 이들 주장이다.
전문가들은 AI 에이전트에 대한 통제 상실이 순식간에 나타나기 때문에 사전에 대응해야 한다고 제언했다.
이원태 국가AI전략위원회 보안특별위원장은 “최근 에이전트 사고를 통해 강력한 능력에 많은 권한을 주고 약한 가드레일과 느린 인간 감독을 붙이면 AI가 경계를 넘는다는 게 확인됐다”며 “보안 단위가 에이전트 신원·권한·통신·로그·정지와 복구까지 포함하는 운영 프로세스 전반이 돼야 한다”고 강조했다.
김세엽 셀렉트스타 대표는 “에이전트를 업무 의사결정이나 채용·대출·보험 심사 등에 활용할 경우 정보 오류나 환각은 물론, 불공정 판단에 대한 부분도 통제돼야 한다”며 “개별 에이전트가 어떻게 행동하는지를 평가하는 방향으로 나아가야 한다”고 말했다.
박종진 기자 truth@etnews.com











