유재준 교수팀, 기존 벤치마크 문제점 밝혀
이를 개선한 새 벤치마크 제시

고양이에 코끼리 피부를 입히면 AI는 어떻게 인식할까.
유재준 울산과학기술원(UNIST) 인공지능대학원 교수팀이 인공지능(AI)의 사물 인식을 평가하는 기존 '큐 컨플릭트(Cue-conflict)' 방식의 구조적 문제점을 규명하고, 새 평가 기준으로 '리파인드 바이어스(REFINED-BIAS)'를 제시했다.
이 연구 결과는 '유럽 컴퓨터 비전 학회(ECCV2026)'에 제출된 전체 논문 1만473편 가운데 약 1.3%에 해당하는 스포트라이트(Spotlight) 논문으로 뽑혔다.
'큐 컨플릭트'는 AI가 사물을 알아볼 때 형상과 표면 질감 중 어느 쪽에 더 의존하는지를 평가하기 위해 2019년 독일 튀빙겐대 연구진이 제시한 벤치마크다. 벤치마크는 동일한 조건에서 비교 평가하기 위한 데이터와 채점 기준을 말한다. 고양이 몸에 코끼리 피부를 입힌 합성 이미지를 고양이라고 하면 형상에, 코끼리라고 하면 표면 질감에 의존한 것으로 평가한다.
당시 AI는 질감에 더 의존해 사물을 인식하는 것으로 나타났다. 이후 AI 모델은 형상 위주로 학습해야 한다는 주장이 나온 배경이다.
하지만 여전히 AI의 형상 선호도와 인식 성능의 관계를 놓고 엇갈린 연구 결과가 나오고 있다.
유 교수팀은 벤치마크 자체에 혼선의 원인을 있음을 밝혀냈다. 큐 컨플릭트의 평가 지표, 이미지 자체, 채점 범위에 결함이 있었다.
가장 큰 문제는 벤치마크가 '비율'만을 본다는 점이다. 100장 이미지에서 형상 의존 답을 8번, 질감 의존 답을 2번 고른 AI와 각각 형상 80번, 질감 20번을 고른 AI 모두 형상 선호도가 80%였다. 즉 AI가 형상을 잘 알아본 수치와 질감을 잘 못 알아봐서 상대적으로 형상 수치가 높아진 것을 구분하지 못했다.
큐 컨플릭트 합성 이미지 자체도 형상과 질감이 제대로 분리되지 않았거나, 둘 중 하나가 더 알아보기 쉽도록 편향돼 있었다.

제한적인 채점 범위도 채점 결과를 왜곡할 수 있다. 고양이 형상에 코끼리 질감을 입힌 이미지를 보고 AI가 '여우'를 1순위, '고양이'를 2순위로 꼽았을 때 '여우'가 평가 대상에 없으면 고양이 형상을 알아본 것으로 평가되는 식이다.
유 교수팀이 제시한 리파인드 바이어스는 형상과 질감을 각각 얼마나 잘 알아보는지 '점수'로 나타내는 벤치마크다. 평가 이미지 또한 시계·모래시계처럼 형상이 뚜렷한 사물 10종과 얼룩말·벌집처럼 질감이 뚜렷한 사물 10종을 골라 총 6000장으로 구성했다. 형상 평가용은 배경과 표면 무늬를 제거해 윤곽과 내부 구조를 남겼고, 질감 평가용은 표면 일부를 잘라 재배열해 전체 형상이 드러나지 않도록 했다. 채점 범위도 일부 후보가 아닌 AI가 선택할 수 있는 전체 답으로 넓혔다.
새 벤치마크로 테스트 한 결과, 고성능 AI 모델일수록 한쪽에 치우치지 않고 형상과 질감을 모두 적극적으로 활용하는 것으로 나타났다. 모델 성능을 가르는 것은 선호 방향이 아니라 두 정보를 쓰는 총량이었다.
유재준 교수는 “벤치마크는 AI의 성능을 평가하고 개발 방향을 제시하는 만큼, 제대로 된 평가 기준을 마련하는 것이 중요하다”며 “새로운 벤치마크는 AI의 형상과 질감 인식 능력을 정확히 평가해 모델 구조와 학습 방법 개선에 기여할 것”이라고 말했다.
울산=임동식기자 dslim@etnews.com











