카카오, LLM 학습비 줄이고 모델은 가볍게…연구성과 공개

Photo Image
정신아 카카오 대표가 2024년 10월 22일 경기 용인시 카카오 AI 캠퍼스에서 열린 '이프 카카오(if kakao) AI 2024'에서 카카오의 인공지능(AI) 통합 브랜드 '카나나(Kanana)'에 대해 소개하고 있다. 〈자료 카카오〉

카카오가 고성능 언어모델 개발에 필요한 자원을 효율적으로 활용하기 위한 학습 최적화·모델 경량화 연구 성과를 공개했다.

카카오가 언어모델링 국제 학회 'COLM(Conference on Language Modeling) 2026'에서 대규모 전문가 혼합(MoE) 모델 학습 효율을 높이는 기술과 모델 크기를 줄이면서 성능을 개선하는 경량화 기술을 발표했다고 8일 밝혔다.

COLM은 거대언어모델(LLM)과 언어모델링 연구를 다루는 국제 학회로 2024년 신설됐다. 카카오는 이번 학회의 메인 컨퍼런스와 토크나이제이션(Tokenization) 워크숍 'TokShop'에서 각각 연구 성과를 발표했다.

메인 컨퍼런스에서 발표한 논문 'Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts'는 대규모 MoE 모델의 사전학습에 필요한 최적의 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 담았다.

학습률은 AI 모델이 학습할 때 내부 설정값인 매개변수를 얼마나 크게 조정할지 결정하는 값이다. 값이 너무 크면 학습이 불안정해지고, 너무 작으면 학습 속도가 느려질 수 있어 적절한 값을 찾는 것이 중요하다.

MoE 모델은 최근 고성능 LLM의 주요 구조로 활용되지만, 기존 밀집형 모델에 비해 학습 설정과 방법에 관한 공개 연구가 충분하지 않아 대규모 학습 과정에서 비용 부담과 시행착오가 발생할 수 있다.

카카오는 소규모 모델에서 찾은 최적 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화(μ-Parameterization)' 기법을 MoE 모델 구조에 맞게 적용했다. 모델 크기와 학습 토큰량을 단계적으로 확장하면서 최적 학습률을 탐색하고, 짧은 학습 구간에서 찾은 설정이 대규모 학습에서도 유효함을 검증했다.

이 방법론은 카카오의 'Kanana-2.6-155b-a17b' 모델 사전학습에도 적용돼 10조(10T) 토큰까지 안정적으로 학습하는 데 활용됐다.

토크나이제이션 워크숍 'TokShop'에서는 모델 크기를 줄이면서 성능을 높인 'BBT: BPE-Guided Byte Transformer'를 공개했다.

기존 '바이트 페어 인코딩(BPE·Byte Pair Encoding)' 기반 모델은 글을 읽고 답변을 생성하기 위해 단어나 단어 조각에 해당하는 정보를 저장한다. BBT는 이를 더 작은 기본 단위인 '바이트'를 활용하는 구조로 바꾸면서 여러 문자를 묶어 처리하는 기존 방식 장점을 유지했다.

BBT는 비교 실험에서 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 개선했다. 오탈자나 문자 교란에 대한 강건성을 확보했다. 학습하지 않은 언어로 전이 성능도 높였다.

카카오는 이를 통해 온디바이스 환경에서 AI 모델 메모리 부담을 줄일 것으로 기대했다. 다국어 입력이나 오탈자가 잦은 대화 환경에서도 안정적인 성능을 구현하는 데 활용될 전망이다.

카카오는 앞으로 모델 구조로 적용 범위를 넓히고 관련 기술을 고도화해 대규모 LLM의 학습 비용을 줄일 계획이다.

카카오 관계자는 “이번 연구들은 AI 모델의 성능을 유지하거나 향상시키면서도 학습과 운영 비용을 낮추는 실용적인 해법을 제시했다는 데 의의가 있다”면서 “앞으로 다양한 모델 구조와 멀티모달, 다국어 환경으로 연구를 확장해 실제 서비스 활용 가능성을 높이겠다”고 말했다.


변상근 기자 sgbyun@etnews.com

  • 놓치면 아쉬운 정보AD