AI

카카오, COLM 2026서 MoE 학습 최적화·경량화 연구 발표

카카오가 COLM 2026 본회의와 TokShop 워크숍에서 MoE 사전학습 최적 학습률 예측 기법과 경량화 기술 BBT를 공개했다.

카카오가 국제 언어모델 학회 COLM 2026 본회의와 토크나이제이션 워크숍 TokShop에서 연구 결과를 발표했다고 aitimes.com이 보도했다.

본회의 논문은 대규모 전문가혼합(MoE) 모델의 사전학습에 필요한 최적 학습률을 전체 학습 비용의 약 1% 수준에서 예측하는 방법론을 제안한다. 카카오는 소규모 모델의 최적 학습 설정을 대규모 모델로 이전하는 mu-파라미터화 기법을 MoE 구조에 적용했다.

이 방법론은 Kanaana-2.6-155b-a17b 모델의 사전학습에 사용돼 10조 토큰 규모에서 안정적인 학습을 가능하게 했다.

TokShop서 공개한 BBT

TokShop에서는 기존 BPE 방식 대신 바이트를 더 작은 단위로 사용하는 경량화 기술 BBT(BPE Guided Byte Transformer)를 공개했다. 비교 실험에서 파라미터 수는 20.2~40.4% 줄고 성능은 2.7~6.6% 향상된 것으로 나타났다.

BBT는 오타와 문자 변형에 대한 견고성도 개선됐으며, 학습하지 않은 언어로의 전이 성능도 더 나은 것으로 확인됐다. 카카오는 이 기술이 온디바이스 환경의 메모리 부담을 줄이고 다국어·오타 입력 환경에서 안정적인 성능을 확보하는 데 기여할 것으로 기대했다.

한눈에 보기

카카오가 COLM 2026에서 발표한 내용은 무엇인가?

MoE 모델 사전학습의 최적 학습률을 전체 학습 비용의 약 1% 수준에서 예측하는 방법론과, TokShop에서 공개한 경량화 기술 BBT(BPE Guided Byte Transformer)다.

BBT의 성능 개선 폭은?

비교 실험에서 파라미터 수가 20.2~40.4% 줄고 성능은 2.7~6.6% 향상됐다.

이 방법론이 적용된 모델은?

Kanaana-2.6-155b-a17b 모델 사전학습에 적용돼 10조 토큰 규모에서 안정적인 학습을 가능하게 했다.

출처