Kakao dévoile ses recherches sur l'entraînement des modèles MoE à COLM 2026
Kakao a présenté à COLM 2026 une méthode prédisant le taux d'apprentissage optimal des modèles MoE pour environ 1 % du coût d'entraînement total.
Kakao a annoncé avoir présenté ses travaux de recherche lors de la conférence principale COLM 2026 ainsi qu'à TokShop, l'atelier consacré à la tokenisation organisé dans ce cadre, selon aitimes.com.
L'article présenté à la conférence principale propose une méthodologie capable de prédire le taux d'apprentissage optimal pour le pré-entraînement de grands modèles Mixture-of-Experts (MoE), pour environ 1 % du coût d'entraînement total. Kakao a appliqué à des architectures MoE une technique de mu-paramétrage, qui transfère les réglages d'entraînement optimaux de petits modèles vers de plus grands modèles.
Cette méthodologie a été employée pour le pré-entraînement du modèle Kanaana-2.6-155b-a17b, afin de stabiliser l'entraînement à une échelle de 10 000 milliards de tokens.
À TokShop, Kakao a dévoilé BBT (BPE Guided Byte Transformer), une technologie d'allègement qui recourt aux octets comme unités plus petites, en remplacement de la méthode BPE existante.
Les expériences comparatives font état d'une réduction du nombre de paramètres de 20,2 à 40,4 % et d'une amélioration des performances de 2,7 à 6,6 %. BBT a également montré une meilleure robustesse face aux fautes de frappe et aux perturbations de caractères, ainsi que de meilleures performances de transfert vers des langues non vues.
Kakao s'attend à ce que ces travaux réduisent la charge mémoire dans les environnements embarqués et garantissent des performances stables dans les contextes multilingues et exposés aux fautes de frappe.
En bref
Qu'a présenté Kakao à COLM 2026 ?
Kakao a présenté une méthodologie qui prédit le taux d'apprentissage optimal pour le pré-entraînement de grands modèles MoE, pour environ 1 % du coût d'entraînement total.
Qu'est-ce que BBT ?
BBT (BPE Guided Byte Transformer) est une technologie d'allègement qui utilise les octets comme unités plus petites au lieu de la méthode BPE existante.
Quels résultats ont été obtenus avec BBT ?
Les expériences comparatives montrent une réduction du nombre de paramètres de 20,2 à 40,4 % et une amélioration des performances de 2,7 à 6,6 %, avec une meilleure robustesse face aux fautes de frappe et aux perturbations de caractères.