Kakao在COLM 2026发布MoE训练优化与轻量化研究
Kakao在COLM 2026主会与TokShop工作坊展示成果,论文提出以约1%训练成本预测MoE预训练最优学习率。
据aitimes.com报道,Kakao宣布在语言建模国际会议COLM 2026的主会及其分词工作坊TokShop上发布了研究成果。主会论文提出一种方法,可在约1%的总训练成本下预测大规模专家混合(MoE)模型预训练的最优学习率。Kakao将用于把小型模型的最优训练设置迁移至大型模型的mu-parameterization技术应用于MoE架构。
该方法被用于Kanaana-2.6-155b-a17b模型的预训练,使其在10万亿token规模下实现稳定训练。
TokShop发布BBT轻量化技术
在TokShop工作坊上,Kakao公开了名为BBT(BPE Guided Byte Transformer)的轻量化技术,该技术以字节作为更小的单元,取代现有BPE方法。对比实验显示,参数量减少20.2%至40.4%,性能提升2.7%至6.6%。
BBT在应对拼写错误和字符扰动方面也表现出更强的鲁棒性,并提升了向未见语言的迁移性能。Kakao预计,这将减轻端侧环境的内存负担,并在多语言及易出现拼写错误的输入环境中保证稳定性能。
快速问答
Kakao在COLM 2026上发布了什么研究成果?
Kakao在主会发布了预测大规模MoE模型预训练最优学习率的方法,并在TokShop工作坊公开了轻量化技术BBT。
BBT技术带来了哪些改进?
对比实验显示,BBT使参数量减少20.2%至40.4%,性能提升2.7%至6.6%,并提升了抗拼写错误鲁棒性和向未见语言的迁移性能。