カカオ、COLM 2026とTokShopでAI研究2件を発表
カカオはMoEモデルの学習率予測手法と軽量化技術BBTをCOLM 2026とTokShopで発表した。BBTはパラメータ数を最大40.4%削減した。
カカオは、国際言語モデリング会議COLM 2026の本会議と、そのトークナイゼーション関連ワークショップTokShopにおいて、AI研究の成果を発表したと明らかにした。
本会議で発表された論文は、大規模Mixture-of-Experts(MoE)モデルの事前学習における最適な学習率を、総学習コストのおよそ1%で予測する手法を提案するもの。カカオは、小規模モデルの最適な学習設定を大規模モデルへ転用するmu-parameterization技術をMoEアーキテクチャに適用した。
この手法は、モデルKanaana-2.6-155b-a17bの事前学習に用いられ、10兆トークン規模での安定した学習を可能にしたという。aitimes.comが報じた。
TokShopでは、既存のBPE方式に代えてバイトをより小さな単位として扱う軽量化技術BBT(BPE Guided Byte Transformer)を公開した。比較実験では、パラメータ数が20.2〜40.4%削減され、性能は2.7〜6.6%向上した。
BBTはまた、誤字や文字の摂動に対する頑健性が高まり、未学習の言語への転移性能も改善した。カカオは、オンデバイス環境でのメモリ負担の軽減や、多言語・誤字の多い入力環境での安定した性能確保につながると期待を示している。
よくある質問
カカオが発表した2件の研究はどの会議で公開されましたか?
COLM 2026の本会議と、そのトークナイゼーションワークショップTokShopです。
BBTとはどのような技術ですか?
既存のBPE方式に代えてバイトをより小さな単位として扱う軽量化技術で、比較実験ではパラメータ数が20.2〜40.4%削減され、性能は2.7〜6.6%向上しました。