كاكاو تعرض أبحاثًا لتحسين تدريب نماذج MoE وتخفيف حجم النماذج في COLM 2026
كاكاو قدمت ورقة رئيسية تتنبأ بمعدل التعلم الأمثل لنماذج MoE بنحو 1% من تكلفة التدريب، وتقنية BBT لتقليل المعاملات بنسبة 20.2-40.4%.
أعلنت شركة كاكاو أنها عرضت نتائج أبحاثها في المؤتمر الرئيسي لمؤتمر النمذجة اللغوية الدولي COLM 2026، وفي ورشة العمل المتخصصة في الترميز TokShop، حسبما ذكر موقع aitimes.com.
وفي الورقة البحثية المقدمة في المؤتمر الرئيسي، اقترحت كاكاو منهجية تتنبأ بمعدل التعلم الأمثل للتدريب المسبق لنماذج Mixture-of-Experts (MoE) الضخمة، وذلك بنحو 1% من إجمالي تكلفة التدريب. وطبقت الشركة تقنية mu-parameterization، التي تنقل إعدادات التدريب المثلى من النماذج الصغيرة إلى النماذج الكبيرة، على معماريات MoE.
واستخدمت هذه المنهجية في التدريب المسبق لنموذج Kanaana-2.6-155b-a17b، مما أتاح تدريبًا مستقرًا على نطاق 10 تريليونات رمز (token).
وفي ورشة TokShop، كشفت كاكاو عن تقنية تخفيف الحجم المسماة BBT (BPE Guided Byte Transformer)، التي تعتمد على البايتات كوحدات أصغر بدلاً من طريقة BPE التقليدية. وأظهرت التجارب المقارنة انخفاضًا في عدد المعاملات بنسبة 20.2-40.4% وتحسنًا في الأداء بنسبة 2.7-6.6%.
كما أظهرت BBT متانة محسّنة تجاه الأخطاء المطبعية والتشوهات في المحارف، وأداء أفضل في النقل إلى لغات لم تُشاهد من قبل. وتتوقع كاكاو أن يسهم ذلك في تقليل عبء الذاكرة في بيئات الأجهزة المحمولة، وضمان أداء مستقر في البيئات متعددة اللغات والتي تكثر فيها الأخطاء المطبعية.
أسئلة سريعة
ما هو مؤتمر COLM 2026؟
هو المؤتمر الرئيسي لمؤتمر النمذجة اللغوية الدولي، حيث عرضت كاكاو نتائج أبحاثها في دورته لعام 2026.
ما هي تقنية BBT التي كشفت عنها كاكاو؟
هي تقنية تخفيف حجم النماذج (BPE Guided Byte Transformer) تستخدم البايتات كوحدات أصغر بدلاً من طريقة BPE التقليدية، وأظهرت التجارب انخفاض عدد المعاملات بنسبة 20.2-40.4% وتحسن الأداء بنسبة 2.7-6.6%.
ما هو نموذج Kanaana-2.6-155b-a17b؟
هو نموذج دربته كاكاو مسبقًا باستخدام منهجية التنبؤ بمعدل التعلم الأمثل، مما أتاح تدريبًا مستقرًا على نطاق 10 تريليونات رمز.