来自Meta FAIR和华盛顿大学的研究团队发表论文《突破Token天花板:蒸馏出更小、更强的字节模型》,提出一种新思路:在知识蒸馏时把学习单位从词元(Token)换成字节(Byte),让学生模型直接从字节级别的概率分布学起。
传统蒸馏让学生学习教师在庞大Token词表上的概率分布。以Llama 3-8B为例,其词表包含128256个Token,每个预测位置对应十几万个候选概率。离线蒸馏若保存完整分布,存储成本极高,实际中通常只能保留概率最高的一部分,即top-k截断。而字节只有256种基础取值,即使加上少量特殊符号,每个位置需保存的概率也不过两百多个,完整分布更容易保留。
为让教师预测的Token与学生预测的字节对齐,团队提出Marginalize-It和End-Of-Token两种方案。前者对已结束的候选不再往后追,将剩余候选概率重新归一化,只需一次教师前向计算,效率高但属于近似;后者在每个Token末尾加入特殊符号,为“结束”本身提供明确预测位置,从而在保留Token边界的同时更完整地映射教师分布。两种方法都只需教师做一次前向计算。
在以Llama 3-8B为教师的蒸馏实验中,团队根据缩放定律预测:随着训练计算量增加,字节级蒸馏将反超Token级蒸馏,下游平均准确率上限高出4个百分点。学习的基本单位更小,模型最终能学到的能力上限却更高。
咨询
咨询