快讯 23:46Anthropic 拟登陆纳斯达克,连续两季盈利目标估值 2 万亿美元23:06英伟达联手 Perplexity:本地智能体 Portable Computer 登陆 Windows RTX PC23:05X与SpaceXAI撤回对苹果反垄断诉讼,继续追责OpenAI 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期二 · 09-15 14:37 约 2 分钟读完

Meta与华盛顿大学提出字节级蒸馏新路径,预测准确率上限较Token蒸馏高出4个百分点

摘要

Meta FAIR与华盛顿大学联合论文提出字节级蒸馏方法End-Of-Token,将教师模型的Token概率分布转换为字节级别,在Llama 3-8B蒸馏实验中预测下游平均准确率上限达52.4%,比传统Token蒸馏高4个百分点,同时可降低数据与存储需求。

Meta与华盛顿大学提出字节级蒸馏新路径,预测准确率上限较Token蒸馏高出4个百分点
图片来源:量子位

蒸馏技术已成为压缩大模型的主流手段,但学生模型的学习单位长期局限于Token。近日,Meta FAIR与华盛顿大学联合发表论文《突破Token天花板:蒸馏出更小、更强的字节模型》,提出将蒸馏的学习单位从Token切换为字节,让学生模型直接学习字节级别的概率分布。

研究团队面临的核心技术难点在于:教师模型预测的是Token概率,学生模型预测的是单个字节,两者需要对齐。为此,论文提出Marginalize-It和End-Of-Token两种方案。前者将已结束候选的概率重新归一化,仅需一次教师前向计算但会丢失部分信息;后者在每个Token末尾加入特殊结束符号,使不同长度Token的概率都能映射到字节空间,更完整地保留教师分布。

实验以Llama 3-8B为教师,三类学生Transformer层参数量均为约12.8亿。团队逐步增加训练数据和计算量,在选择题问答、语言生成和机器翻译三类任务中完成八项评测。通过拟合训练计算量、BPB与下游成绩的关系,团队预测三种蒸馏方案的平均准确率上限分别为:Token蒸馏48.4%、Marginalize-It蒸馏50.5%、End-Of-Token蒸馏52.4%。End-Of-Token比传统Token蒸馏高出4个百分点,是六种方案中预测上限最高的。

字节级蒸馏还带来存储与数据效率的改善。论文预测,在相同计算预算下,End-Of-Token处理的实际文本量约为Token方案的六分之一;在Token仅保存top-600、字节保存完整分布的设置下,存储量约为五分之一。但研究同时指出,End-Of-Token因加入结束符号,处理相同文本量时训练计算量比普通字节模型高约30.94%,且论文尚未完成等推理成本下的公平比较。

该工作展示了一条小模型训练的新路径:以更小的预测空间和更少的训练文本,争取更高的能力上限。End-Of-Token在外推实验中表现最优,但兑现潜力仍需持续投入计算资源。

模型蒸馏字节模型Meta FAIRScaling Law
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
41
企业落地案例
4
完整版提示词