SheepNav
新上线10天前0 投票

加速视觉在线策略蒸馏:批量推测雅可比回放技术

视觉自回归模型的训练常依赖在线策略蒸馏(OPD),即让学生模型从自身生成的轨迹中学习,以提升其性能。然而,传统的自回归解码逐token生成,导致每次在线训练步骤的开销巨大。最新研究提出了一种名为HB-SJD的批量推测雅可比解码后端,旨在显著加速这一过程,同时保持生成质量。

背景:在线策略蒸馏的瓶颈

在线策略蒸馏通过让学生模型在训练过程中不断生成新数据,再基于这些数据优化自身,实现更高效的模型压缩。但问题在于,学生模型的每次前向传播只能生成一个token,这种序列化的解码方式使得整个训练过程耗时严重。尽管已有推测解码等方法尝试并行生成,但它们通常依赖于额外的草稿模型,增加了系统的复杂性。

HB-SJD:无需辅助模型的并行解码

HB-SJD基于推测雅可比解码(SJD),它利用雅可比迭代的原理,允许在不借助辅助模型的情况下并行处理多个token。HB-SJD将其扩展至批量场景,支持多个图像样本同时解码,每个图像根据其自身的生成进度独立推进,同时在不同序列位置进行批量验证。当某个图像完成生成后,HB-SJD会自动切换至更紧凑的执行模式,以降低后续迭代的计算成本。

实验验证与优势

在LlamaGen模型上的实验表明,HB-SJD显著减少了回放生成和端到端训练的时间,同时保持了蒸馏后学生模型的生成质量。该方法仅替换了学生模型的回放后端,不改变教师模型、蒸馏目标或优化过程,因此可以轻松集成到现有的OPD流程中。

意义与展望

HB-SJD为视觉自回归模型的高效训练提供了新思路,尤其适用于对实时性要求较高的应用场景。未来,该技术有望进一步扩展到其他模态或更复杂的模型结构,推动AI模型压缩与部署的实用化进程。

延伸阅读

  1. 马斯克加速燃气轮机生产的新路径,却伴随污染争议
  2. 德州州长冻结Flock AI监控摄像头资金,反监控浪潮席卷全美
  3. Caterpillar:从自动化采矿到AI部署,经验如何迁移?
查看原文