百科问答小站 logo
百科问答小站 font logo



学生网络用知识蒸馏损失去逼近教师网络,如何提高学生网络的准确率? 第1页

  

user avatar   qalian 网友的相关建议: 
      

校招面试的时候,经常碰到使用过“BERT蒸馏”的同学。我基本都会问一下:你觉得,在这一整套操作流程里,需要额外注意和控制的点在哪里?

或者换一种问法,也就是题主的问题:当你按照标准流程做了蒸馏,但是效果不理想,现在该怎么办?

我自己对于这个问题的体会如下,欢迎讨论:

  1. Better Teacher, Bert Student:想办法提升教师模型的效果,最简单粗暴的,比如多模型ensemble在一起;
  2. 不要放弃标注数据:只用soft-label,小模型大概率会跑偏,亲测有坑。训练教师模型的标注数据,一定一定要混在每一个batch里
  3. 隐层逼近不适合简单模型:进行隐层(中间层)的输出逼近,只适合同类模型,比如从12层BERT到4层BERT。千万不要在BERT往CNN迁移的时候,加入奇奇怪怪的学习目标;
  4. 蒸馏数据的质和量:说实话,如果标注数据足够多足够好,根本没有必要做蒸馏。蒸馏的本质就是借助表现能力更强的教师模型,来生成大量的伪数据(即soft-label)。关于数据,第一要义是保证数量(至少10万吧),第二要义是控制来源(蒸馏数据和测试用数据需要“同分布”),第三要义是标签均衡(教师模型输出的得分,从0.01~0.99都要有,比例相差不能悬殊);
  5. 参数控制:标准流程里的参数配置,并不一定适合你的应用场景。比如,引入Temperature因子是为了拉开教师模型输出分数的分布区间,但如果你的模型分布已经很散了,不用也未尝不可;
  6. 心理预期:实操中不要太指望,学生模型可以追平教师模型。心态佛系一点 ^___^



  

相关话题

  经过足够长的时间, AlphaGo 的棋谱能收敛到一张上吗? 
  2021 年了,TensorFlow 和 PyTorch 两个深度学习框架地位又有什么变化吗? 
  Yoshua Bengio为什么能跟Hinton、LeCun相提并论?? 
  Batch Normalization 训练的时候为什么不使用 moving statistics? 
  如何评价哈工大的左旺孟老师? 
  Github、Node、React、pytorch 等官网声明支援乌克兰,如何看待开源组织参与政治? 
  如何看待pytorch在主页写下帮助乌克兰进行人道主义援助? 
  卷积神经网络如果将池化层去除,与神经网络的区别还大么? 
  有人说「真正的人工智能至少还要几百年才能实现」,真的是这样吗? 
  在NLP上,CNN、RNN(认为LSTM等变体也是RNN)、最简单全连结MLP,三者相比,各有何优劣? 

前一个讨论
成年人正畸是什么感受?
下一个讨论
2021 年你拍过最特别的照片是什么?有什么故事?





© 2024-11-21 - tinynew.org. All Rights Reserved.
© 2024-11-21 - tinynew.org. 保留所有权利