权重需要学习。超参数需要选择。学习率、批大小、层数、dropout率和正则化强度都属于这一范畴。它们控制着训练过程和模型的结构。
错误的参数设置会浪费时间和计算资源。学习率过高会导致算法发散,过低则会导致算法运行缓慢。批大小会影响梯度噪声和内存使用情况。深度和宽度决定了模型的容量,而容量必须与任务的复杂度和数据规模相匹配。
常用调音方法
- 在固定集上进行网格搜索
- 随机搜索以获得更多报道
- 贝叶斯优化以提高效率
- 基于人口的培训
- 凭直觉进行手动调校
调优成本很高。每种配置都需要完整的训练运行,而且搜索空间会迅速增长。经验丰富的从业者会在自动化之前利用领域知识缩小搜索范围,这通常比蛮力搜索更有效。
Comments (2)
Leave a comment