權重需要學習。超參數需要選擇。學習率、批次大小、層數、dropout率和正規化強度都屬於此範疇。它們控制著訓練過程和模型的結構。
錯誤的參數設定會浪費時間和計算資源。學習率過高會導致演算法發散,過低則會導致演算法運作緩慢。批次大小會影響梯度雜訊和記憶體使用情況。深度和寬度決定了模型的容量,而容量必須與任務的複雜度和資料規模相符。
常用調音方法
- 在固定集上進行網格搜索
- 隨機搜尋以獲得更多報道
- 貝葉斯優化以提高效率
- 基於人口的培訓
- 憑直覺進行手動調校
調優成本很高。每種配置都需要完整的訓練運行,而且搜尋空間會迅速成長。經驗豐富的從業者會在自動化之前利用領域知識縮小搜尋範圍,這通常比蠻力搜尋更有效。
Comments (2)
Leave a comment