霧のかかった丘を下っていく様子を想像してみてください。足元の傾斜を感じながら、下り坂の方向に一歩ずつ進んでいきます。勾配降下法は、損失関数を用いてこれと同じことを行います。傾斜を計算し、一歩ずつ進み、損失が改善されなくなるまでこれを繰り返します。
学習率はステップサイズを制御します。大きすぎると最小値を超えてしまい、小さすぎると学習に時間がかかりすぎます。Momentum、Adamなどの最適化アルゴリズムは、学習中に学習率を調整して収束を速めます。
一般的な変異体
- 全データを使用したバッチ勾配降下法
- 1サンプルを用いた確率的勾配降下法
- 小グループを用いたミニバッチ勾配降下法
- モメンタムやアダムのような適応型手法
非凸な損失曲面は、解決への道のりを困難にする。鞍点、局所的最小値、プラトーはすべて解決の進行を遅らせる。実際には、確率的手法は浅い罠を回避し、大域的最適性の保証がなくても良好な解を見つけることができる。
Comments
No comments yet. Be the first to share a thought.
Leave a comment