学習によってモデルが構築され、推論ではそのモデルが使用されます。重みが固定されると、ネットワークは新しい入力を受け取り、ラベル、確率、生成された文などの出力を生成します。ここでは勾配の更新は行われません。
推論こそが、AIの経済性が顕著に表れる部分です。学習は一度だけ、場合によっては数週間かけて行われます。一方、推論は何百万回も行われ、多くの場合、ミリ秒単位の応答速度が求められます。チャットウィンドウやスマートフォンで応答が遅すぎるモデルは、どれほど精度が高くても役に立ちません。
一般的な推論設定
- オフライン処理のためのバッチ推論
- 対話型アプリケーション向けリアルタイム推論
- ローカルデバイスでのエッジ推論
- データセンターにおけるサーバー推論
最適化はスループットとレイテンシに焦点を当てています。量子化、枝刈り、専用ハードウェアはすべて推論パスを対象としています。同じモデルでも、提供方法によって動作が大きく異なる場合があります。
Comments
No comments yet. Be the first to share a thought.
Leave a comment