LLMを本番で大量に使うと、推論コストが大きな課題になります。その解決策の一つとして「蒸留(知識蒸留)」が注目されています。LLM蒸留とは何か、どのようにコストを抑えるのか、他の圧縮手法との違い、実際の事例(DeepSeekなど)を交えて整理します。
LLM蒸留とは
LLM蒸留とは、大規模な教師モデルの知識や振る舞いをより小さな生徒モデルに移し、モデルサイズを圧縮して推論コストや処理遅延を抑制する手法のことである。
LLM蒸留(知識蒸留)の仕組み
知識蒸留は、大きな「教師モデル(Teacher)」の振る舞いを小さな「生徒モデル(Student)」に教える手法です。教師モデルが入力に対して出力する確率分布(ソフトラベル)や、推論過程(Chain-of-Thoughtなど)を活用して、生徒モデルを訓練します。
従来の教師あり学習では正解ラベルだけを使いますが、蒸留では教師の「自信の度合い」まで含めた豊富な情報を生徒に与える点が特徴です。これにより、生徒モデルは教師よりはるかに小さいパラメータ数でも、教師に近い振る舞いを再現しやすくなるとされます。
近年は単なる出力の模倣だけでなく、高度な推論パターンを蒸留する試みも進んでいます。
なぜコストを削減できるのか
推論は一度訓練したモデルを何度も呼び出すため、モデルサイズが小さくなると1回の処理に必要な計算量、メモリ、電力が減少します。結果として、クラウドAPI利用時のトークン単価相当コストを抑えたり、自社で運用する場合のGPU台数や消費電力を低減したりしやすくなります。
蒸留の訓練自体は教師モデルの出力生成にコストがかかりますが、一度良い生徒モデルができれば、それを長期間・大量に運用する場面で経済的メリットが出やすい構造です。実運用での遅延短縮も同時に期待できます。
量子化・プルーニングとの違い
モデルを小さくする主な手法には、蒸留の他に量子化とプルーニングがあります。
- 量子化:モデルの重みや活性化の数値精度(例: FP16→INT8/INT4)を下げる。モデル構造は基本的にそのまま。訓練後の後処理で適用しやすい。
- プルーニング:重要度の低い重みやニューロンを除去してモデルを疎にし、計算量を減らす。
- 蒸留:新しい小さな生徒モデルを「訓練」して教師の出力を再現する。構造を変えられるため、量子化やプルーニングとは異なるアプローチ。
実務ではこれらを組み合わせる例が多く見られます。例えば蒸留で小さなモデルを作った後、量子化を適用してさらに軽量化する、といった流れです。
モデル軽量化手法の比較
| 手法名 | アプローチ・仕組み | モデル構造の変化 |
|---|---|---|
| 蒸留(Distillation) | 教師モデルの出力・挙動を生徒モデルに訓練して再現させる。 | 新規の小さなアーキテクチャに変更される。 |
| 量子化(Quantization) | 重みや活性化の数値精度(ビット幅)を低減させる。 | モデル構造は基本的にそのままで精度のみ変更。 |
| プルーニング(Pruning) | 重要度の低い重みやニューロンを除去してモデルを疎にする。 | 元の構造から不要部分が削除・疎化される。 |
DeepSeekの蒸留事例
DeepSeekは2025年頃、大規模な推論特化モデルDeepSeek-R1(総パラメータ約671B、活性化パラメータ約37B程度のMoE構成とされる)から、複数の小型モデルへ知識を蒸留したシリーズを公開しました。
蒸留されたモデル群には、Qwen2.5ベースのDeepSeek-R1-Distill-Qwen-1.5B、7B、14B、32Bや、Llamaベースの8B、70Bなどが含まれます。教師モデルの高品質な推論データを用いてファインチューニングされており、数学やコーディングのベンチマークで、サイズの割に強い結果を示したと報告されています。
特に1.5B〜14Bクラスの小型モデルは、エッジや限られたリソース環境での利用を意識した展開例として注目を集めています。詳細は公式リポジトリやモデルカードで確認できます。
企業にとっての意味と活用の留意点
大量の推論を扱うサービス(カスタマーサポート、社内検索、コンテンツ生成など)では、モデルサイズの削減が直接的なコスト低減につながります。また、蒸留モデルをベースに自社データで追加学習することで、汎用大規模モデルに頼らずに済むケースも考えられます。
留意点として、蒸留の効果は教師モデルの質、蒸留データの質、タスクの性質に大きく依存します。すべてのタスクで同等の精度が維持できるわけではなく、特に高度な汎用性が求められる領域では限界があります。
実際の導入では、蒸留モデルと元の教師モデル(または別途選定したSLM/LLM)を並行して評価し、精度・遅延・コストのバランスを確認することが重要です。RAGなどの検索拡張手法と組み合わせることで、小型モデルでも実用性を高められる可能性もあります。
関連ガイド
小型モデルの全体像はSLM(小型言語モデル)とはもあわせてご覧ください。RAGによる外部知識の活用についてはRAG(検索拡張生成)とはを、オープンウェイトモデルの選択肢についてはオープンウェイトLLMとはを参照してください。用語集は半導体・AI用語集、ガイド一覧はこちらから。