生成AIといえば大規模言語モデル(LLM)を思い浮かべる人が多いでしょう。一方で、近年は「小型言語モデル(SLM)」が企業ユースで注目を集めています。SLMとは何で、LLMとどう違うのか。コストや速度、精度、プライバシーの観点から取捨選択のポイントを整理し、エッジ展開や企業での使いどころを解説します。
SLM(小型言語モデル)とは
SLM(Small Language Model)は、一般的にはパラメータ数が数百万〜十数億程度の言語モデルを指す総称です。明確な閾値はなく、目安として7B(70億)前後やそれ以下をSLMと位置づける事例が多く見られます。一方、LLMは数十億〜数百億以上、時には1兆パラメータ規模のモデルを指すのが通例です。
サイズが小さいことで、必要な計算資源やメモリが少なく、単一のGPUやCPU、NPU、さらにはスマートフォンや産業機器などのエッジ環境でも動作しやすくなるとされます。すべての用途でLLMに劣るわけではなく、特定のタスクに特化した場合に実用的な性能を発揮するケースが増えています。
LLMとの違い — コスト・速度・精度・プライバシー
企業がモデルを選ぶ際の主な比較軸は以下の4点です。数字はモデル・ハードウェア・量子化の有無によって大きく変わるため、目安として捉えてください。
| 項目 | SLMの傾向 | LLMの傾向 |
|---|---|---|
| コスト | 推論あたりの計算量が少なく、クラウド費用や自社GPU台数を抑えやすいとされる | 高性能だが、大量利用時の費用が大きくなりやすい |
| 速度・遅延 | 単一デバイス上で応答が速く、低遅延が期待しやすい | 並列処理でスループットは高いが、単一クエリの遅延は大きくなりがち |
| 精度・能力 | 特定タスクでは良好な結果を出す事例あり。一方、幅広い汎用タスクではLLMに劣る場合が多い | 世界知識・複雑推論・多様な指示追従で優位性が出やすい |
| プライバシー | オンデバイスで動作しやすく、データを外部送信せずに済むケースがある | クラウドAPI利用時はデータ送信が発生。オンプレミスでも大規模な自社基盤が必要 |
重要なのは「どちらが優れているか」ではなく、用途・ボリューム・制約条件によって適した選択が変わることです。
端側・エッジ展開のポイント
SLMの強みのひとつは、エッジや端側(デバイス側)での動作しやすさです。ノートPCやスマートフォン、工場のエッジサーバー、ブラウザ内など、クラウドに常時接続できない・遅延を許容できない場面で使われます。
4ビット量子化などの手法を組み合わせることで、メモリ使用量を数GB程度まで抑えられる事例が報告されています。これにより、既存のPCや産業機器への組み込みが現実的になります。また、通信コストやクラウド依存を減らせる点も企業にとっては利点です。
一方で、コンテキスト長や知識の広さ、複雑な多段階推論が必要な場面では限界があるため、用途を絞った設計が求められます。
代表例 — PhiシリーズとGemmaシリーズ
MicrosoftのPhiシリーズは、Phi-3-miniで3.8Bパラメータながら、合成データと高品質な学習データを活用して小型で高い性能を狙ったモデルです。Phi-3.5やPhi-4でも小型ながら特定ベンチマークで良好な結果が報告されています。
GoogleのGemmaシリーズは、Geminiの研究成果を基にした軽量オープンウェイトモデルで、2Bや7Bなどの小型版が提供されてきました。後続のGemma 2やGemma 3でも小型構成が用意されており、モバイルやローカル環境を意識した最適化が進められています。
これらのモデルはオープンウェイトで公開されるものが多く、オープンウェイトLLMの文脈でも取り上げられます。自社環境でダウンロード・ファインチューニング・量子化して利用しやすい点が企業での採用を後押ししています。
企業での使いどころ — 選定の視点
SLMを検討する典型的な場面は以下のとおりです。
- 大量の定型的な問い合わせや分類・要約タスクで、総コストを抑えたい
- 応答遅延を短くしたい(カスタマーサポートのチャット、社内ツールなど)
- 機密情報や個人情報を外部クラウドに送信したくない(規制業種・製造業など)
- 現場・工場・店舗などのエッジ環境でオフラインまたは低遅延で動作させたい
逆に、極めて複雑な推論や広範な知識が必要なケースでは、LLM単独またはSLM+LLMのハイブリッド構成(RAGとの組み合わせ含む)が適する可能性があります。選定では、実際のデータとワークロードでPoCを行い、精度・レイテンシ・総所有コスト(TCO)を測定することが推奨されます。
関連ツール
SLMの実行や微調整に役立つ主要なOSSの客観的な健全性データ(活発さや最新リリース状況)を確認できます。
- transformers(モデルの読み込みと実行)
- vllm(軽量モデルも高速に動かせる推論エンジン)
関連ガイド
オープンウェイトモデルの選び方はオープンウェイトLLMとは — Llama・Qwen・DeepSeek・Gemma の違いも参考にしてください。用語の整理は半導体・AI用語集が便利です。知識を外部から効率的に補う手法についてはRAG(検索拡張生成)とは、LLMのサイズを小さくする別のアプローチはLLM蒸留(知識蒸留)とはをご覧ください。ガイド一覧はこちらから。