外部のAPIにデータを送れない現場では、生成AIを自社の環境で動かす必要があります。量子化とチューニングは、モデルを載せられる大きさに収め、その業務の言葉に合わせるための技術です。
高性能なモデルほど、大きく重い
機密情報を扱う企業では、「クラウドのAIサービスにデータを送れない」という制約が先に立ちます。自社の環境(オンプレミスやプライベートクラウド)でモデルを動かす場合、課題になるのはモデルの大きさです。
たとえば700億パラメータのモデルは、一般的な16ビットの形式で保存すると、重みだけで約140GBのメモリを必要とします(700億×2バイト)。これを動かすには複数の高価なGPUが必要になり、応答も遅くなります。
さらに、汎用のモデルは、貴社の業務で使われる専門用語、略語、文書の書き方を知りません。一方、モデル全体を追加学習し直す方法は、計算資源とコストの負担が大きく、現実的ではありません。
仕組み
量子化:モデルを小さく、速くする
量子化は、モデルの重みを表す数値の精度を、たとえば16ビットから4ビットへ下げて、モデルを小さく軽くする技術です。4ビットにすれば、重みのメモリは単純計算で4分の1になります。
- GPTQ(Frantar et al., 2023):学習済みモデルを後から量子化する手法です。1,750億パラメータのモデルを約4GPU時間で3〜4ビットに量子化し、精度の低下をわずかにとどめたまま、1枚のGPUで推論できることを示しました。
- AWQ(Lin et al., 2024):すべての重みが同じように重要なわけではないことに着目し、入力の分布から重要な重み(約1%)を見つけて保護することで、量子化による誤差を大きく減らします。
チューニング:業務の言葉に合わせる
- LoRA(Hu et al., 2022):モデル本体の重みは固定したまま、小さな追加の行列だけを学習する手法です。GPT-3(1,750億パラメータ)の全体を学習し直す場合と比べ、学習するパラメータ数を1万分の1に、GPUメモリを3分の1に減らし、推論時の遅延も増やしません。
- QLoRA(Dettmers et al., 2023):量子化したモデルにLoRAを組み合わせ、650億パラメータのモデルを、48GBのGPU 1枚で調整できるようにしました。
Technica AIは、これらを組み合わせて、次の流れで構成を決めます。
- 要件を決める:扱うデータ、利用者数、求める応答速度、使えるハードウェアを確認します。
- モデルを選ぶ:業務に必要な性能と、動かせる大きさのバランスから、候補となるモデルを選びます。
- 調整する:業務分野の文書や用語を使って、LoRAなどで調整します。
- 量子化する:量子化の方式とビット数を、精度と速度のバランスで決めます。
- 業務データで評価する:一般的なベンチマークではなく、貴社の実際の業務の質問で、精度と応答速度を評価します。
導入効果
-
データを外に出さずに使える
機密情報を自社の環境の中だけで処理できます。
-
必要なハードウェアを抑えられる
量子化によって、より少ないGPUでモデルを動かせます。
-
実用的な応答速度になる
軽くしたモデルで、業務で待たされない速度を目指せます。
-
業務の言葉が通じる
専門用語や社内の表現に合わせた応答ができるようになります。
適用にあたって
- 量子化のビット数を下げるほど、タスクによっては精度が下がることがあります。必ず業務データで評価してから採用します。
- 事実に関する知識(製品情報、規程など)は、チューニングでモデルに覚えさせるより、RAGで最新の文書を参照する方が更新しやすく安全です。チューニングは、用語や表現、出力の形式を合わせる目的で使うことを基本とします。
関連する製品
-
AIKNOW Security
機密ナレッジを安全にRAGで使うためのセキュリティ基盤。
-
AIKNOW
機密環境でも動く構成で提供するナレッジ基盤。
参考文献
- Frantar, E. et al. (2023). GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers. ICLR 2023. arXiv:2210.17323. https://arxiv.org/abs/2210.17323
- Lin, J. et al. (2024). AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration. MLSys 2024(Best Paper Award). arXiv:2306.00978. https://arxiv.org/abs/2306.00978
- Hu, E. J. et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022. arXiv:2106.09685. https://arxiv.org/abs/2106.09685
- Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. NeurIPS 2023. arXiv:2305.14314. https://arxiv.org/abs/2305.14314