Reasoning & Operation · Model Quantization & Tuning

モデルの量子化とチューニング

機密環境でも、実用速度で動かす。

外部のAPIにデータを送れない現場では、生成AIを自社の環境で動かす必要があります。量子化とチューニングは、モデルを載せられる大きさに収め、その業務の言葉に合わせるための技術です。

Why It Matters

高性能なモデルほど、大きく重い

機密情報を扱う企業では、「クラウドのAIサービスにデータを送れない」という制約が先に立ちます。自社の環境(オンプレミスやプライベートクラウド)でモデルを動かす場合、課題になるのはモデルの大きさです。

たとえば700億パラメータのモデルは、一般的な16ビットの形式で保存すると、重みだけで約140GBのメモリを必要とします(700億×2バイト)。これを動かすには複数の高価なGPUが必要になり、応答も遅くなります。

さらに、汎用のモデルは、貴社の業務で使われる専門用語、略語、文書の書き方を知りません。一方、モデル全体を追加学習し直す方法は、計算資源とコストの負担が大きく、現実的ではありません。

How It Works

仕組み

量子化:モデルを小さく、速くする

量子化は、モデルの重みを表す数値の精度を、たとえば16ビットから4ビットへ下げて、モデルを小さく軽くする技術です。4ビットにすれば、重みのメモリは単純計算で4分の1になります。

700億パラメータのモデルの重みに必要なメモリの単純計算。16ビット形式では約140GB、4ビットに量子化すると約35GBになる。LoRAは、モデル本体の重みを固定したまま、小さな追加の行列だけを学習する。QUANTIZATION700億パラメータのモデル:重みのメモリ(単純計算)16ビット(FP16)約140GB4ビットに量子化約35GB(4分の1)LoRA本体は固定し、小さな追加の行列だけを学習するモデル本体の重み固定(学習しない)+追加の行列業務データで学習
量子化によるメモリの削減と、LoRAによる調整(概念図・単純計算)
  • GPTQ(Frantar et al., 2023):学習済みモデルを後から量子化する手法です。1,750億パラメータのモデルを約4GPU時間で3〜4ビットに量子化し、精度の低下をわずかにとどめたまま、1枚のGPUで推論できることを示しました。
  • AWQ(Lin et al., 2024):すべての重みが同じように重要なわけではないことに着目し、入力の分布から重要な重み(約1%)を見つけて保護することで、量子化による誤差を大きく減らします。

チューニング:業務の言葉に合わせる

  • LoRA(Hu et al., 2022):モデル本体の重みは固定したまま、小さな追加の行列だけを学習する手法です。GPT-3(1,750億パラメータ)の全体を学習し直す場合と比べ、学習するパラメータ数を1万分の1に、GPUメモリを3分の1に減らし、推論時の遅延も増やしません。
  • QLoRA(Dettmers et al., 2023):量子化したモデルにLoRAを組み合わせ、650億パラメータのモデルを、48GBのGPU 1枚で調整できるようにしました。

Technica AIは、これらを組み合わせて、次の流れで構成を決めます。

  1. 要件を決める:扱うデータ、利用者数、求める応答速度、使えるハードウェアを確認します。
  2. モデルを選ぶ:業務に必要な性能と、動かせる大きさのバランスから、候補となるモデルを選びます。
  3. 調整する:業務分野の文書や用語を使って、LoRAなどで調整します。
  4. 量子化する:量子化の方式とビット数を、精度と速度のバランスで決めます。
  5. 業務データで評価する:一般的なベンチマークではなく、貴社の実際の業務の質問で、精度と応答速度を評価します。
Benefits

導入効果

  • データを外に出さずに使える

    機密情報を自社の環境の中だけで処理できます。

  • 必要なハードウェアを抑えられる

    量子化によって、より少ないGPUでモデルを動かせます。

  • 実用的な応答速度になる

    軽くしたモデルで、業務で待たされない速度を目指せます。

  • 業務の言葉が通じる

    専門用語や社内の表現に合わせた応答ができるようになります。

Considerations

適用にあたって

  • 量子化のビット数を下げるほど、タスクによっては精度が下がることがあります。必ず業務データで評価してから採用します。
  • 事実に関する知識(製品情報、規程など)は、チューニングでモデルに覚えさせるより、RAGで最新の文書を参照する方が更新しやすく安全です。チューニングは、用語や表現、出力の形式を合わせる目的で使うことを基本とします。
Related Products

関連する製品

  • AIKNOW Security

    機密ナレッジを安全にRAGで使うためのセキュリティ基盤。

  • AIKNOW

    機密環境でも動く構成で提供するナレッジ基盤。

References

参考文献

  • Frantar, E. et al. (2023). GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers. ICLR 2023. arXiv:2210.17323. https://arxiv.org/abs/2210.17323
  • Lin, J. et al. (2024). AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration. MLSys 2024(Best Paper Award). arXiv:2306.00978. https://arxiv.org/abs/2306.00978
  • Hu, E. J. et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022. arXiv:2106.09685. https://arxiv.org/abs/2106.09685
  • Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. NeurIPS 2023. arXiv:2305.14314. https://arxiv.org/abs/2305.14314
知識の使い方 モデルの量子化とチューニング
技術一覧へ
Let's Talk

技術の詳細について、
エンジニアが直接お答えします。

評価用の検証環境、ベンチマークの条件、オンプレミス構成の要件。
導入前に確認したい技術的な論点があれば、ご相談ください。