📄 quantization.md

← Vault

Quantization Guide

Contents

Testing strategy:

1. Baseline: Measure FP16 accuracy on your evaluation set

2. Quantize: Create quantized version

3. Evaluate: Compare quantized vs baseline on same tasks

4. Decide: Accept if degradation < threshold (typically 1-2%)

Example evaluation:

`python

from evaluate import load_evaluation_suite

Run on FP16 baseline

baseline_score = evaluate(model_fp16, eval_suite)

Run on quantized

quant_score = evaluate(model_awq, eval_suite)

Compare

degradation = (baseline_score - quant_score) / baseline_score * 100

print(f"Accuracy degradation: {degradation:.2f}%")

Decision

if degradation < 1.0:

print("✅ Quantization acceptable for production")

else:

print("⚠️ Review accuracy loss")

`