LLM Compression via Quantization and Pruning
Papers on reducing model size and computational cost through quantization (including low-bit formats like 4-bit), pruning, and second-order optimization methods like Kronecker-factored Hessians applied to large language models.
quantizationpruningactivationblockskroneckerfactoredhessiangptqsae
Papers
9
Last 4 weeks
9
New topic
—