NVIDIA/Model-Optimizer

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

[view on github]last commit: Jun 19, 2026
stars
2,952
7d
+39
30d
+226
90d
+741
## star history
## found in