Near 1-Bit Ultra-Low-Bit Quantization for Trillion-Scale LLMs
Research on efficient inference for trillion-scale language models at the Flexible Machine Learning Lab, with Samsung Electronics.
Status: Ongoing · Since: Jul 2026 · Lab: Flexible Machine Learning Lab, KAIST — advised by Prof. Insu Han, co-advised by Prof. Sukmin Yun (Hanyang Univ. ERICA)
An industrial collaboration with Samsung Electronics’ Device Solution Division on near-1-bit quantization schemes that keep trillion-scale foundation models usable under tight memory and latency budgets, without collapsing model quality.
Tags: Quantization · 1-bit · Fast Inference