Near 1-Bit Ultra-Low-Bit Quantization for Trillion-Scale LLMs

Research on efficient inference for trillion-scale language models at the Flexible Machine Learning Lab, with Samsung Electronics.

Status: Ongoing · Since: Jul 2026 · Lab: Flexible Machine Learning Lab, KAIST — advised by Prof. Insu Han, co-advised by Prof. Sukmin Yun (Hanyang Univ. ERICA)

An industrial collaboration with Samsung Electronics’ Device Solution Division on near-1-bit quantization schemes that keep trillion-scale foundation models usable under tight memory and latency budgets, without collapsing model quality.

Tags: Quantization · 1-bit · Fast Inference