The Kimi K3 model features 2.8 trillion parameters, a 1 million token context window, and native multimodal capabilities. It achieves up to 6.3x faster decoding in million-token contexts via Kimi Delta Attention and ~25% higher training efficiency with Attention Residuals.