Post by Awni Hannun on X
Awni Hannun@awnihannun
XThe new 1 Trillion parameter Kimi K2 Thinking model runs well on 2 M3 Ultras in its native format - no loss in quality!
The model was quantization aware trained (qat) at int4.
Here it generated ~3500 tokens at 15 toks/sec using pipeline-parallelism in mlx-lm:
2.9K likes76 repliesPosted Nov 7, 2025