Georgi Gerganov@ggerganov
32GB VRAM (e.g. RTX 5090):
llama serve \
-hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \
-hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \
--spec-default \
--spec-type draft-mtp \
--ctx-size 196608 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--reasoning-preserve --fit off --agent
Opens with a number