Not a member of Pastebin yet?
Sign Up,
it unlocks many cool features!
- llama-server \
- --host 0.0.0.0 \
- --port 8080 \
- --model unsloth-Gemma-4-31B-it-qat/gemma-4-31B-it-qat-UD-Q4_K_XL.gguf \
- --mmproj unsloth-Gemma-4-31B-it-qat/mmproj-F16.gguf \
- --model-draft unsloth-Gemma-4-31B-it-qat/mtp-gemma-4-31B-it.gguf \
- --alias 'gemma4' \
- --jinja \
- --gpu-layers all \
- --temp 1.0 \
- --top-p 0.95 \
- --top-k 64 \
- --ctx-size 196608 \
- -ctk q8_0 -ctv q8_0 \
- -b 512 -ub 512 \
- --spec-type draft-mtp \
- --spec-draft-n-max 3 \
- --parallel 2 \
- --ctx-checkpoints 4 \
- --checkpoint-min-step 32768 \
- --cache-ram 22528 \
- --cache-idle-slots
Add Comment
Please, Sign In to add comment