I'm using local model weights, and here are my startup parameters. My C1 throughput is only around 170 tok/s. Could you please advise on how to properly set up/load the NVFP4 proposal head?
services:
glm53-mtp3:
image: ${IMAGE:-voipmonitor/vllm:jovian-judgement-community-20260906-r27}
pull_policy: missing
container_name: ${NAME:-jovian-judgement-mtp3}
network_mode: host
ipc: host
init: true
shm_size: ${SHM_SIZE:-32g}
gpus: all
restart: no
ulimits:
memlock:
soft: -1
hard: -1
nofile:
soft: 1048576
hard: 1048576
stack: 67108864
environment:
CUDA_VISIBLE_DEVICES: ${GPUS:-0,1,2,3}
MODEL: ${MODEL:-/root/models/local-inference-lab/GLM-5.3-Flash-NVFP4}
SPECULATOR: ${SPECULATOR:-mtp}
MTP_DEPTH: ${MTP_DEPTH:-3}
CACHE_MODE: ${CACHE_MODE:-vram}
KV_CACHE_QUANT: ${KV_CACHE_QUANT:-fp8_ds_mla}
CUDAGRAPH_MODE: ${CUDAGRAPH_MODE:-FULL_AND_PIECEWISE}
PORT: ${PORT:-8000}
TP: ${TP:-4}
DCP: ${DCP:-4}
MAX_MODEL_LEN: ${MAX_MODEL_LEN:-1048576}
MAX_NUM_SEQS: ${MAX_NUM_SEQS:-32}
MAX_NUM_BATCHED_TOKENS: ${MAX_NUM_BATCHED_TOKENS:-8192}
PREFILL_SCHEDULE_INTERVAL: ${PREFILL_SCHEDULE_INTERVAL:-1}
FAIRNESS_ENGINE: ${FAIRNESS_ENGINE:-compute_share}
PREFILL_COMPUTE_SHARE: ${PREFILL_COMPUTE_SHARE:-0.4}
GPU_MEMORY_UTILIZATION: ${GPU_MEMORY_UTILIZATION:-0.93}
volumes:
- ${CACHE_VOLUME:-jovian-judgement-runtime-cache}:/cache
- ${HF_CACHE_VOLUME:-jovian-judgement-huggingface-cache}:/root/.cache/huggingface
- ${MODEL_ROOT:-/home/gomezshui/ai_space/models}:/root/models:ro
volumes:
jovian-judgement-runtime-cache:
jovian-judgement-huggingface-cache:
I'm using local model weights, and here are my startup parameters. My C1 throughput is only around 170 tok/s. Could you please advise on how to properly set up/load the NVFP4 proposal head?
services:
glm53-mtp3:
image: ${IMAGE:-voipmonitor/vllm:jovian-judgement-community-20260906-r27}
pull_policy: missing
container_name: ${NAME:-jovian-judgement-mtp3}
network_mode: host
ipc: host
init: true
shm_size: ${SHM_SIZE:-32g}
gpus: all
restart: no
ulimits:
memlock:
soft: -1
hard: -1
nofile:
soft: 1048576
hard: 1048576
stack: 67108864
environment:
CUDA_VISIBLE_DEVICES: ${GPUS:-0,1,2,3}
MODEL: ${MODEL:-/root/models/local-inference-lab/GLM-5.3-Flash-NVFP4}
SPECULATOR: ${SPECULATOR:-mtp}
MTP_DEPTH: ${MTP_DEPTH:-3}
CACHE_MODE: ${CACHE_MODE:-vram}
KV_CACHE_QUANT: ${KV_CACHE_QUANT:-fp8_ds_mla}
CUDAGRAPH_MODE: ${CUDAGRAPH_MODE:-FULL_AND_PIECEWISE}
PORT: ${PORT:-8000}
TP: ${TP:-4}
DCP: ${DCP:-4}
MAX_MODEL_LEN: ${MAX_MODEL_LEN:-1048576}
MAX_NUM_SEQS: ${MAX_NUM_SEQS:-32}
MAX_NUM_BATCHED_TOKENS: ${MAX_NUM_BATCHED_TOKENS:-8192}
PREFILL_SCHEDULE_INTERVAL: ${PREFILL_SCHEDULE_INTERVAL:-1}
FAIRNESS_ENGINE: ${FAIRNESS_ENGINE:-compute_share}
PREFILL_COMPUTE_SHARE: ${PREFILL_COMPUTE_SHARE:-0.4}
GPU_MEMORY_UTILIZATION: ${GPU_MEMORY_UTILIZATION:-0.93}
volumes:
- ${CACHE_VOLUME:-jovian-judgement-runtime-cache}:/cache
- ${HF_CACHE_VOLUME:-jovian-judgement-huggingface-cache}:/root/.cache/huggingface
- ${MODEL_ROOT:-/home/gomezshui/ai_space/models}:/root/models:ro
volumes:
jovian-judgement-runtime-cache:
jovian-judgement-huggingface-cache: