diff --git a/scripts/run-qwen3.5-35B-A3B-npu.sh b/scripts/run-qwen3.5-35B-A3B-npu.sh index 4eb56515..f652c5cf 100644 --- a/scripts/run-qwen3.5-35B-A3B-npu.sh +++ b/scripts/run-qwen3.5-35B-A3B-npu.sh @@ -134,10 +134,9 @@ OPTIMIZER_ARGS=( VLLM_ARGS=( --rollout-num-gpus-per-engine 2 - --vllm-gpu-memory-utilization 0.7 + --vllm-gpu-memory-utilization 0.85 --vllm-enable-sleep-mode --vllm-weight-sync-mode native - --vllm-enforce-eager ) MISC_ARGS=( diff --git a/tests/test_glm4.7_30B_A3B_npu.py b/tests/test_glm4.7_30B_A3B_npu.py index e694052a..c46d87d1 100644 --- a/tests/test_glm4.7_30B_A3B_npu.py +++ b/tests/test_glm4.7_30B_A3B_npu.py @@ -44,7 +44,7 @@ def execute(): "--num-rollout 2 " "--rollout-batch-size 4 " "--n-samples-per-prompt 4 " - "--rollout-max-response-len 2048 " + "--rollout-max-response-len 1024 " "--rollout-temperature 1 " "--global-batch-size 16 " "--balance-data "