From 5b52e4a44a62a32edbc12030ad0f3fee93778db0 Mon Sep 17 00:00:00 2001 From: functionstackx <47992694+functionstackx@users.noreply.github.com> Date: Thu, 24 Sep 2026 22:31:29 -0400 Subject: [PATCH] [Klaud Cold] Update qwen3.5-fp8-mi355x-sglang (+mtp) SGLang ROCm image to v0.5.20-rocm720-mi35x-20260924 Co-Authored-By: Claude Opus 5.5 (1M context) --- .../qwen3.5/sglang/mi355x-fp8-mtp/8k1k.yaml | 6 +++--- .../srt-slurm-recipes/qwen3.5/sglang/mi355x-fp8/8k1k.yaml | 6 +++--- configs/amd-master.yaml | 4 ++-- perf-changelog.yaml | 7 +++++++ 4 files changed, 15 insertions(+), 8 deletions(-) diff --git a/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/mi355x-fp8-mtp/8k1k.yaml b/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/mi355x-fp8-mtp/8k1k.yaml index 488994e3bf..b97ad8cea5 100644 --- a/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/mi355x-fp8-mtp/8k1k.yaml +++ b/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/mi355x-fp8-mtp/8k1k.yaml @@ -3,7 +3,7 @@ base: name: qwen3.5-fp8-mi355x-sglang-mtp-8k1k model: path: hf:Qwen/Qwen3.5-397B-A17B-FP8 - container: lmsysorg/sglang-rocm:v0.5.18-rocm720-mi35x-20260828 + container: lmsysorg/sglang-rocm:v0.5.20-rocm720-mi35x-20260924 precision: fp8 resources: gpu_type: mi355x @@ -29,7 +29,7 @@ base: tokenizer-worker-num: 6 enable-aiter-allreduce-fusion: true max-running-requests: 4 - cuda-graph-max-bs: 4 + cuda-graph-max-bs-decode: 4 disable-radix-cache: true chunked-prefill-size: 32768 scheduler-recv-interval: 30 @@ -60,7 +60,7 @@ zip_override_concurrency: roles: agg: args: - cuda-graph-max-bs: [4, 8, 16, 32, 64, 128, 256] + cuda-graph-max-bs-decode: [4, 8, 16, 32, 64, 128, 256] max-running-requests: [4, 8, 16, 32, 64, 128, 256] benchmark: env: diff --git a/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/mi355x-fp8/8k1k.yaml b/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/mi355x-fp8/8k1k.yaml index c753c2b465..ddbe1db8c4 100644 --- a/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/mi355x-fp8/8k1k.yaml +++ b/benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/mi355x-fp8/8k1k.yaml @@ -3,7 +3,7 @@ base: name: qwen3.5-fp8-mi355x-sglang-8k1k model: path: hf:Qwen/Qwen3.5-397B-A17B-FP8 - container: lmsysorg/sglang-rocm:v0.5.18-rocm720-mi35x-20260828 + container: lmsysorg/sglang-rocm:v0.5.20-rocm720-mi35x-20260924 precision: fp8 resources: gpu_type: mi355x @@ -29,7 +29,7 @@ base: tokenizer-worker-num: 6 enable-aiter-allreduce-fusion: true max-running-requests: 4 - cuda-graph-max-bs: 4 + cuda-graph-max-bs-decode: 4 disable-radix-cache: true chunked-prefill-size: 32768 scheduler-recv-interval: 30 @@ -56,7 +56,7 @@ zip_override_concurrency: roles: agg: args: - cuda-graph-max-bs: [4, 8, 16, 32, 64, 128, 256] + cuda-graph-max-bs-decode: [4, 8, 16, 32, 64, 128, 256] max-running-requests: [4, 8, 16, 32, 64, 128, 256] benchmark: env: diff --git a/configs/amd-master.yaml b/configs/amd-master.yaml index dd6c375967..51695b4066 100644 --- a/configs/amd-master.yaml +++ b/configs/amd-master.yaml @@ -182,7 +182,7 @@ qwen3.5-fp8-mi325x-sglang: srt-recipe: benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/mi325x-fp8/8k1k.yaml qwen3.5-fp8-mi355x-sglang: - image: lmsysorg/sglang-rocm:v0.5.18-rocm720-mi35x-20260828 + image: lmsysorg/sglang-rocm:v0.5.20-rocm720-mi35x-20260924 model: Qwen/Qwen3.5-397B-A17B-FP8 model-prefix: qwen3.5 runner: mi355x @@ -201,7 +201,7 @@ qwen3.5-fp8-mi355x-sglang: srt-recipe: benchmarks/single_node/srt-slurm-recipes/qwen3.5/sglang/mi355x-fp8/8k1k.yaml qwen3.5-fp8-mi355x-sglang-mtp: - image: lmsysorg/sglang-rocm:v0.5.18-rocm720-mi35x-20260828 + image: lmsysorg/sglang-rocm:v0.5.20-rocm720-mi35x-20260924 model: Qwen/Qwen3.5-397B-A17B-FP8 model-prefix: qwen3.5 runner: mi355x diff --git a/perf-changelog.yaml b/perf-changelog.yaml index 89f152cacc..da223b7cd7 100644 --- a/perf-changelog.yaml +++ b/perf-changelog.yaml @@ -8887,3 +8887,10 @@ - "Add DeepSeek-V4-Pro-0813 golden AL for draft lengths 4, 5, 7 and 8 (3.36 / 3.61 / 3.73 / 3.47)." - "Agentic PD router: pin --decode-policy round_robin so decode no longer inherits the prefill --policy (consistent_hashing)." pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/3256 + +- config-keys: + - qwen3.5-fp8-mi355x-sglang + - qwen3.5-fp8-mi355x-sglang-mtp + description: + - "Update SGLang ROCm image from v0.5.18-rocm720-mi35x-20260828 to v0.5.20-rocm720-mi35x-20260924 (latest nightly)" + pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/3423