This commit is contained in:
2026-04-05 02:15:20 +08:00
parent 0027c758d7
commit fd579f68ba
2 changed files with 5 additions and 7 deletions
+5 -4
View File
@@ -20,7 +20,7 @@
"revision": "", "revision": "",
"models": { "models": {
"default": "Qwen3.5-35B-A3B-GPTQ-Int4", "default": "Qwen3.5-35B-A3B-GPTQ-Int4",
"selected": "Gemma-4-26B-A4B", "selected": "Qwen3.5-35B-A3B-FP8",
"profiles": { "profiles": {
"GLM-4.7-Flash-AWQ": { "GLM-4.7-Flash-AWQ": {
"local_path": "GLM-4.7-Flash-AWQ", "local_path": "GLM-4.7-Flash-AWQ",
@@ -78,12 +78,13 @@
"Qwen3.5-35B-A3B-FP8": { "Qwen3.5-35B-A3B-FP8": {
"local_path": "Qwen3.5-35B-A3B-FP8", "local_path": "Qwen3.5-35B-A3B-FP8",
"dtype": "float16", "dtype": "float16",
"ctx": "65536", "ctx": "131072",
"enforce_eager": false,
"trust_remote": true, "trust_remote": true,
"valid_tp": [1, 2], "valid_tp": [1, 2],
"max_num_seqs": "8", "max_num_seqs": "8",
"max_tokens": "4096", "max_tokens": "16384",
"gpu_util": "0.92", "gpu_util": "0.94",
"tool_call_parser": "qwen3_coder", "tool_call_parser": "qwen3_coder",
"enable_auto_tool_choice": true, "enable_auto_tool_choice": true,
"served_model_name": "Qwen3.5-35B-A3B-FP8", "served_model_name": "Qwen3.5-35B-A3B-FP8",
-3
View File
@@ -24,12 +24,9 @@ services:
PYTHONUNBUFFERED: "1" PYTHONUNBUFFERED: "1"
# 启用 AITER 加速(R9700 属于 gfx1201 架构) # 启用 AITER 加速(R9700 属于 gfx1201 架构)
VLLM_ROCM_USE_AITER: "1" VLLM_ROCM_USE_AITER: "1"
VLLM_USE_AITER_UNIFIED_ATTENTION: "1"
VLLM_ROCM_USE_AITER_MHA: "0" VLLM_ROCM_USE_AITER_MHA: "0"
# 增强 All-Reduce 性能(双卡通信优化) # 增强 All-Reduce 性能(双卡通信优化)
VLLM_ROCM_QUICK_REDUCE_QUANTIZATION: "INT4" VLLM_ROCM_QUICK_REDUCE_QUANTIZATION: "INT4"
# 使用 vLLM V1 引擎(性能更好)
VLLM_USE_V1: "1"
devices: devices:
- /dev/kfd - /dev/kfd
- /dev/dri - /dev/dri