x
This commit is contained in:
+1
-1
@@ -1,4 +1,4 @@
|
|||||||
FROM docker.1ms.run/vllm/vllm-openai-rocm:latest
|
FROM rocm/vllm:rocm7.12.0_gfx120X-all_ubuntu24.04_py3.12_pytorch_2.9.1_vllm_0.16.0
|
||||||
|
|
||||||
WORKDIR /workspace
|
WORKDIR /workspace
|
||||||
|
|
||||||
|
|||||||
@@ -1,6 +1,6 @@
|
|||||||
# ROCm vLLM 容器化推理项目
|
# ROCm vLLM 容器化推理项目
|
||||||
|
|
||||||
基于镜像 `docker.1ms.run/vllm/vllm-openai-rocm:latest` 的 Python + vLLM 推理服务,适配双 AMD R9700 32G GPU。
|
基于镜像 `rocm/vllm:rocm7.12.0_gfx120X-all_ubuntu24.04_py3.12_pytorch_2.9.1_vllm_0.16.0` 的 Python + vLLM 推理服务,适配双 AMD R9700 32G GPU。
|
||||||
|
|
||||||
## 项目目标
|
## 项目目标
|
||||||
|
|
||||||
@@ -65,20 +65,35 @@
|
|||||||
|
|
||||||
## 部署步骤
|
## 部署步骤
|
||||||
|
|
||||||
1. 修改 `config.json` 中的 `models.selected` 与服务参数。
|
1. 预拉取基础镜像(与官方文档一致):
|
||||||
|
|
||||||
2. 构建并启动容器:
|
```bash
|
||||||
|
docker pull rocm/vllm:rocm7.12.0_gfx120X-all_ubuntu24.04_py3.12_pytorch_2.9.1_vllm_0.16.0
|
||||||
|
```
|
||||||
|
|
||||||
|
2. 修改 `config.json` 中的 `models.selected` 与服务参数。
|
||||||
|
|
||||||
|
3. 构建并启动容器:
|
||||||
|
|
||||||
```bash
|
```bash
|
||||||
docker compose up -d --build
|
docker compose up -d --build
|
||||||
```
|
```
|
||||||
|
|
||||||
3. 验证 OpenAI 协议服务:
|
4. 验证 OpenAI 协议服务:
|
||||||
|
|
||||||
```bash
|
```bash
|
||||||
curl http://localhost:<services.openai.port>/v1/models
|
curl http://localhost:<services.openai.port>/v1/models
|
||||||
```
|
```
|
||||||
|
|
||||||
|
当前 `docker-compose.yml` 已按官方运行参数适配:
|
||||||
|
|
||||||
|
- `--group-add=video` → `group_add: [video]`
|
||||||
|
- `--ipc=host` → `ipc: host`
|
||||||
|
- `--cap-add=SYS_PTRACE` → `cap_add: [SYS_PTRACE]`
|
||||||
|
- `--security-opt seccomp=unconfined` → `security_opt: [seccomp=unconfined]`
|
||||||
|
- `--device /dev/kfd` 与 `--device /dev/dri` → `devices`
|
||||||
|
- `-e HF_HOME=/app/models` 在本项目等效为 `HF_HOME=/opt/model`
|
||||||
|
|
||||||
## OpenAI 协议示例(8001)
|
## OpenAI 协议示例(8001)
|
||||||
|
|
||||||
```bash
|
```bash
|
||||||
|
|||||||
+3
-3
@@ -75,10 +75,10 @@
|
|||||||
"quantization": "gptq",
|
"quantization": "gptq",
|
||||||
"ctx": "32768",
|
"ctx": "32768",
|
||||||
"trust_remote": true,
|
"trust_remote": true,
|
||||||
"valid_tp": [1],
|
"valid_tp": [2],
|
||||||
"max_num_seqs": "1",
|
"max_num_seqs": "1",
|
||||||
"max_tokens": "1024",
|
"max_tokens": "2048",
|
||||||
"gpu_util": "0.88",
|
"gpu_util": "0.90",
|
||||||
"enforce_eager": true,
|
"enforce_eager": true,
|
||||||
"tool_call_parser": "qwen3_xml",
|
"tool_call_parser": "qwen3_xml",
|
||||||
"reasoning_parser": "qwen3",
|
"reasoning_parser": "qwen3",
|
||||||
|
|||||||
@@ -12,6 +12,8 @@ services:
|
|||||||
volumes:
|
volumes:
|
||||||
- /opt/model:/opt/model:ro
|
- /opt/model:/opt/model:ro
|
||||||
- ./config.json:/workspace/config.json:ro
|
- ./config.json:/workspace/config.json:ro
|
||||||
|
environment:
|
||||||
|
HF_HOME: /opt/model
|
||||||
devices:
|
devices:
|
||||||
- /dev/kfd
|
- /dev/kfd
|
||||||
- /dev/dri
|
- /dev/dri
|
||||||
|
|||||||
Reference in New Issue
Block a user