统信UOS英伟达CUDA异构平台下vLLM部署手册

📅 2026/8/11 23:02:30
统信UOS英伟达CUDA异构平台下vLLM部署手册
部署环境说明服务器浪潮NF5468M6服务器操作系统UOS V2510VLLM版本0.11.2训练卡NVIDIA A100 X 2Python版本3.11.6大语言模型DeepSeek-R1-Distill-Qwen-1.5B部署步骤1.CUDA异构平台安装部署参考统信UOS环境下英伟达CUDA异构平台部署手册文档完成CUDA异构平台安装部署。2.物理机部署vLLM服务创建python虚拟环境# 安装pip yum install python3-pip # 更新pip最新版本 pip install --upgrade pip # 创建虚拟环境 cd /root python3 -m venv vllm_venv #激活虚机环境 source /root/vllm_venv/bin/activate在安装vLLM服务# 在线安装部署vLLM服务 pip install vllm0.11.2 -i https://pypi.tuna.tsinghua.edu.cn/simple #启动vLLM服务 vllm serve /root/model/DeepSeek-R1-Distill-Qwen-1.5B --served-model-name DeepSeek-R1-Distill-Qwen-1.5B --max-model-len 40960 --gpu-memory-utilization 0.8 --tensor-parallel-size 2 --api-key uniontech参数说明/root/model/DeepSeek-R1-Distill-Qwen-1.5B模型文件本地路径served-model-nameAPI服务对应模型名称max-model-len上下文最大长度tensor-parallel-sizeAI训练卡数量api-keyvLLM服务Api的密码gpu-memory-utilization限制GPU资源最大使用率 默认0.9vLLM服务器验证curl -X POST http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer uniontech \ -d { model: DeepSeek-R1-Distill-Qwen-1.5B, messages: [{role: user, content: 你好请介绍一下自己}], temperature: 0.7, max_tokens: 200, stream: false }3.容器化部署vLLM服务安装docker服务# 安装docker yum install docker # 启动docker服务 systemctl start docker # 设置docker服务自启动 systemctl enable docker安装nvidia-container-toolkit参考统信UOS环境下英伟达CUDA异构平台部署手册文档中第八步。容器化启动vLLM服务docker run -d \ --name vllm-openapi \ --networkhost \ --shm-size4gb \ --ulimit nofile65535:65535 \ --ulimit memlock-1:-1 \ --gpusall \ -v /data/models/:/home/models/ \ registry.uniontech.com/uos-ai/uos-server-2500-vllm-cuda-gpu:0.11.2 \ --model /home/models/DeepSeek-R1-Distill-Qwen-1.5B \ --served-model-name DeepSeek-R1-Distill-Qwen-1.5B \ --max-model-len 4096 \ --tensor-parallel-size 1 \ --gpu-memory-utilization 0.8 \ --api-key uniontech参数说明/home/model/DeepSeek-R1-Distill-Qwen-1.5B模型文件本地路径served-model-nameAPI服务对应模型名称max-model-len上下文最大长度tensor-parallel-sizeAI训练卡数量api-keyvLLM服务Api的密码gpu-memory-utilization限制GPU资源最大使用率 默认0.9vLLM服务器验证curl -X POST http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer uniontech \ -d { model: DeepSeek-R1-Distill-Qwen-1.5B, messages: [{role: user, content: 你好请介绍一下自己}], temperature: 0.7, max_tokens: 200, stream: false }