用SGLang部署EGM-Qwen3-VL-8B:超简单Python代码实现视觉定位请求

📅 2026/7/22 5:02:12
用SGLang部署EGM-Qwen3-VL-8B:超简单Python代码实现视觉定位请求
用SGLang部署EGM-Qwen3-VL-8B超简单Python代码实现视觉定位请求【免费下载链接】EGM-8B项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8BEGM-Qwen3-VL-8B是一款功能强大的视觉语言模型结合SGLang工具可以轻松实现视觉定位请求。本文将为你介绍如何通过简单的Python代码使用SGLang快速部署EGM-Qwen3-VL-8B模型实现精准的视觉定位功能。一、准备工作安装SGLang环境要使用SGLang部署EGM-Qwen3-VL-8B首先需要安装SGLang工具。打开终端执行以下命令pip install sglang[all]0.5.5这条命令会安装SGLang及其所有必要的依赖组件确保你能够顺利运行后续的部署和推理任务。二、启动SGLang服务部署EGM-Qwen3-VL-8B模型安装完成后我们需要启动SGLang服务器来部署EGM-Qwen3-VL-8B模型。在终端中输入以下命令python -m sglang.launch_server \ --model-path nvidia/EGM-8B \ --chat-templateqwen3-vl \ --port 30000这里--model-path指定了模型的路径为nvidia/EGM-8B--chat-template设置为qwen3-vl以适配模型的对话格式--port则指定了服务器运行的端口为30000。启动成功后服务器将在本地的30000端口监听请求。三、发送视觉定位请求编写Python代码服务器启动后我们就可以编写Python代码来发送视觉定位请求了。下面是一个完整的示例import openai import base64 client openai.Client(base_urlhttp://127.0.0.1:30000/v1, api_keyEMPTY) # 加载本地图片并转换为base64格式 with open(example.jpg, rb) as f: image_base64 base64.b64encode(f.read()).decode(utf-8) # 发送视觉定位请求 response client.chat.completions.create( modelnvidia/EGM-8B, messages[ { role: user, content: [ {type: image_url, image_url: {url: fdata:image/jpeg;base64,{image_base64}}}, {type: text, text: Please provide the bounding box coordinate of the region this sentence describes: the person on the left.}, ], } ], temperature0.6, top_p0.95, max_tokens8192, ) # 打印模型返回的视觉定位结果 print(response.choices[0].message.content)在这段代码中我们首先导入了openai和base64库。然后创建了一个OpenAI客户端将请求的基础URL设置为本地SGLang服务器的地址http://127.0.0.1:30000/v1API密钥设置为EMPTY因为SGLang服务器不需要实际的API密钥。接下来我们加载本地的图片文件example.jpg并将其转换为base64编码格式以便能够在请求中传递图片数据。然后通过client.chat.completions.create方法发送请求其中包含了图片数据和用户的视觉定位指令“Please provide the bounding box coordinate of the region this sentence describes: the person on the left.”请提供这句话所描述区域的边界框坐标左边的人。最后我们打印出模型返回的视觉定位结果该结果将包含所请求区域的边界框坐标信息。四、模型架构简介了解EGM-Qwen3-VL-8B的核心组件EGM-Qwen3-VL-8B模型的架构如下表所示组件详情ArchitectureQwen3VLForConditionalGenerationText Hidden Size4096Text Layers36Attention Heads32 (8 KV heads)Text Intermediate Size12,288Vision Hidden Size1152Vision Layers27Patch Size16 x 16Max Position Embeddings262,144Vocabulary Size151,936这些组件共同协作使得EGM-Qwen3-VL-8B能够高效地处理视觉和语言信息实现精准的视觉定位等复杂任务。通过以上简单的步骤你就可以使用SGLang部署EGM-Qwen3-VL-8B模型并通过Python代码实现视觉定位请求了。无论是进行图像分析还是视觉问答这款模型都能为你提供强大的支持。赶快尝试一下体验视觉语言模型带来的便捷与强大吧【免费下载链接】EGM-8B项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考