vllm-project/vllm-ascend

【众测任务】Qwen3.5-27B 基础部署与服务调用验证

Open

#11,760 opened on Jul 9, 2026

View on GitHub
 (1 comment) (0 reactions) (0 assignees)C++ (1,318 forks)github user discovery
help wanted

Repository metrics

Stars
 (2,180 stars)
PR merge metrics
 (Avg merge 4d 5h) (559 merged PRs in 30d)

Description

任务背景

本 Issue 由 vLLM-Ascend 众测任务书自动生成,用于跟踪单个众测任务的执行、交付和问题闭环。

基本信息

任务概述

配置必要的vllm启动参数,使用Qwen3.5-27B模型在800I A2环境上部署一个推理服务,通过实操深入理解vllm-ascend的部署架构和服务调用方式

核心要求

3.1 任务范围: 参考https://github.com/vllm-project/vllm-ascend/blob/releases/v0.18.0/docs/source/tutorials/models/Qwen3.5-27B-Qwen3.6-27B.md 社区文档 获取模型权重 创建容器环境 部署推理服务 服务启动成功性验证 基础推理功能验证 功能点 要求 服务启动 服务能够成功启动,无报错退出 HTTP接口 支持OpenAI兼容的API调用方式 推理能力 能够正常返回推理结果

验收标准

交付件 交付件 说明 部署文档 Markdown格式的完整部署指南 部署脚本 服务部署的Python或者shell脚本 测试结果 服务验证的输出日志/截图 问题记录 部署过程中遇到的问题及解决方案 交付标准 维度 标准 功能 服务成功启动并能正常响应推理请求 性能 提供性能测试数据(延迟、吞吐量) 文档 文档完整、步骤清晰、可复现 精度 推理结果正常,无明显异常

测试方法

通过postman、requests库等工具向推理请求对应地址发送推理请求

已知问题和补充说明

容器内无法使用postman工具发送推理请求

交付要求

请在 Issue 中同步以下内容:

  • 部署脚本或关键命令
  • 功能/性能/精度验证结果日志或截图
  • 遇到的问题、规避方案与最终结论
  • 如发现社区文档问题,请给出文档链接、问题描述和建议修正内容

Contributor guide