Repository metrics
- Stars
- (2,180 stars)
- PR merge metrics
- (Avg merge 4d 5h) (559 merged PRs in 30d)
Description
Source:
推理众测任务书-vllm.xlsxrow 14. This issue tracks one community testing task for vLLM-Ascend.
Task Information
- 分类: vllm
- 任务名称: Qwen3.5-27B
- 任务类别: 资料验证和部署测试
- 蓝区镜像: quay.io/ascend/vllm-ascend:v0.18.0
- 权重链接: https://www.modelscope.cn/models/Eco-Tech/Qwen3.5-27B-w8a8-mtp
- 配套信息: Ascend HDK 25.5.0.B078
- 卡数(Atlas 800I A2): 4
- 内存: 1T
- 硬盘: 300G
任务概述
配置必要的vllm启动参数,使用Qwen3.5-27B模型在800I A2环境上部署一个推理服务,通过实操深入理解vllm-ascend的部署架构和服务调用方式
核心要求
3.1 任务范围: 参考https://github.com/vllm-project/vllm-ascend/blob/releases/v0.18.0/docs/source/tutorials/models/Qwen3.5-27B-Qwen3.6-27B.md 社区文档 获取模型权重 创建容器环境 部署推理服务 服务启动成功性验证 基础推理功能验证 功能点 要求 服务启动 服务能够成功启动,无报错退出 HTTP接口 支持OpenAI兼容的API调用方式 推理能力 能够正常返回推理结果
验收标准 / 交付件
交付件 交付件 说明 部署文档 Markdown格式的完整部署指南 部署脚本 服务部署的Python或者shell脚本 测试结果 服务验证的输出日志/截图 问题记录 部署过程中遇到的问题及解决方案 交付标准 维度 标准 功能 服务成功启动并能正常响应推理请求 性能 提供性能测试数据(延迟、吞吐量) 文档 文档完整、步骤清晰、可复现 精度 推理结果正常,无明显异常
测试方法
通过postman、requests库等工具向推理请求对应地址发送推理请求
对接信息
- 技术对接人: 应宇轩 郑志崇 崔青
- PAE/小巧灵: 邹长江 00888932 宋洋 00835984
- 工作量: 暂无
- 任务书路径:
任务书\vllm任务书\修改任务书\任务书-zzc1.docx
任务问题和需求
容器内无法使用postman工具发送推理请求