vllm-project/vllm-ascend

[Community Test] Qwen3.5-27B 8卡部署、性能与精度基线验证

Open

#11,771 opened on Jul 9, 2026

View on GitHub
 (0 comments) (0 reactions) (0 assignees)C++ (1,318 forks)github user discovery
help wanted

Repository metrics

Stars
 (2,180 stars)
PR merge metrics
 (Avg merge 4d 5h) (559 merged PRs in 30d)

Description

Source: 推理众测任务书-vllm.xlsx row 15. This issue tracks one community testing task for vLLM-Ascend.

Task Information

任务概述

在任务一的基础上调整并行策略和卡数,使用Qwen3.5-27B模型在800I A2环境上部署一个推理服务,并输出性能和精度基线

核心要求

3.1 任务范围: 参考https://github.com/vllm-project/vllm-ascend/blob/releases/v0.18.0/docs/source/tutorials/models/Qwen3.5-27B-Qwen3.6-27B.md社区文档 更改vllm参数配置,使用dp2 tp4并行策略 部署推理服务 输出性能基线 输出指定数据集(AIME)精度结果 功能点 要求 服务启动 服务能够成功启动,无报错退出 精度测试 使用aisbench工具完成aime数据集的精度测试 性能测试 使用vllm benchmark完成2048输入、2048输出场景下的性能测试

验收标准 / 交付件

交付件 交付件 说明 部署文档 Markdown格式的完整部署指南 部署脚本 服务部署的Python或者shell脚本,精度测试的数据集、工具和启动命令,性能测试的数据集、工具和启动命令 测试结果 精度测试的输出日志/截图,性能测试的输出日志/截图 问题记录 部署过程中遇到的问题及解决方案 交付标准 维度 标准 功能 服务成功启动并能正常响应推理请求 性能 提供性能测试数据(延迟、吞吐量) 文档 文档完整、步骤清晰、可复现 精度 提供精度测试数据

测试方法

通过postman、requests库等工具向推理请求对应地址发送推理请求

对接信息

  • 技术对接人: 应宇轩 郑志崇 崔青
  • PAE/小巧灵: 邹长江 00888932 宋洋 00835984
  • 工作量: 暂无
  • 任务书路径: 任务书\vllm任务书\修改任务书\任务书-zzc2.docx

任务问题和需求

与上一个重复

Contributor guide