vllm-project/vllm-ascend

【众测任务】Qwen3.5-27B-w8a8模型端到端验证

Open

#11,754 opened on Jul 9, 2026

View on GitHub
 (1 comment) (0 reactions) (0 assignees)C++ (1,318 forks)github user discovery
help wanted

Repository metrics

Stars
 (2,180 stars)
PR merge metrics
 (Avg merge 4d 5h) (559 merged PRs in 30d)

Description

任务背景

本 Issue 由 vLLM-Ascend 众测任务书自动生成,用于跟踪单个众测任务的执行、交付和问题闭环。

基本信息

  • 分类:vllm
  • 任务名称:Qwen3.5-27B-w8a8模型端到端验证
  • 任务类别:资料验证和部署测试
  • 镜像:quay.io/ascend/vllm-ascend:v0.18.0;
  • 权重链接https://www.modelscope.cn/models/Eco-Tech/Qwen3.5-27B-w8a8-mtp
  • 配套信息:Ascend HDK 25.5.0.B078
  • 卡数(Atlas 800I A2):8
  • 内存:1T
  • 硬盘:300G

任务概述

在A2单机环境上部署Qwen3.5-27B-w8a8量化模型,单机混部8卡部署,跑通基本的功能curl功能验证,并使用AISBench进行精度测试,能复现文档上的数据集精度

核心要求

任务范围:部署vllm、vllm-ascend,拉起服务,使用curl进行模型功能验证,并使用AISBench进行精度测试。 curl能够正常回复,且内容符合基本常识,精度测试能复现文档上的数据集精度

验收标准

交付件 测试报告 交付标准 完成模型功能与精度验证

测试方法

基于社区公开文档部署环境并拉起vllm-ascend服务,并能curl通基本问题,能复现文档上的数据集精度

已知问题和补充说明

vllm bench性能评估报v1/completions报404,但是curl http://localhost:8000/v1/completions能通 vllm bench serve --model Eco-Tech/Qwen3.5-27B-w8a8-mtp --dataset-name random --random-input 200 --num-prompts 200 --request-rate 1 --save-result --result-dir ./

交付要求

请在 Issue 中同步以下内容:

  • 部署脚本或关键命令
  • 功能/性能/精度验证结果日志或截图
  • 遇到的问题、规避方案与最终结论
  • 如发现社区文档问题,请给出文档链接、问题描述和建议修正内容

Contributor guide