vllm-project/vllm-ascend
View on GitHub[Community Test] Qwen3-32B-W4A4 Memcache 池化后端验证
Open
#11,745 opened on Jul 9, 2026
help wanted
Repository metrics
- Stars
- (2,180 stars)
- PR merge metrics
- (Avg merge 4d 5h) (559 merged PRs in 30d)
Description
Source:
推理众测任务书-vllm.xlsxrow 10. This issue tracks one community testing task for vLLM-Ascend.
Task Information
- 分类: vllm
- 任务名称: vLLM-Ascend支持Memcache池化后端
- 任务类别: 资料验证和部署测试
- 蓝区镜像: quay.io/ascend/vllm-ascend:v0.18.0
https://docs.vllm.ai/projects/ascend/en/latest/user_guide/feature_guide/kv_pool.html
- 权重链接: https://www.modelscope.cn/models/vllm-ascend/Qwen3-32B-W4A4
- 配套信息: Ascend HDK 25.5.0.B078
- 卡数(Atlas 800I A2): 2
- 内存: 1T
- 硬盘: 300G
任务概述
在A2环境上部署Qwen3-32B量化模型,开启Memcache池化,并跑通精度测试
核心要求
任务范围:部署vllm、vllm-ascend,拉起Memcache池化+VLLM服务,使用aisbench进行模型精度验证。 精度与基线误差1%以内,精度达标。
验收标准 / 交付件
交付件 测试报告 交付标准 完成模型功能验证,精度验证
测试方法
(1)进入容器 (2)安装版本配套 (3)安装memcache_hybrid (4)启动MetaService 服务 (5)拉起vLLM-Ascend服务 (6)配置aisbench (7)aisbench发起精度测试
对接信息
- 技术对接人: 应宇轩 郑志崇 崔青
- PAE/小巧灵: 邹长江 00888932 宋洋 00835984
- 工作量: 暂无
- 任务书路径:
任务书\vllm任务书\修改任务书\任务书-xyq1.docx
任务问题和需求
memcache_hybrid无单独安装包,并且依赖cann,当前cann版本8.5.1不包含memcache_hybird