help wanted
Repository metrics
- Stars
- (2,180 stars)
- PR merge metrics
- (Avg merge 4d 5h) (559 merged PRs in 30d)
Description
任务背景
本 Issue 由 vLLM-Ascend 众测任务书自动生成,用于跟踪单个众测任务的执行、交付和问题闭环。
基本信息
- 分类:vllm
- 任务名称:Qwen3-32B开启池化功能验证
- 任务类别:资料验证和部署测试
- 镜像:quay.io/ascend/vllm-ascend:v0.18.0
https://docs.vllm.ai/projects/ascend/en/latest/user_guide/feature_guide/kv_pool.html
- 权重链接:https://www.modelscope.cn/models/vllm-ascend/Qwen3-32B-W4A4
- 配套信息:Ascend HDK 25.5.0.B078
- 卡数(Atlas 800I A2):2
- 内存:1T
- 硬盘:300G
任务概述
在800I A2境上部署Qwen3-32B量化模型并开启Mooncake池化,跑通精度测试
核心要求
任务范围:部署vllm、vllm-ascend,部署MoonCake池化后端,拉起vllm服务,使用aisbench进行模型精度验证。 精度与基线误差1%以内,精度达标。
验收标准
交付件 测试报告 交付标准 完成模型功能验证,精度验证
测试方法
(1)进入容器 (2)安装MoonCake>=v0.3.9 (3)设置环境变量 (4)配置 mooncake.json(5)启动 mooncake_master (6)配置PD混部拉起脚本,配置本地主机、端口和模型权重路径,使其符合实际设置 (7)运行推理 (8)aisbench发起精度测试
已知问题和补充说明
mooncake环境变量、配置、启动没有具体操作步骤
交付要求
请在 Issue 中同步以下内容:
- 部署脚本或关键命令
- 功能/性能/精度验证结果日志或截图
- 遇到的问题、规避方案与最终结论
- 如发现社区文档问题,请给出文档链接、问题描述和建议修正内容