Repository metrics
- Stars
- (2,180 stars)
- PR merge metrics
- (Avg merge 4d 5h) (559 merged PRs in 30d)
Description
任务背景
本 Issue 由 vLLM-Ascend 众测任务书自动生成,用于跟踪单个众测任务的执行、交付和问题闭环。
基本信息
- 分类:vllm
- 任务名称:cjw2
- 任务类别:资料验证和部署测试
- 镜像:quay.io/ascend/vllm-ascend:v0.18.0
- 权重链接:https://modelscope.cn/models/vllm-ascend/Qwen3-235B-A22B-W8A8
- 配套信息:Ascend HDK 25.5.0.B078
- 卡数(Atlas 800I A2):8
- 内存:1T
- 硬盘:300G
任务概述
在A2单机环境上部署Qwen3-235B-A22B-w8a8模型,发起请求并成功返回
核心要求
3.1任务范围: 参考https://docs.vllm.ai/projects/ascend/en/v0.18.0/tutorials/models/Qwen3-235B-A22B.html社区文档,使用官方镜像创建容器,拉起服务,curl请求可以成功返回。 3.2功能实现要求 服务拉起正常,curl请求可以正常返回。
验收标准
交付件 交付件 说明 部署文档 Markdown格式的完整部署指南 部署脚本 服务部署的Python或者shell脚本 测试结果 服务验证的输出日志/截图 问题记录 部署过程中遇到的问题及解决方案 交付标准 维度 标准 功能 服务成功启动并能正常响应推理请求 文档 文档完整、步骤清晰、可复现 精度 推理结果正常,无明显异常
测试方法
服务拉起后向大模型发起请求可以正常返回。
已知问题和补充说明
1、vllm服务启动loading模型高并发读取要3小时 2、vllm bench 随机数性能测试报404,export VLLM_USE_MODELSCOPE=True vllm bench serve --model vllm-ascend/Qwen3-235B-A22B-w8a8 --dataset-name random --random-input-len 200 --num-prompts 200 --request-rate 1 --save-result --result-dir ./
交付要求
请在 Issue 中同步以下内容:
- 部署脚本或关键命令
- 功能/性能/精度验证结果日志或截图
- 遇到的问题、规避方案与最终结论
- 如发现社区文档问题,请给出文档链接、问题描述和建议修正内容