Repository metrics
- Stars
- (2,180 stars)
- PR merge metrics
- (Avg merge 4d 5h) (559 merged PRs in 30d)
Description
任务背景
本 Issue 由 vLLM-Ascend 众测任务书自动生成,用于跟踪单个众测任务的执行、交付和问题闭环。
基本信息
- 分类:vllm
- 任务名称:yxr1_qwen3-30B性能测试
- 任务类别:资料验证和部署测试
- 镜像:quay.io/ascend/vllm-ascend:v0.18.0
- 权重链接:https://www.modelscope.cn/models/Qwen/Qwen3-30B-A3B
- 配套信息:Ascend HDK 25.5.0.B078
- 卡数(Atlas 800I A2):4
- 内存:1T
- 硬盘:300G
任务概述
在800I A2境上部署Qwen3-30B-A3B模型,并跑通性能测试
核心要求
1.任务范围: 获取模型权重 创建容器环境 部署推理服务 按照社区文档的指导验证服务性能 撰写测试报告,包括资料验证和部署测试结果 资料验证要求: 指标 要求 完整性 文档内容步骤完整 易用性 文档内容易于学习使用 正确性 文档内容正确无误 部署测试要求: 记录每一步的命令和输出,形成完整的部署步骤说明 记录遇到的问题及解决方案,形成FAQ
验收标准
交付件 交付测试报告包括以下内容: 交付件内容 说明 部署脚本 服务部署的Python或者shell脚本 测试结果 服务验证的输出日志/截图 问题记录 部署过程中遇到的问题及解决方案 交付标准 维度 标准 功能 服务成功启动并能正常响应推理请求 文档 文档完整、步骤清晰、可复现
测试方法
1.创建容器环境:参考资料社区文档https://docs.vllm.ai/projects/ascend/en/v0.18.0/tutorials/models/Qwen3-30B-A3B.html 的Run Docker Container章节创建容器环境 2.服务部署:参考资料社区文档https://docs.vllm.ai/projects/ascend/en/v0.18.0/tutorials/models/Qwen3-30B-A3B.html 的Online Inference on Multi-NPU章节 3.性能测试:参考资料社区文档https://docs.vllm.ai/projects/ascend/en/v0.18.0/developer_guide/performance_and_debug/performance_benchmark.html 的Run basic benchmark章节使用vlln benchmark工具测试性能
已知问题和补充说明
启动脚本配置参数--max-model-len 133000 \超长,最长为131070,或新增环境变量:export VLLM_ALLOW_LONG_MAX_MODEL_LEN=1
交付要求
请在 Issue 中同步以下内容:
- 部署脚本或关键命令
- 功能/性能/精度验证结果日志或截图
- 遇到的问题、规避方案与最终结论
- 如发现社区文档问题,请给出文档链接、问题描述和建议修正内容