help wanted
Repository metrics
- Stars
- (2,180 stars)
- PR merge metrics
- (Avg merge 4d 5h) (559 merged PRs in 30d)
Description
Source:
推理众测任务书-vllm.xlsxrow 9. This issue tracks one community testing task for vLLM-Ascend.
Task Information
- 分类: vllm
- 任务名称: MiniMax-M2.5 W8A8模型端到端验证
- 任务类别: 资料验证和部署测试
- 蓝区镜像: quay.io/ascend/vllm-ascend:v0.18.0;
- 权重链接: https://www.modelscope.cn/models/Eco-Tech/MiniMax-M2.5-w8a8-QuaRot/files
- 配套信息: Ascend HDK 25.5.0.B078
- 卡数(Atlas 800I A2): 8
- 内存: 1T
- 硬盘: 300G
任务概述
在A2单机环境上部署MiniMax-M2.5量化模型,单机混部8卡部署,跑通基本的功能curl功能验证
核心要求
任务范围:部署vllm、vllm-ascend,拉起服务,使用curl进行模型功能验证。 能正常部署,curl能够正常回复,且内容符合基本常识,能跑通文档中的样例curl命令
验收标准 / 交付件
交付件 测试报告 交付标准 完成模型功能验证
测试方法
基于社区公开文档拉起vllm-ascend服务,并能curl通基本问题(如文档中的样例)
对接信息
- 技术对接人: 应宇轩 郑志崇 崔青
- PAE/小巧灵: 邹长江 00888932 宋洋 00835984
- 工作量: 暂无
- 任务书路径:
任务书\vllm任务书\修改任务书\任务书-jyf2.docx
任务问题和需求
1、vllm服务启动loading模型高并发读取要3小时 2、如需使用投机推理,则要单独下载Eagle3模型 vllm任务23:启动脚本配置参数--max-model-len 133000 \超长,最长为131070,或新增环境变量:export VLLM_ALLOW_LONG_MAX_MODEL_LEN=1