快速开始
从导入模型到 chat 验证的端到端路径:在推理模板侧 导入模型 生成模板 → 基于模板创建部署 → 用 API Key 做 chat测试(或 curl)。
容器节点环境请先完成 配置 NVIDIA 与 CUDA 环境。概念说明见 推理部署、推理模板。
步骤概览
- 从 ModelScope 导入并生成模板(也可 Hugging Face / 本地路径)。
- 创建推理部署,等待就绪。
- (可选)查看 HAMI 限制显存是否生效。
- 创建 API Key 后做 chat 测试;可选 curl。
从 ModelScope 导入并生成模板
vLLM 等引擎需要挂载可加载模型。推荐在 推理模板 页从 ModelScope(魔搭社区)导入,并同时生成带模型配置的模板(入口不在「模型文件」列表的社区导入)。
更细的字段说明见 推理模板/从 ModelScope 导入。
- 进入 人工智能 → 推理 → 推理模板。
- 点击 导入模型,选择 从 ModelScope。

- 搜索目标模型(示例:
Qwen/Qwen3.5-4B),选中后打开配置抽屉。

- 在导入配置中选择推理引擎(vLLM 或 SGLang,默认 vLLM),配置项目、名称、社区镜像、CPU/内存/数据盘、GPU(启用 HAMI 时选带 HAMI 前缀的型号)与端口(vLLM 默认 TCP
8000,SGLang 默认 TCP30000)等,提交导入。

- 返回模板列表,等待模板状态就绪(如 就绪 vLLM)。在对应卡片上点击 部署,进入创建推理部署页(也可稍后从部署列表 新建)。

tip
模板卡片上可核对 CPU、内存、数据盘、镜像与模型文件等信息,确认无误后再部署。节点需能访问 https://www.modelscope.cn,并预留足够数据盘空间。
创建推理部署
控制台入口:人工智能 → 推理 → 推理部署 → 新建;或从模板卡片 部署 进入(会预选该模板,from_sku)。
部署页主流程是 选择已有推理模板;模型导入发生在模板页,不要在部署页寻找多来源导入入口。
- 填写 名称(如
test-vllm)。 - 确认 推理模板 已选中(类型、模型来源、规格应与模板一致)。
- 在 部署配置 中按需设置 网络(默认网卡或指定 IP 子网)。
- 点击 新建 提交。

等待部署状态变为 就绪(网关同步状态常为 已同步)后,再进行 chat / curl 验证。

查看 HAMI 限制显存是否生效
当导入模板时选择了带 HAMI 前缀的 GPU,并配置了 显存(MiB)(或由挂载模型估算带出)时,可在部署就绪后确认容器内可见显存上限是否与模板一致。未启用 HAMI、未限制显存时可跳过本步。
HAMI 安装与透传设备上报见 配置 NVIDIA 与 CUDA 环境。
- 打开目标 推理部署 详情侧栏,切换到