返回指南列表
模型部署部署vLLMllama.cppOllamaDocker
镜像指南:推理镜像下载导入
Docker 推理镜像 TOS下载导入 ,告别拉取慢与超时
镜像指南
为解决国内用户无法直接访问 Docker Hub / GitHub Container Registry 的问题,我们提供从对象存储下载导入。
镜像下载
我们在国内 OSS(火山引擎 TOS)上预置了所有常用推理镜像的tar.gz 包,直接下载后在 Jetson 设备上导入。
1. 下载镜像包
从 OSS 下载对应镜像的 gz 包:
# 以 vLLM Jetson thor 镜像为例
wget https://ai-hub.tos-cn-guangzhou.volces.com/dockerimages/aoni-vllm-latest-jetson-thor.tar.gz
2. 解压并导入
# 导入 Docker
docker load -i aoni-vllm-latest-jetson-thor.tar.gz
# 验证
docker images | grep vllm
3. 运行模型
导入后即可正常使用,与在线拉取完全一致:
docker run -it \
--runtime=nvidia -p 8200:8000 \
-e CUDA_VISIBLE_DEVICES=0 \
-e HF_HUB_OFFLINE=1 \
-e TRANSFORMERS_OFFLINE=1 \
-e VLLM_USE_MODELSCOPE=False \
-e MODEL_OSS=True \
-e MODEL_NAME=Qwen/Qwen3.5-0.8B \
-v /data/models:/models \
aoni/nvidia-ai-iot/vllm:latest-jetson-thor \
vllm serve /models/Qwen/Qwen3.5-0.8B \
--served-model-name Qwen/Qwen3.5-0.8B \
--gpu-memory-utilization 0.2 --max-model-len 204800 \
--enable-prefix-caching \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
可用镜像列表
| 镜像名称 | OSS 路径 | 大小 |
|---|---|---|
| aoni-vllm-openai_v0.20.0-ubuntu2404 | https://ai-hub.tos-cn-guangzhou.volces.com/dockerimages/aoni-vllm-openai_v0.20.0-ubuntu2404.tar.gz |
~8.58GiB |
| aoni-vllm-openai-nightly-aarch64 | https://ai-hub.tos-cn-guangzhou.volces.com/dockerimages/aoni-vllm-openai-nightly-aarch64.tar.gz |
~9.89GiB |
| aoni-vllm-latest-jetson-thor | https://ai-hub.tos-cn-guangzhou.volces.com/dockerimages/aoni-vllm-latest-jetson-thor.tar.gz |
~13.49GiB |
| aoni-trt-inference_0.7.1 | https://ai-hub.tos-cn-guangzhou.volces.com/dockerimages/aoni-trt-inference_0.7.1.tar.gz |
~1.68GiB |