aoniAI Hub
返回指南列表
模型部署部署vLLMllama.cppOllamaDocker

镜像指南:推理镜像下载导入

Docker 推理镜像 TOS下载导入 ,告别拉取慢与超时

镜像指南

为解决国内用户无法直接访问 Docker Hub / GitHub Container Registry 的问题,我们提供从对象存储下载导入。

镜像下载

我们在国内 OSS(火山引擎 TOS)上预置了所有常用推理镜像的tar.gz 包,直接下载后在 Jetson 设备上导入。

1. 下载镜像包

从 OSS 下载对应镜像的 gz 包:

# 以 vLLM Jetson thor 镜像为例
wget https://ai-hub.tos-cn-guangzhou.volces.com/dockerimages/aoni-vllm-latest-jetson-thor.tar.gz

2. 解压并导入

# 导入 Docker
docker load -i aoni-vllm-latest-jetson-thor.tar.gz

# 验证
docker images | grep vllm

3. 运行模型

导入后即可正常使用,与在线拉取完全一致:

docker run -it \
  --runtime=nvidia -p 8200:8000 \
  -e CUDA_VISIBLE_DEVICES=0 \
  -e HF_HUB_OFFLINE=1 \
  -e TRANSFORMERS_OFFLINE=1 \
  -e VLLM_USE_MODELSCOPE=False \
  -e MODEL_OSS=True \
  -e MODEL_NAME=Qwen/Qwen3.5-0.8B \
  -v /data/models:/models \
  aoni/nvidia-ai-iot/vllm:latest-jetson-thor \
  vllm serve /models/Qwen/Qwen3.5-0.8B \
  --served-model-name Qwen/Qwen3.5-0.8B \
  --gpu-memory-utilization 0.2 --max-model-len 204800 \
  --enable-prefix-caching \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

可用镜像列表

镜像名称 OSS 路径 大小
aoni-vllm-openai_v0.20.0-ubuntu2404 https://ai-hub.tos-cn-guangzhou.volces.com/dockerimages/aoni-vllm-openai_v0.20.0-ubuntu2404.tar.gz ~8.58GiB
aoni-vllm-openai-nightly-aarch64 https://ai-hub.tos-cn-guangzhou.volces.com/dockerimages/aoni-vllm-openai-nightly-aarch64.tar.gz ~9.89GiB
aoni-vllm-latest-jetson-thor https://ai-hub.tos-cn-guangzhou.volces.com/dockerimages/aoni-vllm-latest-jetson-thor.tar.gz ~13.49GiB
aoni-trt-inference_0.7.1 https://ai-hub.tos-cn-guangzhou.volces.com/dockerimages/aoni-trt-inference_0.7.1.tar.gz ~1.68GiB

下一步