aoniAI Hub
返回模型列表

Qwen3-VL-8B-Instruct

Qwen3-VL-8B-Instruct 是阿里云通义千问团队开发的一款80亿参数的多模态大模型,在同系列中兼具强大的性能和更友好的部署成本

参数量5.5 GB
模态Text, Image
精度NVFP4
类型LLM
推理引擎vllm, TensorRT Edge-LLM

快速部署

部署模型

命令根据你的配置自动生成
docker run -d --privileged -p 8080:8080 \
  -e MODEL_OSS=True \
  -e MODEL_ROOT=/models \
  -e ENGINE_URI=tos://ai-hub/models/qwen/Qwen3-VL-8B-Instruct.tar.gz \
  -e MODEL_NAME=qwen/Qwen3-8B \
  -e MODELSCOPE_CACHE=/models \
  -e HF_HUB_OFFLINE=1 -e TRANSFORMERS_OFFLINE=1 \
  -e MACA_SMALL_PAGES_FW_ENABLE=1 -e MASA_USE_ASYNC_MMAP=1 \
  -e MCCL_NET_GDR_LEVEL=5 -e MCCL_P2P_LEVEL=7 \
  -e MACA_QUANT_DISABLE=1 \
  -e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \
  -v /data/models:/models:ro \
  --device /dev/mxcd:/dev/mxcd \
  aoni/metax/vllm-metax:0.20.0-maca.ai3.7.0.107-torch2.8-py310-ubuntu22.04-amd64 \
  vllm serve /models/Qwen/Qwen3-VL-8B-Instruct \
  --served-model-name Qwen/Qwen3-VL-8B-Instruct\
  --host 0.0.0.0 --port 8080 \
  --trust-remote-code --dtype bfloat16 --max-model-len 204800 \
  --gpu-memory-utilization 0.97 \
  --max-num-seqs 4 \
  --enforce-eager --disable-custom-all-reduce

模型详情

发布者
Alibaba
系列
Qwen3
参数量
8B (5.5 GB)
上下文长度
242,144 tokens
许可证
Apache 2.0
推理引擎
vllm, TensorRT Edge-LLM

输入和输出

输入: Text, Image / 输出: Text, Image

用途

  • 多模态对话与问答:构建能看懂图片、图表的智能客服或助手。
  • 文档与内容分析:从海量扫描文档、收据、论文中提取并理解信息,支持多语言。
  • 自动化内容创作:根据截图或设计稿,生成HTML/CSS/JS代码,或撰写描述性文本。
  • 教育和研究:辅助解答几何、物理等学科的视觉化问题。

Jetson 兼容性

Thor 128GB

Qwen3 系列

模型参数量
Qwen3-VL-8B-Instruct8B
Qwen3 30B-A3B30B-A3B
Qwen3-8B8B
Qwen3 4B4B
Qwen3 32B32B

模型路径