返回模型列表
发布者 Alibaba 系列 Qwen3 参数量 8B (5.5 GB) 上下文长度 242,144 tokens 许可证 Apache 2.0 推理引擎 vllm, TensorRT Edge-LLM
Qwen3-VL-8B-Instruct
Qwen3-VL-8B-Instruct 是阿里云通义千问团队开发的一款80亿参数的多模态大模型,在同系列中兼具强大的性能和更友好的部署成本
参数量5.5 GB
模态Text, Image
精度NVFP4
类型LLM
推理引擎vllm, TensorRT Edge-LLM
快速部署
部署模型
命令根据你的配置自动生成
docker run -d --privileged -p 8080:8080 \
-e MODEL_OSS=True \
-e MODEL_ROOT=/models \
-e ENGINE_URI=tos://ai-hub/models/qwen/Qwen3-VL-8B-Instruct.tar.gz \
-e MODEL_NAME=qwen/Qwen3-8B \
-e MODELSCOPE_CACHE=/models \
-e HF_HUB_OFFLINE=1 -e TRANSFORMERS_OFFLINE=1 \
-e MACA_SMALL_PAGES_FW_ENABLE=1 -e MASA_USE_ASYNC_MMAP=1 \
-e MCCL_NET_GDR_LEVEL=5 -e MCCL_P2P_LEVEL=7 \
-e MACA_QUANT_DISABLE=1 \
-e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \
-v /data/models:/models:ro \
--device /dev/mxcd:/dev/mxcd \
aoni/metax/vllm-metax:0.20.0-maca.ai3.7.0.107-torch2.8-py310-ubuntu22.04-amd64 \
vllm serve /models/Qwen/Qwen3-VL-8B-Instruct \
--served-model-name Qwen/Qwen3-VL-8B-Instruct\
--host 0.0.0.0 --port 8080 \
--trust-remote-code --dtype bfloat16 --max-model-len 204800 \
--gpu-memory-utilization 0.97 \
--max-num-seqs 4 \
--enforce-eager --disable-custom-all-reduce模型详情
输入和输出
输入: Text, Image / 输出: Text, Image
用途
- 多模态对话与问答:构建能看懂图片、图表的智能客服或助手。
- 文档与内容分析:从海量扫描文档、收据、论文中提取并理解信息,支持多语言。
- 自动化内容创作:根据截图或设计稿,生成HTML/CSS/JS代码,或撰写描述性文本。
- 教育和研究:辅助解答几何、物理等学科的视觉化问题。
Jetson 兼容性
Thor 128GB
Qwen3 系列
| 模型 | 参数量 | 硬件 | 精度 |
|---|---|---|---|
| Qwen3-VL-8B-Instruct | 8B | Thor 128GB | NVFP4 |
| Qwen3 30B-A3B | 30B-A3B | Thor 128GB, Thor 64GB, Orin 64GB | NVFP4, BF16 |
| Qwen3-8B | 8B | Thor 128GB, Thor 64GB, Orin 64GB, Orin 16GB | NVFP4, FP8, BF16 |
| Qwen3 4B | 4B | Thor 128GB, Thor 64GB, Orin 64GB, Orin 16GB, Orin 8GB | NVFP4, BF16 |
| Qwen3 32B | 32B | Thor 128GB, Thor 64GB | NVFP4, BF16 |