aoniAI Hub
返回模型列表

Qwen3.8-27B-GGUF

Unsloth 团队发布的 Qwen3.8-27B 量化版(GGUF 格式)模型卡,Apache-2.0 许可,约 1.7k 点赞。模型基于 Qwen3.5 架构演进,是开源 Qwen 家族目前最强一代:27B 参数的稠密因果语言模型,配备视觉编码器,原生支持图文与视频理解。亮点包括:灵活思维控制(思考模式默认开启、可按请求关闭,支持 reasoning_effort 调节推理深度);更强的智能体规划与环境反馈处理能力;改进的工具调用解析;兼容 Codex 等智能体工具。存储约 16.3GB,提供多种量化档位(Q3_K、Q4_K_M、Q5_K_M、IQ4_NL、UD-Q4_K_XL 等)及 mmproj 视觉投影。

参数量17GB
模态Text, Image
精度FP16 · INT4
类型LLM
推理引擎llama.cpp

快速部署

部署模型

命令根据你的配置自动生成
docker run -i --rm \
    --network host \
    --runtime=nvidia \
    -e MODEL_OSS=True \
    -e MODEL_NAME=unsloth/Qwen3.8-27B-GGUF \
    -e LLAMACPP_MAIN_GGUF=Qwen3.8-27B-Q4_K_M.gguf \
    -e LLAMACPP_MMPROJ_GGUF=mmproj-F16.gguf \
    -v /data/models:/models \
    aoni-docker-cn-guangzhou.cr.volces.com/public/llm/main/aoni/nvidia-ai-iot/llama_cpp:latest-jetson-thor \
        llama-server -m /models/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf \
            --mmproj /models/unsloth/Qwen3.8-27B-GGUF/mmproj-F16.gguf \
            -ngl all \
            --spec-type draft-mtp \
            --temp 1.0 \
            --top-k 20 \
            --min-p 0.0 \
            --host 0.0.0.0 --port 8080

模型详情

发布者
Alibaba
系列
Qwen
参数量
27B (17GB)
上下文长度
262,144 tokens
许可证
Apache 2.0
推理引擎
llama.cpp

输入和输出

输入: Text, Image / 输出: Text, Image

Jetson 兼容性

Thor 128GBThor 64GBOrin 64GB