快速入口
选择你需要的资源,快速开始
精选模型
最新模型,上线即支持 Jetson 部署
Qwen3.8-27B-GGUF
Unsloth 团队发布的 Qwen3.8-27B 量化版(GGUF 格式)模型卡,Apache-2.0 许可,约 1.7k 点赞。模型基于 Qwen3.5 架构演进,是开源 Qwen 家族目前最强一代:27B 参数的稠密因果语言模型,配备视觉编码器,原生支持图文与视频理解。亮点包括:灵活思维控制(思考模式默认开启、可按请求关闭,支持 reasoning_effort 调节推理深度);更强的智能体规划与环境反馈处理能力;改进的工具调用解析;兼容 Codex 等智能体工具。存储约 16.3GB,提供多种量化档位(Q3_K、Q4_K_M、Q5_K_M、IQ4_NL、UD-Q4_K_XL 等)及 mmproj 视觉投影。
部署模型
模型详情docker run -i --rm \
--network host \
--runtime=nvidia \
-e MODEL_OSS=True \
-e MODEL_NAME=unsloth/Qwen3.8-27B-GGUF \
-e LLAMACPP_MAIN_GGUF=Qwen3.8-27B-Q4_K_M.gguf \
-e LLAMACPP_MMPROJ_GGUF=mmproj-F16.gguf \
-v /data/models:/models \
aoni-docker-cn-guangzhou.cr.volces.com/public/llm/main/aoni/nvidia-ai-iot/llama_cpp:latest-jetson-thor \
llama-server -m /models/unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf \
--mmproj /models/unsloth/Qwen3.8-27B-GGUF/mmproj-F16.gguf \
-ngl all \
--spec-type draft-mtp \
--temp 1.0 \
--top-k 20 \
--min-p 0.0 \
--host 0.0.0.0 --port 8080Qwen3.6 35B-A3B(MoE)
阿里 Qwen3.6 系列 MoE 模型,总参数 35B 仅激活 3B,支持 MTP 推测解码,原生支持推理和函数调用
部署模型
模型详情sudo docker run -it --rm --runtime=nvidia --network host \
-e MODEL_OSS=True \
-e MODEL_ROOT=/models \
-e ENGINE_URI=tos://ai-hub/models/qwen/Qwen3.6-35B-A3B-NVFP4.tar.gz \
-e MODEL_NAME=qwen/Qwen3.6-35B-A3B-NVFP4 \
-v ~/models:/models \
aoni-docker-cn-guangzhou.cr.volces.com/public/llm/main/aoni/vllm/vllm-openai:nightly-aarch64 \
--port 8300 \
--max-model-len 8192 \
--gpu-memory-utilization 0.4 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_xml \
--speculative-config '{"method":"mtp","num_speculative_tokens":3,"moe_backend":"triton"}'最新动态
最近更新的模型与资源
模型更新
Nemotron-3-Nano-Omni
VLM模型NVIDIA 推出的全模态 MoE 推理模型,30B 总参数仅激活 3B,原生支持文本、图像、音频、视频四种输入,256K 上下文
Gemma 3 4B
LLM模型Google Gemma 3 系列 4B 语言模型
Qwen3-VL-8B-Instruct
LLM模型Qwen3-VL-8B-Instruct 是阿里云通义千问团队开发的一款80亿参数的多模态大模型,在同系列中兼具强大的性能和更友好的部署成本
Gemma 3 1B
LLM模型Google Gemma 3 系列 1B 轻量语言模型,适合资源受限设备
Gemma 3 270M
LLM模型Google Gemma 3 系列 270M 超轻量语言模型
Gemma 4 26B-A4B
LLM模型Google Gemma 4 系列 MoE 模型,25.8B 总参数 / 3.8B 激活,256K 上下文,支持文本和图像理解
应用更新
灵策智算
officeAgent面向企业与个人的 AI 智能体协作桌面平台,可通过自然语言调用文档、表格、PDF 与浏览器工具,并提供数字员工、专家团队、定时任务及应用/技能扩展。
AI相面大师
chatAgent相面大师是一款基于**多模态大模型**、**确定性排盘算法**与**规则评分引擎**构建的综合命理分析智能体。 用户依次提供清晰的正面面部照片、手掌照片(掌纹清晰),并输入出生时间(触控屏操作) 系统将: 1. 通过视觉算法(MediaPipe FaceMesh)提取面部与手掌关键特征; 2. 利用确定性算法完成八字排盘(天干地支、五行旺衰、十神等,不依赖大模型计算,确保准确性与可复现性); 3. 融合三路信息,调用端侧多模态大模型生成解读文案,并叠加规则评分引擎输出趣味星级; 4. 通过 WebSocket 实时反馈分析进度,最终生成完整报告,并支持海报分享。 全流程端侧离线推理 · 数据不出设备 · 照片分析后自动清除。
AI虚拟试衣间
image-designAgent虚拟试衣间是一款基于**虚拟试穿模型(CatVTON)**与**图像生成技术**打造的 AI 换装智能体。用户可通过摄像头拍照或选择预设模特作为试穿主体,从内置服装库中挑选款式,亦可上传自己的服装图片作为自定义素材,由智能体生成对应的虚拟试穿效果。 支持中国传统服饰、现代时装及创意主题等多种风格,并提供 **“模特 + 人脸换脸”** 模式,适用于服装搭配、穿搭探索、商品展示和视觉创作。所有换装与分享数据默认保存在端侧设备,分享链接 **10 分钟后自动失效并删除**,充分保障隐私安全。
技能更新
飞书 LARK
officeSkill**官方来源**: Lark (MIT) Lark 官方 CLI 与 AI Agent Skills,覆盖文档、消息、日历、表格等 **支持能力**: 1. Lark 官方 CLI 与 AI Agent Skills,覆盖文档、消息、日历、表格等 2. 按官方 `SKILL.md` 工作流提供任务级指导。 3. 通过 references / scripts / assets 等资源实现渐进式披露。 4. 在任务匹配时触发,减少无关上下文占用。
前端设计
designSkill**官方来源**: Anthropic (Apache-2.0) 创建具有差异化审美和生产质量的前端界面 **支持能力**: 1. 创建具有差异化审美和生产质量的前端界面 2. 按官方 `SKILL.md` 工作流提供任务级指导。 3. 通过 references / scripts / assets 等资源实现渐进式披露。 4. 在任务匹配时触发,减少无关上下文占用。
前端设计
designSkillAnthropic 官方开源前端设计技能
