aoniAI Hub
返回应用列表
D

DeepSeek-R1 / DeepSeek-V3

其它对话聊天
deepseek开源大模型推理模型MoE强化学习
访问网站

应用介绍

DeepSeek 是杭州深度求索人工智能基础技术研究有限公司开发的开源大语言模型系列,其中 DeepSeek-R1 是首个完全通过强化学习训练的推理模型,采用组相对策略优化(GRPO)算法,在数学、代码、自然语言推理等任务上表现对标国际顶尖闭源模型;DeepSeek-V3 为通用对话与生成模型,采用 671B 参数混合专家(MoE)架构,实际激活参数量较小,推理效率高,适合在边缘设备上量化部署。两款模型均已开源模型权重,支持免费下载、本地部署、二次微调与商业化使用,是目前私有化部署场景下最主流的开源大模型之一。

部署方式

部署方式

本地量化部署(推荐,适配奥尼设备)

# 通过 ModelScope 下载量化版本
modelscope download --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B-FP4 --local_dir ./deepseek-r1

vLLM 推理引擎启动

vllm serve ./deepseek-r1 --port 8080 --quantization fp4

Ollama 快速体验

ollama run deepseek-r1:32b

硬件建议

  • 满血版 671B 模型:建议奥尼 Pro 6000D 集群或多卡服务器部署,不建议单台边缘设备运行
  • 蒸馏小尺寸版本(1.5B/7B/8B/14B/32B):奥尼 A2000 工作站(Thor 64GB/128GB)可直接本地运行,推荐 W4A16 或 FP8 量化

使用说明

核心特点

  • 强化学习驱动的推理能力:DeepSeek-R1 支持长链思维(Chain of Thought),复杂推理任务准确率高
  • 混合专家架构(MoE):671B 总参数但激活参数量小,推理成本低
  • 多尺寸蒸馏版本:1.5B 到 70B 多档蒸馏模型,适配不同硬件配置
  • 完全本地部署:模型权重开源可下载,数据不出企业
  • 开发者生态活跃:全球最热门开源模型之一,社区资源丰富

适用场景

企业私有化知识问答、代码辅助生成、复杂业务逻辑推理、政务/金融合规敏感场景本地化部署


**⚠️ 风险与注意事项:**

1. **许可证并非单一协议,需按模型类型分别核实**:DeepSeek-R1 与 DeepSeek-V3 的**代码仓库**遵循 MIT License(完全宽松,可自由使用/修改/商用/再分发,仅需保留版权声明);但 **DeepSeek-V3 模型权重本身**适用其自建的 DEEPSEEK LICENSE AGREEMENT(基于 OpenRAIL 修改),虽然同样允许商用且无强制开源回馈义务,但**附带"禁止用于非法或危险目的"的使用场景限制条款**。

2. **蒸馏模型许可证随基座模型继承,不能一概而论**:DeepSeek 官方发布的蒸馏版本基于 Llama 或 Qwen 架构训练,其许可证**继承自所选基座模型**——基于 Qwen 蒸馏的版本适用 Apache 2.0(宽松),但基于 Llama 蒸馏的版本需遵循 Meta 的 Llama License(附带一定使用条件,如月活超过一定量级需另行申请)。

3. **模型幻觉与内容合规责任**:作为生成式AI模型,DeepSeek 存在生成错误信息或不当内容的可能性,尤其在医疗、法律等专业场景,模型输出仅供参考,不构成专业意见。