来源:互联网 更新时间:2026-07-20 13:10
Deepseek最近太火了,关于它的文章铺天盖地,但仔细一翻,大多停留在Ollama部署这种“玩具”场景,真正能扛住企业级应用的文章少之又少。低质量内容虽然热闹,但对于追求高效、稳定解决方案的团队来说,总觉得隔靴搔痒。
这篇文章就直奔主题:从镜像选择到推理框架,从云服务器部署到Dify配置,把企业级部署的完整流程掰开了揉碎了讲清楚。每个步骤都经过反复验证,确保专业性和可复现性——既是一份技术指南,也是企业走向智能运营的实用工具。
先说镜像选型。满血版R1有671B参数,对显存和存储的要求都相当高。如果没有集群环境,完全可以考虑DeepSeek-R1-Distill-Qwen-32B作为平替。在精度要求不那么高的场景下,这个蒸馏版部署起来更轻便,作为满血版的补充很合适。
接下来是推理框架的选择。目前主流的框架有这么几种:
经过实际测试,部署满血版R1建议用SGLang镜像,而部署蒸馏版模型(如32B、70B)则用vLLM效果更好。
这次选择以火山引擎的GPU ECS为例(因为火山引擎已经缓存了推理引擎和模型文件,直接拉取速度更快)。
推理引擎镜像:cp-controller-cn-beijing.cr.volces.com/appdeliver-ml/vllm:0.7.1
运行docker时会自动下载对应模型文件。如果有手动下载需求,下面链接供参考:
| 模型名称 | 参数量 | 对象存储服务链接 |
|---|---|---|
| DeepSeek-R1-Distill-Qwen-7B | 7B | https://cp-public-model-cn-beijing.tos-cn-beijing.volces.com/models/DeepSeek-R1-Distill-Qwen-7B/ |
| DeepSeek-R1-Distill-Qwen-32B | 32B | https://cp-public-model-cn-beijing.tos-cn-beijing.volces.com/models/DeepSeek-R1-Distill-Qwen-32B/ |
| DeepSeek-R1-Distill-Llama-70B | 70B | https://cp-public-model-cn-beijing.tos-cn-beijing.volces.com/models/DeepSeek-R1-Distill-Llama-70B/ |
ECS实例规格可以参考以下配置:
| 模型名称 | 参数量 | CPU | 内存 | 存储 | 显存需求 | 显卡推荐(Nvidia) |
|---|---|---|---|---|---|---|
| DeepSeek-R1 | 7B | 8C | 16GB | 30GB | 8GB | 1x RTX 3060 |
| 32B | 16C | 64GB | 200GB | 48GB | 2x L20 48GB | |
| 70B | 32C | 128GB+ | 500GB+ | 96GB+ | 1x H20 96GB 或 4x RTX 4090 | |
| 671B | 128C | 512GB+ | 1T+ | 700GB+ | 8x H20 96GB |
实际选择的服务器配置:

购买ECS后,进入控制台,需要完成两步:安装Docker和安装nvidia-container-toolkit。具体命令如下:
# Update the apt package index and install packages to allow apt to use a repository over HTTPS
sudo apt update
sudo apt install ca-certificates curl gnupg lsb-release
# Add Docker’s official GPG key
sudo mkdir -p /etc/apt/keyrings
curl -fsSL https://mirrors.ivolces.com/docker/linux/ubuntu/gpg | sudo gpg --dearmor -o /etc/apt/keyrings/docker.gpg
# Use the following command to set up the repository
echo "deb [arch=$(dpkg --print-architecture) signed-by=/etc/apt/keyrings/docker.gpg] https://mirrors.ivolces.com/docker/linux/ubuntu $(lsb_release -cs) stable" | sudo tee /etc/apt/sources.list.d/docker.list > /dev/null
# update package index
sudo apt update
# Install docker-ce
sudo apt install docker-ce docker-ce-cli containerd.io docker-compose-plugin
curl -s https://mirrors.ivolces.com/nvidia_all/ubuntu2204/x86_64/3bf863cc.pub | sudo apt-key add -
cat </etc/apt/sources.list.d/nvidia.list
deb http://mirrors.ivolces.com/nvidia_all/ubuntu2204/x86_64/ /
EOF
apt update
apt install nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
接下来正式部署Docker镜像(单机4卡,TP=4,PORT=8888可自定义):
docker run -d --network host --privileged --gpus=all --name=vllm_qwen32B --ipc=host \
-v /data00/models:/data00/models \
-v /var/run/nvidia-topologyd/:/var/run/nvidia-topologyd/ \
-e MODEL_PATH=/data00/models \
-e PORT=8888 \
-e MODEL_NAME=DeepSeek-R1-Distill-Qwen-32B \
-e TP=4 \
cp-controller-cn-beijing.cr.volces.com/appdeliver-ml/vllm:0.7.1
静等pull完成。返回completed并不代表加载完成,需要打开Docker日志继续观察:
docker logs vllm_qwen32B
日志输出如下:

等到进度显示100%,恭喜!模型加载完成,Docker启动成功。
先在服务器内部验证一下。执行以下curl命令,如果观察到流式输出,说明模型正常运行,可以进入下一步集成。
curl -X POST http://0.0.0.0:8888/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "/data00/models/DeepSeek-R1-Distill-Qwen-32B",
"messages": [{"role": "user", "content": "请证明一下黎曼猜想"}],
"stream": true,
"max_tokens": 100,
"temperature": 0.7
}'
提醒:如果curl返回拒绝连接,大概率是权重文件还没下载加载完毕,稍后再试即可。

如果你部署在云端,需要调整安全组策略,添加入方向规则开放8888端口。配置完毕后,用Postman调用接口测测看:

返回结果中可以看到reasoning_content字段,R1推理成功。
好了,接下来就是集成到应用平台。这里用Dify作为应用构建平台。
以下安装流程比较通用,也可以参考Dify官网的说明。
CPU >= 2 Core,RAM >= 4GB。
此处不再赘述,自行百度即可。
git clone https://github.com/langgenius/dify.git
cd dify/docker
cp .env.example .env
docker compose up -d
检查所有容器是否正常运行:
docker compose ps
应该看到3个业务服务(api / worker / web)和6个基础组件(wea viate / db / redis / nginx / ssrf_proxy / sandbox)。
cd dify/docker
docker compose down
git pull origin main
docker compose pull
docker compose up -d
.env.example文件有更新,请务必同步修改本地.env文件,确保所有配置项与实际运行环境匹配。
项目中启动了一个nginx容器将web服务转发到80端口,直接在浏览器中输入公网IP地址,设置管理员的账号密码,即可进入Dify主界面。在浏览器中输入http://localhost访问Dify。
最后一步,配置大模型。
选择用户信息下拉列表 → 设置 → 模型供应商,选择【OpenAI-API-compatible】模块,配置自定义模型接口。
按照下图格式配置信息,API Key没有就填EMPTY。
保存后,记得在模型列表选择配置按钮,开启模型。
最后,创建一个空白应用,在模型列表里选择刚配置的模型即可。
点击发布应用,就可以进入聊天界面了。
当然,目前与Dify的集成还有些小问题:比如思考内容不能输出,上下文对话轮次不能调整等。后续有待优化。
七麦数据官网网页地址 七麦数据官方入口在线首页
问卷星官方网站入口地址 问卷星网页版在线使用
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
淘宝直播如何看回放在哪里看?怎么查看淘宝直播回放
摩托车活塞环性能如何
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
《梦幻西游》特殊鬼怪怎么抓-隐藏变异鬼应对要点
索尼限时赠送PS Plus Premium七日会员,需手
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
豆包AI专业版使用教程【新手必看】
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
币圈十大实用工具:从实时行情监控到数据分析、资产管理
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc