🚀本地Agent实战|DeepSeek‑Harness对接Qwen完整部署指南
模型+Harness=Agent,零API依赖,数据完全本地闭环,从算力选型、架构设计、实操部署到任务目标,一篇上手本地智能体开发。
标签:#DeepSeekHarness #Qwen #本地大模型 #AIAgent #私有化部署
📌前言:什么是DeepSeek‑Harness
DeepSeek‑Harness(简称dsh)是MIT协议开源的智能体运行框架,不是大模型本身。
公式:Agent = LLM模型 + Harness运行时
-
🧠Qwen:负责思考、推理、生成输出(大脑) -
⚙️DeepSeek‑Harness:负责任务拆解、工具调用、文件读写、shell执行、会话管理、沙箱隔离、子Agent调度(身体与神经系统)
传统对话模型只能输出文本;Harness可以让Qwen具备动手执行能力:读写本地文件、运行代码、调用终端、拆分复杂任务、失败自动重试,完整闭环完成工程任务。
⚠️当前为开发者预览版,部分接口会迭代变更,以官方GitHub为准。
🖥️算力硬件怎么选?显存/机器配置对照表
核心约束:Qwen模型推理消耗显存;Harness本身是Node.js程序,对GPU无要求,吃CPU+内存。
Harness可跑在普通PC、工作站、服务器;显存全部消耗来自Qwen大模型推理服务,Harness只做调度。
|
|
|
|
|
|
|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
💡补充说明:
-
优先使用vLLM/SGLang做推理后端,开启PagedAttention优化KV Cache显存占用,显著提升吞吐。 -
Apple Silicon:M3‑Max/M4,使用MLX量化版本,统一内存≥32G可流畅跑14B‑Q4。 -
CPU仅推理:仅适合0.6B‑4B小模型,Agent工具调用延迟很高,不推荐正式调试Agent。 -
Harness服务资源:8核CPU、16G内存即可,硬盘预留≥50GB存放模型权重。
分层拆解:
-
Cordis微内核层:Harness底层,所有能力全部插件化,模型、工具、UI、存储均可替换,无需修改源码。 -
Agent运行时层:Agent循环、任务规划、子Agent调度、会话日志、沙箱安全隔离。 -
模型适配层:OpenAI兼容标准接口,不绑定DeepSeek自家模型,原生支持Qwen、Llama等任意本地推理服务。 -
底层推理服务层:vLLM/Ollama/SGLang加载Qwen权重,对外提供标准OpenAI接口。
关键设计:Harness与大模型完全解耦。你可以随时切换Qwen不同版本,只修改配置文件,不用改动Agent业务逻辑。
两种部署架构方案
同一台机器同时运行:
-
Node.js运行DeepSeek‑Harness(3080端口WebUI) -
vLLM/Ollama推理服务,加载Qwen模型 -
全部本地,无外网,数据不出本机。
-
GPU服务器:只跑vLLM推理集群,部署Qwen,提供内网OpenAI接口。 -
应用服务器:运行DeepSeek‑Harness,内网访问推理服务地址。 -
多客户端访问Harness WebUI,多用户共享GPU算力。
🛠️完整本地部署实操步骤
环境前置条件
1.Git、Node.js ≥22版本;Python3.10‑3.12;CUDA环境;
2.已经下载好Qwen对应量化权重;
3.推理服务对外提供OpenAI兼容API地址。
Step1:部署Qwen本地推理服务(二选一)
python -m vllm.entrypoints.openai.api_server \--model ./Qwen3‑14B‑Instruct‑Q4_K_M \--served‑model‑name qwen‑local \--port 8000 \--gpu‑memory‑utilization 0.85
启动完成后,本地接口地址:http://127.0.0.1:8000/v1
ollama run qwen3:14b
默认接口:http://127.0.0.1:11434/v1
✅验证推理服务是否正常:浏览器访问
http://127.0.0.1:8000/v1/models,返回模型列表,代表推理服务就绪。
Step2:安装启动DeepSeek‑Harness
两种安装方式:
npx @deepseek‑ai/dsh web
访问WebUI地址:http://127.0.0.1:3080
git clone https://github.com/deepseek‑ai/deepseek‑harness.gitcd deepseek‑harnesspnpm installpnpm run buildpnpm run web
Step3:Harness配置对接本地Qwen模型
进入WebUI → Settings → Models配置面板
-
添加自定义OpenAI兼容模型提供商
providers:qwen‑local:type: openaibaseUrl: http://127.0.0.1:8000/v1apiKey: dummy #本地推理服务不需要真实密钥,填任意字符串
-
模型名称填写推理服务中 served‑model‑name,选中该模型作为当前Agent使用模型。 -
保存配置,重启Harness会话。
💡Headless无界面模式:适合脚本自动化执行任务,无需打开WebUI,直接命令行下发任务。
Step4:安全配置
-
开启沙箱插件,限制shell命令执行权限,防止模型执行高危系统命令; -
配置工作目录白名单,Agent仅允许读写指定文件夹,禁止访问系统目录。
🎯可以完成哪些任务?
基于Qwen+DeepSeek‑Harness本地Agent,可落地任务清单:
-
代码工程类
-
完整项目生成:需求描述直接生成完整前端/后端项目,自动创建文件、写代码、运行调试、修复Bug; -
本地代码库阅读:读取项目源码,分析架构、生成文档、单元测试;
-
文件处理类
-
批量解析本地文档、PDF、markdown,批量整理、改写、抽取数据;
-
自动化任务
-
拆分复杂目标为多步子任务,调用子Agent分工执行,自动重试失败步骤;
-
本地知识库RAG增强
-
接入本地检索插件,读取本地知识库做事实问答;
-
评测调试
-
headless模式批量跑Agent基准测试,对比不同Qwen版本、不同量化效果。
❗注意:小参数量模型(≤8B)工具调用稳定性有限,复杂Agent任务优先选择14B及以上版本。
✨部署后达成的核心目标
-
100%本地私有化闭环:所有业务数据、代码、文档不出内网,不调用第三方大模型API,满足数据安全合规; -
构建可执行的本地Agent底座:不再只是聊天对话,大模型具备真实环境执行能力; -
高度可扩展:插件化架构,自定义工具、自定义技能,可扩展自有业务插件; -
全链路可观测:Harness完整记录每一步思考、工具调用、返回结果,支持回放、回溯、复现Agent执行轨迹,方便调试问题; -
灵活切换底座模型:同一套Agent运行框架,随时切换Qwen不同参数版本,也可以切换其他开源大模型。
⚠️踩坑避坑清单
-
Harness本身不加载大模型权重,必须先启动独立推理服务,很多新手直接启动Harness后报错,根源是推理服务没有就绪。 -
Agent非常消耗上下文窗口,KV Cache显存占用会随对话轮次上涨,建议设置合理max‑context长度。 -
预览版插件配置会breaking change,升级版本注意备份settings.yaml配置文件。 -
本地小模型工具调用会出现格式错误,建议开启重试插件,自动修复JSON格式错误。 -
shell工具默认权限较高,生产部署务必开启沙箱插件,做好权限管控。
📚参考资源
-
DeepSeek‑Harness GitHub:https://github.com/deepseek‑ai/deepseek‑harness -
Qwen官方仓库:https://github.com/QwenLM/Qwen3 -
vLLM推理引擎:https://github.com/vllm‑project/vllm
📩 合作咨询 👇
【深入导读】
WorkBuddy:管理者该算的一笔账——不聊概念,只聊它怎么帮你建组织能力
零幻觉率AI智能体:让企业销售转化率飙升的"秘密武器"
星科AI-零幻觉率多智能体:让企业销售转化率飙升的"秘密武器",让AI真正为商业结果负责
星科AI-0幻觉率交易平台,不做"玩具型AI",只做能卖货的AI、能提效的AI、能落地的AI
深入了解企业级Workbuddy及AI Agent
可加星科AI客服微信号
📩 合作咨询 👇

