大数跨境

本地Agent实战|DeepSeek‑Harness对接Qwen完整部署指南

本地Agent实战|DeepSeek‑Harness对接Qwen完整部署指南 星科智汇ai
2026-08-22
1


🚀本地Agent实战|DeepSeek‑Harness对接Qwen完整部署指南

模型+Harness=Agent,零API依赖,数据完全本地闭环,从算力选型、架构设计、实操部署到任务目标,一篇上手本地智能体开发。

标签:#DeepSeekHarness #Qwen #本地大模型 #AIAgent #私有化部署


📌前言:什么是DeepSeek‑Harness

DeepSeek‑Harness(简称dsh)是MIT协议开源的智能体运行框架,不是大模型本身。

公式:Agent = LLM模型 + Harness运行时

  • 🧠Qwen:负责思考、推理、生成输出(大脑)
  • ⚙️DeepSeek‑Harness:负责任务拆解、工具调用、文件读写、shell执行、会话管理、沙箱隔离、子Agent调度(身体与神经系统)

传统对话模型只能输出文本;Harness可以让Qwen具备动手执行能力:读写本地文件、运行代码、调用终端、拆分复杂任务、失败自动重试,完整闭环完成工程任务。

⚠️当前为开发者预览版,部分接口会迭代变更,以官方GitHub为准。


🖥️算力硬件怎么选?显存/机器配置对照表

核心约束:Qwen模型推理消耗显存;Harness本身是Node.js程序,对GPU无要求,吃CPU+内存。
Harness可跑在普通PC、工作站、服务器;显存全部消耗来自Qwen大模型推理服务,Harness只做调度。

使用场景
Qwen模型版本
量化精度
最低显存
推荐硬件
学习测试、简单脚本任务
Qwen3‑8B
Q4_K_M
8‑10GB
RTX3060‑12G / RTX4060Ti
日常开发Agent、代码工程
Qwen3‑14B
Q4_K_M
16‑18GB
RTX3090/4090 24G
复杂项目、长上下文、多轮工具调用
Qwen3‑32B
Q4_K_M
20‑22GB
RTX4090 24G / A10‑24G
企业级高并发
Qwen3‑72B
FP8
80GB+
A100/H100多卡张量并行

💡补充说明:

  1. 优先使用vLLM/SGLang做推理后端,开启PagedAttention优化KV Cache显存占用,显著提升吞吐。
  2. Apple Silicon:M3‑Max/M4,使用MLX量化版本,统一内存≥32G可流畅跑14B‑Q4。
  3. CPU仅推理:仅适合0.6B‑4B小模型,Agent工具调用延迟很高,不推荐正式调试Agent。
  4. Harness服务资源:8核CPU、16G内存即可,硬盘预留≥50GB存放模型权重。

分层拆解

  1. Cordis微内核层:Harness底层,所有能力全部插件化,模型、工具、UI、存储均可替换,无需修改源码。
  2. Agent运行时层:Agent循环、任务规划、子Agent调度、会话日志、沙箱安全隔离。
  3. 模型适配层OpenAI兼容标准接口,不绑定DeepSeek自家模型,原生支持Qwen、Llama等任意本地推理服务
  4. 底层推理服务层:vLLM/Ollama/SGLang加载Qwen权重,对外提供标准OpenAI接口。

关键设计:Harness与大模型完全解耦。你可以随时切换Qwen不同版本,只修改配置文件,不用改动Agent业务逻辑。

两种部署架构方案

同一台机器同时运行:

  • Node.js运行DeepSeek‑Harness(3080端口WebUI)
  • vLLM/Ollama推理服务,加载Qwen模型
  • 全部本地,无外网,数据不出本机。
  1. GPU服务器:只跑vLLM推理集群,部署Qwen,提供内网OpenAI接口。
  2. 应用服务器:运行DeepSeek‑Harness,内网访问推理服务地址。
  3. 多客户端访问Harness WebUI,多用户共享GPU算力。

🛠️完整本地部署实操步骤

环境前置条件
1.Git、Node.js ≥22版本;Python3.10‑3.12;CUDA环境;
2.已经下载好Qwen对应量化权重;
3.推理服务对外提供OpenAI兼容API地址。

Step1:部署Qwen本地推理服务(二选一)

python -m vllm.entrypoints.openai.api_server \--model ./Qwen3‑14B‑Instruct‑Q4_K_M \--served‑model‑name qwen‑local \--port 8000 \--gpu‑memory‑utilization 0.85

启动完成后,本地接口地址:http://127.0.0.1:8000/v1

ollama run qwen3:14b

默认接口:http://127.0.0.1:11434/v1

✅验证推理服务是否正常:浏览器访问 http://127.0.0.1:8000/v1/models,返回模型列表,代表推理服务就绪。

Step2:安装启动DeepSeek‑Harness

两种安装方式:

npx @deepseek‑ai/dsh web

访问WebUI地址:http://127.0.0.1:3080

git clone https://github.com/deepseek‑ai/deepseek‑harness.gitcd deepseek‑harnesspnpm installpnpm run buildpnpm run web

Step3:Harness配置对接本地Qwen模型

进入WebUI → Settings → Models配置面板

  1. 添加自定义OpenAI兼容模型提供商
providers:  qwen‑local:    type: openai    baseUrl: http://127.0.0.1:8000/v1    apiKey: dummy #本地推理服务不需要真实密钥,填任意字符串
  1. 模型名称填写推理服务中served‑model‑name,选中该模型作为当前Agent使用模型。
  2. 保存配置,重启Harness会话。

💡Headless无界面模式:适合脚本自动化执行任务,无需打开WebUI,直接命令行下发任务。

Step4:安全配置

  • 开启沙箱插件,限制shell命令执行权限,防止模型执行高危系统命令;
  • 配置工作目录白名单,Agent仅允许读写指定文件夹,禁止访问系统目录。

🎯可以完成哪些任务?

基于Qwen+DeepSeek‑Harness本地Agent,可落地任务清单:

  1. 代码工程类
  • 完整项目生成:需求描述直接生成完整前端/后端项目,自动创建文件、写代码、运行调试、修复Bug;
  • 本地代码库阅读:读取项目源码,分析架构、生成文档、单元测试;
  1. 文件处理类
  • 批量解析本地文档、PDF、markdown,批量整理、改写、抽取数据;
  1. 自动化任务
  • 拆分复杂目标为多步子任务,调用子Agent分工执行,自动重试失败步骤;
  1. 本地知识库RAG增强
  • 接入本地检索插件,读取本地知识库做事实问答;
  1. 评测调试
  • headless模式批量跑Agent基准测试,对比不同Qwen版本、不同量化效果。

❗注意:小参数量模型(≤8B)工具调用稳定性有限,复杂Agent任务优先选择14B及以上版本。

✨部署后达成的核心目标

  1. 100%本地私有化闭环:所有业务数据、代码、文档不出内网,不调用第三方大模型API,满足数据安全合规;
  2. 构建可执行的本地Agent底座:不再只是聊天对话,大模型具备真实环境执行能力;
  3. 高度可扩展:插件化架构,自定义工具、自定义技能,可扩展自有业务插件;
  4. 全链路可观测:Harness完整记录每一步思考、工具调用、返回结果,支持回放、回溯、复现Agent执行轨迹,方便调试问题;
  5. 灵活切换底座模型:同一套Agent运行框架,随时切换Qwen不同参数版本,也可以切换其他开源大模型。

⚠️踩坑避坑清单

  1. Harness本身不加载大模型权重,必须先启动独立推理服务,很多新手直接启动Harness后报错,根源是推理服务没有就绪。
  2. Agent非常消耗上下文窗口,KV Cache显存占用会随对话轮次上涨,建议设置合理max‑context长度。
  3. 预览版插件配置会breaking change,升级版本注意备份settings.yaml配置文件。
  4. 本地小模型工具调用会出现格式错误,建议开启重试插件,自动修复JSON格式错误。
  5. shell工具默认权限较高,生产部署务必开启沙箱插件,做好权限管控。

📚参考资源

  • DeepSeek‑Harness GitHub:https://github.com/deepseek‑ai/deepseek‑harness
  • Qwen官方仓库:https://github.com/QwenLM/Qwen3
  • vLLM推理引擎:https://github.com/vllm‑project/vllm


📩 合作咨询 👇


【深入导读】

WorkBuddy:管理者该算的一笔账——不聊概念,只聊它怎么帮你建组织能力

零幻觉率AI智能体:让企业销售转化率飙升的"秘密武器"

星科AI-零幻觉率多智能体:让企业销售转化率飙升的"秘密武器",让AI真正为商业结果负责

星科AI-0幻觉率交易平台,不做"玩具型AI",只做能卖货的AI、能提效的AI、能落地的AI


深入了解企业级Workbuddy及AI Agent

可加星科AI客服微信号

📩 合作咨询 👇


星科AI全面升级!
如需深度了解,文未客服微信联系!
云端+本地!平台+场景!服务+陪跑!
欢迎联系!




【声明】内容源于网络
0
0
星科智汇ai
星科AI链接:www.xingkeai.cn 技术研发、人才培养、产业孵化、学术交流、科研资源、人才集聚、产业融合
内容 111
粉丝 0
星科智汇ai 星科AI链接:www.xingkeai.cn 技术研发、人才培养、产业孵化、学术交流、科研资源、人才集聚、产业融合
总阅读350
粉丝0
内容111