《外贸 AI 落地实战》第 4 篇 / 共 10 篇 · 第一部分 · 底座
本篇来源:线下沙龙知识库部分整理(原理、工具、PDF 解析、团队共享)
开篇:同样一句话,两个网站
我在现场做了个对比演示。

同一句指令——"根据这份 PDF 帮我做个网站"——跑了两遍:
- 第一遍
:只有一个 PDF。出来一个单页,配色普通,点"立即咨询"会跳到别的页面去。你看了会说"这玩意儿也能叫网站?" - 第二遍
:接了知识库。出来的是一个多页网站,有产品、有服务、有关于我们,图片是它自己从知识库里找到对应产品传上去的,内容长度也合适,几乎可以直接用。
指令一模一样。差别只在 AI 知道多少。
这就是知识库的全部意义。
一、原理:一句话,AI 为什么会变聪明
正常你问大模型一句"帮我做个网站",它看到的就是这七个字,然后给你做个网站。
接了知识库之后,流程变成这样:
```
你提问 → 先去知识库检索相关知识 → 把检索结果和你的问题一起给模型 → 模型输出
```
同样一句"帮我做个网站",模型实际收到的是:
请帮我做个网站。我们公司成立多少年、厂房多大、有多少专利、做什么产品、产品优势是什么、服务有哪些、有多少案例、哪些客户说过我们好……
两个网站能一样吗?
所以知识库的本质不是"存资料",而是:
让你在 AI 那儿变得"可见"。
AI 看不见你,它就只能瞎编;编出来的东西你还得改,改的时间比自己写还长——于是你的结论就是"AI 还不如我自己写"。
这不是 AI 的问题,是你没让它看见你。
二、为什么必须向量化,以及为什么是 Obsidian
向量是个什么东西?
举个例子:"中国"和"北京"这两个词,字面上没有任何关系——"中国"不包含"北京","北京"也不包含"中国"。
但在向量空间里,这俩词离得非常近。因为"中国的首都是北京"。
AI 理解世界靠的就是这种"距离"。 哪个词跟你现在说的事更近,它就往哪个方向走。
这带来一个关键结论:
AI 能理解的,必须是向量数据库。你过去那些结构化文件(Excel 表格、固定的表单),它理解起来很吃力,而且经常理解错。
为什么是 Obsidian
当前开源、免费、自己能用、又足够好的本地知识库方案里,Obsidian 是我用下来最省事的一个。
你要是技术大拿,可以去搞图计算、知识图谱那一套前沿的东西。对绝大多数公司来说,不需要。
界面长这样:打开是一张"点状图",每个点是一块知识,点和点之间的连线就是向量距离。你点开一个点,能看到这篇文章讲什么、围绕哪些东西组织起来。
我自己电脑上有好几个这样的库:我自己的、美容仪器的、矿山机械的——后两个是因为我第一份工作做美容仪器、第二份工作做矿山机械,手上资料多,就搭着玩。
底部还有两个是给客户做测试的。
一个反直觉的用法:不知道什么有用,就全扔进去
很多人卡在第一步:"我不知道哪些资料有用啊。"
我的答案永远是:不知道就都扔进去。
理由很简单:它最终建成的是个向量环境,相关内容会自动聚在一起,不相关的内容会自动离主题很远。AI 自己能识别。
有垃圾进去?无所谓,就是硬盘多占点空间。
比起"漏掉关键知识","多存点没用的"代价小太多了。
三、三个必须知道的操作
1. 建库:一句话的事
帮我把这个博客/这个文件夹里的内容,同步到 Obsidian 本地知识库。
就这一句,它自己干。
我自己有个从 2009 年开始写的博客,我把全部内容同步进了本地知识库。现在它比我还了解我——十五年前写的东西我都忘了,它还记得。有时候我看它写的内容,会有一种回忆的感觉:"哦,我过去确实是这么想这件事的。"
2. 新内容自动回流
这一点特别重要,很多人漏了:
我以后写的文章,你帮我自动回到这个知识库里。
说完这一句,它就会记住。以后你说"写篇文章",写完的文章自动就出现在知识库里了。
闭环就这么搭上了。 你的知识库会随着你工作自动长大,而不是建一次就死在那儿。
3. 目录授权
Obsidian 是本地 App,知识库就是你电脑上的文件。
⚠️ 关键操作:把知识库放在你给了 Agent 完整权限的那个目录下。
比如我的都放在 project 目录里,而这个目录我给 AI 开了完整权限(有些客户端里叫 Bypass)。这样 AI 需要读的时候,直接就能进去读。
不放对地方,它读不到,等于白建。
四、最大的坑:PDF 是流失率最高的格式
你公司的资料大概是这样的:PPT、Excel、Word、PDF。
这些转成 Markdown 格式时,损失率都不算高。唯独 PDF 是重灾区。
原因:PDF 是为了"显示"而格式化的,换行、层级、图文关系在硬编码结构里被打散了。AI 读它,就像你读一份被拆散重排的说明书——字都在,但关系没了。
解法:用专门工具还原。
我自己在用的是 MinerU(免费的,有在线版,也有 API)。它能把 PDF 里的字和图都解析出来,还原度高很多。
⚠️ 这里有个通用方法,价值比工具本身大:
给 AI 任何新能力,你只需要两样东西:一个 API + 一份说明文档。
把 MinerU 的 API 密钥和它的说明文档链接丢给 Agent,告诉它"去使用这个",它自己就学会了。你不需要先读懂文档再教它。
这个套路适用于你后面遇到的所有工具:
```
找到工具的 API → 生成密钥 → 把密钥和说明文档给 AI → 告诉它你要什么
```
我现场讲的所有东西,几乎都是这个模式。 这也是为什么我反复强调那句:
以后你选任何线上工具,第一个问题永远是:有 API 吗?
没有,就换一个。
原因很实在:没有 API,AI 就只能用"肉眼看"的方式去操作界面——能干,但 token 消耗大概是 API 方式的一百倍(现场口径)。本来一块钱干完的事,变成一百块。
五、知识库里到底该放什么
按用途分:
营销场景(最好用的部分)
-
产品介绍 -
客户案例 -
服务内容 -
工厂/产能 -
证书资质 -
口碑评价
判断标准特别简单:你网站上有的那些东西,就是营销知识库该有的东西。
内部管理场景
制度、流程、常见问题的答案。这块 AI 能给你做提示,比较省心。
⚠️ 销售场景:我劝你别碰
这句是我的真心话:
当前的销售场景,整体是超出 AI 边界的。别去想让它帮你谈客户。
举个例子。客户问:"这个价?"
这句话背后可能是什么意思?——"这么贵?""这么便宜?""还能再降吗?""你在试探我?"
同样一句话,意思完全不同。AI 理解不了人和人之间沟通里那些微妙的东西。
所以别在这上面浪费时间。
一个被低估的富矿:你的邮箱
我在现场问了个问题:公司里最有价值的信息在哪?
在你的邮箱里。
你天天跟客户来来往往的那些邮件——客户问过什么问题、关心什么参数、纠结什么交期、为什么最后没下单——这是最真实、最高密度的客户知识。
网站要解决客户的问题,而客户问题最集中的地方,就是你和业务员的收件箱。
把邮箱授权给 Agent 去读一遍,它能提炼出大量产品知识、应用场景、客户案例。
⚠️ 安全说明(我在现场也强调了):这种授权是让它搜索并提炼知识,提炼出来的是产品知识、应用场景、案例这类内容;你的密码、客户隐私信息不会被保留。
但我要补一句实话:只要你用第三方 SaaS 工具,理论上的泄露风险就存在。 这是你选择便利时必须接受的代价。所以——
六、为什么知识库必须在你自己手里
前面说的都是"怎么建"。这一节说"放哪",我认为这是整篇最重要的部分。
结论:核心知识库放在本地,你自己完全控制。
理由一:它是你未来最核心的资产。
客户资料可能会流失,平台规则会变,甚至你的产品线都会换——但知识是那个真正给你带来客户的东西。
理由二:第三方工具的知识库,必然在第三方服务器上。
这不是阴谋论,是技术必然:它要连着你的知识库给你自动回复,那你的知识库就得放在它那儿。
理由三:向外分发的,都应该是子集,而且要脱敏。
我的做法是这样的:
```
本地核心库(完整、原始、不外发)
├── 营销用子集(脱敏)
├── 销售用子集(脱敏)
└── 生产/采购用子集(脱敏)
```
每一个往外发的,都只是完整知识库的一部分,且经过脱敏。核心的东西不出去。
这也是为什么很多国企、大型上市公司上 AI 上得慢——他们宁愿不上,也不能让数据外泄。
团队怎么共用?(这是目前最难的一节)
Obsidian 是本地 App,装在你电脑上,同事用不了。
方案一(简单):Obsidian 官方同步服务。
付费插件,买了之后同一个账号多台电脑自动同步,谁改都能同步。价格不算贵(我印象中是几十块钱级别,现场口径,以官网为准)。
⚠️ 注意:换个电脑就没了。它是本地文件,不会自动跟着你走。
方案二(进阶):自建服务器版 Agent。
把知识库放在一台服务器上,大家远程访问同一个网址、同一套 Agent。这样全公司用的是一个知识库、一套 Skill,不会你造一遍我造一遍、还都是不同版本。
目前这类方案(比如 DeepSeek 的 Harness)还在很早期——官方自己都提示"可能会有大变化,不要部署生产系统"。今天做的开发,明天底层一变就全废了。
所以我的现实建议是:
现阶段别想太多。先自己个人跑明白,把知识库和 Skill 攒起来。
Agent 和模型这两个,等它们打完仗再说。
等你要换的时候,知识库还是你的知识库,Skill 还是你的 Skill,迁移一下就能接着干活。
七、最后一个提醒:全网口径必须一致
这是很多人没意识到的一点,放在知识库这篇讲,因为它本质上是知识库问题。
你现在做 GEO(第 9 篇详讲),AI 会去读你全网各处的信息:官网、YouTube、Reddit、Facebook、LinkedIn、各种黄页和目录站。
如果这些地方说法不一致,AI 就会判断你"不可信",然后不推荐你。
真实的翻车案例:
公司成立年份,官网写"5 年",某个目录站写"2016 年成立",LinkedIn 写"7 年经验"。
人看了可能无所谓,AI 看了就是冲突信号。
解法只有一个:所有对外的资料,都出自同一个知识库。
这就是知识库的另一个价值——它不只是给 AI 用的,它是你公司对外信息一致性最可靠的来源。
我们内部对写 SEO 文章的同事是有考核的:文章里的"知识库含量"必须达标,否则绩效受影响。逼着大家去用知识库,而不是自己瞎写。
本篇清单
-
知识库 = 让 AI 看见你。看不见你,它就只能编 -
工具:Obsidian(本地、免费、开源,我用下来最省事) -
建库指令: 帮我把这个文件夹同步到 Obsidian 知识库 -
⚠️ 必须设置新内容自动回流,否则知识库会死 -
⚠️ 知识库要放在 Agent 有完整权限的目录下 -
PDF 用 MinerU 解析(API + 说明文档给 AI,它自己学会) -
万能公式:API + 说明文档 = AI 的新能力 -
内容:产品/案例/服务/工厂/证书/口碑 + 你的邮箱 -
⚠️ 销售场景别碰;核心库放本地;外发用脱敏子集 -
全网口径必须一致,所有对外资料出自同一个库
下篇预告
05|主动开发客户(上):让 AI 像老业务一样,把带联系方式的客户挖出来
从下一篇开始,进入"人找客户"这条腿。
我会先泼一盆冷水:你公司现在每个月群发几十万封的 EDM,回复率基本是零。 然后告诉你,十年前那些一年做几千万的老业务,是怎么一个人一台电脑把客户挖出来的——以及 AI 为什么特别适合干这件事。
《外贸 AI 落地实战》共 10 篇,整理自 2026 年 8 月 27 日外贸 AI 沙龙的全天分享,本篇是第 4 篇。

