大数跨境

④|同样让 AI 做个网站,有没有知识库出来完全两样

④|同样让 AI 做个网站,有没有知识库出来完全两样 询盘云
2026-09-10
4
导读:接了库,AI 才知道你公司成立多少年、有什么案例和资质。附建库指令、PDF 解析方案和核心库为什么放本地。

《外贸 AI 落地实战》第 4 篇 / 共 10 篇 · 第一部分 · 底座

本篇来源:线下沙龙知识库部分整理(原理、工具、PDF 解析、团队共享)

开篇:同样一句话,两个网站

我在现场做了个对比演示。

同一句指令——"根据这份 PDF 帮我做个网站"——跑了两遍:

  • 第一遍
    :只有一个 PDF。出来一个单页,配色普通,点"立即咨询"会跳到别的页面去。你看了会说"这玩意儿也能叫网站?"
  • 第二遍
    :接了知识库。出来的是一个多页网站,有产品、有服务、有关于我们,图片是它自己从知识库里找到对应产品传上去的,内容长度也合适,几乎可以直接用。

指令一模一样。差别只在 AI 知道多少。

这就是知识库的全部意义。

一、原理:一句话,AI 为什么会变聪明

正常你问大模型一句"帮我做个网站",它看到的就是这七个字,然后给你做个网站。

接了知识库之后,流程变成这样:

```

你提问 → 先去知识库检索相关知识 → 把检索结果和你的问题一起给模型 → 模型输出

```

同样一句"帮我做个网站",模型实际收到的是:

请帮我做个网站。我们公司成立多少年、厂房多大、有多少专利、做什么产品、产品优势是什么、服务有哪些、有多少案例、哪些客户说过我们好……

两个网站能一样吗?

所以知识库的本质不是"存资料",而是:

让你在 AI 那儿变得"可见"。

AI 看不见你,它就只能瞎编;编出来的东西你还得改,改的时间比自己写还长——于是你的结论就是"AI 还不如我自己写"。

这不是 AI 的问题,是你没让它看见你。

二、为什么必须向量化,以及为什么是 Obsidian

向量是个什么东西?

举个例子:"中国"和"北京"这两个词,字面上没有任何关系——"中国"不包含"北京","北京"也不包含"中国"。

但在向量空间里,这俩词离得非常近。因为"中国的首都是北京"。

AI 理解世界靠的就是这种"距离"。 哪个词跟你现在说的事更近,它就往哪个方向走。

这带来一个关键结论:

AI 能理解的,必须是向量数据库。你过去那些结构化文件(Excel 表格、固定的表单),它理解起来很吃力,而且经常理解错。

为什么是 Obsidian

当前开源、免费、自己能用、又足够好的本地知识库方案里,Obsidian 是我用下来最省事的一个

你要是技术大拿,可以去搞图计算、知识图谱那一套前沿的东西。对绝大多数公司来说,不需要。

界面长这样:打开是一张"点状图",每个点是一块知识,点和点之间的连线就是向量距离。你点开一个点,能看到这篇文章讲什么、围绕哪些东西组织起来。

我自己电脑上有好几个这样的库:我自己的、美容仪器的、矿山机械的——后两个是因为我第一份工作做美容仪器、第二份工作做矿山机械,手上资料多,就搭着玩。

底部还有两个是给客户做测试的。

一个反直觉的用法:不知道什么有用,就全扔进去

很多人卡在第一步:"我不知道哪些资料有用啊。"

我的答案永远是:不知道就都扔进去。

理由很简单:它最终建成的是个向量环境,相关内容会自动聚在一起,不相关的内容会自动离主题很远。AI 自己能识别。

有垃圾进去?无所谓,就是硬盘多占点空间。

比起"漏掉关键知识","多存点没用的"代价小太多了。

三、三个必须知道的操作

1. 建库:一句话的事

帮我把这个博客/这个文件夹里的内容,同步到 Obsidian 本地知识库。

就这一句,它自己干。

我自己有个从 2009 年开始写的博客,我把全部内容同步进了本地知识库。现在它比我还了解我——十五年前写的东西我都忘了,它还记得。有时候我看它写的内容,会有一种回忆的感觉:"哦,我过去确实是这么想这件事的。"

2. 新内容自动回流

这一点特别重要,很多人漏了:

我以后写的文章,你帮我自动回到这个知识库里。

说完这一句,它就会记住。以后你说"写篇文章",写完的文章自动就出现在知识库里了。

闭环就这么搭上了。 你的知识库会随着你工作自动长大,而不是建一次就死在那儿。

3. 目录授权

Obsidian 是本地 App,知识库就是你电脑上的文件。

⚠️ 关键操作:把知识库放在你给了 Agent 完整权限的那个目录下。

比如我的都放在 project 目录里,而这个目录我给 AI 开了完整权限(有些客户端里叫 Bypass)。这样 AI 需要读的时候,直接就能进去读。

不放对地方,它读不到,等于白建。

四、最大的坑:PDF 是流失率最高的格式

你公司的资料大概是这样的:PPT、Excel、Word、PDF。

这些转成 Markdown 格式时,损失率都不算高。唯独 PDF 是重灾区。

原因:PDF 是为了"显示"而格式化的,换行、层级、图文关系在硬编码结构里被打散了。AI 读它,就像你读一份被拆散重排的说明书——字都在,但关系没了。

解法:用专门工具还原。

我自己在用的是 MinerU(免费的,有在线版,也有 API)。它能把 PDF 里的字和图都解析出来,还原度高很多。

⚠️ 这里有个通用方法,价值比工具本身大:

给 AI 任何新能力,你只需要两样东西:一个 API + 一份说明文档。

把 MinerU 的 API 密钥和它的说明文档链接丢给 Agent,告诉它"去使用这个",它自己就学会了。你不需要先读懂文档再教它。

这个套路适用于你后面遇到的所有工具:

```

找到工具的 API → 生成密钥 → 把密钥和说明文档给 AI → 告诉它你要什么

```

我现场讲的所有东西,几乎都是这个模式。 这也是为什么我反复强调那句:

以后你选任何线上工具,第一个问题永远是:有 API 吗?

没有,就换一个。

原因很实在:没有 API,AI 就只能用"肉眼看"的方式去操作界面——能干,但 token 消耗大概是 API 方式的一百倍(现场口径)。本来一块钱干完的事,变成一百块。

五、知识库里到底该放什么

按用途分:

营销场景(最好用的部分)

  • 产品介绍
  • 客户案例
  • 服务内容
  • 工厂/产能
  • 证书资质
  • 口碑评价

判断标准特别简单:你网站上有的那些东西,就是营销知识库该有的东西。

内部管理场景

制度、流程、常见问题的答案。这块 AI 能给你做提示,比较省心。

⚠️ 销售场景:我劝你别碰

这句是我的真心话:

当前的销售场景,整体是超出 AI 边界的。别去想让它帮你谈客户。

举个例子。客户问:"这个价?"

这句话背后可能是什么意思?——"这么贵?""这么便宜?""还能再降吗?""你在试探我?"

同样一句话,意思完全不同。AI 理解不了人和人之间沟通里那些微妙的东西。

所以别在这上面浪费时间。

一个被低估的富矿:你的邮箱

我在现场问了个问题:公司里最有价值的信息在哪?

在你的邮箱里。

你天天跟客户来来往往的那些邮件——客户问过什么问题、关心什么参数、纠结什么交期、为什么最后没下单——这是最真实、最高密度的客户知识。

网站要解决客户的问题,而客户问题最集中的地方,就是你和业务员的收件箱。

把邮箱授权给 Agent 去读一遍,它能提炼出大量产品知识、应用场景、客户案例。

⚠️ 安全说明(我在现场也强调了):这种授权是让它搜索并提炼知识,提炼出来的是产品知识、应用场景、案例这类内容;你的密码、客户隐私信息不会被保留

但我要补一句实话:只要你用第三方 SaaS 工具,理论上的泄露风险就存在。 这是你选择便利时必须接受的代价。所以——

六、为什么知识库必须在你自己手里

前面说的都是"怎么建"。这一节说"放哪",我认为这是整篇最重要的部分。

结论:核心知识库放在本地,你自己完全控制。

理由一:它是你未来最核心的资产。

客户资料可能会流失,平台规则会变,甚至你的产品线都会换——但知识是那个真正给你带来客户的东西。

理由二:第三方工具的知识库,必然在第三方服务器上。

这不是阴谋论,是技术必然:它要连着你的知识库给你自动回复,那你的知识库就得放在它那儿。

理由三:向外分发的,都应该是子集,而且要脱敏。

我的做法是这样的:

```

本地核心库(完整、原始、不外发)

├── 营销用子集(脱敏)

├── 销售用子集(脱敏)

└── 生产/采购用子集(脱敏)

```

每一个往外发的,都只是完整知识库的一部分,且经过脱敏。核心的东西不出去。

这也是为什么很多国企、大型上市公司上 AI 上得慢——他们宁愿不上,也不能让数据外泄。

团队怎么共用?(这是目前最难的一节)

Obsidian 是本地 App,装在你电脑上,同事用不了。

方案一(简单):Obsidian 官方同步服务。

付费插件,买了之后同一个账号多台电脑自动同步,谁改都能同步。价格不算贵(我印象中是几十块钱级别,现场口径,以官网为准)。

⚠️ 注意:换个电脑就没了。它是本地文件,不会自动跟着你走。

方案二(进阶):自建服务器版 Agent。

把知识库放在一台服务器上,大家远程访问同一个网址、同一套 Agent。这样全公司用的是一个知识库、一套 Skill,不会你造一遍我造一遍、还都是不同版本。

目前这类方案(比如 DeepSeek 的 Harness)还在很早期——官方自己都提示"可能会有大变化,不要部署生产系统"。今天做的开发,明天底层一变就全废了。

所以我的现实建议是:

现阶段别想太多。先自己个人跑明白,把知识库和 Skill 攒起来。

Agent 和模型这两个,等它们打完仗再说。

等你要换的时候,知识库还是你的知识库,Skill 还是你的 Skill,迁移一下就能接着干活。

七、最后一个提醒:全网口径必须一致

这是很多人没意识到的一点,放在知识库这篇讲,因为它本质上是知识库问题。

你现在做 GEO(第 9 篇详讲),AI 会去读你全网各处的信息:官网、YouTube、Reddit、Facebook、LinkedIn、各种黄页和目录站。

如果这些地方说法不一致,AI 就会判断你"不可信",然后不推荐你。

真实的翻车案例:

公司成立年份,官网写"5 年",某个目录站写"2016 年成立",LinkedIn 写"7 年经验"。

人看了可能无所谓,AI 看了就是冲突信号。

解法只有一个:所有对外的资料,都出自同一个知识库。

这就是知识库的另一个价值——它不只是给 AI 用的,它是你公司对外信息一致性最可靠的来源

我们内部对写 SEO 文章的同事是有考核的:文章里的"知识库含量"必须达标,否则绩效受影响。逼着大家去用知识库,而不是自己瞎写。

本篇清单

  • 知识库 = 让 AI 看见你。看不见你,它就只能编
  • 工具:Obsidian(本地、免费、开源,我用下来最省事)
  • 建库指令:帮我把这个文件夹同步到 Obsidian 知识库
  • ⚠️ 必须设置新内容自动回流,否则知识库会死
  • ⚠️ 知识库要放在 Agent 有完整权限的目录
  • PDF 用 MinerU 解析(API + 说明文档给 AI,它自己学会)
  • 万能公式:API + 说明文档 = AI 的新能力
  • 内容:产品/案例/服务/工厂/证书/口碑 + 你的邮箱
  • ⚠️ 销售场景别碰;核心库放本地;外发用脱敏子集
  • 全网口径必须一致,所有对外资料出自同一个库

下篇预告

05|主动开发客户(上):让 AI 像老业务一样,把带联系方式的客户挖出来

从下一篇开始,进入"人找客户"这条腿。

我会先泼一盆冷水:你公司现在每个月群发几十万封的 EDM,回复率基本是零。 然后告诉你,十年前那些一年做几千万的老业务,是怎么一个人一台电脑把客户挖出来的——以及 AI 为什么特别适合干这件事。

《外贸 AI 落地实战》共 10 篇,整理自 2026 年 8 月 27 日外贸 AI 沙龙的全天分享,本篇是第 4 篇。

【声明】内容源于网络
0
0
询盘云
北京鑫互联科技有限公司,亦称“鑫互联”,是一家专业的海外营销解决方案供应商,专注于增强B2B出口企业的在线营销成效。
内容 540
粉丝 0
询盘云 北京鑫互联科技有限公司 北京鑫互联科技有限公司,亦称“鑫互联”,是一家专业的海外营销解决方案供应商,专注于增强B2B出口企业的在线营销成效。
总阅读54.5k
粉丝0
内容540