我相信不管是2026年还是2006年,任何人做外贸都还是要以刨祖坟式调研开始。
大家还是要问这个问题:资料怎么搜,怎么爬?有没有批量爬取的办法?
刨祖坟式调研是很麻烦的,公开资料往往会散落在几十个网页里,所以之前外贸口有一群人专做 RPA。RPA 不难但是也要先研究网页结构,再写选择器、处理翻页、登录、弹窗和反爬,最后清洗数据。等表格出来以后,人再从头读一遍,才开始做业务判断。
现在不用了。Codex 5.6 是一个很明显的拐点。我们可以直接把最后要交付的东西写给 Codex:
我要判断什么?需要查哪些网站?哪些结论必须带原始链接?遇到不知道的地方,应该标成什么?最后是给我一张名单、一份诊断,还是下一步行动建议?
然后让 Browser Use 自己打开网页、点击、搜索、跨页面追线索,边读边输出。
所以对一次性的小任务,已经没有爬虫这回事了。最终还是 codex 内置的浏览器使用,browser use,掌控了一切。
以前的问题不只是爬得慢
传统爬虫的逻辑是先把采集做完,再开始理解。采集的部分包括目标网站、DOM 结构、CSS Selector、翻页规则、登录状态、清洗去重。然后再来分析。
这个模式在大规模、重复采集时非常有效。但外贸里大量真实任务都很散的。不值当这么大量的跑一回。比如一个做工业设备的老板想判断德国市场上的潜在经销商。他通常不是上来就说“帮我抓 3000 个邮箱”。因为其实广撒网是没什么意义的,还会浪费信任。你但凡找到了一个可联系的人,其实他是很宝贵的,不要浪费触点。你需要知道:
-
对方现在卖什么产品,和我的产品线有没有缺口;它服务的是终端用户、工程商,还是二级经销商;
-
先联系谁,第一封邮件应该从什么业务缺口切进去。
这种任务最贵的部分是跨页面理解、保留证据,然后把信息整合成一个判断,告诉你接下来该怎么联系他——所以现在在 codex 里面做这件事,Browser Agent 开始接手的,是过去必须由人完成的“读完以后怎么办”。
在 codex 里做一次性研究的成本约等于零
所以其实以前做一次研究,必须要先支付一轮工具开发/调用成本。现在一次性研究的成本还剩什么呢,简化成浏览器执行、模型判断和人工抽检了。如果你已经支付了Codex Pro的账号费用,你的研究成本就是等于零。
这件事对小团队尤其重要。这样同一个人能做一串事儿了。但需要避免的就是 AI 给了我一张看起来很漂亮的名单,却没有原始链接,也没有告诉我哪些事情是他推理想象出来的,哪些事情是真的。
所以我们需要先给 codex 说清楚,可以直接复制下面的几行提示:
请注意,关键判断必须能回到原始网页;事实和推断分开写;
没找到证据的字段请明确标成“未知”。
一个刨祖坟调研示例
假设我们是一家做焊机的工厂,想判断波兰的 SpawLab 值不值得先联系怎么联系
这时候 Codex 就不会只告诉你一些显而易见的东西,它会给下面几个结论
事实是:它有多品牌销售、有脉冲 MIG 和铝焊产品,也有明确的服务能力。
判断是:它不是一个需要你教育什么叫脉冲焊的普通贸易商,而是一个懂产品、能服务工业客户的专业渠道。但它手里已经有成熟的欧洲品牌,所以渠道冲突也会比较大。
未知是:它现有产品的真实销量、价格带缺口、是否接受中国品牌,以及谁有权决定引进一个新产品。这些不能让 AI 猜,必须标出来。所以第一封信也不应该再写“我们是中国工厂,附件是我们的全套目录”。应该直接问:你们现有高端品牌下面,有没有客户需要更可控的价格和交付周期?如果有,我们能不能先用一台脉冲 MIG 做产品评估?
所以现在确实可以在 codex 里一站式刨祖坟了——从公开资料到完成开发信 🫰
那爬虫还剩什么?
爬虫并没有消失。边界很清楚。如果你要每天抓几万个 SKU、长期记录库存和价格、建立完整历史数据,或者要求可重复、可审计、低单次成本,API 和爬虫依然更合适。如果两种需求同时存在,还可以让 Agent 先摸清网站、字段和判断规则,再让程序长期批量运行。异常样本重新交给 Agent 或人处理。
现在最大的问题是:BrowserUse 出现的时间还太短。我们不知道什么时候会出现新的风控规则。如果为了自动化地读点东西,搞到社媒账号没了就得不偿失。
所以如果你已经被风控过了,也可以在评论区留个言。
为新外贸人做的新外贸导航站:alexwaimao.com

