先从一个时间点说起。
Google 上一个真正的旗舰 Pro 版本,是今年 2 月 19 日的 Gemini 3.1 Pro。到今天,整整隔了 7 个月。
这 7 个月,Google 过得不算体面。I/O 大会上高调预告的 Gemini 3.5 Pro,从「难产」拖到最后「流产」——据 WSJ 报道,内部评估后认为 3.5 Pro 的进化幅度连 Flash 都比不上,索性取消。之后 Google 连发了 3.6、3.7、3.8 三个 Flash 版本,但圈内都清楚,那只是配角。
另一边,GPT-6 Astra 在刷屏,Claude 在拿长文档能力封神。曾经的「御三家」之一,安静得不像话。
然后,就在这两天,Arena 这个大模型公开擂台榜上,悄悄多了一个新模型。
标签挂的是 gemini-3.8-flash。
但上手的人测了几轮之后发现不对:这个「Flash」的输出上限是 25.6 万 token,而当前整个 Gemini 家族最大只有 64K——翻了 4 倍。有位网友拿 1000 颗行星的 JSON 做压力测试,它一路写到底,不偷懒。
这极有可能,就是 Google 压了整整半年、始终没拿出手的那张底牌:Gemini 4 Pro。
图:Gemini 4 Pro(Google 至今未官方发布)
一、先把能确认的事实,摆清楚
Arena Tracker 的截图显示,这个新模型变体被发现于美国时间 9 月 17 日清晨 5:19,标签 gemini-3.8-flash,组织标记为 google。
图:Arena Tracker 抓到的模型变体记录(发现于 9 月 17 日)
有个细节挺有意思。就在大家讨论正热的时候,Google 悄悄把马甲换了——几个钟头前还叫 gemini-3.8-flash,转眼变成了 gemini-3.7-flash。这个动作本身就在说明:后台有人在调。
把目前能拼起来的几块摆一起:
· 输出上限 25.6 万 token,是当前 Gemini 家族的 4 倍;
· 有研究员摸到后端,看到 1000 万 token 的输入上限、跨会话的永久记忆,不接 API 也能联网;
· 内部开发代号:Argon;
· 而 Google 官方,到今天为止,一个字都没说。
重点: 目前圈子里的预期发布时间是 10 月。也就是说,这是一次「半成品先上桌」的偷跑——能确认的只是它存在,其余都还待验证。
二、那张疯传的基准表,信息量到底在哪
全网转得最凶的,是一张基准测试表。
图:全网疯传的基准测试表(第三方流传,未经官方确认)
挑几个最能说明问题的:
· 长周期软件工程 DeepSWE v1.1:88.7%,GPT-6 Astra 是 86.9%;
· 知识工作任务 GDPval-AA v2:2064 Elo,是表里唯一过 2000 的;
· 终端编码 Terminal-bench 2.1:95.3%,全场最高;
· 桌面自动化 OSWorld-2.0:86.8%,压过 Astra 的 84.5%。
但真正让圈内人坐不住的,不是分数,是价格。
你一头,价格却只有你的零头。这个组合,才是「回归」两个字真正的分量。
提醒: 不过有句话得说在前面——这张表是全网流传的截图,没有独立验证,也没有 Google 官方确认。这种图今天做出来并不难,看看可以,别急着当真。
三、比跑分更好看的,是它开始「会做东西」了
分数是给评测看的。真正让人有感觉的,是这一波实测。
先看这张。同一条提示词,让几个模型各画一只猫的 SVG。
图:同一条提示词下的猫咪 SVG 对比(左:Gemini 4 Pro;右上:GPT-6 Astra;右下:3.8 Flash)
结果挺有意思:4 Pro 给出的是一只结构完整、姿态自然的猫;GPT-6 Astra 那只,怎么说呢,似猫非猫;3.8 Flash 能看出是猫,但明显更糙。
再看网页设计这块。
图:十几分钟生成出来的素描铅笔质感创意网页
有个开发者十几分钟做出一个以素描、铅笔、石墨质感为主题的创意页面——向下滚动,线条会逐渐加深,把「滚动即笔触」做成了真的。
图:赛博朋克 + 复古未来主义风格的作品站(含可交互 3D 模型)
另一个走的是「赛博朋克混复古未来主义」的路线,首屏直接塞进 3D 网格、数据仪表盘和可交互的 3D 模型。
图:生成出来的体素游戏,体量接近「我的世界」
甚至连体素游戏这种体量的东西,页面搭建带模块设计,也做下来了。
图:X 上开发者晒出的实测——左边是那张基准表,右边是「鹈鹕骑自行车」交互演示
最经典的还是那个「鹈鹕骑自行车」:配色、日夜切换、车灯、踏频控制、解剖标注,全部可交互。
上手反馈比较一致:出东西的速度快了一档,矢量图和三维模型的完成度提升最明显;一段复杂需求,常常一次就能接住。
重点: 以前的模型是「能回答」,现在这批模型开始「能交付」。这个差别,比跑分表上的几个百分点重要得多。
四、为什么我说这次不一样:它开始「敢站队」了
这几天我盯着这些实测图看,最在意的其实不是分数,是一个变化。
过去你问 AI:「我要找一家中国的丝网供应商,推荐几家。」它多半给你一段很稳的话——市场上有很多不错的选择,建议你根据自身需求评估,然后列一堆泛泛的判断标准。
它不敢点名。因为点错了要担责任,模型被训练得很保守。
但当模型的推理链条、以及它背后能调取的信息源上了台阶之后,事情在变:它开始有把握说「如果你要的是 X,那优先看 A 家」了。
对做外贸的人来说,这里面藏着一个词的变化——
重点: 过去 GEO 的目标是「被 AI 提到」;现在要升级成「被 AI 点名当首选推荐」。
这两件事的含金量,差的不是一个量级。被提到,你只是列表里的一个选项;被点名,你是用户看完就直接去找的那一家。
重点: AI 越强,「被点名」就越值钱——因为它不是广告位,是模型自己算出来的结论。
五、模型越强,外贸工厂的「入场券」反而更清楚了
反过来说,也别慌。模型变强,对老老实实做生意的工厂,其实是好事。
因为强模型判断一家公司靠不靠谱,看的不是你自己官网写得多漂亮,而是这几点:
· 全网有多少第三方在说起你;
· 你的资质、认证、出口记录、案例,有没有公开可查的痕迹;
· 在你所在的行业语境里,你是不是一个「被讨论过的名字」。
说白了——它不看你说了什么,它看你有没有被别人说过。
这和过去做 SEO 的逻辑不太一样。SEO 时代,你优化的是「关键词」;GEO 时代,你要优化的是「被引用的证据」。
六、这几件事,现在就能动手
不用等 10 月官方发布,有几件事现在做就有意义:
· 把官网从「自我介绍」改成「资料库」。产品参数、认证、应用场景、客户常问的问题,越具体越好——这些才是 AI 抓得到、也愿意引用的原料。
· 补第三方信源。行业平台、B2B 站、海外社区里,有没有关于你的真实讨论?如果没有,现在就开始沉淀。
· 按「客户会怎么问」铺内容,而不是按「我想说什么」。前者是入口,后者是自嗨。
· 别等。新模型刚上桌,规则还没定型,先动手的人边际收益最高。
七、最后说一句
Gemini 4 Pro 到底是什么水平,等 10 月官方发布就见分晓。现在所有的分数,都还是别人截图里的数字。
但有一件事不用等官方确认:AI 正在从一个「回答问题的工具」,变成一个「帮你做决定的采购顾问」。
而采购顾问这个东西的特点是——他有权点名,也有权,不点你。
聊聊你的行业 | 我是做外贸 AI 获客的。你所在的行业,最近用 AI 搜供应商、搜产品,结果里出现的是谁?评论区留一下你的行业和品类,我挑几个典型的,下期拆给你看。
博主更多精彩文章和视频:
一个丝网独立站,从"有产品没流量"到全域获客,只需这5步!
这你不知道就亏了,想让ChatGPT推荐你的品牌?这8个GEO步骤一定要做
亚马逊把广告打进ChatGPT: 你的工厂在AI里搜不到,买家都被抢光了!
#外贸获客 #GEO优化 #AI搜索 #Gemini4Pro #AI推荐 #AI获客 #跨境电商 #外贸工厂 #AI营销 #独立站

