大数跨境

可视化文档检索工具:不用 OCR,不转文字,腾讯 AI 直接看 PDF 找答案

可视化文档检索工具:不用 OCR,不转文字,腾讯 AI 直接看 PDF 找答案 启示AI科技
2026-09-09
3
导读:你有没有遇到过这种崩溃时刻:一个几十页的财务报表,你需要找某一行数字。PDF扔给AI,结果它给你返回的答案对不上,甚至找不到。

你有没有遇到过这种崩溃时刻:一个几十页的财务报表,你需要找某一行数字。PDF扔给AI,结果它给你返回的答案对不上,甚至找不到。你自己翻,表格乱了,数字串行了,原来那个结构精美的表,被系统"读取"之后,变成了一堆乱码。

这不是你的问题,也不是AI的问题。是整个文档搜索的底层架构,从一开始就走错了路。

过去十年,所有人都在用一种"翻译再搜索"的逻辑

你把一份PDF交给AI去理解,它干的第一件事是什么?

OCR

也就是光学字符识别——把图片里的文字,翻译成计算机能读的纯文本。听起来合理,对吧?但问题就出在这一步。

一张发票,原本有清晰的行列结构:品名、单价、数量、合计。经过OCR一"翻译",表格的逻辑碎了,变成了:零件A 500 3 1500 合计 4500,一行平铺。

然后AI去这堆乱码里找"总价是多少",找到了算你运气好,找不到,你只能手动翻。更惨的是图表。一张柱状图,OCR直接放弃,什么都读不出来。

这个痛点,工程师知道,做过数据处理的人知道,但大多数人以为这是"AI还不够强",其实根本原因是:把图像硬翻成文字这件事本身就是在破坏信息。

01

PART


腾讯AI  → 不同的道路

EVE Preview 4.5B


腾讯刚发布的这个模型,选择了完全不同的路

上周,腾讯悄悄放出一个模型,叫 EVE Preview 4.5B。它做文档搜索的方式,和所有人都不一样——它不做OCR,完全不翻译,直接看图。

你问它:"这张发票的总金额是多少?"

它不会先把发票变成文字,再去文字里找答案。它直接把这张发票的图片,和你的问题,转换成一组向量,然后在向量空间里做比对,直接告诉你:这一页,就是你要找的那一页。

这个设计哲学只有一句话:原始图像里有的信息,我一个字节都不丢。

表格的行列结构?保留。图表的视觉布局?保留。字体大小暗示的层级关系?也保留。OCR会毁掉的,它全都留下来了。

但"直接看图搜索",难点在哪里?这里稍微深入一点,但我保证你能看懂。

普通的搜索逻辑是这样的:把文档压缩成一个"摘要向量",你的问题也压缩成一个向量,两个向量做比较,越近越相关。问题是,整个文档被压成了一个点,细节全丢了。

EVE的做法叫“晚期交互”(Late Interaction)——它不把整页文档压成一个点,而是把每一小块区域(每个视觉patch)都保留成一个独立的向量。你的问题里每个词,也各自保留成一个向量。

搜索的时候,你问题里的每个词,分别去和文档里的每一块区域比对,找最像的那个,然后把所有得分加起来。

这意味着:就算整张页面99%的内容和你的问题无关,只要有那1%藏着答案,它照样能找到。

研究人员测试过这样一个场景:一页论文的参考文献,密密麻麻列了几十条引用。问它:"哪篇论文第一次提出了page attention技术?"

它在几十条引用里,精确定位到了那一行。

02

PART

腾讯AI  → 一张显卡就能跑

EVE Preview 门槛没有那么高


一张显卡就能跑,门槛没你想象得高

这类模型,一般人的第一反应是:跑不起,硬件要求太高。

但EVE出人意料的轻量。

测试环境是一张 RTX A6000 显卡,模型加载完,显存占用大概10GB。按现在的显卡行情,消费级的 RTX 4090 也有24GB,完全够用。

不需要服务器集群,一台工作站,一张显卡,跑起来了。

而且向量压缩得很紧凑,每个patch只用128维向量表示。测算下来,100万页文档的索引,大概需要180GB存储——对于企业级档案搜索来说,这个数字是可接受的。

03

PART

腾讯AI  → EVE 4.5B 能做什么

EVE Preview 4.5B


它能做什么,不能做什么——这里必须说清楚

EVE只做一件事:找到最相关的那一页。它会告诉你:"第37页,相关度分数15.2,这页最可能有你要的答案。"

但它不会告诉你答案是多少。这是设计上的分工,不是缺陷。找页面是它的职责,读出具体数字,是下一个模型(视觉语言模型,类似GPT-4o那类)的事。

整个工作流程是:EVE找页 → 视觉语言模型读答案 → 你拿到结果。

一个精准的"索引员",加一个懂看图的"阅读员",两者分工明确。


04

PART

腾讯AI  → 方向比参数重要

EVE Preview 4.5B


这件事真正让我触动的,是背后那个信号。Tencent放出这个模型,在几个主流的视觉文档检索榜单上排了第一,而且参数量4.5B,比很多排名靠后的模型小得多。

这说明什么?

在AI这条赛道上,找对方向,比堆参数更重要。过去十年,所有人都默认:文档搜索必须先转文字。没人质疑这件事,因为这是"行业常识"。

EVE做的事,本质上是把这个常识掀了桌子:不对,图像本身就是信息,为什么要翻译?

这种思路的转变,影响的不只是文档搜索。它可能会重塑所有"先转文字再处理"的AI工作流——医疗报告、工程图纸、法律扫描件、多语言档案……只要是"图片里有结构化信息"的场景,这条路都值得重走一遍。

技术在迭代,但底层逻辑的转变,往往比版本更新更值得关注。下次你的AI搜索又找不到表格里的数字时,可以想想这件事。也许问题从来不是AI不够聪明,而是它从一开始就在读一份被翻译坏了的稿子。


【声明】内容源于网络
0
0
启示AI科技
1234
内容 86
粉丝 0
启示AI科技 1234
总阅读993
粉丝0
内容86