大数跨境

The Batch: 963 | 网络检索让大语言模型“失常”

The Batch: 963 | 网络检索让大语言模型“失常” DeeplearningAl
2026-07-31
4

大语言模型新闻检索能力评估报告

大语言模型在新闻收集任务中,查找相关报道的能力仍是主要短板。

最新消息:斯坦福大学与 Together AI 的研究团队(Mirac Suzgun 等)测试了六款主流大语言模型(配备网页搜索工具)回答每日新闻问题的能力。结果显示,模型在问题表述准确且为英语时表现尚可;错误主要源于检索到了无关或低质量的文档。

关键见解

大语言模型回答训练数据之外的事实性问题,依赖以下三个关键步骤:

(i)接收表述清晰的问题;

(ii)检索到相关文档;

(iii)从文档中准确提取事实。

任一环节受损均会降低输出质量。例如,问题包含错误事实、检索文档缺失关键信息或模型不掌握文档语言,都会导致回答错误。构建高性能新闻系统需同时优化这三步。

运作方式

研究于 2026 年 2 月 9 日至 22 日进行,基于 BBC News 报道,使用六种语言(阿拉伯语、英语、法语、印地语、俄语、土耳其语)提问。测试对象包括 Gemini 3 Flash/Pro、Grok 4、Claude 4.5 Sonnet、GPT-5 及 GPT-4o mini(均配备网页搜索)。

测试设计:

1. 每日由 Gemini 3 Flash 生成 150 道选择题(每种语言 25 道),包含时间背景及五个选项,答案为可验证的事实细节。

2. 三种测试场景:

(a)原始选择题;

(b)引入错误前提(如错误人名、时间)并增加“信息不足”选项;

(c)去除选项的自由回答题。

3. 利用 Claude Opus 4.7、GPT-5.4 和 Gemini 3 Pro 的多数投票结果,将错误归因为八类,包括检索失败、来源细节偏差、理解力不足及时间线错误等。

测试结果

模型在英语且表述良好的问题上准确率较高,但在其他方面存在明显短板:

1. 非英语表现欠佳,尤其是印地语;

2. 多数错误源于检索环节而非推理能力;

3. 面对错误前提时表现显著下降。

具体数据:

(1)原始选择题准确率前四名均超 90%:Gemini 3 Flash(95.6%)、Grok 4(95.0%)、Gemini 3 Pro(93.7%)、Claude 4.5 Sonnet(90.4%)。GPT-5 为 85%,GPT-4o mini 为 69%。转为自由回答题后,准确率普遍下降 11 至 22 个百分点。

(2)印地语问题平均准确率最低(79.3%)。即便使用非英语提问,模型仍倾向于引用英文来源(如英文版 Wikipedia)。

(3)主要错误原因:检索失败占 38.8%;检索到主题相关但细节错误的来源占 32.7%。

(4)面对错误前提,Grok 4 表现最佳(70%),领先其他模型至少 15%;GPT-5 准确率仅 19%,接近随机猜测水平。

重要原因与改进方向

配备搜索功能的模型虽适合查找事实,但其表现高度依赖输入准确性、文档相关性及答案提取能力。鉴于多数错误发生在检索阶段,优化检索能力比单纯扩大模型参数更能提升时效性查询性能。研究人员提出三项改进建议:

(i)提高索引覆盖范围;

(ii)优化信息来源排序;

(iii)增强非英语语言的查询处理能力。

行业观察

面向智能体而非人类用户的网页搜索引擎正成为新兴领域。当前数据显示,在为智能体打造更高效的网页搜索工具方面,仍有巨大的优化空间和发展潜力。

【声明】内容源于网络
0
0
DeeplearningAl
吴恩达老师的人工智能教育传播平台.
内容 1319
粉丝 0
DeeplearningAl 吴恩达老师的人工智能教育传播平台.
总阅读19.6k
粉丝0
内容1.3k