大数跨境

o3 级别视觉推理功能,豆包做到了!

o3 级别视觉推理功能,豆包做到了! 怪兽抱抱AI电商
2025-07-31
1

向阳而生,炽热希望

这是怪兽抱抱的第92篇文章

大家好,我是怪兽抱抱,Ai实战派,Ai流量操盘手,专注“AI+行业”场景获客,用AI为个体赋能,为企业降本增效。点击下方关注加我👇免费送你一份AI电商全流程闭环知识库!



今天像往常一样打开豆包,想让它帮我辨认张旅行时拍的照片。本以为就是个普通的 “这是哪里” 的问答,结果它给了我个小惊喜,没有直接回答,反而在思维链里先圈出图片里的细节: “市中心的中式寺庙”“周围有金色玻璃幕墙高楼”,接着说上海静安区的静安寺就坐落在繁华商圈,寺庙建筑为金色琉璃瓦,背后有上海环球金融中心等现代高楼。先通过相似图检索验证,才确定答案。



当时我就愣了:大聪明什么时候偷偷升级了?后来才发现,豆包现在在 “深度思考” 模式下,已经能支持 o3 级别视觉推理功能—— 简单说,就是它不光能 “看” 图,还会 “思考着看” 图:知道该放大哪里、该裁剪哪块,甚至会主动联网搜信息验证,这可是之前只有高端模型才有的能力,现在豆包直接免费开放了!


最让我觉得靠谱的,它不是在猜,是真的在干活,它 “先理解问题,再动手处理” 的过程。


这种带工具的视觉能力,在国产大模型里不多见。以前用其他 AI 看图,经常遇到 “瞎猜” 的情况 —— 比如明明是饭店的招牌,硬说是书店。但豆包不一样,它会把思考过程摊开给你看:先分析 “用户可能想知道这个标志的内容”,再决定 “需要放大裁剪”,最后才给出结果。全程不猜、不蒙,就老老实实干活,这点真的让人放心。


尽管豆包的视觉推理能力已经实现显著突破,但实际测试中仍发现一些需要优化的细节:


复杂场景识别稳定性不足

在街景识别测试中,豆包将广西合浦的文昌塔误认为是广东的政江塔,主要原因是对非标志性建筑的特征提取不够精准。当图片包含多个干扰元素(如密集广告牌、相似建筑集群)时,识别准确率会出现波动。


极端拍摄条件适应性有限

在逆光、低分辨率或拍摄角度倾斜的场景下,豆包对细小文字(如公交站牌、商品标签)的识别成功率会下降,容易出现字符漏识别或误识别。


比如上个月我拍了火车站的图片,让他去识别,在很远的位置其实有高铁站点的信息,但是正常人得放大瞪半天才能看清。丢给豆包后,它先在思维链里写:“画面中央远处有一块蓝底白字的站台牌,放大后才能看清文字,从而确定车站名称。”—— 整个过程就像个细心的助理,不慌不忙把活儿干明白。

当我信心满满的认为他一定能识别的很对的时候,意外出现了!他识别出错了,把浠水南站错认为是冷水南站了,然后我又反问他“这个不是写的是浠水南吗?怎么到你这变成了冷水南“?


紧接着他又酷酷一顿分析,最后给出的答案依然是冷水南站。现在支持 “图像链式推理” 的国产模型其实不多,豆包这次的升级,有两个点特别值得夸:


一是工具化视觉真落地了。过去只有 o3 这类高端模型才会 主动用工具(比如放大、裁剪),现在豆包把这功能做到了0门槛 —— 普通用户丢张图,它自己就知道该怎么处理,不用你额外提示。


二是联网验证让图片不再孤立。它不是对着一张图空想,而是会把图片扔进互联网知识库:比如识别植物时,会对比中科院植物数据库;认建筑时,会交叉验证百度地图和小红书笔记。这种 “把孤立图片和真实世界关联” 的能力。


豆包这次让我看到:真正的进步,是让 AI 具备人的思考习惯,不急于给答案,先观察、再分析、最后验证。


------最后------

以上就是今天分享的内容,觉得我的文章有用,记得点赞、关注、收藏、转发,点个在看,祝大家发财!

更多AI探索及案例:

抱抱组建了一个AI变现公益社群,每天都会分享一些AI的最新玩法和变现案例,下方扫码备注“AI”拉你入群。


点击卡片|添加关注|一起掘金


【声明】内容源于网络
0
0
怪兽抱抱AI电商
1234
内容 103
粉丝 0
怪兽抱抱AI电商 1234
总阅读1
粉丝0
内容103