大数跨境

实测Seed-Evolving,豆包这次稳了

实测Seed-Evolving,豆包这次稳了 AIGC新知
2026-08-31
1
导读:最近豆包有个模型讨论度挺高,Seed-Evolving。

Hello,大家好,我是绛烨。

最近豆包有个模型讨论度挺高,Doubao-Seed-Evolving。

我一开始注意到它,是因为它更新得很勤,基本按周在迭代。而且用的是统一 Model ID,一次接入之后版本自动升级,不用来回切 Endpoint、改调用方式,这点对开发者来说挺省心的。

而且从方向上看,它明显冲着现在AI最热的两件事Coding 和 Agent去。

所以这次我没有拿 Benchmark 去测,也没太想看它数学题又涨了几分。我直接找了三件自己平时会做的事情。

第一,把电脑里一直在用的项目资料,整理成一个能搜、能问的知识库网站;

第二,做一款适合在小红书传播的 H5 小游戏;

第三,给自己搭一套可以长期使用的个人 AI 工作台。

这三件事都有一个共同点:它得看资料、理解图片、整理信息、做规划、写代码,中间还要不断调用工具,最后交出一个真正能用的东西。

这里多说一句视觉理解。到了 Agent 和 Coding 阶段,VLM(视觉语言模型)已经不是锦上添花了,设计稿要看懂、报错截图要读懂、UI 还原要对照、文档里的表格和流程图要解析。

纯文本模型在这些场景里基本是瞎的,而视觉理解一直是豆包 Seed 模型的优势项,处于全球第一梯队,比肩 Gemini。

这也是我选这三个 case 的原因之一:每个都得真看懂图,不是光处理文字就行。

到了 Agent 阶段,我更关心的已经不是模型会不会,而是它能不能把一件复杂的事完整做下来。

所以这次测试标准也很简单,最后交出来的东西,到底能不能直接用?带着这个问题,我开始跑。

01

WIKI

把过去的项目文件,整理成一个能搜能问的知识库 Wiki

先从一个我拖了很久的需求开始。

我的电脑里常年躺着大量项目文件,比如Word、PDF、PPT、会议纪要、网页收藏、代码说明、截图、零散笔记……

一个项目结束之后,资料基本就开始吃灰,真正麻烦的是,几个月后突然想找某个东西。

我明明记得做过,却完全想不起,最后经常变成全盘搜索。

所以第一件事,我想看看 Seed-Evolving 能不能把这堆历史资料,直接整理成一套个人项目 Wiki。

提示词我是这么写的:

PROMPT

我提供过去做过的一些项目文件在当前文件夹,包括文档、会议纪要、PDF、PPT、网页收藏、代码说明、截图及零散笔记。

请先不要写代码,先盘点全部资料:

 · 识别所属项目、时间、主题、关键信息、重复/冲突项和无法解析内容;

 · 再输出分类体系、标签规则、知识条目 Schema 及网站信息架构。

确认后,交付一个可本地运行、可部署的知识库 Wiki 网站,至少包含项目页、知识条目页、全文搜索、标签筛选、资料导入和 AI 问答。

AI 问答只能基于已导入资料作答,每条结论必须附原始文件、原文片段和跳转入口;资料不足时明确说明,禁止编造。

最终交付资料盘点报告、分类与信息架构、可运行代码、导入脚本、测试结果及部署说明。

我故意把第一题出的很重,因为这种任务特别考验 Agent 的基本功——多模态资料理解、深度搜索和来源追溯,刚好对应 Seed-Evolving 主打的视觉推理和更低幻觉的搜索能力。

很多模型单独总结一篇 PDF 没问题,单独写一个网页也没问题。

真正麻烦的是,一次塞进去大量不同格式的资料之后,它还能不能把关系理顺。哪些资料属于同一个项目,哪些内容有冲突,哪些只是重复,网站怎么组织,最后回答问题的时候能不能找到出处。

交付物包括:一份完整的资料盘点报告,一套分类体系和信息架构,一个可以本地运行、也可以继续部署的 Wiki 网站。

项目页、知识条目、全文搜索、标签筛选、资料导入和 AI 问答都做进去了,更关键的一点是,AI 问答给出的内容,可以继续往回追到原始资料。

这一下,整个东西就从一个垃圾站,开始有点接近真正能长期用的个人知识库了。

02

GAME

做一款能在小红书传播的 H5 小游戏

第二件是做小游戏。

我先让它调研近期小红书上比较常见、传播效果比较好的小游戏玩法,再从里面挑一个适合快速上线的方向,让它做一款移动端 H5 小游戏,主题就用「测测你是哪种 AI 打工人」,要有题目分支、结果生成、分享海报、埋点,还得适配手机端。

提示词:

PROMPT

我想做一款适合在小红书传播的小游戏。

请先调研近期比较受欢迎的小红书小游戏,分析它们的玩法和传播点,并给我 3 个适合快速上线的创意方案。

选定一个方案后,参考小红书的视觉风格完成游戏设计:确定配色、字体、页面风格、题目内容、结果类型和分享海报。

最后直接开发成可在手机上玩的 H5 小游戏,用户可以完成答题、获得结果并保存分享海报。请交付可运行、可上线的游戏页面。

最终产物按小红书 minitool 规范校验、修复并打包。

这个 case 压的是视觉理解和多模态代码生成能力——参考截图里的风格能不能真看懂,再反映到代码里。所以我这次特别关注两个问题。

一是它到底懂不懂小红书。

现在让 AI 做一个 H5 页面并不难,比较难的是,做出来以后有没有小红书的种草感,放进真实内容流里会不会显得违和。

小红书的页面、封面、字体、排版、色彩密度,都有一套很明显的内容语言。如果只是做一个渐变色背景,加几个圆角卡片,再配点 Emoji,那和小红书没什么关系。

所以我给它参考截图,也是想看看模型能不能真正从视觉素材里抽出规律,再反映到最终页面里。

二是它懂不懂传播。

小游戏最关键的地方,从来都不只是题目本身——结果页才是传播核心。

用户为什么愿意截图?为什么愿意发小红书?别人看到结果之后,为什么还会继续点进来测试?这些都要在结果类型、文案、视觉和分享海报里提前设计。

所以这道题真正考的,其实是一整条内容传播链路。

确定方向之后,它完成了整套设计,包括配色、字体、题目、结果类型和分享海报,然后把这些东西写成了一个可以直接玩的小游戏。

做到这里,我对 Seed-Evolving 的感受开始有点变化。

因为它处理的已经不只是一个页面,前面那套调研、判断、设计和开发,被它串到了一起。

03

WORKBENCH

搭一个自己日常用的 AI 工作台

前两个案例多少还带一点测试性质。

第三个,我干脆做一个自己真想长期用的东西。

我一直想搞一个个人生活工作台:每天记账、看日程、打卡、健身、记录体重、存书影音、列待买清单……

这些东西现在散落在一堆 App 里。功能都能找到,问题是太散。

所以我干脆给 Seed-Evolving 提了个有点变态的需求

提示词:

PROMPT

请为泛生活人群设计并开发一个集成式个人生活工作台,以单文件 HTML 交付,所有 CSS、JavaScript、图标和资源均内联,不依赖外部组件;确保手机和电脑端均可稳定使用。

工作台包含六个核心模块:

 · 今日生活指数;记账理财(收支、预算、月度对比、分类筛选、消费结构和 Excel 导出);

 · 习惯健康(新增/删除习惯,勾选、计数、数值三种打卡方式和 30 天热力图);

 · 减脂健身(体重体脂、7 日均线、BMI、目标进度、热量缺口和自定义周计划);

 · 日程统筹与待买清单;书影音收藏(状态、星级、短评、封面墙/列表和年度统计)。

所有数据输入后立即保存到 localStorage,关闭页面后仍可恢复;支持 JSON 备份导出和不限条数导入。新增数据满 20 条时提醒用户备份;存储失败或数据损坏时,需明确提示并提供恢复方案。

预置少量可一键清空的演示数据。视觉风格要克制、高级、有生活感,避免模板化卡片堆叠。最终交付一个可直接打开使用的 HTML 文件。

最后还有一个纯审美要求:别给我整成一屏圆角卡片。我希望它看起来克制一点,高级一点,有点生活感。

这道题真正折磨模型的地方,在于细节特别多。

一个普通网页,写到一半忘了前面的要求,可能没什么感觉。这种工作台不一样——六个模块共存在一个文件里,数据需要互相保持一致,移动端和电脑端都得适配,存储、备份、导入、异常处理还不能漏。

任务一旦拉长,模型很容易写着写着就把前面的约束忘了。所以这一题,我其实是在测它的长程执行能力,也就是 Seed-Evolving 主打的通用 Agent 能力——百万上下文、长文理解和持续规划。

交付的是一个完整的单文件 HTML:没有外部依赖,下载之后直接双击就能打开。六个核心模块都在,数据会写入 localStorage,JSON 可以导入导出,手机和电脑也都能正常使用。

这种感觉挺有意思。以前 Vibe Coding 很容易让人上头的一点,是一句话生成一个网页。

现在慢慢开始变成:一句需求,生成一个自己真的会留下来继续用的小工具。

这两个阶段的区别,其实挺大。

04

REVIEW

跑完之后的感受

三件事做完,其实刚好把 Seed-Evolving 主打的三项能力都压了一遍:视觉推理和多模态代码生成(知识库的截图/PDF理解、小游戏的封面风格还原)、深度搜索和工具调用(更低幻觉,问答能带原文引用)、通用 Agent 长程执行(工作台六个模块的持续规划和约束保持)。

单看其中任何一项,现在很多模型都能做。真正让我觉得有意思的地方,是这些能力开始被连起来了。

以前用 AI,经常是这样的:先让一个模型整理资料,再自己把结论复制出来;然后让另一个模型写产品方案,再拿去 Coding,报错之后继续改,视觉不对再重新调——你始终是流程中间那个搬东西的人。

这次三个 Case 跑下来,我明显感觉到模型开始接手更长的一段流程:资料进去,它自己整理、自己规划、自己开发、自己检查,最后给你一个可以继续使用的产物。

当然,我目前依然不会把它理解成全自动。复杂任务里,该人工检查的地方还是得检查,尤其涉及重要判断、数据和最终发布的时候,人依然要站在最后一道。

但 Agent 真正开始好用之后,最明显的变化,大概就是:以前我们在问 AI 能帮我做哪一步;以后更常见的问题可能会变成:这件事,我到底还需要在哪几步介入。

这也是我这次测 Seed-Evolving 最明显的感受。

EPILOGUE

写在最后

Seed-Evolving 还在按照周频率持续迭代。所以这篇文章测到的,也只是它在 2026 年 8 月这个时间点的状态。下周、下下周再跑同一套题,结果都有可能继续变。

但从这一轮三个场景来看,我会继续关注 Seed 基模这条线。

我现在越来越觉得,接下来模型比的,很可能就是谁能把更长的任务真正做完

写代码、看图、搜索、调用工具,这些能力现在大家都在补。最后真正拉开体验差距的,还是能不能把它们一起用起来,帮你把事情做完。

如果后面 Seed-Evolving 再有比较大的版本更新,我应该还会拿同一套任务重新跑一遍,看看这种周更模型到底能进化到什么程度。

想自己试试的话,可以去火山引擎模型广场搜索 doubao-seed-evolving,也可以直接点原文链接这里接入。

现在火山 Agent Plan 里就能调用豆包搜索和这个模型,单月套餐限时 9.9 元起,想体验的可以试试。


END
图片

我是绛烨,热衷于分享 AI 观察与干货。

如果这篇实测对你有用,欢迎点赞、在看、转发三连;

想第一时间看到后续,也可以顺手加个星标 ⭐

【声明】内容源于网络
0
0
AIGC新知
拆解生成式AI的前沿动态、实用技巧与行业机遇,做你身边的AIGC干货充电站。
内容 337
粉丝 0
AIGC新知 拆解生成式AI的前沿动态、实用技巧与行业机遇,做你身边的AIGC干货充电站。
总阅读15.0k
粉丝0
内容337