评价对象:字节跳动豆包 Doubao-Seed-Evolving
场景:AI 简化安全情报站(Astro 静态站)全量重构
一、为什么写这份评价
模型榜单看多了容易麻木。MMLU、HumanEval 上的数字,跟「我把一个真实项目丢给它,它能不能干完」是两回事。
这次我把一个已经上线、跑了 100 多天、有 103 期内容的项目丢给 Doubao-Seed-Evolving,让它做完整的代码与体验重构。全程一次性会话内完成——没有切模型、没有换 IDE、没有人工写代码(除了审核和提反馈)。
本文只回答五件事:它做了什么、哪里真行、哪里差点翻车、中大型重构水平如何、什么任务该交/不该交。
二、丢给它的是什么
项目:cloudcursor / AI简化安全[1]
Astro 纯静态站 · GitHub Pages · 103 期简报 → 129 个页面 · TypeScript + 原生 CSS。
重构触发点:深色主题不适配企业阅读、CSS 单文件过重、详情页缺结构、无搜索/专题/RSS,还有性能与安全债。
任务节奏:通读代码 → 出建议清单 → 我审核 → 视觉 / 信息架构 / 新功能 / 架构债四波落地。
最终产出:31 文件变更,+4350 / -2033 行;129 页构建全绿;新增专题、纯前端搜索、RSS、sitemap;CSS 拆四层 + 内存索引 + prebuild 校验。全程自己跑几十次 build、自己定位、自己修。
落地顺序:先收益最大的视觉,再 IA、功能与架构债。
重构后的站点一瞥:
公网:https://dimuran2100.github.io/cloudcursor/
-
点击阅读原文进入站点
三、六维评分:综合 8.5 / 10
按「中大型代码库重构」场景打分,不是泛泛通用能力。
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 综合 | 8.5 | 能独立交付一整波重构的高级工程师水平 |
四、它做对了什么
1)主动加 prebuild 内容校验
我只说「重构」。它发现简报正则解析会静默失败,主动写校验脚本并挂到 prebuild——期数、要点、来源、主题 slug、enrichment 引用全查。这种「想到我没要求的正确事」是分水岭。
2)白底切换是系统性改动
我只说「改成白色背景」。它没有只改一个 --bg,而是调色板、主题色对比度、按钮、渐变、阴影、硬编码 rgba 一并处理,再全路由 HTTP 200 验收。
3)搜索够用就好
没上 Algolia / Pagefind / 独立搜索服务,而是构建时吐 search-index.json + 前端百行关键词匹配。对这个体量,过度工程才是错。
4)两个 Map 搞定索引
主题/维度查询从全表扫描改成 O(1) Map,不引数据库、不写 ORM——简单数据结构解决真问题。
五、局限与差点翻车
-
1. 不主动验证视觉:build 过 ≠ 长得对。对比度、对齐、hover 态需要人截图验收。 -
2. 长会话工具结果偶发丢失:后台 build 中断时节奏会被打断,宜分 checkpoint。 -
3. 批量 edit 失配整批回滚:应小批次改、改完立刻 build。 -
4. 客户端脚本混入 TS 泛型:浏览器会报错;后已自修,但说明冒烟测试仍必要。 -
5. IA 偶尔越权:导航直接加「专题」「搜索」——这次碰巧对了,规则应是「先列方案再改」。 -
6. 业务上下文有限:企业受众、默认不生图等偏好,需要任务开头主动注入。
六、什么适合交给它
非常适合:中大型重构、架构债清理、中等复杂度新功能、设计系统/CSS 重构(方向明确时)、代码审查、构建与部署脚本。
可以做但要盯:视觉/UI(必须截图)、信息架构(先方案后改)、复杂正则(补测试)、跨项目改动(明确边界)。
不适合:纯审美与品牌定调、模糊产品需求、业务优先级决策、不可逆生产变更、安全敏感代码的最终审查。
七、横向感受(主观)
-
• 相对 Claude Sonnet:长上下文稳定性 Sonnet 仍强;Doubao 代码干净度能打平,中文表达更自然,价格友好。 -
• 相对 GPT / DeepSeek:Doubao 写 CSS/前端更稳;DeepSeek 在算法/后端深度上更锐。 -
• 相对其他国产模型:这是我用过的中文项目重构综合体验较好的国产模型——长任务不断片、build 闭环成熟、代码品味在线。
最大差异化:接任务 → 自己跑几十次 build → 自己修到全绿的耐久力与自驱力。很多模型第三次失败就开始绕开,它不会。
八、用好它的五条建议
-
1. 先通读、列建议,你审核后再动手。 -
2. 划清「可决策」边界:颜色间距可自定;导航/URL/新页面必须先问。 -
3. 要求每波改动后必须 build。 -
4. 视觉改动自己截图,不信「构建通过」。 -
5. 长任务拆 checkpoint,断了也能续。
九、结语
Doubao-Seed-Evolving 给我的感觉是:一个靠谱的、能独立交付一整波重构的高级工程师。
它不是超人——审美要人盯、IA 会越权、长会话偶断片。但基础功扎实、工程纪律好、能自我验证、不装懂,已是第一梯队。
对我这种「一个人维护一个项目、每天只有 30 分钟改代码」的人来说,它的价值不是「替我写几行代码」,而是:
我可以把一个 100 天历史、30 个文件、4 类改造的重构任务交给它;它把代码改完、build 跑通、文档更新好,等我截图验收。
这是质变。而它没做好的视觉验证、IA 决策、业务判断——恰恰是人最该做、也最不可被替代的部分。
人和模型各干各擅长的,这才是 AI 辅助编程的正确打开方式。
相关链接
-
• 学习站:https://dimuran2100.github.io/cloudcursor/ -
• 仓库:https://github.com/DIMURAN2100/cloudcursor
引用链接
[1] cloudcursor / AI简化安全: https://github.com/DIMURAN2100/cloudcursor

