大数跨境

万字长文|数据分析 7 大场景实战教程

万字长文|数据分析 7 大场景实战教程 TRAE.ai
2026-07-21
7

点击【阅读原文】获取文章中提示词。


市面上讲 AI 工具的文章大多停在"它能做什么",这篇文章想多走一步,告诉你怎么把需求讲清楚、怎么写出可复用的 Prompt、怎么验证它不出错。这些方法不依赖某个具体功能,换个工具、换个场景照样能用。


无论你是分析师,还是偶尔要处理表格的运营、HR、财务、客服,都用得上;不需要会写代码、不需要懂算法,会提需求、能看懂结果就够了。


怎么读? 全文分三大部分,对应数据工作的三个阶段:把数据拿到手(获取)→ 收拾干净(清理)→ 挖出价值(分析)。七个场景相对独立,你可以挑最头疼的一节直接看,照着步骤就能上手;也可以从头读到尾,建立起对整条流程的完整感觉。



用 TRAE Work 做数据分析的三条心法


在进入具体场景之前,先记住三句话,后面每个场景都会反复用到:


  1. 把它当成一个聪明但需要交代清楚的实习生。 TRAE Work 很能干,但它不知道你脑子里的"潜台词"。你交代得越清楚(要什么字段、什么格式、遇到异常怎么办),结果就越好。


  2. 永远要"验真",尤其是数字。 AI 偶尔会"自信地编"。凡是涉及金额、人数、关键结论的输出,都要让它标注依据,并自己抽查几条。


  3. 复杂任务拆开做。 不要指望一个 Prompt 解决所有问题。"提取 → 清洗 → 核对 → 分析"分步走,每一步结果可检查、可回溯,整体反而更快更稳。


第一步·数据获取


数据分析的第一步,永远是"把数据弄到手"。如果你还没有现成的数据,这部分讲三种最常见的获取方式:从网页抓、从文档/文件/图片里抠、从数据库里查


场景 1:网页批量采集数据


本节你将学到:如何用 TRAE Work 把网页上的数据批量、结构化地"搬"下来,省去一页页手动复制粘贴的痛苦。你还会掌握一套写好"采集 Prompt"的黄金结构,以及把采集变成"每天自动跑"的定时任务。


案例背景


老王是一名投资从业者。他有个雷打不动的晨间习惯:每个交易日开盘前,打开基金收益排行榜网页,把当天排名靠前的基金数据复制下来,粘贴进自己的 Excel 跟踪表,用来观察资金流向和热门赛道的变化。


听起来简单,但实际操作很折磨:网页表格分了好多页,复制过来格式还乱:"近1年收益率"带着百分号、"基金规模"写成"23.45亿"这种文本,每次粘完都要手动清洗一遍。一套流程下来至少 20 分钟,雷打不动地占掉他每个交易日早上的一段时间


老王想要的其实很朴素:每天自动帮我把排行榜抓下来、清洗好、存成带日期的 Excel,最好我什么都不用管。 这正是 TRAE Work 采集能力的典型用武之地。


实战教程


1. 先理解:一条好的"数据采集 Prompt"长什么样


网页采集能不能成功、结果干不干净,七成取决于你的 Prompt 写得清不清楚。一条靠谱的采集 Prompt,通常包含五个核心要素(记住这个"黄金五要素",后面所有采集任务都能套):



一句话区分好坏 Prompt: 差的 Prompt 让 AI 不停猜(抓哪些字段?几页?怎么排?存成啥?),好的 Prompt 让 AI 读完不用猜任何东西。缺了哪个要素,AI 就会在那里"自由发挥",结果自然不可控。


2. 直接用自然语言告诉 TRAE Work 你想如何提取数据


打开TRAE Work桌面端,新建任务 --> 在对话框中输入以下Prompt --> 点击发送:

今日日期。访问 https://fund.eastmoney.com/data/fundranking.html ,提取基金排行榜中的所有基金数据。
需要的字段:排名、基金代码、基金简称、基金类型、最新净值、近1年收益率、近3年收益率、基金规模、基金经理。
处理规则:1. 排除货币基金和短债基金2. 按近一年收益率从高到低排序3. 收益率保留两位小数
输出为 Excel 文件,文件名包含今日日期。


3. 观察 TRAE Work 的思考与执行


发送后,TRAE Work 会自动打开网页、识别表格、逐页抓取,并自主调用浏览器操作和 Excel 处理能力完成清洗,整个过程你不用看懂任何代码,对话窗口里能看到它的思考和执行步骤,右侧还能同步看到它正在操作的页面,过程透明可追踪。



4. 点击直接预览最终产物


最终它交付一个整理好的 Excel,点击即可在 TRAE Work 端内直接预览,也可以下载到本地查看。



可以看到几个细节正是它"靠谱"的地方:收益率自动去掉了百分号转成数字、基金规模统一成"亿元"、货币和短债基金被排除掉了、抓不到的"近3年收益率"如实填了"未获取"而不是瞎编。


实用技巧


1. 先判断这个网页"适不适合"采集


不是所有网页都能顺利抓。开工前对照一下:


遇到需要登录的网站,TRAE Work 右侧浏览器会弹出登录页,你手动登录后它就能继续抓(过程中不会记录你的个人信息)详情请见下图。多页数据它能自动翻页/滚动,不用你手动操作。



2. 字段抓不全、格式乱怎么办? 


核心还是回到"五要素",把"处理规则"和"注意事项"写细。比如明确"2.3万转成数字 23000""抓不到就填未获取",AI 就会按规矩来,而不是给你一堆带单位的文本。


3. 数据量大、跨很多页怎么办? 


直接在 Prompt 里说明"如有分页请翻页抓全"即可,TRAE Work 会自动翻页累积。如果页数特别多,也可以分关键词/分类多跑几次,最后合并。


4. 想每天自动跑、不用手动发起? 


这是网页采集最香的玩法。采集任务调通后,直接用大白话告诉 TRAE Work:「把这个任务设成每个交易日早上 9 点自动执行,结果推送给我。」它就会把这条采集变成一个定时自动化任务,每天到点自动抓取、产出、推送到桌面端/手机端/网页端。老王那 20 分钟的晨间手工活,从此彻底交给机器。



任务设置完毕,可在对话流中查看;也可进入“自动化”页面,随时查看并修改任务设置。



场景 2:从不同格式文件中提取数据


本节你将学到:当你手里有一堆格式各异(PDF / 图片 / 文档)、信息散乱的文档(简历、合同、发票、名片……)时,如何用 TRAE Work 一次性把关键字段"抠"出来,整理成一张干净的表格。重点是怎么应对真实文档里的"脏、乱、缺"。


案例背景


小林是一家公司的 HR,每年金三银四的社招旺季,她的邮箱就会被简历淹没,比如她手里攒了 200 多份候选人简历 PDF


过去她的工作流是这样的:一份份点开 PDF,眼睛在屏幕上来回扫,把姓名、电话、学历、薪资期望等信息一个个敲进 Excel。一份简历熟练操作也要 3-5 分钟,200 份就是大半天,眼睛看花、手指敲酸不说,还经常录错电话号码、看漏期望薪资。


她真正想要的,其实只是一张结构化的表格:每行一个候选人,每列一个关键字段,方便后续筛选(比如"挑出 5 年以上经验、期望薪资 25k 以内、在上海的候选人")。简历本身的排版多花哨她并不关心。


这正是 TRAE Work 最擅长的活儿:从非结构化文档里抽取结构化信息


实战教程


1. 明确要提取哪些字段


动手前先想清楚"我要什么"。小林梳理出 8 个字段:



小技巧字段定义里把"取值规则"也写清楚(比如"联系方式优先取手机号"),AI 才不会乱猜。这一步花 2 分钟,能省掉后面反复返工。


2. 看看真实简历长什么样(脏数据预警)


真实简历从来不是整整齐齐的。下面是小林随手抽出的 3 份(已脱敏,仅作演示),注意它们的"不规则"之处——这恰恰是手动录入最容易出错、也最考验 AI 的地方:

========== 简历 1 ==========张伟    男 | 1992.03 | 138-0013-8000 | zhangwei92@email.com
【教育背景】2014.09-2017.06  复旦大学   计算机科学与技术   硕士2010.09-2014.06  上海大学   软件工程         本科
【工作经历】2020.07 至今    某大厂      高级后端工程师2017.07-2020.06 某创业公司   后端开发工程师
【求职意向】期望城市:上海期望薪资:30-40k
========== 简历 2 ==========姓名:李娜电话:未填写邮箱:lina_hr@email.com学历:本科(北京交通大学,2015 届)目前在做产品经理,工作 8 年了现居北京(简历里没有写期望薪资)
========== 简历 3 ==========WANG Lei  王磊Tel: 13600001111最高学历:大专  ——  广东轻工职业技术学院经验:3年最近职位:UI设计师 @ 深圳某公司期望薪资:10000/月City: 深圳 / 可接受广州


发现"坑"了吗?


  • 格式五花八门:简历 1 用电话+邮箱并排,简历 2 用"字段:值",简历 3 中英文混排。


  • 缺失字段:李娜没填手机号(要回退到邮箱),也没填期望薪资。


  • 薪资写法不统一:"30-40k"、"10000/月"、还有人干脆不写。


  • 干扰信息:王磊的城市写了"深圳 / 可接受广州",到底填哪个?


  • 多段教育/工作经历:要的是"最高学历"和"当前职位",不能把所有经历都堆上去。


手动录入时,正是这些细节让人崩溃。下面看 TRAE Work 怎么一次搞定。


3. 直接用自然语言告诉 TRAE Work 你想如何提取数据


把多个简历文件一次上传/直接拖入 TRAE Work 后,用下面这段 Prompt 告诉智能体你想要如何提取数据。

附件是一批候选人简历(PDF/文档),请你从每一份简历中提取以下 8 个字段,整理成一张表格。
【需要提取的字段】1. 姓名2. 联系方式:优先取手机号;如果没有手机号,则取邮箱;都没有则填"缺失"3. 最高学历:从博士/硕士/本科/大专/其他中选一个,取学历最高的一项4. 毕业院校:填"最高学历"对应的那所院校5. 工作年限:填累计工作年限的数字(单位:年);如果只能推算,填推算值并在备注说明6. 当前职位:填最近一份工作的职位名称7. 期望薪资:原样保留简历里的写法(如"30-40k""10000/月");如果未填写,填"未填写"8. 所在城市:填候选人当前所在城市;如果写了多个,取第一个(当前城市),其余放入备注
【输出要求】- 用 Excel 表格输出,每行一个候选人,列顺序与上面字段一致,最后加一列"备注"- 严格基于简历原文提取,不要猜测或编造。简历里确实没有的信息,一律填"未填写"或"缺失",不要替我脑补- 对于有歧义或需要推算的字段(如工作年限、多城市),在"备注"列简要说明你的判断依据- 如果某份简历完全无法识别,也单独列一行并在备注里说明原因


 这段 Prompt 为什么好用?


  • 把缺失/异常的处理规则提前写死("没有就填未填写,不要脑补"),这是防止 AI 编造的关键。


  • 要求标注判断依据(备注列),让你能一眼看出哪些是 AI 推算的、需要复核。


  • 明确"取最高学历""取当前职位",避免它把多段经历全堆进去。


4. 观察 TRAE Work 的思考与执行


TRAE Work 智能体会根据任务情况,自主调用内置 或 自定义技能(Skills)来更好地完成任务,这里TRAE Work自主调用了word、pdf 和 xlsx 技能,更高质量地处理各类格式的文件。



TRAE Work 智能体和普通Chatbot不一样的点之一在于,TRAE Work 还会对数据反复进行校验和核对,提高准确度;本案例中 TRAE Work 自动进行了 3 次校验与核对。



5. 针对上面 4 份简历,TRAE Work 会输出类似这样的结构化表格



注意几个细节,正是它"靠谱"的体现:


  • 张伟的手机号自动去掉了分隔符(138-0000-0001 → 13800000001),方便后续使用。


  • 李娜没手机号,自动回退到邮箱,且期望薪资如实填"未填写"而没有瞎编一个数字


  • 王磊的多城市问题,按规则取了"深圳",并把"可接受广州"放进备注,判断过程透明可查。


实用技巧


实战中你一定会遇到下面这些情况,记住这几招:



场景 3:快速生成 SQL 语句


本节你将学到:当你面对一个"逻辑绕、表又多"的复杂查询时,如何用 TRAE Work 快速生成一份高质量的 SQL 初稿,再由你来检查微调——把"从零写"变成"审改稿",效率翻倍。同时学会让 AI 帮你解释逻辑、优化慢查询、排查报错。


案例背景


小陈是一家在线教育平台的数据分析师。这天运营负责人扔给他一个需求:


"帮我拉个数:过去 30 天内,完成了至少 3 门课程学习、并且最近 7 天内有登录行为的活跃学员,按城市分组,统计每个城市的人数、平均学习时长、续费率。"


小陈一看就知道这不是个简单查询:


  • 涉及多张表JOIN:用户、学习记录、登录记录、订单都要关联。


  • 多重过滤条件:30 天内、完成 ≥3 门、7 天内登录过。


  • 要算续费率这种比率指标,得先定义清楚"续费"是什么。


  • 大概率要用到子查询、聚合、甚至窗口函数


小陈本身 SQL 功底不差,能看懂、能 debug、能优化,但要从一张白纸开始把这段逻辑捋顺、敲完、调通,没有 20-30 分钟下不来。他想的是:让 TRAE Work 先生成初稿,我来审和改,这样最省力。


这是用 AI 写 SQL 的黄金姿势:你负责把关,AI 负责打草稿。


实战教程


1. 先把"表结构"喂给 TRAE Work


让智能体写 SQL 最重要的前提是它得知道你的表长什么样。小陈把相关 4 张表的建表语句整理出来,这是写好 SQL 最关键的一步,表结构给得越准,SQL 越能直接用:

-- 用户表CREATE TABLE users(    user_id        BIGINT       PRIMARY KEY COMMENT '用户ID',    nickname       VARCHAR(64)  COMMENT '昵称',    city           VARCHAR(32)  COMMENT '所在城市',    register_time  DATETIME     COMMENT '注册时间',    status         TINYINT      DEFAULT 1 COMMENT '账号状态:1=正常,0=注销') COMMENT '用户表';
-- 课程学习记录表(一条记录代表一个用户对一门课程的学习情况)CREATE TABLE course_progress(    id             BIGINT       PRIMARY KEY AUTO_INCREMENT,    user_id        BIGINT       COMMENT '用户ID',    course_id      BIGINT       COMMENT '课程ID',    status         TINYINT      COMMENT '学习状态:0=未开始,1=学习中,2=已完成',    study_minutes  INT          DEFAULT 0 COMMENT '该课程累计学习时长(分钟)',    finish_time    DATETIME     COMMENT '完成时间(status=2时有值)',    update_time    DATETIME     COMMENT '最近学习更新时间',    KEY idx_user (user_id),    KEY idx_finish (finish_time)) COMMENT '课程学习记录表';
-- 登录记录表(一条记录代表一次登录)CREATE TABLE login_log(    id             BIGINT       PRIMARY KEY AUTO_INCREMENT,    user_id        BIGINT       COMMENT '用户ID',    login_time     DATETIME     COMMENT '登录时间',    device         VARCHAR(32)  COMMENT '登录设备:ios/android/web',    KEY idx_user_time (user_id, login_time)) COMMENT '登录记录表';
-- 订单/续费表(一条记录代表一笔购买,含首购与续费)CREATE TABLE orders(    order_id       BIGINT       PRIMARY KEY COMMENT '订单ID',    user_id        BIGINT       COMMENT '用户ID',    amount         DECIMAL(10,2) COMMENT '订单金额(元)',    order_type     TINYINT      COMMENT '订单类型:1=首购,2=续费',    pay_status     TINYINT      COMMENT '支付状态:1=已支付,0=未支付',    pay_time       DATETIME     COMMENT '支付时间',    KEY idx_user (user_id)) COMMENT '订单表';


拿不到完整 DDL 怎么办? 如果你手头没有建表语句,至少把表名、关键字段名、字段含义用大白话列给 AI(比如"orders 表里 order_type=2 表示续费")。AI 最容易翻车的地方就是猜错字段含义,所以业务口径一定要交代清楚,尤其是像"续费率"这种需要定义的指标。


2. 直接用自然语言告诉 TRAE Work 你想如何提取数据


你是一名资深数据工程师,精通 MySQL。请根据我提供的表结构和业务需求,写一段可直接运行的 SQL 查询。

【表结构】
(把上面 4 张表的 CREATE TABLE 语句原样粘贴在这里)

【业务需求】
统计"活跃学员"按城市分组的指标。活跃学员的定义需同时满足:
1. 过去 30 天内(以当前时间为基准)完成学习的课程数 ≥ 3 门(即 course_progress 中 status=2 且 finish_time 在近 30 天内的课程数 ≥ 3)
2. 最近 7 天内有过登录行为(login_log 中存在近 7 天的登录记录)
3. 账号状态正常(users.status = 1)

【需要输出的指标】(按城市 city 分组)
- 活跃学员人数
- 平均学习时长:这些活跃学员"近 30 天完成课程"的人均累计学习时长(分钟)
- 续费率:这些活跃学员中,"近 30 天内有过续费订单(order_type=2 且 pay_status=1)"的人数占比,结果保留 2 位小数、以百分比形式

【输出要求】
- 使用 MySQL 方言
- SQL 要可直接运行,关键步骤加注释说明逻辑
- 时间范围用 NOW() 和 INTERVAL 动态计算,不要写死日期
- 结果按"活跃学员人数"降序排列
- 如果业务定义中有你认为模糊、需要我确认的地方,先在 SQL 上方用注释列出你的假设


这段 Prompt 的精髓在于:指标口径写得像需求文档一样精确("续费率 = 有续费订单的活跃学员 / 全部活跃学员"),并且主动要求 AI 把模糊点的假设列出来。这样生成的 SQL 才不会"逻辑对、口径错"。


3. 查阅 TRAE Work 的SQL产出


仅需二十秒,TRAE Work 就能生成带有完整注释的 SQL 语句,大大省去了手动查表、拼字段、调语法的时间。



拿到 SQL,小陈不会直接跑生产,而是查看 TRAE Work 返回的注释内容、确认模糊口径并逐段审一遍。这正是"AI 写初稿 + 人来把关"的价值:AI 把 80% 的活儿(JOIN、CTE、聚合、语法)干完了,小陈只需聚焦在业务口径这种 AI 无法独自判断的 20% 上。整个过程不到 10 分钟,比从零写快太多。


检查 SQL 的几个必看点:


  1. JOIN 类型对不对:该用 LEFT JOIN 的地方别用成 JOIN


  2. 时间边界:是 >= 还是 >?"近30天"含不含今天?跟 AI 确认口径。


  3. 去重COUNT 要不要 DISTINCT?多表 JOIN 后很容易出现行数翻倍。


  4. 业务口径:比率类指标(续费率、转化率)的分子分母定义,永远要自己再确认一遍。


实用技巧


写出 SQL 只是开始,TRAE Work 还能帮你做更多:


1. 让它解释一段看不懂的 SQL

接手别人的祖传 SQL 看不懂?直接丢给它:

请逐段解释下面这段 SQL 在做什么,每个子查询/CTE 的作用是什么,最后用一句话概括它的业务含义:(粘贴 SQL


2. 优化慢查询

某个查询跑得特别慢?让它帮你诊断:

下面这段 SQL 在千万级数据量下跑了 40 秒,请帮我分析慢在哪里,并给出优化建议(包括索引建议、改写思路)。表结构和 SQL 如下:(粘贴 DDL 和 SQL


3. 帮你看懂报错

SQL 报错不知道错在哪儿?把报错信息原样贴给它:

这段 SQL 报错:ERROR 1055 (42000): Expression #2 of SELECT list is not in GROUP BY clause...请告诉我原因和怎么改。SQL 如下:(粘贴 SQL


4. 一键适配其他数据库方言

如果你的库不是 MySQL,加一句:「请把上面这段 SQL 改写成 PostgreSQL(或 Hive / ClickHouse)方言」即可。


第二步·数据清理与标准化


数据拿到手了,但往往是"毛坯",有错漏、有重复、格式不统一、没有分类。这部分讲怎么用 TRAE Work 把数据收拾干净,让它"能用、好用"。


场景 4:数据核对与校验


本节你将学到:当你有两张本该对得上的表(报销单 vs 银行流水、订单 vs 发货、应收 vs 实收……)时,如何用 TRAE Work 自动找出"对不上"的异常记录,并且学会一套防止 AI 编造结论的关键方法。


案例背景


老周是一家消费品公司的财务专员。每到月末,他都要做一件最磨人的事:核对员工报销


他手上有两张 Excel:


  • 报销申请表:员工自己填的,包含姓名、部门、申请金额、费用类型、申请日期。


  • 银行付款流水:财务系统导出的实际打款记录,包含付款日期、收款方姓名、付款金额、备注。


理论上,每一笔报销申请,都应该在银行流水里有一笔对应的打款。但现实总有意外:


  • 有人报了金额对不上(申请 800,实际打了 600)。


  • 流水里有一笔打款,报销表里却找不到对应申请(可能是补录漏了)。


  • 报销表里有申请,流水里却没打款(可能还没打、或打款失败)。


过去老周得拿两张表左右开弓、用 VLOOKUP 一行行比对,几十上百条对下来,眼睛都直了,还容易漏。现在他想让 TRAE Work 来当这个"火眼金睛"。


实战教程


1. 用自然语言告诉 TRAE Work 数据核对需求


把两张源数据表都上传给 TRAE Work,然后在对话框内输入以下 Prompt:

你是一名严谨的财务稽核助理。我有两张表需要逐条核对:- 表A【报销申请表】:字段有 员工姓名、部门、申请金额、费用类型、申请日期- 表B【银行付款流水】:字段有 付款日期、收款方姓名、付款金额、备注
【核对规则】以"姓名"作为主要匹配键,把表A的每一条申请与表B的流水进行匹配,判断属于以下哪种情况:1. ✅ 匹配:姓名能对上,且申请金额 = 付款金额2. ⚠️ 金额不一致:姓名能对上,但申请金额 ≠ 付款金额(请写出差额)3. 🔵 仅流水有:表B里有这条流水,但表A里找不到对应申请4. 🔴 仅申请表有:表A里有这条申请,但表B里找不到对应流水
【输出要求】- 输出一张核对结果表,逐条列出:姓名、申请金额、付款金额、核对状态、依据说明- 每一条都要给出"依据说明",写清楚你是凭哪条申请、哪条流水做出的判断- 重要:严格基于我给的数据判断,不要猜测。如果某条因为姓名相近、金额接近等原因你无法确定如何匹配,请标为"❓待确认"并说明疑点,不要强行配对- 最后给出一个汇总:各类状态分别有几条


数据核对最怕的就是 AI"自信地配错对",或者把不存在的记录说成存在。上面 Prompt 里其实已经藏了三个防幻觉的关键设计,这里专门点出来:


  • 要求逐条标注"依据说明":强迫 AI 把"我凭哪条数据下的结论"写出来。你一眼就能看出它有没有张冠李戴。


  • 允许并鼓励它说"我不确定":明确给出"❓待确认"这个出口。AI 一旦被允许"示弱",就不会硬着头皮瞎配对——这比要求它"必须给答案"安全得多。


  • 明令禁止猜测:"严格基于我给的数据,不要猜测"。这句话能显著降低它脑补数据的概率。


一句话总结防幻觉心法:让 AI 亮出证据、给它说"不知道"的权利、禁止它脑补。 核对、对账、稽核这类"错一个数就出事"的场景,这三条必须写进 Prompt。


2. 观察 TRAE Work 的思考与执行


和 Chatbot 不一样的是,TRAE Work 智能体会自主将复杂的大任务拆解成更细粒度的小任务,并在对话流中展示思考和执行方式。



在执行过程中,TRAE Work 会自动编写数据处理脚本来完成采集和清洗工作;遇到问题时,它还能自我检查错误并修复。用户不需要看懂或修改任何代码,整个过程由智能体自主完成,最终只交付整理好的结果文件。



3. 查阅 TRAE Work 产出的数据核对结果


按照需求,TRAE Work 汇总了匹配的数据、需要确认 或 有问题的数据。



场景 5:用 AI 做批量分类标注


本节你将学到:当你面对成千上万条文本(用户反馈、评论、工单、问卷开放题……)需要按一套标签体系归类时,如何用 TRAE Work 又快又准地批量打标,怎么处理"模棱两可"的样本,以及上千条数据该怎么分批跑。


案例背景


小苏在一家电商平台的客服团队做数据运营。团队的工单系统和 App 评价区里,积累了 5000 多条用户反馈文本


老板想知道:用户到底在抱怨什么?是功能不好用,还是嫌贵,还是物流太慢?这些反馈如果能按统一标签体系分类,就能:


  • 产品团队指明迭代方向(哪类问题最多)。

  • 客服质检提供抓手(哪类问题处理得不好)。


但 5000 条纯文本,靠人一条条读、一条条打标签,几个人干一周都未必干得完,而且不同人标准还不一样。小苏决定用 TRAE Work 来批量标注。


实战教程


1. 定义清楚标签体系(这是成败关键)


分类质量 = 标签体系质量。 标签定义得越清楚、边界划得越明确,AI 标得就越准。小苏先和产品、客服一起,定下了这套两级标签体系,每个标签都配了"边界定义"和"样例"


划边界的诀窍:最容易混的两个标签,要专门说清楚"谁归谁"。比如"操作复杂"(功能能用但麻烦)vs"功能异常"(功能根本用不了),在定义里点明差异,AI 就不容易标混。这一步也可以直接交给 TRAE Work 来生成标签体系,再进行人工审核。


2. 用自然语言告诉 TRAE Work 如何进行数据标准化处理


请按我给定的标签体系,参考附件 Excel 文档,对每一条用户反馈进行分类。
【标注要求】1. 给每条反馈打上"一级分类 + 二级标签"2. 给出置信度(高/中/低):当反馈表意清晰、明确对应某标签时为"高";当措辞模糊、可能落在两个标签之间时为"中"或"低"3. 给出一句话理由,说明你判断的依据(引用反馈里的关键词)4. 如果一条反馈同时涉及多个问题,选择用户**最主要、最强烈**抱怨的那个作为主标签,并在理由里注明它还涉及哪个次要标签5. 严格按标签体系来,不要自创标签。实在无法归类的,标为"其他 / 无法归类"
【输出格式】按下面的表格逐条输出:序号 | 反馈摘要 | 一级分类 | 二级标签 | 置信度 | 理由


这段 Prompt 的关键设计:把完整标签定义随 Prompt 一起给(不要假设 AI 记得)、要求输出置信度(这是后面筛查模糊样本的抓手)、规定多标签时怎么取主标签(避免 AI 自己乱选)。


3. 检查 TRAE Work 产出的分类标签标注



打完标签,数据就从"一堆文本"变成了"可分析的结构化资产":


  • 问题分布一目了然:统计各标签的数量占比,画成饼图/柱状图——比如发现"配送问题"占 35% 居首,"功能异常"占 20% 紧随其后,产品和供应链的优化优先级立刻清晰。


  • 趋势监控:按周/月统计各类问题的变化,能及时发现"某次发版后功能异常类反馈激增"这种信号。


  • 交叉分析:结合用户分层、地区、机型等维度,定位问题(如"安卓用户的闪退反馈明显高于 iOS")。


  • 客服质检抓手:"客服服务"类反馈可直接推给质检团队复盘。


而这些统计和可视化,正好可以交给下一个场景来做。


实用技巧


1. 大规模数据(>1000 条)的分批策略


当数据量级非常大的时候,推荐先用少量的样本数据进行测试。 没问题后,可以全量进行分析;不推荐直接把 5000 条塞进一个对话框是不行的(太长、易出错、跑一半断了前功尽弃)。正确做法是分批


  • 固定标准,分批投喂:把标签体系和要求作为"固定开头",每批投入 50-100 条反馈。每批都用完全一样的标签定义和输出格式,保证标准统一。


  • 善用文件批处理:大文件拆解成批量文件也无需手动操作,可以直接把文件交给 TRAE Work,让它拆解成每个 100 条反馈的文件,比手动复制粘贴高效得多。


  • 第一批当"对齐基准":先认真跑第一批,人工检查标得准不准。确认 AI 理解到位了,后续批次就可以放心跑。


  • 保留序号,方便合并:每条数据带上全局唯一序号(如 0001-5000),AI 输出时保留序号,最后你按序号把各批结果拼起来即可。


  • 失败可重跑:分批的另一个好处是,哪一批结果有问题,单独重跑那一批就行,不用从头来过。


  • 合并文件:所有批次都跑完后,可以再让 TRAE Work 把所有的文件都合并成 1 个大文件。


  • (进阶,可选)沉淀技能:用自然语言就能在 TRAE Work 里沉淀技能。当以上 1 - 5 步骤跑顺畅之后,可以在对话框内直接输入“把以上批量数据分批处理的工作流整理成一个 TRAE Work 里的Skill”。以后,在反复出现同样使用场景的时候,可以直接 “/” 调用该技能,省去重复沟通以上常用步骤。



2. 多任务并行,让你的工作更高效


大规模的数据标注处理一般需要较长的时间,那 TRAE Work 智能体在跑大规模任务的时候,你需要等着吗?答案是 No。


  • 你可以关上你的电脑去喝一杯咖啡:TRAE Work 里的云端任务执行时无需电脑处于开机状态,合上电脑也能跑。



  • 你也可以同时开启另一项任务:TRAE Work 支持同时执行多个任务,互不干扰,同时进行。



第三步·数据分析


数据获取到了、也清洗干净了,终于到了"挖价值"的环节:做统计、找规律、出洞察,这也是 TRAE Work 最惊艳的功能之一:丰富的技能选择、工具调用、科学的分析、专业的绘表、详实的报告。


场景 6:周报类敏捷数据分析


本节你将学到:如何把一份(或多份)Excel/CSV/JSON 等数据文件直接交给 TRAE Work,让它替你做透视、合并、分组汇总、口径计算、风险筛查,并且直接给出业务结论。把以前那些“打开三个文件、拼 VLOOKUP、算完成率、敲业务话术”的流程,压缩到一条 Prompt。本节会重点演示多文件合并 + 进度跟踪 + 风险预警的复合场景。


案例背景


小余是某公司数据团队的成员。每周一早上,他都要做一份让全公司都看的「业务进展周报」,盘点本周三大事业部(电商、内容、广告)下属各渠道的业务进度,把低于预期进度的渠道标出来,让对应的负责人重点跟进。


听起来很常规,但实操起来全是琐碎活:


  • 三个事业部各自维护一张 Excel,每张表 50 行,字段虽然一致但文件是三个


  • 他得先打开三个文件、复制粘贴到一张总表里,还要手动加一列“所属事业部”才不会混。


  • 然后写 VLOOKUP 拼数据、算完成率(已完成 / 目标)、做透视表分事业部汇总。


  • 再筛选出“完成率 < 60%”的渠道做风险列表,按完成率从低到高排序。


  • 最后还得自己写一段业务总结:“整体进度怎么样?谁拖后腿了?该重点盯谁?”


整套下来一两个小时是少不了的。更要命的是:周周如此,而且每一步只要手抖一下就可能出错(VLOOKUP 串了、完成率分母用错了、漏算了一行)。


小余想:能不能把三个文件一起丢给 TRAE Work,让它自己合并、自己算、自己筛、自己总结?


实战教程


1. 用自然语言告诉 TRAE Work 周报分析的需求


把三个业绩数据的 Excel 一起拖入 TRAE Work 对话窗口,然后发送下面这段 Prompt。它把“合并 + 计算 + 筛选 + 总结”四件事一次说清,这正是分析型 Prompt 和采集型 Prompt 的根本区别:分析型 Prompt 不只是“提取数据”,而是“得出结论”


附件的 3 个 Excel 文件,分别是电商事业部、内容事业部、广告事业部的数据采集进度,每个文件字段相同:序号、平台/渠道名称、负责人、目标数据量、已完成数据量、本周新增、截止日期。
请帮我做以下处理:1. 把 3 个文件合并成一张总表,新增“所属事业部”列以区分来源;2. 按事业部汇总:渠道数、目标数据量、已完成、缺口、本周新增、整体完成率(已完成/目标),最后加一行全公司合计;3. 判断标准:完成率 < 60% 的渠道标记为“落后”,单独输出一张风险预警列表(按完成率从低到高排),列出缺口和截止日期;4. 最后用一段话总结整体进度和最需要关注的事。
输出要求:先给分事业部汇总表,再给落后渠道风险预警列表,最后一段话总结业务进展。完成率保留 1 位小数。


2. 查阅 TRAE Work 的输出


TRAE Work 会自动读三个文件、拼表、加来源列、跑分组汇总、筛选落后渠道、按规则排序,最后根据需求产出核心总结、任务完成度 及 风险预警团队,可以直接应用到周报。



3. (进阶,可选)数据可视化


想做可视化怎么办?直接追加一句即可:“请对以上数据进行可视化绘图,使用 /chart-visualization 技能。” TRAE Work 会自动调用相关技能生成图表,但我们也可以更直接的指定使用某个技能。



为什么要使用技能?搭配 chart-visualization 技能,图表效果更专业美观。在 TRAE Work 对话框中输入 “/” 或 点击 对话框左下角的 “/” 即可选择已安装的技能。



如何安装技能?除了内置的技能外,TRAE Work 还支持用户在技能市场里一键安装技能 或 自定义上传技能



场景 7:深度数据分析洞察报告


本节你将学到:如何让 TRAE Work 处理上千行的大体量数据,并自主完成多维分析,最终产出包含交互图表的 HTML 报告和可直接分发的 PDF 深度洞察报告。


案例背景


小陆是一家营销公司的增长负责人。季度复盘到了,他拿到了过去三个月全量投放明细 Excel,足足 1500 条数据、19 个维度


以往,小陆需要带一个实习生,花一整天时间在 Excel 里拉透视表、切片、算 ROI,然后再一张张截图贴进 PPT,最后配上文字说明。这种方式不仅效率低,而且很难挖掘出更深层的规律,比如“华东地区的 25-34 岁受众在短视频渠道的视频创意表现,是否显著优于其他组合?”这类多维交叉洞察,在 Excel 里操作极其繁琐。


他希望 TRAE Work 能帮他完成从“原始数据”到“专业报告”的跨越:直接吞下这 1500 行数据,自己找亮点、画图表,最后吐出一份像模像样的 HTML 交互报告和 PDF 总结。


实战教程


1. 用自然语言告诉 TRAE Work 数据分析报告要求


数据量大(上千行)时,TRAE Work 智能体处理得会比普通 AI 快且稳,他不仅是简单处理数据,作为智能体,他会自主调用工具、写脚本、检查逻辑等等。我们要给 TRAE Work 一个清晰的“任务说明书”,让它知道不仅要计算,还要像分析师一样产出洞察。


附件是季度广告投放数据,请帮我进行深度数据洞察分析,并产出专业报告,使用 /consulting-analysis 技能。
【分析目标】1. 效果复盘:整体评估本季度的投放质量。2. 寻找亮点:识别出 ROI、转化率表现最突出的维度组合。3. 识别浪费:找出消耗较高但 ROI 极低(如 ROI < 1.0)的“资金黑洞”。4. 策略建议:基于数据,为下季度预算分配给出至少 5 条具体建议。
【分析维度】请在以下维度进行交叉分析:投放渠道、创意类型、目标受众、地区、广告主。
【分析指标】必须覆盖:总消耗、总转化量、平均 CTR、平均 CPC、平均 CPA、整体 ROI。
【输出要求】1. 生成一份 HTML 交互式报告,图表需美观且可交互。2. 同时生成一份 PDF 静态版本,用于存档。3. 报告必须包含:执行摘要(Executive Summary)、关键发现(Top 5 Findings)、详细维度分析、结论与下步建议。4. 图表建议:请根据数据特征自主选择最佳图表(如用热力图看地区分布、用散点图看 CPC 与 ROI 的关系、用漏斗图看转化等)。
【注意事项】- 所有数字必须来自数据本身,严禁编造结论。- 对每个“关键发现”请标注具体的支撑数据及计算口径。- 报告中若有显著的异常值(Outliers),请单独指出。


2. 观察 TRAE Work 的思考与执行


不同于普通Chatbot,TRAE Work 智能体在拿到复杂、大型数据任务后,会自动将其拆解到更细粒度的任务并自主调用技能、工具、写脚本,逐步执行。



3. 查阅生成的报告并做进一步修改


TRAE Work 生成了一份完整的数据分析报告,并生成了便于交互与展示的 HTML 文件 以及 便于发送的 PDF 文件。洞察报告中,包含了总结数据、执行摘要、5大洞察、各维度关键数据可视化、下一步结论及建议。



但我想要麦肯锡风格的简约、明亮色调的报告,在已生成的文件之上,TRAE Work 可以随时加以修改、编辑。



实用技巧


在处理大体量深度分析时,这几招能让你事半功倍:

  • 大文件处理:如果数据超过 10 万行,建议先让 TRAE Work 写一段 Python 脚本在本地运行进行预汇总。对于 1500-5000 行的“中等规模”数据,直接拖进去即可。


  • 自主权 vs 约束:给 Prompt 时,可以多给“分析目标”(例如:帮我找到最高 ROI 的组合),少给具体的“绘图指令”。让 TRAE Work 利用它的推理能力自主选择分析角度,往往能发现你没想到的视角。


  • 分步提问法:如果报告要求极高,可以先使用 /plan 模式让它出一版分析计划以及“数据洞察大纲”,你确认大纲没问题后,再说:“请针对第二章的渠道分析,再深入挖掘一下不同时间段的表现”。


  • 解决中文乱码:在生成 HTML 或图表时,如果发现中文字符显示为方框,可以提醒它一句:“请在绘图脚本中使用支持中文的字体库(如 SimHei 或指定路径字体)”。


让 TRAE Work 成为你的数据搭子


回顾这六个场景,你会发现一条清晰的主线:


  • 数据获取(场景 1/2/3):把散落在网页、文档、数据库里的数据,变成手边可用的结构化表格。


  • 数据清理与标准化(场景 4/5):把"毛坯数据"核对干净、分类打标,变成可信、可分析的资产。


  • 数据分析(场景 6/7):从干净的数据里跑出统计与洞察,支撑决策。


而贯穿始终的,是开头那三条心法:


  1.  交代清楚:把你脑子里的"潜台词"(要什么、缺了怎么办、有歧义怎么办)写进 Prompt。

  2. 永远验真:尤其是数字,让 AI 亮出依据,自己再抽查。

  3. 拆开来做:复杂任务分步走,每步可检查、可回溯。


TRAE Work 不会替代你的专业判断,但它能把那些重复、枯燥、易错的体力活全包了,让你专注在真正需要"人"的地方:定义问题、把关质量、解读洞察。


把这份文档收藏好,下次遇到对应的场景,直接翻到那一节,照着 Prompt 改改就能用。


TRAE Work 官方AI 工作知识库已上线,立即【阅读原文】了解 TRAE Work 知识库。



【声明】内容源于网络
0
0
TRAE.ai
TRAE,The Real AI Engineer|字节跳动旗下的AI编程产品,你的专属AI开发工程师。欢迎在PC端官网直接下载,免费使用。
内容 365
粉丝 0
TRAE.ai TRAE,The Real AI Engineer|字节跳动旗下的AI编程产品,你的专属AI开发工程师。欢迎在PC端官网直接下载,免费使用。
总阅读8.2k
粉丝0
内容365