招聘岗位:8个;
薪资范围:15K-60K;
覆盖城市:杭州/西安/北京/上海/长沙;
招聘人数:12人
职位方向:测试开发、算法测试、AI测试、大模型测试;
自行前往招聘官网投递。
“蚂蚁集团”招聘12人
网商银行-高级测试工程师/测试开发专家*杭州*1人
薪资:20K-40K
【主要职责】
1、参与软件产品的需求分析,负责测试计划和方案制定,并能预先评估质量风险;
2、完成项目测试,包括: 用例开发、构建测试环境、集成测试、回归测试等;
3、完成线上核对防线建设,支持线上应急处理;
4、在项目中保持和项目经理、开发工程师、需求方等相关团队积极有效的沟通,驱动问题解决。
【任职资格】
1、熟悉测试用例设计,有接口测试、白盒测试经验;
2、熟悉Linux操作系统;对软件工程和大型软件架构有较深刻的认识;
3、熟悉Java语言,了解常用的java开发框架,精通至少一种脚本语言, 如:shell、php、perl、ruby等;
4、良好的沟通技能,团队合作能力;
5、有金融产品测试经验者优先。
OceanBase-测试开发工程师*西安*1人
薪资:15K-30K*16薪
【主要职责】
1、能够从客户需求、架构设计、编码等多方面保障OceanBase数据库内核和平台的质量,发现风险并推动快速解决;
2、设计和研发提升数据库平台和内核质量的自动化测试框架或工具,保证测试效率和产品的快速迭代;
3、在测试技术和方法上不断创新,提升测试效率和产品质量。
【任职资格】
1、熟练掌握Python/Java/C++中的一种或几种,有测试开发技术背景3年以上工作经验;
2、熟悉关系数据库、分布式系统专业领域知识,有Web平台的自动化测试经验优先,有公有云测试经验优先,有数据库或分布式系统的测试经验者优先;
3、具备良好的逻辑思维和系统分析能力,对测试技术有浓厚的兴趣,乐于创新,善于钻研;
4、具备良好的沟通和团队合作能力,认真负责,拥抱变化,有很强的抗压能力。
AI驱动测试工程师*北京/西安*2人
薪资:不明
【主要职责】
你将深度参与以下工作:
1、AI 测试效能落地:协助构建基于 LLM(大语言模型)的自动化测试框架,推动 Vibe Coding 理念在测试场景中的实际应用,实现从“自然语言描述”到“可执行测试用例/脚本”的自动转化。
2、智能工具链研发:与团队协作,将复杂的数据库测试场景沉淀为 AI 原生工具,利用 Agent 技术实现测试用例自动生成、异常根因智能分析及测试报告自动解读。
3、数据飞轮建设:负责测试领域高质量语料的清洗、构造与管理,优化 Prompt 工程策略,持续迭代模型在数据库垂直领域的理解与生成能力。
4、前沿技术探索:跟踪业界最新的 AI for SE(软件工程)及 AI Testing 技术动态,并在内部进行技术预研与原型验证。
【任职资格】
基础素质
1、学历背景:计算机、软件工程、人工智能或相关专业在校生,本科及以上学历。
2、编程能力:熟练掌握至少一门主流编程语言(Python 优先,或 Java/Go),具备良好的代码规范与数据结构算法基础。
3、系统认知:熟悉 Linux 操作系统基本原理,了解容器化技术(Docker/K8s)者优先。
AI 专项技能(核心加分项)
1、AI 应用基础:
了解大语言模型(LLM)的基本原理、常见架构及局限性。
熟悉 Prompt Engineering(提示词工程)技巧,有实际调优经验者极佳。
了解 LangChain、LlamaIndex 等主流 AI 应用开发框架,或有 RAG(检索增强生成)、Agent(智能体)开发经验者优先。
有模型输出评估和agent测试经验者优先
2、Vibe Coding 敏锐度:对“自然语言即代码”的开发模式有浓厚兴趣,善于利用 AI 辅助编程工具(如 Cursor、Claude code、Codex等)提升开发效率,并能思考其在测试领域的边界与突破点。
3、有AI测试工具链开发经验者优先
领域知识
1、数据库与云原生:对数据库基本原理(SQL、事务、索引等)有基本认知;了解云计算、分布式系统概念者加分。
2、测试思维:对软件测试理论(单元测试、集成测试、压力测试)有基础了解,具备质量意识。
软实力
1、学习与协作:逻辑清晰,具备极强的主动学习能力(Self-driven),能够快速消化新技术并转化为生产力;具备良好的团队沟通与协作意识。
2、责任心:靠谱(值得信任)、负责、精进(精进钻研),富有责任感,有很好的问题分析和推进问题解决能力
蚂蚁数字科技测试开发(算法评测方向)*杭州/上海*2人
薪资:25K-40K*15薪
【主要职责】
1、参与数科算法的测试和评估工作,包括模型、算法、大模型、AI Agent等相关业务,打造算法研发的标准流程和算法评测体系;
2、与算法研发、产品、工程团队紧密合作,参与需求、系分、测分等评审,确保评测方案贴合业务需求;
3、设计对应的算法评测自动化能力,提升评测效率;设计相应的监控指标,监控线上真实效果;能够形成评测-反馈(线下/线上)-迭代的算法评测闭环;
4、探索新型测试技术,并能对算法模型效果质量的评价维度及测试方法提出改进。
【任职资格】
1、有3-5年的算法测试或者开发经验;
2、熟练掌握一种或多种开发语言,python、java等开发经验;
3、具备良好的团队合作精神,善于协调沟通,具备针对复杂问题的分析和解决的能力;
4、有相关的AI相关产品测试经验、测试平台建设者优先。
蚂蚁集团-AI质量评测工程师*杭州/北京*1人
薪资:30K-60K*16薪
【主要职责】
这是一个面向 AI 评测、AITesting 与业务质量保障的复合型岗位。你将参与大模型、智能体、AI 测试平台和业务系统的评测与测试建设,围绕真实业务场景,构建可复现、可自动化、可持续优化的评测和测试体系,推动 AI 能力在研发、测试和质量保障流程中的落地。
1、参与大模型、Agent、AITesting 等场景的评测体系建设,包括评测任务设计、指标定义、评测集构建、自动化评测和结果分析;
2、参与 AI 测试能力建设,包括测分 / 用例生成、接口测试、服务端测试、端到端测试、回归测试、日志 / DB / 接口校验、测试报告等能力落地;
3、结合业务需求和技术方案,完成测试计划制定、用例设计、测试执行、问题定位、回归验证和质量风险评估;
4、基于评测和测试结果,分析模型、Agent、工具链路或业务系统中的问题,推动优化闭环,提升 AI 应用效果和业务交付质量;
5、参与测试工具、自动化框架、评测平台、质量看板等工程能力建设,提升测试效率、覆盖率和问题发现能力;
6、与产品、研发、算法、测试、业务团队协作,推动问题定位、修复和持续改进,保障核心业务链路质量。
【任职资格】
1、熟悉软件测试基础方法,具备测试用例设计、接口测试、集成测试、回归测试等经验,有白盒测试经验更佳;
2、熟悉 Linux 操作系统,具备一定的问题排查、日志分析和脚本编写能力;
3、熟悉 Java 或其他至少一种主流编程语言,了解常见开发框架,熟悉 Shell / Python / Ruby / Perl 等脚本语言之一优先;
4、对软件工程、服务端架构、接口设计、数据一致性、质量风险有基本理解,能够参与需求分析和技术方案评审;
5、对 AI 测试、模型评测、Agent、RAG、Prompt、自动化评估等方向有兴趣,愿意学习并参与相关能力建设;
6、具备良好的沟通能力、团队协作能力和问题推进意识,能够与产品、研发、算法、测试等角色高效协作。
加分项
1、有大模型评测、LLM-as-a-Judge、Agent 评测、RAG 评测、自动化评测平台建设经验;
2、有 AITesting、测试用例自动生成、接口自动化、服务端自动化、端到端自动化测试经验;
3、有金融、支付、信贷、风控、营销等复杂业务系统测试经验;
4、有质量平台、测试工具、数据构造、Mock、日志 / DB 校验、线上核对、防线监控建设经验;
5、有 Java 服务端开发、测试开发、CI/CD、DevOps 或大型分布式系统质量保障经验;
6、有较强的数据分析、问题归因、评测集构建、难例沉淀和效果闭环意识。
语音大模型评测工程师*北京/杭州*2人
薪资:28K-55K*15薪
【主要职责】
1、负责医疗语音大模型及相关语音能力的评测体系建设,围绕S2T/ASR/TTS、语音通话、数字人、医疗语音交互等场景,设计评测方案、构建评测标准并持续优化。
2、结合业务目标与模型能力,定义核心评测指标,包括但不限于识别准确率、延迟、稳定性、自然度、可懂度、鲁棒性、安全合规性、医疗场景可用性等,并建立可量化、可追踪的评测机制。
3、负责搭建语音大模型离线评测、在线评测与专项评测能力,建设测试集、基准集和场景化评测集,覆盖真实医疗场景中的口音、噪声、术语、通话链路、长语音、多轮交互等复杂问题。
4、与语音算法、数据、产品、工程团队紧密协同,深入分析模型效果问题,定位性能瓶颈,推动ASR/TTS/语音大模型在医疗业务中的效果优化与目标达成。
5、参与评测自动化平台、评测工具链和数据闭环建设,推动评测流程标准化、工程化和规模化,提升模型迭代效率。
6、持续跟踪语音大模型、多模态、数字人、智能通话等方向的前沿评测方法与行业最佳实践,推动评测体系不断升级。
【任职资格】
1、本科及以上学历,语音、计算机、人工智能、机器学习、多模态等相关专业,2年以上语音算法、语音测试、模型评测或相关工作经验。
2、熟悉语音相关核心技术原理,理解语音前端、唤醒、VAD、ASR、TTS、语音通话处理、端到端语音模型及原生多模态模型的基本机制与常见问题。
3、具备语音模型评测体系设计经验,能够独立设计评测维度、指标体系、测试方案和数据集,具备较强的问题分析与效果归因能力。
4、熟悉语音交互系统或语音产品落地流程,了解业界主流语音系统实现方案,有医疗语音、客服通话、数字人、智能助手等相关场景经验者优先。
5、具备良好的工程能力,熟悉Python,了解C/C++,能够完成评测脚本开发、数据分析、自动化评测流程搭建及相关工具开发。
6、具备较强的跨团队协同和项目推动能力,能够与算法团队高效配合,推动模型效果持续优化并落地业务目标。
7、有大模型开源项目经验、医疗应用场景实操经验者优先;有人工智能、语音、多模态等方向顶会/顶刊论文发表者优先。
网商银行算法评测工程师*杭州*1人
薪资:35K-50K*13薪
【主要职责】
1、按照产品架构和业务要求,设计覆盖功能及非功能需求的质量保障策略,主要负责AI/算法类产品质量(如智能引擎、大模型应用);
2、参与AI业务系统架构设计方案评审,进行专项评测方案设计,包括评测指标体系、评测集、性能压测等;
3、解决测试复杂技术问题,开发适配算法服务的测试工具(评测数据集构造、模型效果评估等),提升效能与品质;
4、研究测试新技术方法,重点推进AI算法评测、AI原生应用测试能力升级等创新方向,攻克算法领域特有质量难题。
【任职资格】
1、计算机、信息、人工智能、数据等相关专业本科及以上学历;三年以上互联网及传统行业开发测试和质量保障经验,具备一年以上AI/算法类产品的算法评测等测试经验(如大模型/推荐/搜索/NLP系统);
2、熟悉算法服务测试场景(如精度验证、AB实验评估等),精通至少一个测试领域(自动化/性能/安全);
3、熟悉主流算法框架,熟练使用Python、java等至少一种编程语言,有测试工具平台开发经验;
4、具备算法评测基础知识,熟悉常用评测指标(准确率/召回率/F1-score等),了解badcase分析及评测数据集构建等评测方法,有算法评测工程经验者优先;
5、对新质量技术敏锐度高,能快速理解AI产品特性,具备技术攻关和团队协作能力。
高级测试技术工程师*长沙*1人
薪资:11K-22K*16薪
【主要职责及任职资格】
1、计算机或其他相关专业统招本科以上学历;
2、熟悉mysql或者其他数据库;
3、熟悉java、python中任意一门编程语言;
4、2年以上工作经验;
5、工作积极主动、有推动力;
6、有较好质量思维;
7、有保险等金融行业相关测试经验优先。
你还想知道关于招聘的哪些信息
或者
需要我们整理哪些招聘岗位

