「TalentAI」将持续带来人工智能相关在招职位信息,欢迎正在找工作与看新机会的朋友关注,也欢迎企业伙伴与我们联系合作。
关于 PhAI Labs
PhAI Labs 是一家专注于下一代人工智能前沿研究的 Neo Lab。
我们的创始团队由来自 Stanford、Oxford、Princeton 的强 AI 背景科学家组成,成员包括高校教授、大厂研究员等。团队长期深耕大模型、强化学习、智能体与科学智能,首轮融资数千万美元。团队已产出多个高影响力论文及开源项目,并与 Anthropic、OpenAI、Google DeepMind 等全球头部 AI 机构开展学术合作。
我们不以常规应用开发和短期产品迭代为核心,只关注可能决定下一代智能系统形态的前沿研究问题。
PhAI Labs 的长期目标是推动 Recursive Self-Improvement(RSI,递归自我改进):构建能够从真实任务和环境反馈中持续学习,主动发现自身缺陷,并不断优化推理、记忆、技能与行动机制的智能系统。
我们正在寻找你
我们希望招募对 LLM / Agent Post-Training 和 Self-Evolving 算法 充满热情的在读硕博实习生——通过强化学习、蒸馏与自我演化机制,让大模型从“会说”走向“会做”:能够推理、规划、调用工具、自我纠错,并在真实任务中持续提升自身能力。
你将主导或深度参与面向全球社区的高质量开源项目,并参与从研究构想、实验验证到论文投稿和开源发布的完整过程。优秀实习生有机会以第一作者或核心贡献者身份参与顶会顶刊论文与开源工作。
你将参与的硬核研究
1. RL Post-Training
研发面向推理与Agent 任务的强化学习训练方法(包括 GRPO、On-policy Distillation、RLHF、RLVR 等),提升训练稳定性、样本效率与可扩展性。
2. Reward / Verifier Modeling
设计Reward Model、过程奖励模型(PRM)与可验证奖励机制,研究过程监督、信用分配、自我纠错与自我提升闭环。
3. Agentic Post-Training
构建 Agent 的技能、记忆与工具调用架构,研究长程任务、多轮交互及多智能体协作场景下的训练与评测方法。
4. Self-Evolving Harness
设计并构建自进化 harness 系统,让评测与训练基础设施本身具备持续优化能力,目标是让评测系统本身成为推动模型进化的一部分,而不是被动指标工具。
任职要求
重点高校计算机、人工智能、数学、物理或相关专业在读硕士、博士,优秀本科生亦可考虑;
有 LLM RL、Post-Training 或 Agent 相关研究或项目经历(如 RLHF、GRPO 训练、Reward Modeling 或 Agent 框架开发);
对前沿科研有热情,具备较强的自驱力、研究能力和执行力。
加分项
有 NeurIPS、ICML、ICLR、ACL、EMNLP 等顶会顶刊论文(包括在投或第一作者工作);
有高质量开源项目或核心代码贡献;
熟悉 verl、Megatron、DeepSpeed 等训练框架;
有大规模分布式训练、推理优化、Agent Infrastructure、工具调用、长上下文或多智能体系统经验;
对 RSI、自我演化智能体、科学智能或通用智能有长期兴趣。
你将获得
国内外顶尖高校深造支持:创始成员包括高校教授,可为表现优秀、研究能力突出的实习生提供系统的申请指导、学术推荐与合作引荐机会;
国内:清华、北大、复旦、上交等顶尖高校硕博申请支持;
海外:Stanford、Oxford、Princeton 等顶尖高校博士及博士后申请推荐与学术支持。
极具竞争力的实习薪资:1000–5000元/天,特别优秀者可单独面议。
顶级学术与开源影响力:主导或深度参与面向全球社区的前沿开源项目;有机会以第一作者或核心贡献者身份参与高质量顶会顶刊论文;接触顶级研究网络。
充足的科研资源:一线算力资源,以及从 Idea、模型训练到论文与开源落地的完整科研训练。
长期发展机会:表现优秀者可转正或获得长期合作机会。
我们希望找到的不只是执行既定任务的实习生,而是愿意面对尚无标准答案的问题,主动提出假设、构建系统并验证研究判断的年轻研究者。
欢迎加入 PhAI Labs,与我们一起构建能够:自主学习、自我验证、自我纠错、自我演化,并最终实现递归自我改进的智能系统。
Build the systems that improve themselves.
投递方式
简历投递:yang@phai-labs.com
实习地点:北京市海淀区未来科技大厦(北京大学西门)
实习时间:每周不少于 4 天,连续不少于 3 个月

