
阿里巴巴
面向Auto Research的强化学习算法与数据合成体系研究-阿里星
面向Auto Research的强化学习算法与数据合成体系研究-阿里星
发布于 大约 4 小时前普通员工/个人贡献者
北京市 / 杭州市
无经验要求
全职员工
仅现场办公
博士
机器学习工程
Auto Research
Dpo
Grpo
Ppo
Pytorch
大语言模型
强化学习
数据合成
AI 估算 · 45k–65k
阿里星为顶尖博士项目,北京/杭州一线城市,前沿AI方向,薪资竞争力强,通常有丰厚年终奖。
职位详情
关于这个职位
作为阿里巴巴阿里星项目的算法研究员,你将聚焦Auto Research领域,研究强化学习与数据合成核心技术,推动自动化科研智能体在生物、化学、材料等理工科领域的自主决策与实验验证能力
岗位涉及大模型、Agent、RLHF等前沿方向,适合有强研究背景的博士毕业生,提供顶级平台与资源
最低要求
计算机科学、人工智能、信息科学、数学、统计学、自动化或相关STEM专业以及交叉学科背景(如计算生物学、计算神经科学、计算化学)的应届博士毕业生,或即将获得博士学位的优秀候选人
在领域内高水平学术期刊会议上发表论文并经过同行评议
或研究内容形成专利成果
具备扎实的编程能力,熟练使用 Python,熟悉 PyTorch 或类似深度学习框架,能够独立完成算法实现、实验设计与结果分析
深入理解以下至少一个方向:大语言模型 / 多模态大模型、强化学习 / 强化学习后训练、Agent 系统 / 工具调用 / 自主决策、代码智能体 / 自动化科研 / 自动化推理等
熟悉主流强化学习或偏好优化算法,包括但不限于:PPO、DPO、GRPO等
如为自然科学专业,需具备扎实的编程基础,并对AI for Science有强烈兴趣和深入的见解
能够独立推进科研项目,具备较强的理论知识背景、问题定义能力、实验设计能力、论文阅读与复现能力,能够针对复杂问题提出创新性解决方案
具有强自驱力、学习能力、创新意识和沟通协作能力,能够适应快速变化的 AI 研究方向、适应跨学科合作的工作环境,并具备一定抗压能力
工作职责
研究 Auto Research Agent 的核心训练方法,围绕理工类科研领域(如生物化学材料物理等)自动化科研智能体的自主决策、规划、工具调用、代码执行与实验验证能力,开展系统性算法研究
设计并构建 Agentic 数据合成体系,研究大规模 Agent 轨迹数据的高效生成、清洗、筛选、增强与配比策略,构建高质量后训练数据管线
探索稳定高效的 Agentic RL 训练方案,应用并改进 PPO、DPO、GRPO 等强化学习算法,优化长程任务中的奖励设计、训练稳定性、探索效率与泛化能力
提升模型在代码、真实科研流程、实验场景中的任务成功率,针对代码生成、实验执行、错误修复、结果分析、论文写作等任务,构建训练与评测闭环,持续提升模型鲁棒性
推动学术成果产出与开源建设,将研究成果整理为高水平论文,投稿至国际顶级会议
根据项目情况推动算法、数据或模型开源,提升团队技术影响力
AI 洞察
优缺点分析
优点
- 阿里巴巴顶级人才项目,资源倾斜,平台影响力大
- 研究内容前沿,涉及大模型、强化学习、数据合成等热门方向,技术成长快
- 与顶尖团队合作,有充足算力和数据支持,可快速验证想法
- 鼓励学术产出和开源,对个人学术声誉有显著提升
- 研究难度大,需要解决长程任务中的训练稳定性、奖励设计等复杂问题
- 跨学科合作要求高,需要快速理解生物、化学等领域知识
- 工作强度可能较大,适应快速迭代的研究节奏和抗压要求
- 适合对AI科研和创新有强烈热情,具备扎实算法功底和独立研究能力,渴望在自动化科研领域做出突破的博士毕业生
缺点 / 挑战
暂无明显挑战项
角色解读
- 在阿里星项目中积累自动化科研的最前沿经验,快速成长为领域专家
- 学术与工业界双轨发展,可产出高水平论文并推动技术开源,提升学术影响力
- 未来可晋升为算法团队的技术带头人,或转向核心业务算法研发负责人
- 研究自动化科研智能体的核心训练算法,提升模型在真实科研场景中的自主决策、工具调用和实验验证能力
- 构建大规模Agent轨迹数据合成与处理管线,为后训练提供高质量数据支撑
- 探索并改进PPO、DPO、GRPO等强化学习算法,解决长程任务中的训练稳定性与探索效率问题
- 建立训练与评测闭环,覆盖代码生成、实验执行、结果分析到论文写作的完整科研流程
- 扎实的编程能力,熟练使用Python和PyTorch等深度学习框架
- 深入理解大语言模型、强化学习、Agent系统等至少一个前沿方向
- 具备独立科研能力,包括问题定义、实验设计、论文复现与结果分析
- 优秀的自驱力、跨学科沟通协作能力,以及对AI for Science的浓厚兴趣
申请策略
- 关注阿里巴巴Auto Research团队的技术博客或开源项目,了解其研究方向
- 在简历和面试中强调自驱力和创新意识,展示对科研问题的独到见解
- 突出在强化学习、大语言模型或Agent方向的顶尖会议论文或专利成果
- 展示亲手实现的算法项目,尤其是涉及PPO/DPO/GRPO等具体方法
- 强调编程能力和代码质量,可附上GitHub链接或开源项目
- 体现跨学科科研经验或对AI for Science的深入理解
- 提前熟悉RLHF、Agent轨迹数据合成、长程任务稳定训练等前沿技术
- 补充实验设计、结果分析和论文复现能力,可使用开源代码进行复现练习
面试指南
- 采用STAR法则(情境-任务-行动-结果)结构化回答,突出个人贡献和技术深度
- 从问题定义出发,先拆解核心难点,再对比多种方法,最后用实验结果支撑结论
- 结合具体案例展示对强化学习和Agent系统的理解,并说明与岗位的匹配点
- 请详细描述你的一项强化学习研究,包括遇到的问题、解决思路和实验设计
- 如何设计Agent在长程任务中的奖励函数以避免稀疏奖励和局部最优?
- 如果需要自动化一个生物实验流程,你会如何分解任务并训练Agent?
- 请比较PPO、DPO、GRPO的优缺点,并说明在Agent训练中的应用场景
- 如何构建高质量Agent轨迹数据的合成与清洗流程?
职位点评
75
综合评分
阿里巴巴顶尖研究项目,前沿技术栈,学术影响力大,但工作强度高且WLB不明确。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
该职位最适合追求前沿技术研究、学术成就和高速成长,且能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展92
工作生活50
使命价值70
薪资福利
75中等
阿里巴巴平台大,阿里星项目薪资较高,但JD未明确具体薪资,属于吸引力较强的补偿性动机。
薪资信号未披露(AI估算:45K-65K/月)
成长发展
92较高
岗位深度聚焦前沿AI技术,研究资源丰富,学术产出与开源机会多,发展性动机极强。
技术前沿前沿/新兴技术
技术栈强化学习、PPO、DPO、GRPO、大语言模型、Agent、数据合成
业务类型ambiguous
工作生活
50较低
JD要求适应快速变化和高抗压,未提及WLB措施,生活化动机满足程度有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
工作内容推动科研自动化,对社会有潜在积极影响,但JD未强调使命感,属于中等偏上。
行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs