
普通员工/个人贡献者
综合评分 73
前沿RL数据算法岗,技术成长快,薪资竞争力强,但工作生活平衡待确认。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
薪资怎么样
45K
比人工智能中位数高
发布情况
新岗位 · 今天发布
公司情况
这家公司招聘很活跃
约 1630 个在招 · 其中人工智能 91 个
市场机会
选择面较广
杭州 · 人工智能 · 97 个在招
该职位负责构建 RL 数据生产体系,通过分析评测结果确定数据覆盖范围,设计 Agent 运行环境与 Verifier/Rubric,搭建端到端数据 Pipeline,并协同算法与标注团队形成训练闭环
具备 RL/Post-Training 研究或机器学习Applied Scientist 相关经历,理解 Reward Modeling 基本原理及 Reward 信号设计对 RL 训练(PPO/GRPO/DAPO 等)的影响
通过分析主流Benchmark及模型评测结果等方式,结合训练需求确定 RL 数据的能力覆盖范围与优先级
有大规模机器学习任务调优经验者优先,有某个领域任务深度经验者优先(数学物理,ACM,kernel研发,高并发/HFT,软件工程,research,science等)
优点
缺点 / 挑战
阿里巴巴作为上市大厂,薪资福利具有竞争力,但JD未披露具体薪资,补偿性动机有一定满足但存在不确定性。
岗位处于AI前沿RL数据方向,技术难度高,成长空间大,能积累稀缺的复合技能。
工作地点为北京/杭州,需现场办公,JD未提及工作生活平衡相关信息,大厂节奏可能较快。
岗位致力于构建训练数据体系推动AGI发展,具有较高的使命感和行业社会价值。
阿里巴巴 的其他在招职位