
普通员工/个人贡献者
AI 估算 · 35k–60k
该职位隶属于阿里巴巴数据基础及产品部,核心职责是构建RL(强化学习)训练所需的数据生产管线
了解 RL 基本原理:理解 Reward Modeling 的基本原理及 Reward 信号设计对 RL 训练(PPO/GRPO 等)的影响,能从训练视角判断什么样的 Instance 是有效数据,并据此设计能力覆盖与难度分布
从 0 到 1 生产合成 RL Instance:围绕种子任务构建完整 Instance(任务描述、运行环境、输入资产、评测钩子),通过参数化模板实现批量合成与自动校验,保证 Instance 的正确性、完整性与可复现性,作为 rollout 数据生产的起点
加分项:有办公、数据分析、金融、法律、医疗等 Cowork 场景任务的深度经验者优先
优点
缺点 / 挑战
阿里核心数据团队,前沿RL技术栈,薪资优厚,成长空间巨大,但工作强度可能较大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
阿里巴巴作为行业巨头,提供具有竞争力的薪酬和福利,该岗位属于核心数据团队,薪资水平在市场上处于领先地位。
该职位处于大模型与强化学习的最前沿,技术挑战大,能接触到最先进的技术和业务场景,个人成长空间巨大。
工作地点在杭州,需要现场办公。作为大厂核心岗位,工作强度可能较大,但具体工作节奏未在JD中明确。
该职位直接参与推动大模型技术发展,对AI行业有重要影响,能带来较强的技术成就感和使命感。