
普通员工/个人贡献者
AI 估算 · 40k–70k
该职位负责开发和维护内部强化学习后训练框架,支持文本及多模态RL训练,解决大规模训练中的工程痛点,如训推不一致和长尾延迟
扎实的工程算法基础,熟练掌握 PyTorch 及性能调试工具
负责维护和开发内部强化学习后训练(Post-training)框架,支持 Reasoning、Agentic 等方向的文本及多模态 RL 训练
加分项:为 Slime、VeRL、OpenRLHF 等开源框架提交过重要 PR
优点
缺点 / 挑战
前沿技术、高薪稳定,但工作强度可能较大,WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
该职位薪资水平较高,且中国电信作为大型国企,福利待遇稳定,能较好满足补偿性动机。
职位涉及大模型强化学习前沿技术,技术挑战大,成长空间广阔,能很好满足发展性动机。
工作地点明确为上海徐汇区,但职位未提及弹性工作或远程办公,且高强度研发工作可能影响工作生活平衡。
大模型强化学习是当前热门领域,具有较高的行业前景和社会价值,但职位本身未明确提及使命导向。