
智元机器人
大模型算法工程师-强化学习
大模型算法工程师-强化学习
发布于 1 天前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Areal
Deepspeed
Grpo
Llm
Megatron-Lm
Ppo
Rlhf
Slime
Verl
AI 估算 · 40k–60k
大模型算法岗薪资较高,上海中大型B轮公司,月薪中位数约50k,15薪
职位详情
关于这个职位
该职位专注于大模型算法的强化学习方向,负责框架开发、工具链构建及前沿技术探索,与产品团队协作提供解决方案
适合对强化学习、分布式训练有深入理解的技术专家,工作内容涉及模型精调、知识蒸馏等核心技术
最低要求
计算机科学、数学、电子工程等相关专业硕士及以上学历,精通Python
有Megatron-LM、DeepSpeed等开源框架使用或二次开发经验,理解分布式训练、显存优化技术
熟悉 GRPO/PPO 等 RL 算法、veRL/Slime/AReaL等强化学习框架者优先
工程经验上具备大型项目架构设计能力,能独立解决性能调优、多节点调试等复杂问题
综合素养
强烈的技术热情,良好的沟通能力与团队协作精神
工作职责
框架开发与优化:负责强化学习、模型精调、知识蒸馏等核心模块的设计与开发
工具链构建:参与开发轻量化训练框架,支持LLM、VLM等模型的快速模型微调、部署
前沿技术探索:跟踪学术动态,将最新研究成果转化为框架功能,提升产品竞争力
协作与文档:与产品团队紧密配合,提供框架级解决方案
优先资格
在顶级会议发表过框架优化或算法相关论文
活跃于开源社区(如PyTorch、HuggingFace项目贡献者)
有LLM训练、RLHF全流程开发经验
AI 洞察
优缺点分析
优点
- 大模型是当前技术前沿,技能积累极具市场竞争力
- B轮公司既有发展潜力,又能接触核心算法开发
- 上海工作地点,科技氛围浓厚,薪资水平高
- 技术要求极高,需同时掌握分布式系统和强化学习算法
- 工作强度可能较大,需要跟踪学术动态并快速落地
- 竞争激烈,需在开源社区或顶级会议有贡献才能脱颖而出
缺点 / 挑战
- 适合对强化学习和分布式训练有深度热情、具备扎实工程能力且渴望前沿技术挑战的技术型人才
角色解读
- 技术深度:从框架使用者成长为框架开发者,深入理解分布式训练和RLHF全流程
- 专家路线:成为大模型训练和强化学习领域的专家,推动公司技术迭代
- 管理转型:积累项目经验后可转向技术管理或架构师岗位
- 负责强化学习、模型精调、知识蒸馏等核心模块的设计与开发,提升模型性能
- 参与开发轻量化训练框架,支持LLM、VLM等模型的快速微调和部署
- 跟踪学术前沿,将最新研究成果转化为框架功能,增强产品竞争力
- 精通Python,具备扎实的编程和算法基础
- 熟悉Megatron-LM、DeepSpeed等分布式训练框架及其优化
- 掌握GRPO/PPO等强化学习算法及相关框架(veRL等)
- 具备大型项目架构设计和性能调优能力,能独立解决复杂工程问题
申请策略
- 深入了解智元机器人公司的技术方向,在面试中展示对机器人+大模型结合的理解
- 准备一个完整的项目案例,从问题定义到框架选择、优化和部署的完整过程
- 突出Megatron-LM、DeepSpeed等框架的二次开发或使用经验
- 展示GRPO/PPO等强化学习算法的项目成果或论文
- 强调大型系统架构设计、性能调优和多节点调试案例
- 系统学习veRL、Slime等强化学习框架的源码和原理
- 动手实践LLM训练和RLHF全流程,积累端到端经验
- 关注HuggingFace、PyTorch社区,参与贡献以增加亮点
面试指南
- 技术原理:先清晰阐述基础概念,再结合实际经验说明优化点
- 项目实战:用STAR法则描述具体案例,重点突出遇到的挑战和解决方案
- 综合思考:展现对技术趋势的把握,如问题扩展或与其他技术的关联
- 请详细解释Megatron-LM中的张量并行和流水线并行原理,并举例说明如何优化显存
- 描述PPO算法的核心步骤及其在RLHF中的应用,如何调整超参数以稳定训练?
- 你如何设计一个轻量化训练框架支持LLM快速微调?请从架构和性能角度展开
- 谈谈你对GRPO和PPO的区别及应用场景的理解
- 遇到训练不收敛或OOM问题时,你的排查和解决思路是什么?
职位点评
68
综合评分
前沿技术、高成长性,但工作强度大,适合技术热衷者
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长和发展的求职者,愿意投入高强度工作以换取前沿技能积累。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活40
使命价值70
薪资福利
65中等
大模型算法岗薪资在大厂水平,B轮公司可能股权激励,但整体薪酬竞争力较高;福利未明确提及,补偿性动机中等偏上。
薪资信号未披露(AI估算:40K-60K/月)
成长发展
90较高
职位涉及前沿技术(大模型、强化学习),要求跟踪学术动态,成长空间极大,且公司处于快速发展期,发展性动机得分很高。
技术前沿前沿/新兴技术
技术栈Python、Megatron-LM、DeepSpeed、GRPO、PPO、veRL、Slime、AReaL、RLHF、分布式训练、知识蒸馏、强化学习
业务类型profit_center
工作生活
40较低
工作地点上海,仅现场办公,未提及弹性工作或加班情况,大模型研发强度通常较高,生活化动机满足有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
大模型用于机器人领域有较强社会影响力,公司处于机器人创新赛道,意义感动机中等偏上。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs