AgiBot logo
智元机器人
大模型算法工程师-强化学习

大模型算法工程师-强化学习

发布于 1 天前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Areal
Deepspeed
Grpo
Llm
Megatron-Lm
Ppo
Rlhf
Slime
Verl

AI 估算 · 40k–60k

大模型算法岗薪资较高,上海中大型B轮公司,月薪中位数约50k,15薪

职位详情

关于这个职位

该职位专注于大模型算法的强化学习方向,负责框架开发、工具链构建及前沿技术探索,与产品团队协作提供解决方案

适合对强化学习、分布式训练有深入理解的技术专家,工作内容涉及模型精调、知识蒸馏等核心技术

最低要求

计算机科学、数学、电子工程等相关专业硕士及以上学历,精通Python

有Megatron-LM、DeepSpeed等开源框架使用或二次开发经验,理解分布式训练、显存优化技术
熟悉 GRPO/PPO 等 RL 算法、veRL/Slime/AReaL等强化学习框架者优先
工程经验上具备大型项目架构设计能力,能独立解决性能调优、多节点调试等复杂问题
综合素养
强烈的技术热情,良好的沟通能力与团队协作精神

工作职责

框架开发与优化:负责强化学习、模型精调、知识蒸馏等核心模块的设计与开发

工具链构建:参与开发轻量化训练框架,支持LLM、VLM等模型的快速模型微调、部署
前沿技术探索:跟踪学术动态,将最新研究成果转化为框架功能,提升产品竞争力
协作与文档:与产品团队紧密配合,提供框架级解决方案

优先资格

在顶级会议发表过框架优化或算法相关论文

活跃于开源社区(如PyTorch、HuggingFace项目贡献者)
有LLM训练、RLHF全流程开发经验

AI 洞察

优缺点分析

优点

  • 大模型是当前技术前沿,技能积累极具市场竞争力
  • B轮公司既有发展潜力,又能接触核心算法开发
  • 上海工作地点,科技氛围浓厚,薪资水平高
  • 技术要求极高,需同时掌握分布式系统和强化学习算法
  • 工作强度可能较大,需要跟踪学术动态并快速落地
  • 竞争激烈,需在开源社区或顶级会议有贡献才能脱颖而出

缺点 / 挑战

  • 适合对强化学习和分布式训练有深度热情、具备扎实工程能力且渴望前沿技术挑战的技术型人才

角色解读

  • 技术深度:从框架使用者成长为框架开发者,深入理解分布式训练和RLHF全流程
  • 专家路线:成为大模型训练和强化学习领域的专家,推动公司技术迭代
  • 管理转型:积累项目经验后可转向技术管理或架构师岗位
  • 负责强化学习、模型精调、知识蒸馏等核心模块的设计与开发,提升模型性能
  • 参与开发轻量化训练框架,支持LLM、VLM等模型的快速微调和部署
  • 跟踪学术前沿,将最新研究成果转化为框架功能,增强产品竞争力
  • 精通Python,具备扎实的编程和算法基础
  • 熟悉Megatron-LM、DeepSpeed等分布式训练框架及其优化
  • 掌握GRPO/PPO等强化学习算法及相关框架(veRL等)
  • 具备大型项目架构设计和性能调优能力,能独立解决复杂工程问题

申请策略

  • 深入了解智元机器人公司的技术方向,在面试中展示对机器人+大模型结合的理解
  • 准备一个完整的项目案例,从问题定义到框架选择、优化和部署的完整过程
  • 突出Megatron-LM、DeepSpeed等框架的二次开发或使用经验
  • 展示GRPO/PPO等强化学习算法的项目成果或论文
  • 强调大型系统架构设计、性能调优和多节点调试案例
  • 系统学习veRL、Slime等强化学习框架的源码和原理
  • 动手实践LLM训练和RLHF全流程,积累端到端经验
  • 关注HuggingFace、PyTorch社区,参与贡献以增加亮点

面试指南

  • 技术原理:先清晰阐述基础概念,再结合实际经验说明优化点
  • 项目实战:用STAR法则描述具体案例,重点突出遇到的挑战和解决方案
  • 综合思考:展现对技术趋势的把握,如问题扩展或与其他技术的关联
  • 请详细解释Megatron-LM中的张量并行和流水线并行原理,并举例说明如何优化显存
  • 描述PPO算法的核心步骤及其在RLHF中的应用,如何调整超参数以稳定训练?
  • 你如何设计一个轻量化训练框架支持LLM快速微调?请从架构和性能角度展开
  • 谈谈你对GRPO和PPO的区别及应用场景的理解
  • 遇到训练不收敛或OOM问题时,你的排查和解决思路是什么?

职位点评

68
综合评分

前沿技术、高成长性,但工作强度大,适合技术热衷者

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和发展的求职者,愿意投入高强度工作以换取前沿技能积累。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活40
使命价值70

薪资福利

65中等

大模型算法岗薪资在大厂水平,B轮公司可能股权激励,但整体薪酬竞争力较高;福利未明确提及,补偿性动机中等偏上。

薪资信号未披露(AI估算:40K-60K/月)

成长发展

90较高

职位涉及前沿技术(大模型、强化学习),要求跟踪学术动态,成长空间极大,且公司处于快速发展期,发展性动机得分很高。

技术前沿前沿/新兴技术
技术栈Python、Megatron-LM、DeepSpeed、GRPO、PPO、veRL、Slime、AReaL、RLHF、分布式训练、知识蒸馏、强化学习
业务类型profit_center

工作生活

40较低

工作地点上海,仅现场办公,未提及弹性工作或加班情况,大模型研发强度通常较高,生活化动机满足有限。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

大模型用于机器人领域有较强社会影响力,公司处于机器人创新赛道,意义感动机中等偏上。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs