AgiBot logo
智元机器人
训练框架算法工程师

训练框架算法工程师

发布于 2 天前

普通员工/个人贡献者

上海市 / 北京市
高级经验
全职员工
仅现场办公
学历未注明
软件工程
Deepspeed
Gpu优化
Jax
Megatron
Pytorch
具身智能
分布式训练
强化学习

AI 估算 · 25k–45k

具身智能是前沿赛道,B轮公司融资充裕,上海北京一线城市,算法工程师薪资较高,中位数3.5万/月。

职位详情

关于这个职位

该职位负责训练框架的研发与效率优化,涵盖VLA、RL、模仿学习等核心算法,并与算法团队紧密合作构建自动化迭代体系

同时参与开源具身智能工具链建设,推动生态发展
适合对深度学习框架有深入理解、追求极致性能优化的技术人才

最低要求

具备扎实的 Python/C++ 编程能力,熟悉底层实现原理,具备优秀的性能调优能力

具有良好的工程意识、代码规范与系统化设计思维,能构建高可靠、高扩展性的训练组件
熟悉主流深度学习框架(PyTorch / JAX / Transformers / DeepSpeed / Megatron 等),理解其内部机制与关键抽象
熟练掌握 profiling、量化、蒸馏、混合并行、缓存优化等模型训练与推理加速技术,能够基于算法与系统特性共同优化性能
熟悉分布式训练架构,包括数据并行、模型并行、流水线并行等,能够根据算法需求设计合适的并行策略

工作职责

训练框架研发与效率优化

设计与迭代具身智能训练研发框架,构建统一的训练、评测与真机实验全流程
优化模型训练与推理性能,持续提升 GPU 集群利用效率与研发效率
深入理解 VLA、IL、RL、模仿学习、自监督学习等核心算法,并基于算法特性进行系统级优化
负责数据加载、分布式训练、在线真机强化学习等模块的性能瓶颈分析与优化
参与自动化模型迭代体系建设(训练监控、日志采集、模型评估、可视化分析等)
与算法团队紧密合作,将算法需求工具化、模块化、可扩展化,推动端到端模型研发流程高效演进
开源具身智能工具链建设
参与具身智能相关开源工具链的设计、研发与生态建设
基于自研训练框架,支持社区开源模型的训练、微调、算法复现与能力验证
构建高可复现的训练与评测体系,沉淀行业标准化工具与最佳实践
与外部开发者深度协作,共建具身智能方向的可持续开源生态

优先资格

对强化学习(RL)、模仿学习(IL)、行为克隆(BC)、自监督学习(SSL)或多模态模型(VLA)有理解或实战经验之一者优先

具备从零到一构建、优化、交付系统的经验者优先
对训练框架有深入理解,具备从零到一构建、优化、交付系统的经验者优先

AI 洞察

优缺点分析

优点

  • 前沿技术领域:具身智能是AI下一波浪潮,技术成长空间巨大
  • 核心岗位:直接参与训练框架设计与优化,对模型迭代效率有决定性影响
  • 开源贡献:有机会主导开源工具链,积累社区影响力
  • 技术难度高:需要同时掌握工程系统设计和算法理解,对综合能力要求高
  • 领域处于早期:具身智能行业标准尚未成熟,需要较强的自主探索能力

缺点 / 挑战

  • 薪资竞争力:B轮公司对核心技术岗位投入大,薪资水平较高
  • 工作强度可能较大:作为核心基础设施团队,可能面临快速迭代和线上问题处理压力
  • 适合对系统性能优化有极致追求、喜欢挑战复杂工程难题、同时愿意深入理解算法原理的技术型人才

角色解读

  • 技术深度:从训练框架工程师成长为系统架构师,主导大规模分布式训练系统设计
  • 算法融合:与算法团队紧密协作,深入具身智能算法核心,转型为算法+工程复合型专家
  • 开源影响力:通过建设开源工具链,积累行业声誉,成为具身智能领域的技术KOL
  • 设计和优化训练框架,提升GPU集群利用率和模型迭代效率
  • 分析VLA、RL等算法特性,进行系统级性能调优
  • 构建自动化训练、评测与真机实验流程
  • 参与开源工具链开发,支持社区模型训练与复现
  • 扎实的Python/C++编程和性能调优能力
  • 深入理解PyTorch、DeepSpeed等框架内部机制
  • 熟悉分布式训练策略(数据并行、模型并行等)
  • 掌握模型加速技术(量化、蒸馏、混合并行等)

申请策略

  • 在面试中主动展示对具身智能领域的理解,如VLA模型、真机部署等
  • 关注智元机器人的开源动态,在申请中提及相关项目贡献意向
  • 突出训练框架或分布式系统的构建经验,尤其是从零到一的项目
  • 展示性能优化案例(如GPU利用率提升、训练时间缩短的具体数据)
  • 强调对主流框架(PyTorch、DeepSpeed)的源码理解或贡献
  • 如有开源项目经历,请附上链接并说明个人贡献
  • 熟悉至少一种分布式训练框架(如Megatron-LM、DeepSpeed)的架构细节
  • 补充强化学习或模仿学习的基础知识,了解常用算法(PPO、BC等)

面试指南

  • STAR法则:描述场景、任务、行动和结果,量化效果
  • 系统思维:从整体架构出发,分析问题根因,提出多层次优化方案
  • 对比分析:比较不同方案的优缺点,展示决策逻辑
  • 请描述你如何设计和优化一个大规模分布式训练系统,遇到的主要瓶颈是什么?
  • 你对模型并行和数据并行有什么理解?在什么场景下选择哪种策略?
  • 举例说明你如何通过profiling发现并解决训练性能瓶颈
  • 你对具身智能中的VLA模型了解多少?训练这类模型时有哪些特殊挑战?
  • 你参与过哪些开源项目?如何保证代码质量和可复现性?

职位点评

68
综合评分

前沿具身智能训练框架岗位,技术成长空间巨大,但工作模式传统,WLB不确定。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合以技术成长为首要目标、能接受高强度工作、追求前沿领域影响力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活35
使命价值70

薪资福利

70中等

B轮融资公司对核心技术岗位薪资有竞争力,但JD未明确薪资范围,存在不确定性。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

90较高

岗位涉及具身智能前沿技术栈,有深度工程挑战和开源机会,成长性极高。

技术前沿前沿/新兴技术
技术栈Python、C++、PyTorch、JAX、Transformers、DeepSpeed、Megatron、强化学习、分布式训练、GPU优化
业务类型profit_center

工作生活

35较低

要求现场办公,北京上海通勤压力大,JD未提及弹性工作或WLB,预期工作强度较高。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

具身智能是AI变革方向,对社会有积极影响,但JD未强调社会使命,偏向技术驱动。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
Watch Jobs