
智元机器人
训练框架算法工程师
训练框架算法工程师
发布于 2 天前普通员工/个人贡献者
上海市 / 北京市
高级经验
全职员工
仅现场办公
学历未注明
软件工程
Deepspeed
Gpu优化
Jax
Megatron
Pytorch
具身智能
分布式训练
强化学习
AI 估算 · 25k–45k
具身智能是前沿赛道,B轮公司融资充裕,上海北京一线城市,算法工程师薪资较高,中位数3.5万/月。
职位详情
关于这个职位
该职位负责训练框架的研发与效率优化,涵盖VLA、RL、模仿学习等核心算法,并与算法团队紧密合作构建自动化迭代体系
同时参与开源具身智能工具链建设,推动生态发展
适合对深度学习框架有深入理解、追求极致性能优化的技术人才
最低要求
具备扎实的 Python/C++ 编程能力,熟悉底层实现原理,具备优秀的性能调优能力
具有良好的工程意识、代码规范与系统化设计思维,能构建高可靠、高扩展性的训练组件
熟悉主流深度学习框架(PyTorch / JAX / Transformers / DeepSpeed / Megatron 等),理解其内部机制与关键抽象
熟练掌握 profiling、量化、蒸馏、混合并行、缓存优化等模型训练与推理加速技术,能够基于算法与系统特性共同优化性能
熟悉分布式训练架构,包括数据并行、模型并行、流水线并行等,能够根据算法需求设计合适的并行策略
工作职责
训练框架研发与效率优化
设计与迭代具身智能训练研发框架,构建统一的训练、评测与真机实验全流程
优化模型训练与推理性能,持续提升 GPU 集群利用效率与研发效率
深入理解 VLA、IL、RL、模仿学习、自监督学习等核心算法,并基于算法特性进行系统级优化
负责数据加载、分布式训练、在线真机强化学习等模块的性能瓶颈分析与优化
参与自动化模型迭代体系建设(训练监控、日志采集、模型评估、可视化分析等)
与算法团队紧密合作,将算法需求工具化、模块化、可扩展化,推动端到端模型研发流程高效演进
开源具身智能工具链建设
参与具身智能相关开源工具链的设计、研发与生态建设
基于自研训练框架,支持社区开源模型的训练、微调、算法复现与能力验证
构建高可复现的训练与评测体系,沉淀行业标准化工具与最佳实践
与外部开发者深度协作,共建具身智能方向的可持续开源生态
优先资格
对强化学习(RL)、模仿学习(IL)、行为克隆(BC)、自监督学习(SSL)或多模态模型(VLA)有理解或实战经验之一者优先
具备从零到一构建、优化、交付系统的经验者优先
对训练框架有深入理解,具备从零到一构建、优化、交付系统的经验者优先
AI 洞察
优缺点分析
优点
- 前沿技术领域:具身智能是AI下一波浪潮,技术成长空间巨大
- 核心岗位:直接参与训练框架设计与优化,对模型迭代效率有决定性影响
- 开源贡献:有机会主导开源工具链,积累社区影响力
- 技术难度高:需要同时掌握工程系统设计和算法理解,对综合能力要求高
- 领域处于早期:具身智能行业标准尚未成熟,需要较强的自主探索能力
缺点 / 挑战
- 薪资竞争力:B轮公司对核心技术岗位投入大,薪资水平较高
- 工作强度可能较大:作为核心基础设施团队,可能面临快速迭代和线上问题处理压力
- 适合对系统性能优化有极致追求、喜欢挑战复杂工程难题、同时愿意深入理解算法原理的技术型人才
角色解读
- 技术深度:从训练框架工程师成长为系统架构师,主导大规模分布式训练系统设计
- 算法融合:与算法团队紧密协作,深入具身智能算法核心,转型为算法+工程复合型专家
- 开源影响力:通过建设开源工具链,积累行业声誉,成为具身智能领域的技术KOL
- 设计和优化训练框架,提升GPU集群利用率和模型迭代效率
- 分析VLA、RL等算法特性,进行系统级性能调优
- 构建自动化训练、评测与真机实验流程
- 参与开源工具链开发,支持社区模型训练与复现
- 扎实的Python/C++编程和性能调优能力
- 深入理解PyTorch、DeepSpeed等框架内部机制
- 熟悉分布式训练策略(数据并行、模型并行等)
- 掌握模型加速技术(量化、蒸馏、混合并行等)
申请策略
- 在面试中主动展示对具身智能领域的理解,如VLA模型、真机部署等
- 关注智元机器人的开源动态,在申请中提及相关项目贡献意向
- 突出训练框架或分布式系统的构建经验,尤其是从零到一的项目
- 展示性能优化案例(如GPU利用率提升、训练时间缩短的具体数据)
- 强调对主流框架(PyTorch、DeepSpeed)的源码理解或贡献
- 如有开源项目经历,请附上链接并说明个人贡献
- 熟悉至少一种分布式训练框架(如Megatron-LM、DeepSpeed)的架构细节
- 补充强化学习或模仿学习的基础知识,了解常用算法(PPO、BC等)
面试指南
- STAR法则:描述场景、任务、行动和结果,量化效果
- 系统思维:从整体架构出发,分析问题根因,提出多层次优化方案
- 对比分析:比较不同方案的优缺点,展示决策逻辑
- 请描述你如何设计和优化一个大规模分布式训练系统,遇到的主要瓶颈是什么?
- 你对模型并行和数据并行有什么理解?在什么场景下选择哪种策略?
- 举例说明你如何通过profiling发现并解决训练性能瓶颈
- 你对具身智能中的VLA模型了解多少?训练这类模型时有哪些特殊挑战?
- 你参与过哪些开源项目?如何保证代码质量和可复现性?
职位点评
68
综合评分
前沿具身智能训练框架岗位,技术成长空间巨大,但工作模式传统,WLB不确定。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合以技术成长为首要目标、能接受高强度工作、追求前沿领域影响力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活35
使命价值70
薪资福利
70中等
B轮融资公司对核心技术岗位薪资有竞争力,但JD未明确薪资范围,存在不确定性。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
90较高
岗位涉及具身智能前沿技术栈,有深度工程挑战和开源机会,成长性极高。
技术前沿前沿/新兴技术
技术栈Python、C++、PyTorch、JAX、Transformers、DeepSpeed、Megatron、强化学习、分布式训练、GPU优化
业务类型profit_center
工作生活
35较低
要求现场办公,北京上海通勤压力大,JD未提及弹性工作或WLB,预期工作强度较高。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
具身智能是AI变革方向,对社会有积极影响,但JD未强调社会使命,偏向技术驱动。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs