
智元机器人
具身大模型训练框架工程师-觅蜂子公司
具身大模型训练框架工程师-觅蜂子公司
发布于 大约 8 小时前普通员工/个人贡献者
上海市
其它
全职员工
仅现场办公
本科
研究与开发 (研发)
Cuda
Deepspeed
Megatron
Pytorch
Vla
具身智能
分布式系统
大模型训练
强化学习
AI 估算 · 30k–60k
上海大模型训练框架工程师岗位,结合公司知名度和技术前沿性,薪资具有竞争力。
职位详情
关于这个职位
该职位负责建设具身智能统一训练框架,涵盖大规模分布式训练、后训练与强化学习系统,以及训练效率优化
你将与算法团队协作,复现并落地VLA、世界模型等前沿算法,涉及万卡GPU集群和300B+参数规模的模型训练
适合对大规模训练系统、分布式计算和具身智能有浓厚兴趣的工程师
最低要求
计算机基础扎实,学习能力强,愿意深入复杂系统和底层细节
代码能力强,代码品味好,能熟练使用 AI Coding / Code Agent 提升研发效率
具备良好的系统设计能力,能在功能、效率、稳定性之间做合理取舍
熟悉 Python / C++ / Rust 之一,了解 PyTorch、Megatron、DeepSpeed、VeRL、RLinf 等训练框架中的一种或多种
在大模型训练 / 推理、分布式系统、强化学习系统或具身智能任一方向有经验或强烈兴趣
计算机、AI、机器人等相关专业本科及以上,硕士 / 博士优先
工作职责
可以选择以下一个或多个方向深入参与:
建设具身智能统一训练框架,支撑 VLA、世界模型、分层决策模型等具身基础模型的预训练与后训练,覆盖从十亿级到百亿/千亿级参数规模,并面向 300B+ 模型持续演进
建设大规模分布式训练系统,包括数据并行、张量并行、流水线并行、混合并行、MoE、长上下文、低精度训练与推理等,支撑万卡 GPU 集群上的稳定训练
建设规模化后训练与强化学习系统,涵盖模仿学习、在线/离线 RL、真机 RL,以及云端训练 + 边缘异步 rollout 的云边协同架构
建设训练效率优化体系,围绕数据、计算、异步、通信全链路进行度量与优化,包括 IO、算子融合、CUDA Graph、计算通信 overlap、梯度同步、性能 profiling 等
与算法团队协作,快速复现并工程化落地 VLA、世界模型、flow matching、RL 等前沿算法
优先资格
有大规模 GPU 集群训练经验,理解吞吐、调度、容错、稳定性等系统级问题
熟悉 Megatron、DeepSpeed、VeRL、RLinf 等训练框架,有从零构建或深度重构训练框架经验
熟悉 CUDA / Triton 算子开发、RDMA 编程、CPU / IO 优化,或熟练使用 Nsight Systems、PyTorch Profiler 等性能分析工具
有分布式真机 RL、云边协同、异步训练系统经验,或熟悉 sim2real 与 RoboSuite、ManiSkill、Isaac 等仿真器
在大型开源软件中有深度贡献,或有优秀个人开源项目
在高性能计算赛事、算法竞赛中取得优异成绩,或在校成绩排名前 10%
复现过 LLM、RL、多模态、VLA、世界模型相关论文或项目
AI 洞察
优缺点分析
优点
- 接触前沿技术:直接参与具身智能、大模型训练等热门方向,技术积累价值高
- 公司平台好:智元机器人是明星创业公司,资源投入大,团队成长快
- 协作氛围好:与优秀算法团队合作,紧跟学术前沿,快速工程落地
- 技术门槛高:要求对分布式系统、GPU编程等有深入理解,上手难度大
- 不确定性:具身智能行业仍在快速发展,技术路线可能频繁调整,需要持续学习
缺点 / 挑战
- 挑战性强:面对300B+模型和万卡集群,能锻炼解决复杂系统问题的能力
- 工作强度可能较高:涉及大规模系统优化和紧急问题排查,需要投入大量精力
- 适合对大规模分布式系统和底层性能优化有热情,喜欢挑战复杂技术问题,并希望将算法落地到真实机器人场景的工程师
角色解读
- 技术纵深:从训练框架开发逐步深入底层系统优化,成为分布式训练专家
- 技术广度:扩展到具身智能、强化学习系统、仿真平台等领域,形成跨领域能力
- 管理方向:带领团队负责整个训练平台或基础设施,向技术负责人或架构师发展
- 设计和实现具身智能统一训练框架,支持VLA、世界模型等大规模模型的高效训练
- 开发分布式训练系统,优化数据并行、张量并行等策略,确保万卡GPU集群稳定运行
- 建设后训练与强化学习系统,包括模仿学习、在线/离线RL及云边协同架构
- 与算法团队紧密合作,复现并落地前沿算法,推动模型性能持续提升
- 扎实的计算机基础,熟悉分布式系统原理和性能优化方法
- 精通Python/C++/Rust之一,熟练使用PyTorch、Megatron等训练框架
- 具备系统设计能力,能在功能、效率、稳定性之间权衡
- 对大模型训练、分布式系统或强化学习系统有深入理解或强烈兴趣
申请策略
- 提前了解智元机器人的产品方向和技术路线,在面试中展示你对具身智能领域的理解
- 准备一个你解决过的复杂系统问题案例,体现问题分析、方案设计和落地能力
- 突出分布式训练相关项目,如参与过大规模模型训练或框架开发,说明你的具体贡献和性能提升
- 展示代码能力:GitHub链接、开源贡献或比赛成绩,强调代码质量和系统设计能力
- 列举强化学习或具身智能相关经验,即使只是学术项目,体现对该方向的兴趣
- 强调对底层优化的理解,如CUDA算子、通信优化、性能Profiling等
- 深入学习Megatron-LM、DeepSpeed等框架源码,理解其架构和关键设计
- 动手实践分布式训练,搭建小规模集群实验,熟悉数据并行、流水线并行等配置
面试指南
- 用STAR原则描述问题:情境-任务-行动-结果,突出技术细节和量化成果
- 对比不同方案的优缺点,展示系统设计思维,强调权衡取舍
- 结合具体项目或开源框架,体现动手能力和深入理解
- 请描述你在大规模分布式训练中遇到的一个性能瓶颈,以及你是如何定位和解决的?
- 解释数据并行、张量并行和流水线并行的区别,并在什么场景下选择使用?
- 你如何优化PyTorch训练过程中的GPU显存使用?请举例说明
- 你对强化学习系统中的训练和推理异步架构有什么理解?
- 复习分布式训练核心概念,熟悉Megatron和DeepSpeed的关键特性
职位点评
73
综合评分
前沿技术栈,极强发展性,但工作强度可能较高,薪资未明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和前沿领域,不介意高强度工作,且对生活平衡要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展95
工作生活40
使命价值85
薪资福利
70中等
薪资面议但属于热门赛道,预计有竞争力,福利方面JD未明确提及,但创业公司通常提供期权等,但信息不足。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
95较高
该职位涉及最前沿的具身智能和大模型训练技术,提供深度参与尖端系统建设的机会,成长空间极大。
技术前沿前沿/新兴技术
技术栈具身智能、大模型训练、VLA、世界模型、分布式系统、CUDA、Megatron、DeepSpeed、强化学习
业务类型profit_center
工作生活
40较低
工作地点上海,要求现场办公,未提及弹性工作或WLB,创业公司可能强度较大。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
85较高
具身智能属于高速增长赛道,推动机器人智能化具有积极社会影响,技术开拓性强。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs