
小米
足式机器人运动控制算法工程师实习生(强化学习)
足式机器人运动控制算法工程师实习生(强化学习)
发布于 大约 13 小时前实习/见习
北京市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Ddpg
Dqn
Isaacgym
Ppo
Pytorch
Ros
Sac
Sim-To-Real
域随机化
AI 估算 · 4k–8k
实习岗位,北京小米大厂,强化学习方向热门前沿,硕士可拿较高实习薪资,但总量有限。
职位详情
关于这个职位
该实习岗位专注于足式机器人运动控制,利用强化学习和模仿学习开发机器人行走控制算法
你将参与算法训练、sim-to-real迁移部署,并跟踪前沿技术
适合对机器人学习和控制有浓厚兴趣、具备一定编程和机器学习基础的研究生
最低要求
硕士及以上学历,机器人、计算机、机械工程、人工智能、应用数学等专业,数学、英语能力扎实,具有较强的学习与研究能力
掌握主流的强化学习算法,如:PPO、DQN、DDPG、SAC等
掌握机器人学习中的广泛使用的训练方法和模型架构,如:教师学生模型(Teacher-Student Network),课程学习(Curriculum Learning),域随机化(Domain Randomization),混合专家模型(MoE)等
熟悉Mujoco、IsaacGym、IsaacLab等机器人仿真平台
扎实的C++、Python编程能力,熟悉Pytorch等机器学习框架,熟悉Linux,Git,ROS等开发环境和工具
工作职责
开发基于强化/模仿学习的机器人行走及全身控制策略
开发复杂地形下基于视觉的强化学习行走策略
负责算法策略的训练与移植部署,实现算法sim-to-real在机器人实机上落地应用
持续跟踪国内外前沿研究成果,并进行相关算法复现
编写相关技术文档,推动团队技术沉淀与知识共享
优先资格
有足式机器人强化学习算法的实机调试和sim-to-real经验者优先,有基于模型/优化等传统控制经验者优先
AI 洞察
优缺点分析
优点
- 小米作为大厂,平台资源丰富,可接触前沿的足式机器人项目,技术含金量高
- 有机会参与从算法仿真到实机部署的完整流程,快速提升工程实践能力
- 技术难度高,需要扎实的数学、算法和编程基础,学习曲线陡峭
- sim-to-real调试验证周期长,需要耐心和系统性解决问题的能力
缺点 / 挑战
- 强化学习在机器人领域应用前景广阔,积累的经验具有较高稀缺性和市场竞争力
- 实习节奏可能较快,需要同时兼顾研究探索和工程落地,压力较大
- 适合对机器人控制和强化学习有强烈兴趣,具备较强自我驱动力和科研能力的研究生,不介意工作压力和现场办公环境
角色解读
- 从实习算法工程师起步,积累足式机器人控制项目经验,深入强化学习领域
- 可向足式机器人算法工程师、机器人研究工程师方向发展,参与更核心的算法研发
- 未来可成长为技术专家或团队负责人,或转向机器人产品化、仿真平台等方向
- 开发基于强化/模仿学习的机器人行走及全身控制策略,涉及算法设计、训练与调优
- 开发复杂地形下的视觉强化学习行走策略,结合感知信息提升机器人适应能力
- 负责算法策略的训练与移植部署,实现sim-to-real在机器人实机上的落地应用
- 持续跟踪国内外前沿研究成果,复现相关算法并编写技术文档,推动团队知识沉淀
- 掌握主流强化学习算法(PPO、DQN、DDPG、SAC等),理解其原理和实现细节
- 熟悉机器人学习中的训练方法和模型架构,如教师学生模型、课程学习、域随机化、混合专家模型等
- 熟练使用MuJoCo、IsaacGym、IsaacLab等仿真平台进行算法验证和策略训练
- 具备扎实的C++和Python编程能力,熟悉PyTorch、Linux、Git、ROS等开发工具
申请策略
- 建议在简历中明确表达对足式机器人的热情,可附上相关课外项目或研究论文
- 关注小米机器人团队的技术博客或公开论文,了解团队研究方向,在面试中体现契合度
- 突出与强化学习或机器人控制相关的项目经历,如机器人运动控制、游戏AI、仿真环境中的策略学习等
- 强调在项目中使用过的仿真平台和算法,如MuJoCo、IsaacGym、PPO、SAC等,并说明具体贡献和效果
- 展示扎实的编程能力,包括C++/Python代码质量、开源项目或GitHub链接,以及PyTorch使用经验
- 提前动手练习在IsaacGym或MuJoCo上跑简单的强化学习控制任务,熟悉环境和接口
- 深入复习PPO等算法的数学原理,能够推导公式并解释实现中的关键细节
- 了解ROS基本概念和常用命令,能编写简单的ROS节点
面试指南
- 从算法原理出发,结合公式和直觉,先讲清楚核心思想再展开细节
- 回答设计类问题时,采用结构化框架:任务分析、方案设计、实施步骤、潜在问题及解决方案
- 澄清问题、分点作答,突出关键决策点和权衡,并尽量联系自己的项目经验
- 请详细解释PPO算法的核心思想,包括裁剪目标、重要性采样和更新流程
- 如何设计一个足式机器人行走任务的强化学习训练方案?包括状态空间、动作空间、奖励函数和训练策略
- 谈谈你对sim-to-real迁移的理解,有哪些常用方法?你是否有相关实践经验?
- 如何在仿真环境中设置域随机化?具体会随机化哪些因素?
- 你了解传统控制方法(如MPC、WBC)与强化学习在机器人控制中的优劣吗?如何结合?
职位点评
64
综合评分
小米足式机器人强化学习实习,技术前沿成长快,薪资一般,现场办公。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
适合追求技术前沿成长和热爱机器人领域的研究生,对薪资要求不高,能接受现场办公。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利45
成长发展80
工作生活55
使命价值60
薪资福利
45较低
实习薪资有限,且JD未提及明确福利,补偿性动机满足程度较低。
薪资信号未披露(AI估算:4K-8K/月)
成长发展
80较高
该职位专注前沿强化学习技术,参与核心算法研发,技能成长空间大,能紧跟机器人学习趋势。
技术前沿前沿/新兴技术
技术栈强化学习、PPO、DQN、DDPG、SAC、Teacher-Student Network、Curriculum Learning、Domain Randomization、MuJoCo、IsaacGym、PyTorch、C++、ROS
成长机会前沿研究、技术沉淀、知识共享
业务类型ambiguous
工作生活
55较低
北京现场办公,无弹性工作安排,实习强度可能较大,生活方式灵活度一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
机器人行业具有较好的社会价值和创新性,但实习岗位对使命感的体现有限,整体意义感中等。
行业发展新兴领域(暂难判断)
社会影响中性/一般
创新程度积极采用新技术
小米 的其他在招职位
相似职位推荐
Watch Jobs