AAC Technologies logo
瑞声科技
强化学习算法工程师(云台)

强化学习算法工程师(云台)

发布于 大约 2 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
硕士
软件工程
Ddpg
Pid控制
Ppo
Pytorch
Tensorflow
云台控制
嵌入式部署
强化学习

AI 估算 · 25k–45k

强化学习算法工程师属于高需求技术岗位,硕士1-3年经验,上海地区薪资水平较高,结合公司上市背景,月薪2.5-4.5万合理。

职位详情

关于这个职位

该职位是强化学习算法工程师,专注于云台(PTZ相机/无人机云台)控制算法的研发

你将负责从算法选型、仿真环境搭建到真机部署的全流程,利用PPO、DDPG等主流强化学习算法解决云台姿态控制与目标跟踪中的非线性问题
适合有强化学习背景且对机器人控制感兴趣的候选人

最低要求

硕士及以上学历,计算机科学、人工智能、自动控制、机器人工程、应用数学等相关专业

精通强化学习核心理论,熟悉Value-Based、Policy-Based、Model-Based框架,熟练掌握PPO、DDPG、DQN等算法原理与实现
熟练使用Python,精通PyTorch或TensorFlow等深度学习框架
具备强化学习仿真环境搭建经验,熟练使用Unity、Gazebo等仿真工具
熟悉云台机械结构、控制原理,了解运动学、动力学特性
了解嵌入式平台(如Jetson、ARM)算法部署流程,具备轻量化、实时性优化经验
良好的问题分析与解决能力,独立应对技术难题
较强的学习能力和创新意识
良好的沟通协作能力
工作认真负责,严谨细致,抗压能力强
良好的技术文档编写能力

工作职责

负责云台控制强化学习算法的全流程研发,包括算法选型、模型设计、奖励函数优化,构建适配云台运动的强化学习模型

搭建云台控制强化学习仿真环境,基于Unity、Gazebo等工具构建高保真仿真场景,用于算法训练与迭代
针对云台动态跟踪、定点防抖、自动对焦等场景,优化算法策略,解决收敛慢、泛化能力差等问题
跟踪强化学习与云台控制前沿技术,开展技术预研与创新,形成技术专利或文档
与硬件、软件、测试工程师协作,完成算法真机测试与迭代优化,输出测试报告与技术方案
参与技术标准制定,梳理研发流程,指导初级工程师
设计强化学习与传统控制(如PID)的融合方案,提升综合性能

优先资格

有1-3年及以上云台控制或强化学习算法研发经验者优先

熟悉RLlib、SampleFactory等分布式强化学习库者优先
有云台控制算法(如PID控制、运动控制)研发经验者优先
有相关项目落地经验者优先

AI 洞察

优缺点分析

优点

  • 强化学习在机器人控制领域应用前景广阔,积累的算法和工程经验有高迁移性
  • 瑞声科技作为行业龙头,平台资源丰富,有机会接触真机部署全流程
  • 团队协作与前沿技术跟踪要求能持续提升技术视野和创新能力
  • 强化学习训练收敛难、调参繁琐,需要较强的实验设计和问题分析能力
  • 云台控制涉及机械、硬件、软件多领域知识,要求跨学科学习能力
  • 真机测试周期长,需要耐心和细致排查问题
  • 适合对强化学习算法有扎实基础、热爱机器人控制领域、喜欢动手做仿真和真机实验的工程师

缺点 / 挑战

暂无明显挑战项

角色解读

  • 从算法工程师成长为云台控制算法专家,主导核心算法研发与创新
  • 向技术管理方向发展,带领团队完成复杂系统级项目
  • 横向拓展至机器人控制、自动驾驶等其他运动控制领域
  • 设计并实现基于强化学习的云台控制算法(如PPO、DDPG),通过奖励函数优化解决姿态控制与目标跟踪问题
  • 使用Unity或Gazebo搭建高保真仿真环境,模拟各种干扰场景以加速算法训练和验证
  • 与硬件、软件团队协作,完成算法在真机上的部署、测试和调优,确保实际性能
  • 跟踪前沿技术,开展预研并推动算法迭代,形成技术专利或标准文档
  • 精通强化学习理论及常见算法(PPO、DDPG、DQN等),具备连续动作空间控制经验
  • 熟练使用Python及PyTorch/TensorFlow,有仿真环境搭建经验(Unity/Gazebo)
  • 了解云台机械结构、运动学/动力学,以及传统控制方法(如PID)
  • 具备嵌入式部署经验(Jetson/ARM),能做算法轻量化和实时性优化

申请策略

  • 了解瑞声科技的云台产品线(如用于手机、无人机、安防的云台),在面试中展示对业务场景的理解
  • 准备一个完整的强化学习控制项目案例,包括问题定义、算法设计、仿真及结果分析
  • 突出强化学习项目经验:详细描述算法选型、奖励函数设计、仿真环境搭建及调优过程
  • 如果有云台或机器人控制项目,重点展示PID与强化学习结合或相关控制成果
  • 量化成果:如收敛速度提升、精度提升百分比、部署后功耗或延迟优化等
  • 展示编程能力:Python、PyTorch/TensorFlow,以及仿真工具(Unity/Gazebo)的使用
  • 如果缺乏云台控制经验,可以学习PID控制原理和云台运动学基础
  • 熟悉至少一种强化学习框架(如RLlib或SampleFactory),了解分布式训练

面试指南

  • 技术原理类:从核心公式和直觉讲起,结合实际项目中的调参经验
  • 问题解决类:采用STAR方法:背景、任务、行动、结果,突出逻辑和效果
  • 设计类:先分析需求,提出多个方案并比较,最后给出推荐和理由
  • 请详细解释PPO算法的原理,并说明它与DDPG在连续控制中的优劣
  • 设计一个奖励函数用于云台目标跟踪,你会考虑哪些因素?
  • 如何搭建一个仿真环境来模拟云台在振动干扰下的行为?
  • 你如何衡量强化学习模型在真实硬件上的性能?遇到过什么部署问题?
  • 请描述一次你解决强化学习训练不收敛或过拟合问题的经历

职位点评

67
综合评分

技术前沿、薪资有竞争力,但现场办公且WLB不明显。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合重视技术成长和前沿算法研究的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活40
使命价值60

薪资福利

70中等

薪资水平在上海地区具有竞争力,但JD未明确福利细节,补偿性动机满足程度中等偏上。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

85较高

职位涉及前沿强化学习技术与仿真部署,团队协作和指导初级工程师可锻炼领导力,成长路径清晰。

技术前沿前沿/新兴技术
技术栈强化学习、PPO、DDPG、Unity、Gazebo、PyTorch、嵌入式部署
成长机会指导初级算法工程师
业务类型ambiguous

工作生活

40较低

工作地点在上海,仅现场办公,JD未提及WLB相关福利,可能面临一定强度。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

云台控制技术在安防、无人机等领域有实际社会价值,但JD未强调使命感,行业属于稳定增长。

行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs