CXMT logo
长鑫存储
强化学习算法专家-Reinforcement Learning Algorithm Expert(J16073)

强化学习算法专家-Reinforcement Learning Algorithm Expert(J16073)

发布于 大约 7 小时前

普通员工/个人贡献者

合肥市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Dqn
Ppo
Pytorch
Sac
Tensorflow
半导体
强化学习
深度学习

AI 估算 · 30k–50k

强化学习算法专家岗位技术要求高,半导体行业投入大,合肥薪资竞争力强,月薪3-5万。

职位详情

关于这个职位

该职位负责设计、开发和优化强化学习算法,应用于半导体设计、生产、封装、测试等业务场景,解决实际决策与控制问题

需要熟练掌握Python/C++及主流强化学习算法和深度学习框架,并具备优秀的工程化能力
适合有3年以上强化学习经验、对工业场景落地感兴趣的算法工程师

最低要求

教育背景与专业知识:硕士以上学历,计算机科学、电子信息科学、应用数学、统计学等相关背景

行业与专业经验:至少3年以上强化学习算法相关工作经验
专业技能与资格:熟悉Python、C++等编程语言,具备良好的代码能力
熟悉主流强化学习算法(如DQN、PPO、A3C、SAC等),精通强化学习经典算法
熟悉深度学习框架(如TensorFlow、PyTorch)和强化学习工具(如OpenAI Gym、Stable-Baselines等)
具有一定的工程化基础,能对业务场景进行抽象、建模、算法开发,有代码封装的能力
具有扎实的数学和英文功底,熟悉概率论、优化理论等
其他要求:具备良好的团队协作精神,目标导向,行动力强,勇于接受挑战并有较强的抗压能力
具有出色的文献研究能力和沟通能力,乐于分享自己的研究和实践成果
工作地点优先合肥,特别优秀的可在上海、北京,但需要经常到合肥出差

工作职责

强化学习算法研发与优化:负责设计、开发和优化强化学习算法,优化现有算法,解决复杂的决策和控制问题,在模拟环境或实际场景中测试和验证算法性能

业务场景算法构建:根据实际业务需求,构建用于半导体设计、生产、封装、测试等业务场景的算法,解决半导体领域的实际问题
算法实现与质量保障:使用Python或C++等编程语言进行算法实现,确保代码的正确性、可读性和可维护性,进行充分的单元测试和集成测试,保证算法的稳定运行

优先资格

项目/任务成果:有多智能体强化学习、逆强化学习、元强化学习等前沿领域的研究经验者优先

有分布式训练、高性能计算经验者优先
有半导体行业相关经历,熟悉芯片设计、生产、封装、测试等相关业务者优先
有独立负责大型软件项目架构设计并实际参与编码研发相关的项目经历者优先
有顶级会议(如NeurIPS、ICML、ICLR)论文发表或拥有相关专利者优先
在强化学习相关的技术领域有独立开发的开源项目者优先

AI 洞察

优缺点分析

优点

  • 强化学习在工业界的落地应用是前沿方向,技术壁垒高,个人技能增值快
  • 半导体行业是国家重点发展产业,长鑫存储作为存储芯片领军企业,平台稳定且有资源
  • 涉及多智能体、逆强化学习等前沿领域研究,有机会接触顶尖学术资源
  • 合肥生活成本相对一线城市低,薪资竞争力强,可积累可观的储蓄
  • 半导体制造场景复杂,算法落地需要深入了解业务流程,跨学科学习成本高
  • 工作地点主要在合肥,可能需要经常出差(上海、北京),对生活稳定性有一定影响

缺点 / 挑战

  • 需要较强的抗压能力,可能面临项目进度紧张和研发迭代压力
  • 适合对强化学习技术有热情、具备扎实算法基础、乐于挑战工业场景难题,并愿意在合肥长期发展的资深算法工程师

角色解读

  • 在半导体+AI赛道深耕,成为工业强化学习领域的专家
  • 向算法技术负责人或架构师方向发展,负责更大规模业务场景的算法落地
  • 可对内对外输出技术影响力,发表顶级会议论文或申请专利,提升行业认可度
  • 设计、开发和优化强化学习算法,用于解决半导体制造中的复杂决策和控制问题
  • 根据业务需求,构建适用于芯片设计、生产、封装、测试等环节的算法模型,并验证其性能
  • 使用Python或C++进行算法实现,编写高质量代码,并完成单元测试和集成测试
  • 扎实的强化学习理论基础,熟悉DQN、PPO、A3C、SAC等主流算法
  • 熟练掌握Python和C++编程,具备良好的代码工程化能力
  • 熟悉深度学习框架(TensorFlow、PyTorch)和强化学习工具(OpenAI Gym、Stable-Baselines等)
  • 具备较强的数学功底和英文文献阅读能力,能快速跟进前沿研究

申请策略

  • 了解长鑫存储的业务和产品(DRAM),在面试中展示对存储芯片行业的认知
  • 强调对前沿强化学习方向的跟踪,如多智能体、逆强化学习、元强化学习,体现学习热情
  • 突出强化学习项目的完整落地经验,尤其是从算法设计到工程实现的闭环
  • 强调编程能力和工程化能力,展示Python/C++的代码质量,可附上GitHub或开源项目链接
  • 如果有顶级会议论文(NeurIPS、ICML、ICLR)或相关专利,务必显著列出
  • 体现对半导体行业或相关工业场景的理解,哪怕只是项目中的边缘接触
  • 补充半导体制造流程的基础知识,如光刻、刻蚀、封装测试等,能体现业务理解能力
  • 巩固数学基础,尤其是概率论、优化理论,有助于应对算法设计中的理论问题

面试指南

  • 采用STAR法则(情境-任务-行动-结果)描述项目,突出量化结果
  • 对比算法时,从理论基础、样本效率、稳定性、实现复杂度等维度分析
  • 对于应用场景问题,先梳理业务约束,再提出合适的强化学习框架,并说明可行性验证步骤
  • 请介绍一个你独立负责的强化学习项目,如何设计状态空间、动作空间和奖励函数?
  • DQN、PPO、SAC等算法的优缺点和适用场景是什么?
  • 如何将强化学习应用到半导体生产的设备调度或工艺参数优化中?会遇到哪些挑战?
  • 你如何在算法训练中处理样本效率低和收敛不稳定的问题?
  • 请解释一下PPO的clip机制和重要性采样原理

职位点评

69
综合评分

半导体行业前沿强化学习岗位,技术含量高,薪资未披露但预计优厚,需现场办公且压力较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求前沿技术挑战和长期技术创新积累的资深算法工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展88
工作生活35
使命价值80

薪资福利

70中等

薪资未在JD中披露,但职位级别高,半导体行业普遍薪资优厚,可能提供不错的薪酬和福利,但缺乏明确信息。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

88较高

强化学习技术本身属于前沿领域,JD中涉及大量主流和先进算法框架,技术成长空间大,但未提及明确的晋升通道或培训计划。

技术前沿前沿/新兴技术
技术栈强化学习、DQN、PPO、A3C、SAC、Python、C++、TensorFlow、PyTorch、OpenAI Gym、Stable-Baselines
业务类型ambiguous

工作生活

35较低

仅现场办公,JD明确提到需要较强的抗压能力,且可能需要频繁出差上海、北京,工作生活平衡性较差。

工作模式仅现场办公
办公地点未明确
加班情况JD含高强度暗示词

使命价值

80较高

半导体行业属于国家重点发展的战略领域,存储芯片自主可控具有较高的社会价值,但JD未直接传达使命感。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs