iFLYTEK logo
科大讯飞
AI研究算法工程师-后训练强化学习方向(J13374)

AI研究算法工程师-后训练强化学习方向(J13374)

发布于 大约 4 小时前

普通员工/个人贡献者

合肥市
无经验要求
全职员工
仅现场办公
硕士
研究与开发 (研发)
Grpo
Ppo
Rlhf
代码生成
分布式训练
大语言模型
强化学习
智能体
机器学习

AI 估算 · 18k–25k

校招硕士AI算法岗,合肥上市大厂,薪资在18-25k/月,15薪,竞争力强。

职位详情

关于这个职位

该职位聚焦大语言模型的强化学习后训练方向,主要研究RLHF、PPO、GRPO等前沿算法,并参与构建高效训练环境和评测体系,适合对LLM强化学习有浓厚兴趣、具备扎实算法基础和编程能力的硕士及以上同学

最低要求

重点院校计算机科学、人工智能、自动化、电子信息、数学等专业毕业,硕士及以上学历

对大模型能力提升具有强烈兴趣,具备扎实的大模型强化学习算法和训练基础,熟悉PPO、GRPO、OPD等常见的大模型后训练和强化学习算法,拥有大语言模型强化学习相关实习或项目经历
具有扎实的编程和计算机基础,精通Python等语言,具备优秀的编程习惯和工程实现能力,熟悉Linux开发环境,熟练掌握Git及AICoding类常用研发工具
具备较强的实验设计和分析能力,能够通过对照实验、消融实验和Bad Case分析定位模型问题
具备良好的沟通协作能力、自驱力和责任意识,能够独立推进研究任务,愿意持续解决开放性、高不确定性的技术问题

工作职责

研究面向大语言模型的强化学习算法及后训练新范式,包括但不限于RLHF、RLVR、RLAIF、OPD等方法,探索通过强化学习训练实现后训练Scaling Law

面向复杂推理、代码生成、工具调用和智能体任务,从RL训练数据构建、多目标奖励模型优化、生成式奖励模型、过程监督奖励模型、RL算法调优等多方面提升模型的探索能力和任务完成能力
与基础设施团队协作,建设面向代码工程、复杂工具调用的强化学习高效训练环境和评测体系,形成任务生成、轨迹采样、奖励计算、策略训练和效果分析闭环,提升大规模强化学习的训练效率和稳定性
跟踪大模型后训练强化学习领域的前沿进展,复现、验证并改进相关算法,探索研究具有长期价值的后训练新范式

优先资格

在算法编程竞赛、数学竞赛或其他相关机器学习比赛中取得过优异成绩

在NeurIPS、ICML、ICLR、ACL、EMNLP、AAAI等机器学习或自然语言处理会议发表过高水平论文
有大规模分布式强化学习、异步Rollout、训推一体化或多机多卡训练经验

AI 洞察

优缺点分析

优点

  • 科大讯飞作为AI上市龙头企业,平台大,资源丰富,技术积累深厚
  • 聚焦大模型强化学习前沿方向,技术含量高,成长潜力大
  • 团队科研氛围浓厚,有发表高水平论文和参与顶级会议的机会
  • 合肥生活成本较低,薪资购买力强,适合长期发展
  • 相比一线城市,合肥的AI生态和职业机会相对有限
  • 开放性问题多,需要较强的独立研究和解决不确定性问题的能力
  • 适合对强化学习和LLM有极强兴趣、追求技术深度、愿意在合肥长期发展的硕博同学

缺点 / 挑战

  • 工作强度和压力较大,需要持续跟进快速迭代的前沿技术

角色解读

  • 成长为强化学习算法专家,主导大模型后训练方向的技术攻坚
  • 晋升为AI研究员或技术负责人,带领团队开展前沿研究
  • 向大模型训练架构、分布式系统方向拓展,成为全栈AI工程师
  • 研究大模型强化学习算法,如RLHF、PPO、GRPO等,探索后训练Scaling Law
  • 构建RL训练数据、优化多目标奖励模型,提升模型在推理、代码生成等复杂任务上的能力
  • 与基础设施团队协作,搭建高效训练环境和评测体系,形成闭环训练流程
  • 跟踪前沿进展,复现和改进行业最新算法,推动后训练新范式
  • 扎实的强化学习理论基础,熟悉PPO、GRPO等主流算法
  • 精通Python编程,具备良好的工程实现能力和Linux开发经验
  • 优秀的实验设计与分析能力,能通过对照实验、消融实验定位问题
  • 较强的自驱力和协作能力,能独立推进研究并解决开放性问题

申请策略

  • 关注科大讯飞AI研究院的公开研究动态,在面试中展示对前沿工作的理解
  • 准备1-2个完整的项目案例,详细说明实验设计、问题分析和改进效果
  • 突出强化学习相关项目经历,尤其是RLHF、PPO等大模型训练经验
  • 强调编程能力,列出Python、PyTorch等工具和实际工程成果
  • 如有论文或竞赛奖项,重点展示在对应顶会或比赛中的贡献
  • 系统复习PPO、GRPO等算法原理,并尝试动手复现简化版本
  • 学习分布式训练框架如Megatron、DeepSpeed,了解训推一体化

面试指南

  • 从算法原理出发,解释核心创新点和数学基础,再结合实际实现细节
  • 对于开放性问题,先拆解问题为几个关键子问题,然后分别给出分析思路和可能的解决方案
  • 结合自身项目经验,用STAR法则描述背景、任务、行动和结果
  • 请详细解释PPO算法的原理、关键步骤及实现中的注意事项
  • 在RLHF中,如何解决奖励模型过拟合和分布外泛化问题?
  • 如何设计消融实验来证明某个RL算法改进的有效性?
  • 你有过大规模分布式训练的经验吗?请描述一下遇到的技术挑战及解决方式
  • 你对当前大模型后训练强化学习的趋势有什么看法?你认为未来可能的发展方向是什么?

职位点评

77
综合评分

上市AI龙头核心研发岗,前沿强化学习方向,技术成长空间大,但WLB和薪资弹性一般。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合追求技术成长和行业前沿的求职者,愿意在合肥稳定发展并能接受一定工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活55
使命价值80

薪资福利

75中等

薪资水平与一线大厂有差距,但在合肥具有较强竞争力,福利未在JD中明确提及。

薪资信号未披露(AI估算:18K-25K/月)

成长发展

90较高

技术方向前沿,能接触大模型核心算法,成长空间极大,但未明确提及晋升通道。

技术前沿前沿/新兴技术
技术栈大语言模型、强化学习、RLHF、PPO、GRPO、分布式训练
业务类型ambiguous

工作生活

55较低

合肥工作生活节奏相对舒适,但岗位未提及弹性工作或远程,需现场办公,且可能面临较高强度。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

80较高

推动AI技术进步具有较高社会价值,大模型行业高速增长,使命感和创新性较强。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
Watch Jobs