
科大讯飞
AI研究算法工程师-后训练强化学习方向(J13374)
AI研究算法工程师-后训练强化学习方向(J13374)
发布于 大约 4 小时前普通员工/个人贡献者
合肥市
无经验要求
全职员工
仅现场办公
硕士
研究与开发 (研发)
Grpo
Ppo
Rlhf
代码生成
分布式训练
大语言模型
强化学习
智能体
机器学习
AI 估算 · 18k–25k
校招硕士AI算法岗,合肥上市大厂,薪资在18-25k/月,15薪,竞争力强。
职位详情
关于这个职位
该职位聚焦大语言模型的强化学习后训练方向,主要研究RLHF、PPO、GRPO等前沿算法,并参与构建高效训练环境和评测体系,适合对LLM强化学习有浓厚兴趣、具备扎实算法基础和编程能力的硕士及以上同学
最低要求
重点院校计算机科学、人工智能、自动化、电子信息、数学等专业毕业,硕士及以上学历
对大模型能力提升具有强烈兴趣,具备扎实的大模型强化学习算法和训练基础,熟悉PPO、GRPO、OPD等常见的大模型后训练和强化学习算法,拥有大语言模型强化学习相关实习或项目经历
具有扎实的编程和计算机基础,精通Python等语言,具备优秀的编程习惯和工程实现能力,熟悉Linux开发环境,熟练掌握Git及AICoding类常用研发工具
具备较强的实验设计和分析能力,能够通过对照实验、消融实验和Bad Case分析定位模型问题
具备良好的沟通协作能力、自驱力和责任意识,能够独立推进研究任务,愿意持续解决开放性、高不确定性的技术问题
工作职责
研究面向大语言模型的强化学习算法及后训练新范式,包括但不限于RLHF、RLVR、RLAIF、OPD等方法,探索通过强化学习训练实现后训练Scaling Law
面向复杂推理、代码生成、工具调用和智能体任务,从RL训练数据构建、多目标奖励模型优化、生成式奖励模型、过程监督奖励模型、RL算法调优等多方面提升模型的探索能力和任务完成能力
与基础设施团队协作,建设面向代码工程、复杂工具调用的强化学习高效训练环境和评测体系,形成任务生成、轨迹采样、奖励计算、策略训练和效果分析闭环,提升大规模强化学习的训练效率和稳定性
跟踪大模型后训练强化学习领域的前沿进展,复现、验证并改进相关算法,探索研究具有长期价值的后训练新范式
优先资格
在算法编程竞赛、数学竞赛或其他相关机器学习比赛中取得过优异成绩
在NeurIPS、ICML、ICLR、ACL、EMNLP、AAAI等机器学习或自然语言处理会议发表过高水平论文
有大规模分布式强化学习、异步Rollout、训推一体化或多机多卡训练经验
AI 洞察
优缺点分析
优点
- 科大讯飞作为AI上市龙头企业,平台大,资源丰富,技术积累深厚
- 聚焦大模型强化学习前沿方向,技术含量高,成长潜力大
- 团队科研氛围浓厚,有发表高水平论文和参与顶级会议的机会
- 合肥生活成本较低,薪资购买力强,适合长期发展
- 相比一线城市,合肥的AI生态和职业机会相对有限
- 开放性问题多,需要较强的独立研究和解决不确定性问题的能力
- 适合对强化学习和LLM有极强兴趣、追求技术深度、愿意在合肥长期发展的硕博同学
缺点 / 挑战
- 工作强度和压力较大,需要持续跟进快速迭代的前沿技术
角色解读
- 成长为强化学习算法专家,主导大模型后训练方向的技术攻坚
- 晋升为AI研究员或技术负责人,带领团队开展前沿研究
- 向大模型训练架构、分布式系统方向拓展,成为全栈AI工程师
- 研究大模型强化学习算法,如RLHF、PPO、GRPO等,探索后训练Scaling Law
- 构建RL训练数据、优化多目标奖励模型,提升模型在推理、代码生成等复杂任务上的能力
- 与基础设施团队协作,搭建高效训练环境和评测体系,形成闭环训练流程
- 跟踪前沿进展,复现和改进行业最新算法,推动后训练新范式
- 扎实的强化学习理论基础,熟悉PPO、GRPO等主流算法
- 精通Python编程,具备良好的工程实现能力和Linux开发经验
- 优秀的实验设计与分析能力,能通过对照实验、消融实验定位问题
- 较强的自驱力和协作能力,能独立推进研究并解决开放性问题
申请策略
- 关注科大讯飞AI研究院的公开研究动态,在面试中展示对前沿工作的理解
- 准备1-2个完整的项目案例,详细说明实验设计、问题分析和改进效果
- 突出强化学习相关项目经历,尤其是RLHF、PPO等大模型训练经验
- 强调编程能力,列出Python、PyTorch等工具和实际工程成果
- 如有论文或竞赛奖项,重点展示在对应顶会或比赛中的贡献
- 系统复习PPO、GRPO等算法原理,并尝试动手复现简化版本
- 学习分布式训练框架如Megatron、DeepSpeed,了解训推一体化
面试指南
- 从算法原理出发,解释核心创新点和数学基础,再结合实际实现细节
- 对于开放性问题,先拆解问题为几个关键子问题,然后分别给出分析思路和可能的解决方案
- 结合自身项目经验,用STAR法则描述背景、任务、行动和结果
- 请详细解释PPO算法的原理、关键步骤及实现中的注意事项
- 在RLHF中,如何解决奖励模型过拟合和分布外泛化问题?
- 如何设计消融实验来证明某个RL算法改进的有效性?
- 你有过大规模分布式训练的经验吗?请描述一下遇到的技术挑战及解决方式
- 你对当前大模型后训练强化学习的趋势有什么看法?你认为未来可能的发展方向是什么?
职位点评
77
综合评分
上市AI龙头核心研发岗,前沿强化学习方向,技术成长空间大,但WLB和薪资弹性一般。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
最适合追求技术成长和行业前沿的求职者,愿意在合肥稳定发展并能接受一定工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活55
使命价值80
薪资福利
75中等
薪资水平与一线大厂有差距,但在合肥具有较强竞争力,福利未在JD中明确提及。
薪资信号未披露(AI估算:18K-25K/月)
成长发展
90较高
技术方向前沿,能接触大模型核心算法,成长空间极大,但未明确提及晋升通道。
技术前沿前沿/新兴技术
技术栈大语言模型、强化学习、RLHF、PPO、GRPO、分布式训练
业务类型ambiguous
工作生活
55较低
合肥工作生活节奏相对舒适,但岗位未提及弹性工作或远程,需现场办公,且可能面临较高强度。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
80较高
推动AI技术进步具有较高社会价值,大模型行业高速增长,使命感和创新性较强。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs