iFLYTEK logo
科大讯飞
【星火X计划】面向自主持续学习的基础大模型训练技术研究(J13797)

【星火X计划】面向自主持续学习的基础大模型训练技术研究(J13797)

发布于 大约 8 小时前

普通员工/个人贡献者

合肥市 / 北京市
无经验要求
全职员工
仅现场办公
硕士
机器学习工程
Agentic Rl
Grpo
Ppo
Pytorch
分布式训练
大模型
强化学习
推理
自主持续学习

AI 估算 · 25k–45k

核心AI研究岗,高学历要求,技能稀缺,薪资水平高于市场平均,结合城市差异取中间值。

职位详情

关于这个职位

该岗位隶属于科大讯飞星火X顶尖AI人才计划,专注于大模型自主持续学习与强化学习训练技术研究

你将参与PPO、GRPO等算法优化、推理增强和智能体环境交互的完整技术验证,构建下一代大模型训练基础设施,推动模型迈向自主进化

最低要求

-27届硕士及以上学历,计算机科学、人工智能、自动化、电子信息、数学、物理等相关专业

其他专业但具备突出研究和动手能力者同样欢迎
对强化学习、大模型推理、智能体和自主学习具有强烈兴趣,具备扎实的大模型强化学习算法和训练基础,熟悉PPO、GRPO、OPD等常见的大模型后训练和强化学习算法,拥有大语言模型强化学习相关实习或项目经历
具有扎实的编程和计算机系统基础,精通Python等语言,熟悉PyTorch及主流分布式训练框架,具备优秀的工程实现能力
熟悉Linux、Git、推理引擎、分布式训练系统和大规模数据处理流程
对自主持续学习、开放式学习、模型自我验证或递归式自我改进等前沿方向具有深入思考,能够在缺少成熟范式和标准答案的开放问题中开展探索性研究,愿意持续解决开放性、高不确定性的技术问题
具备良好的沟通协作能力、自驱力和责任意识,能够独立负责重要研究方向,并推动算法、数据、系统和业务团队之间的协同落地

工作职责

岗位职责:【课题介绍】我们认为未来的通用大模型不仅需要根据人类提供的数据和奖励进行训练,还需要能够主动探索环境、发现知识与技能缺口、从交互反馈中持续学习,并逐步形成自我改进和自主进化能力

本课题围绕Reasoning RL、Agentic RL、自主持续学习与递归式自我改进等关键技术方向开展研究,探索从离线训练、在线强化学习、环境交互学习到模型自主生成目标、自主构造训练数据、自主验证和持续更新的完整技术体系,构建具备深度推理、复杂决策、长期探索和持续自我提升的下一代大模型
你将研究从奖励建模、可验证强化学习、策略优化、过程监督,到智能体环境交互、在线学习的完整技术验证
构建面向推理、代码、工具使用和开放环境任务的强化学习基础设施与评测体系,探索通向自主持续学习和递归式自我改进的技术路径
【课题挑战】
Agentic RL与长时程Credit Assignment:面向代码智能体、复杂工具调用智能体,任务通常包含数百至数千步环境交互,且反馈稀疏、延迟并带有较强噪声
需要研究层次化策略学习、轨迹级与步骤级价值估计、反事实信用分配、失败恢复和探索策略,使模型能够从长程交互轨迹中有效学习规划、推理、工具选择和环境操作能力
开放环境中的探索与自主学习:自主智能模型需要主动发现未知问题、识别能力短板并生成具有适当难度的训练任务
需要探索模型的能力边界探测、开放式探索、内在奖励和自博弈机制,形成“发现问题—尝试解决—验证结果—更新能力”的自主学习循环
递归式自我改进的稳定性与可控性:模型自主改进可能带来能力快速增长,也可能产生目标漂移、评估失效和累积性错误
需要探索模型生成训练数据、改进算法、优化智能体框架乃至辅助研究流程的技术路径,建立稳定、可解释和可控制的实验范式
【课题价值】
突破大模型推理与决策能力上限:建立面向数学、代码、科学推理和复杂开放问题的通用强化学习方法,使模型从模仿已有答案迈向主动搜索、验证和发现更优解决方案
推动智能体从任务执行走向环境学习:使智能体能够在复杂软件工程、深度研究、数据分析和企业工作流中,根据真实执行反馈持续优化策略
建立模型自主持续学习能力:构建模型发现能力缺口、自主生成任务、自主采集反馈、自主验证结果并持续更新的技术闭环,使模型能够适应不断变化的知识、工具和环境
探索下一代模型自我进化路径:系统研究从强化学习、在线学习、自博弈和自动课程学习到递归式自我改进的关键技术,为具有持续成长能力的下一代大模型提供理论、算法和系统基础

优先资格

在 NeurIPS/ICML/ICLR/ACL/EMNLP/AAAI/IJCAI等相关会议或期刊发表高质量论文者优先

在ACM等高水平算法编程竞赛、CMO/IMO等数学竞赛或其他比赛中取得过优异成绩者优先

AI 洞察

优缺点分析

优点

  • 科大讯飞作为AI头部上市公司,平台资源丰富,研究实力雄厚
  • 星火X顶尖人才计划提供专项培养体系,职业发展路径清晰
  • 研究方向兼具学术价值和工业落地前景,影响力大
  • 研究难度高,不确定性大,需要长期攻坚和强大心理承受力
  • 对数学和算法功底要求极高,需持续学习最新技术
  • 适合对强化学习和自主智能体有强烈兴趣,具备扎实研究功底和探索精神,渴望在AI前沿领域实现突破的顶尖硕博毕业生

缺点 / 挑战

  • 课题处于大模型自主持续学习最前沿,技术挑战大,成长空间无限
  • 可能面临高强度工作压力,加班和急迫的交付周期

角色解读

  • 成长为强化学习与大模型训练领域的顶级研究专家
  • 向技术负责人或研究员方向发展,牵头核心算法研究
  • 依托星火X计划平台,有机会发表顶会论文,成为AI领域领军人才
  • 研究大模型强化学习算法,探索PPO/GRPO等后训练方法,优化推理与决策能力
  • 构建面向推理、代码、工具使用和开放环境任务的强化学习基础设施与评测体系
  • 探索模型自主生成目标、构造训练数据、验证结果和持续更新的技术路径
  • 与算法、数据、系统和业务团队协同,推动自主持续学习技术在真实场景落地
  • 扎实的强化学习和深度学习基础,熟悉PPO、GRPO、OPD等主流大模型后训练算法
  • 精通Python和PyTorch,熟悉主流分布式训练框架,具备优秀工程实现能力
  • 具备独立研究能力,能在开放、不确定问题中探索创新方案
  • 优秀的沟通协作能力,能跨团队推动研究落地

申请策略

  • 申请时展现对课题研究的热情和独立见解,突出自己能在不确定性中推进工作的能力
  • 提前了解科大讯飞星火大模型的技术路线和公开研究成果,在面试中体现契合度
  • 突出强化学习相关项目经历和论文,尤其是大模型RLHF或RLVR实战经验
  • 强调编程能力和工程素养,展示在分布式训练、系统优化等方面的实际操作
  • 提及ACM、CMO/IMO等竞赛获奖或顶会论文,体现顶尖学术水平
  • 展示对开放性问题主动探索的经历,如自设研究课题或参与开源项目
  • 深入学习GRPO、OPD等最新算法,并动手复现论文结果
  • 熟悉大规模分布式训练框架,如DeepSpeed、Megatron,掌握RL训练基础设施搭建

面试指南

  • 先明确问题定义和核心挑战,再给出技术思路和算法选型,结合具体项目案例说明实施过程,最后总结潜在风险和演进方向
  • 如何设计一个强化学习算法来提升大模型的推理能力?
  • 在长程任务中如何处理稀疏奖励和延迟反馈?
  • 请介绍你参与过的大模型强化学习项目,关键挑战和解决方案是什么?
  • 如何保证递归式自我改进过程中模型的稳定性和可控性?
  • 你理解中的自主智能体应该具备哪些关键能力?
  • 复习强化学习经典算法和最新进展,尤其RLHF、RLVR、GRPO等
  • 准备一个完整的RL项目案例,包括问题拆解、实验设计、结果分析和经验教训

职位点评

77
综合评分

前沿大模型强化学习研究岗,技术成长极佳,薪资有竞争力,但工作强度可能较高,WLB一般。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求前沿技术成长、渴望在AI研究领域深耕并愿意接受高强度挑战的顶尖人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展95
工作生活50
使命价值85

薪资福利

70中等

科大讯飞作为上市公司,提供有竞争力的薪资和福利,但JD未明确具体数额,整体满足度良好。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

95较高

该岗位处于大模型强化学习的最前沿,提供顶尖的研究课题和培养计划,对技能成长和职业发展极有利。

技术前沿前沿/新兴技术
技术栈强化学习、PPO、GRPO、PyTorch、分布式训练、大模型
业务类型ambiguous

工作生活

50较低

工作地点在北京或合肥,未提及弹性办公,研究岗可能工作强度大,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

该课题旨在推动大模型自主进化,具有重大科学意义和产业价值,能激发使命感。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号突破大模型推理与决策能力上限、推动智能体从任务执行走向环境学习
创新程度开拓性创新(行业首创)
Watch Jobs