iFLYTEK logo
科大讯飞
【星火X计划】面向自主持续学习的基础大模型训练技术研究(J13979)

【星火X计划】面向自主持续学习的基础大模型训练技术研究(J13979)

发布于 大约 8 小时前

实习/见习

合肥市 / 北京市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Agentic Rl
Grpo
Ppo
Pytorch
分布式训练
大模型
强化学习
自主持续学习
递归式自我改进

AI 估算 · 8k–15k

AI顶尖人才计划,实习薪资较高,结合城市与岗位竞争力综合评估。

职位详情

关于这个职位

这是一份科大讯飞星火X顶尖AI人才计划的研究实习岗位,专注于基础大模型的自主持续学习技术

你将深入研究强化学习、Agentic RL和递归式自我改进等前沿方向,参与构建下一代大模型训练体系
适合对AI前沿研究有强烈兴趣、具备扎实算法和编程能力的在读硕士或博士

最低要求

届及以后在读硕士及以上学历,计算机科学、人工智能、自动化、电子信息、数学、物理等相关专业

其他专业但具备突出研究和动手能力者同样欢迎
对强化学习、大模型推理、智能体和自主学习具有强烈兴趣,具备扎实的大模型强化学习算法和训练基础,熟悉PPO、GRPO、OPD等常见的大模型后训练和强化学习算法,拥有大语言模型强化学习相关实习或项目经历
具有扎实的编程和计算机系统基础,精通Python等语言,熟悉PyTorch及主流分布式训练框架,具备优秀的工程实现能力
熟悉Linux、Git、推理引擎、分布式训练系统和大规模数据处理流程
对自主持续学习、开放式学习、模型自我验证或递归式自我改进等前沿方向具有深入思考,能够在缺少成熟范式和标准答案的开放问题中开展探索性研究,愿意持续解决开放性、高不确定性的技术问题
具备良好的沟通协作能力、自驱力和责任意识,能够独立负责重要研究方向,并推动算法、数据、系统和业务团队之间的协同落地

工作职责

本课题围绕Reasoning RL、Agentic RL、自主持续学习与递归式自我改进等关键技术方向开展研究,探索从离线训练、在线强化学习、环境交互学习到模型自主生成目标、自主构造训练数据、自主验证和持续更新的完整技术体系,构建具备深度推理、复杂决策、长期探索和持续自我提升的下一代大模型

你将研究从奖励建模、可验证强化学习、策略优化、过程监督,到智能体环境交互、在线学习的完整技术验证
构建面向推理、代码、工具使用和开放环境任务的强化学习基础设施与评测体系,探索通向自主持续学习和递归式自我改进的技术路径
【课题挑战】
Agentic RL与长时程Credit Assignment:面向代码智能体、复杂工具调用智能体,任务通常包含数百至数千步环境交互,且反馈稀疏、延迟并带有较强噪声
需要研究层次化策略学习、轨迹级与步骤级价值估计、反事实信用分配、失败恢复和探索策略,使模型能够从长程交互轨迹中有效学习规划、推理、工具选择和环境操作能力
开放环境中的探索与自主学习:自主智能模型需要主动发现未知问题、识别能力短板并生成具有适当难度的训练任务
需要探索模型的能力边界探测、开放式探索、内在奖励和自博弈机制,形成“发现问题—尝试解决—验证结果—更新能力”的自主学习循环
递归式自我改进的稳定性与可控性:模型自主改进可能带来能力快速增长,也可能产生目标漂移、评估失效和累积性错误
需要探索模型生成训练数据、改进算法、优化智能体框架乃至辅助研究流程的技术路径,建立稳定、可解释和可控制的实验范式
【课题价值】
突破大模型推理与决策能力上限:建立面向数学、代码、科学推理和复杂开放问题的通用强化学习方法,使模型从模仿已有答案迈向主动搜索、验证和发现更优解决方案
推动智能体从任务执行走向环境学习:使智能体能够在复杂软件工程、深度研究、数据分析和企业工作流中,根据真实执行反馈持续优化策略
建立模型自主持续学习能力:构建模型发现能力缺口、自主生成任务、自主采集反馈、自主验证结果并持续更新的技术闭环,使模型能够适应不断变化的知识、工具和环境
探索下一代模型自我进化路径:系统研究从强化学习、在线学习、自博弈和自动课程学习到递归式自我改进的关键技术,为具有持续成长能力的下一代大模型提供理论、算法和系统基础

优先资格

在 NeurIPS/ICML/ICLR/ACL/EMNLP/AAAI/IJCAI等相关会议或期刊发表高质量论文者优先

在ACM等高水平算法编程竞赛、CMO/IMO等数学竞赛或其他比赛中取得过优异成绩者优先

AI 洞察

优缺点分析

优点

  • 参与最前沿的大模型训练研究,技术含量高,学术与工业价值兼具
  • 科大讯飞提供平台资源和导师指导,研究氛围浓厚
  • 课题方向长远,个人成长空间大,能积累稀缺的强化学习实战经验
  • 研究难度大,面临开放性问题和高不确定性,需要较强的心理承受力
  • 实习岗位,转正和长期待遇存在不确定性

缺点 / 挑战

  • 可能工作强度较高,需要持续投入时间进行实验和阅读论文
  • 适合对AI前沿研究充满热情、具备扎实算法功底、愿意接受高难度挑战的硕博在读生

角色解读

  • 从实习研究员成长为AI算法专家,深入大模型核心技术领域
  • 有机会发表顶级会议论文,积累学术影响力,成为行业稀缺人才
  • 在科大讯飞内部可转向核心研发岗或技术管理岗,参与更大规模产品化研究
  • 研究大模型强化学习算法,包括PPO、GRPO等后训练方法的优化与改进
  • 构建智能体环境交互与在线学习的训练基础设施和评测体系
  • 探索模型自主生成任务、自我验证和递归式自我改进的技术路径
  • 扎实的强化学习和大模型训练基础,熟悉主流RL算法及实现
  • 精通Python和PyTorch,熟悉分布式训练框架和大规模数据处理
  • 对自主学习和智能体方向有深入思考,具备独立开展探索性研究的能力
  • 良好的英文文献阅读和学术写作能力

申请策略

  • 关注科大讯飞星火X计划官方信息,提前了解课题方向和研究团队成果
  • 在简历或求职信中明确表达对自主持续学习课题的独特见解和兴趣
  • 突出大模型强化学习相关项目经历,如RLHF、RL训练、分布式训练等
  • 展示论文发表或编程竞赛获奖情况,证明研究能力和动手能力
  • 强调对自主学习和智能体方向的深入思考,可附上相关技术博客或开源项目
  • 熟悉PPO、GRPO等算法原理及实现,掌握PyTorch分布式训练技巧
  • 阅读强化学习和智能体领域最新论文,了解Agentic RL前沿进展
  • 参与开源RL项目或复现经典实验,提升工程实践能力

面试指南

  • 对于算法理解题,从原理、优缺点、实际权衡切入,并举具体例子
  • 对于项目经验题,使用STAR法则描述问题、行动、结果,并反思改进空间
  • 对于开放性问题,先明确问题定义,再给出系统性解决思路和验证方法
  • 请解释PPO和GRPO的区别,以及各自适用场景
  • 如何设计一个奖励模型来指导智能体在开放环境中学习?
  • 你在强化学习项目中遇到过哪些困难,如何解决?
  • 谈谈你对递归式自我改进的理解,有哪些潜在风险?
  • 如何评估一个智能体在长程任务中的表现?

职位点评

73
综合评分

AI顶尖研究实习岗,技术前沿性强,成长空间大,但工作强度和不确定性较高,WLB一般。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
该职位最适合追求前沿技术成长、渴望学术突破、对AI研究有强烈使命感的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展92
工作生活50
使命价值85

薪资福利

55较低

实习岗位薪资面议,但作为顶尖AI人才计划,预计提供具有竞争力的实习补贴和福利。整体补偿性一般,稳定性较低。

薪资信号未披露(AI估算:8K-15K/月)

成长发展

92较高

该职位处于AI最前沿研究领域,涉及强化学习、大模型、自主持续学习等,技能成长和学术发展空间极大,发展性动机满足程度很高。

技术前沿前沿/新兴技术
技术栈强化学习、大模型、PPO、GRPO、Agentic RL、PyTorch、分布式训练、自主持续学习
业务类型ambiguous

工作生活

50较低

工作地点在合肥或北京,要求现场办公,未提及远程或弹性工时,生活便利性一般,WLB信息不明确。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

85较高

研究下一代大模型自主进化,推动AI技术进步,社会价值和使命感较强,处于高速增长赛道,意义感满足较好。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号推动智能体从任务执行走向环境学习、探索下一代模型自我进化路径
创新程度开拓性创新(行业首创)
Watch Jobs