
科大讯飞
【星火X计划】面向超长程任务的大模型智能体技术研究(J13978)
【星火X计划】面向超长程任务的大模型智能体技术研究(J13978)
发布于 大约 8 小时前实习/见习
合肥市 / 北京市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Llm
Pytorch
分布式训练
强化学习
机器学习
软件工程
AI 估算 · 5k–10k
顶尖AI人才计划,实习薪资高于普通实习,合肥和北京差异较大,综合取中位。
职位详情
关于这个职位
这是科大讯飞星火X顶尖AI人才计划下的研究实习岗位,专注于大模型智能体技术研究,涉及超长程任务规划、复杂软件工程智能体、强化学习等前沿方向
你将参与从轨迹数据构造、模型训练到评测的完整技术闭环,推动Agent在真实业务场景中落地
适合具备扎实机器学习基础和强烈研究兴趣的硕士/博士在读学生
最低要求
届及以后在读硕士及以上学历,计算机科学、人工智能、自动化、电子信息、数学等相关专业,其他专业但具备突出研究和动手能力者同样欢迎
对大模型智能体具有强烈兴趣,具备扎实的大模型算法和训练基础,能够持续跟踪论文和开源项目,并将研究思路转化为可验证的实验方案
具有扎实的编程和计算机系统基础,精通Python等语言,熟悉PyTorch及主流分布式训练框架,具备优秀的工程实现能力
熟悉Linux、Git、推理引擎、分布式训练系统和大规模数据处理流程
拥有独立发现问题、建立假设、设计对照实验和分析失败案例的能力,能够在开放问题中形成清晰、可验证的研究路线
具备极强的实验设计和分析能力,能够通过对照实验、消融实验和 Bad Case 分析定位模型问题
具备良好的沟通协作能力、自驱力和责任意识,能够独立推进研究任务
工作职责
你将结合真实业务流程,研究从轨迹数据构造、监督微调、强化学习、测试时计算到在线学习的完整技术闭环
建立核心评测体系,推动 Agent 在复杂软件工程、深度研究、企业工作流等高价值场景中的规模化应用
超长时程规划与Credit Assignment:面向目标不完备、反馈稀疏、环境持续变化的数百至数千步任务,研究如何将稀疏、延迟且可能带有噪声的结果反馈,准确分配给长轨迹中的规划、推理、代码修改和工具调用行为
超长上下文记忆与持续学习:模型长时间运行会产生大量代码、日志、工具返回和失败记录,如何在有限上下文预算下保留关键状态、压缩历史信息并避免错误记忆,是智能体长期稳定运行的基础问题
长程复杂智能体轨迹数据的合成与评价:如何构建出具有多样性、高难度的长时程轨迹数据,尽可能提供丰富的学习信号以促进模型训练
如何评测数据的质量,以及如何评测模型在复杂智能体场景下的能力边界
模型、智能体框架与环境的协同优化:智能体能力不仅由基础模型决定,还受到提示协议、工具定义、上下文管理、执行环境和搜索策略的显著影响
需要建立模型训练与 Agent Harness 联合优化的方法,减少对人工规则和复杂脚手架的依赖
优先资格
有大模型训练、数据构建研究、Agent等方向实战经验者优先
在 NeurIPS/ICML/ICLR/ACL/EMNLP/AAAI/IJCAI等相关会议或期刊发表高质量论文者优先
在ACM等高水平算法编程竞赛、CMO/IMO等数学竞赛或其他比赛中取得过优异成绩者优先
AI 洞察
优缺点分析
优点
- 科大讯飞是上市AI公司,平台大,研究资源丰富
- 课题前沿,涉及大模型智能体核心方向,技术成长快
- 有明确的课题价值和实际业务场景,研究能落地
- 顶尖人才计划,可能配备导师和优质资源
- 研究难度高,需要处理超长时程任务中的复杂问题,对科研能力要求高
- 需要同时掌握算法、工程和实验设计,知识面要求广
缺点 / 挑战
- 实习期间可能面临高强度科研压力,竞争激烈
- 适合对AI研究有强烈热情,具备扎实机器学习和编程基础,乐于挑战开放复杂问题的硕士/博士在读学生
角色解读
- 在顶尖AI实验室积累前沿研究经验,可发表高质量论文
- 表现优秀者可转正为正式研究员,成为大模型智能体方向专家
- 发展方向包括技术专家、研究科学家或产品技术负责人
- 研究并开发面向超长程任务的大模型智能体,涉及规划、工具调用和反馈学习
- 构建复杂智能体轨迹数据的合成与评测体系,推动Agent在软件工程等场景落地
- 参与从监督微调、强化学习到测试时计算的完整训练闭环
- 与团队协作,分析模型失败案例并设计实验持续优化
- 扎实的大模型算法基础,熟悉Transformer、预训练、微调等原理
- 精通Python和PyTorch,具备分布式训练和大规模数据处理能力
- 理解强化学习(如PPO、RLHF)和智能体相关技术
- 具备独立实验设计和问题分析能力,能通过对照实验定位问题
申请策略
- 准备一段展示自己研究或项目深度的介绍,突出解决问题的能力
- 了解科大讯飞星火大模型业务,结合课题挑战提出自己的想法
- 突出大模型相关的项目经验,如预训练、微调、RLHF实践
- 强调Agent方向的实战,如工具调用、多步推理或自主规划
- 展示扎实的代码能力,如PyTorch分布式训练、大规模数据处理
- 如有论文或竞赛获奖,重点提及
- 系统学习强化学习(PPO、RLHF)和Agent相关论文
- 动手实现一个简单Agent,并尝试接入工具调用或环境交互
面试指南
- 用STAR法则回答项目经验,突出目标、方案、行动和结果
- 对于开放研究问题,先拆解问题,提出假设,设计实验验证,并说明可能遇到的挑战
- 展示你的研究思路:从相关文献出发,对比不同方法,给出你的创新点
- 请介绍一个你做过的大模型相关项目,并说明你如何验证效果?
- 在长时程任务中,如何解决稀疏奖励的信用分配问题?
- 如何设计一个智能体轨迹数据的评价指标?
- 训练大模型智能体时,你会如何优化上下文管理?
- 当模型在复杂任务中失败,你如何分析原因并改进?
职位点评
72
综合评分
顶尖AI人才计划,研究前沿大模型智能体,发展空间大,但实习薪资一般且工作强度未知。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
适合追求技术成长和前沿研究,对薪资和WLB要求不高的学生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活50
使命价值80
薪资福利
60中等
实习岗位薪资适中,作为上市AI公司,福利和稳定性有保障,但实习期收入有限。
薪资信号未披露(AI估算:5K-10K/月)
成长发展
90较高
岗位专注于大模型智能体前沿技术,提供完整科研训练,成长空间大。
技术前沿前沿/新兴技术
技术栈LLM、Agent、强化学习、PyTorch
业务类型ambiguous
工作生活
50较低
未提及工作强度,但研究岗位通常要求自我驱动,工作与生活平衡一般。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
80较高
课题具有明确的社会和产业价值,致力于用AI改变世界,使命感强。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号用技术改变世界、构建世界一流的智能体模型
创新程度积极采用新技术
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs