
科大讯飞
【星火X计划】面向通用大模型智能体强化学习的Infra工程(J13998)
【星火X计划】面向通用大模型智能体强化学习的Infra工程(J13998)
发布于 大约 14 小时前普通员工/个人贡献者
合肥市 / 北京市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Deepspeed
Gpu集群
Pytorch
Rlhf
Vllm
分布式系统
强化学习
Agentrl
Ppo/Grpo
AI 估算 · 6k–12k
顶尖AI人才计划实习岗,技术要求高,实习薪资有竞争力,合肥北京待遇有差异。
职位详情
关于这个职位
这是一份面向通用大模型智能体强化学习的基础设施工程岗位,你将参与设计RL后训练和AgentRL场景下的分布式系统,解决多模型混合部署、大规模环境并行、显存调度等核心技术难题,优化GPU集群利用率并推动自研工程方案落地
岗位技术要求高,研究方向前沿,适合对系统性能有强烈热情的AI专业学生
最低要求
届及以后在读硕士及以上学历,人工智能、计算机科学、分布式系统、数学、高性能计算等相关专业
其他专业但具备突出工程能力者同样欢迎
扎实的深度学习与强化学习基础,熟悉 PPO、GRPO、DPO、REINFORCE 等后训练算法及在线/多智能体 RL 范式,深入理解 Transformer/MoE 架构与分布式并行范式
精通 C/C++ 或 Python,熟练 PyTorch
熟悉分布式通信与集合通信拓扑优化,具备大规模 GPU 集群调优经验
具备分布式系统、高性能网络、存储或资源调度背景
拥有独立建模、系统架构设计与大规模实验能力,能搭建端到端 RL 评测基线,对标前沿方案并提出创新解法
良好跨团队协作能力,能协同算法、模型、推理、环境模拟与业务团队推进落地,具备解决工业集群复杂工程瓶颈的抗压能力
工作职责
岗位职责:【课题介绍】
当前大模型 RL 后训练面临多模型(策略/价值/参考/奖励/验证器)并存带来的显存压力、生成回滚与梯度更新的同步等待、海量轨迹数据的传输存储开销等核心痛点
而 AgentRL 场景中,智能体需与十万级并发环境实例进行数十至上百轮交互,长程上下文累积、环境状态异构性与故障频发、推理与训练速度失配等问题进一步加剧系统复杂度
两类场景在分布式通信拓扑优化、经验流数据管道、显存感知调度、容错恢复与资源弹性等层面具有高度一致的系统挑战
本课题将针对上述瓶颈,设计统一的异步流水线架构与动态资源调度器,突破多模型混合训练与大规模环境并行的扩展限制,大幅缩短 RL 迭代周期,显著提升 GPU 集群利用率,并形成自研工程方案与开源贡献,提升公司在 RL Infra 领域的技术影响力
【课题挑战】
高吞吐生成与多轮推理加速
设计异步流水线生成服务,使推理与训练过程解耦匹配,降低生成等待时延
针对 AgentRL 多轮交互,实现 KV Cache 增量复用、跨轮注意力掩码管理及长上下文显存换入换出,显著降低推理延迟,支持长期决策与复杂工具调用链调用
多模型混合部署与显存管理
制定动态换入换出、参数分片与共享、显存感知调度策略,在有限显存下承载策略/价值/参考/奖励/验证器及环境编码器等组件,避免显存溢出与碎片化
实现多组件协同下的显存弹性分配,兼顾计算效率与模型规模
大规模环境并行与状态管理
支持十万级并发环境实例(浏览器沙箱、代码解释器等)的编排、生命周期管理、状态快照/恢复,设计轻量化环境抽象层、环境池预热与弹性扩缩容策略
解决异构状态(文本、结构化、工具结果)的序列化、压缩传输与版本管理,降低 I/O 与存储开销
分布式 RL 算法系统化与通信优化
将 PPO/GRPO 的优势计算、重要性采样、KL 惩罚等环节映射到张量/数据并行策略,设计 All-Reduce 与 All-Gather 协同的异构通信拓扑,降低多模型同步开销
在 Actor-Rollout 解耦架构下构建异步消息队列与键值状态同步机制,应对网络分区与积压,保障系统可观测性
经验流系统与分级存储数据管道
研发内存优先 + 分级存储(内存/SSD/远端)的经验回放缓冲系统,支持海量轨迹(含状态、动作、奖励、优势值、工具调用结果等)的实时持久化、优先级采样与流式回放,应对数据倾斜与 I/O 瓶颈
针对多模态异构数据设计压缩传输与零拷贝序列化方案
混合负载调度与资源弹性
设计在线弹性扩缩容与资源池动态切分调度器,实现推理生成、环境交互与梯度更新的异步并行与资源错峰复用,最大化集群整体利用率
支持 CPU 密集型环境模拟与 GPU 密集型推理/训练的资源隔离与超卖控制,降低硬件成本
沙箱安全、容错与长稳运行
构建轻量级执行沙箱,实现动作白名单、越权拦截、资源配额与超时控制,防范系统风险
嵌入端到端加密、访问令牌与审计日志,保障数据安全
设计自动 Checkpoint、异常恢复、节点与环境实例热迁移、部分故障降级机制,保障数天至数周训练任务的持续收敛与数据一致性
【课题价值】
大幅提升 RLVR/AgentRL 后训练效率:通过异步流水线与动态调度,缩短 PPO/GRPO 迭代周期,同时提升异步AgentRL 多轮交互训练吞吐,加速智能体策略研发与验证
突破系统扩展瓶颈:支撑千亿级主模型与多辅助模型协同后训练,同时支持十万级环境实例与千亿参数策略网络的 AgentRL 任务,形成适配超大规模混合集群的自研 RL 工程方案,赋能公司智能体产品线规模化部署
显著降低硬件成本:利用推理-训练-环境三者的资源错峰与弹性复用,提升 GPU 集群有效利用率 ,大幅降低大模型对齐与智能体部署的综合运行开销
输出学术论文、开源模块与最佳实践:为开源社区贡献核心系统优化,推动 RL 工程化标准演进,提升公司在 RL Infra 方向的行业影响力
优先资格
有 DeepSpeed/Megatron-LM/vLLM/sglang 二次开发经验者优先
有 RLHF/RLVR/AgentRL 全链路工程落地经验者优先
有 Kubernetes/Slurm 集群编排经验者优先
在 ICLR/NeurIPS/ICML 等顶会发表分布式训练、系统优化、RL 或智能体相关论文者优先
拥有开源 RL 训练框架(verl/slime/OpenRLHF)或 AgentRL 框架贡献经验,推理引擎深度集成或沙箱技术贡献者优先
AI 洞察
优缺点分析
优点
- 前沿技术赛道,深刻理解大模型强化学习训练的全链路,技术含金量高
- 科大讯飞作为上市公司,平台稳定,资源充足,能接触大规模真实业务场景
- 鼓励开源和学术产出,对个人品牌和学术影响力提升有很大帮助
- 涉及多领域知识(分布式系统、AI、存储),技能积累复合性强
- 技术要求极高,需要同时掌握算法和系统知识,学习曲线陡峭
- 作为实习岗位,转正存在不确定性,且工作地点可能需要在合肥与北京之间协调
- 适合对系统底层优化有强烈兴趣、喜欢攻克技术难题,并愿意在AI基础设施领域长期深耕的计算机或相关专业学生
缺点 / 挑战
- 工程任务复杂,涉及性能优化、故障排查等,可能面临较高的工作强度和压力
角色解读
- 成为大模型RL基础设施领域的专家,深度参与前沿系统设计与开源社区建设
- 可向技术专家或技术负责人方向发展,带领团队构建大规模AI系统
- 有机会转向算法研究,结合工程经验在系统优化与强化学习交叉方向持续深入
- 设计与实现大模型强化学习后训练的分布式系统,包括异步流水线架构、动态资源调度、多模型混合部署等核心模块
- 针对AgentRL场景,优化大规模环境并行与状态管理,支持十万级并发环境实例的编排、快照与恢复
- 开发经验流系统与分级存储数据管道,实现海量轨迹数据的实时持久化、优先级采样与流式回放
- 构建沙箱安全与容错机制,保障数天至数周训练任务的稳定运行,并输出学术论文或开源模块
- 扎实的深度学习与强化学习基础,熟悉PPO、GRPO、DPO、REINFORCE等算法,理解Transformer/MoE架构
- 精通C/C++或Python,熟练使用PyTorch,具备大型系统开发与性能调优能力
- 熟悉分布式通信与集合通信拓扑优化,了解Kubernetes/Slurm等集群编排工具,有GPU集群调优经验
- 具备独立建模、系统架构设计与大规模实验能力,能搭建端到端RL评测基线
申请策略
- 了解科大讯飞星火大模型和相关AI业务,在面试中体现出对RL Infra领域的热情
- 突出自己的抗压能力和跨团队协作经验,这是岗位的重要软素质
- 突出强化学习相关的项目经验,特别是RLHF/RLVR/AgentRL的训练流程和调优实践
- 强调分布式系统或高性能计算的项目,如使用过vLLM、DeepSpeed等框架进行二次开发
- 展示扎实的编程能力,如Python/C++、PyTorch使用,以及性能分析、内存优化等工程能力
- 如有开源贡献、竞赛获奖或顶会论文,务必放在显眼位置
- 深入学习PPO/GRPO算法原理,并动手实现一个简单的RL训练流程
- 阅读vLLM、DeepSpeed等框架源码,理解其架构设计和优化技巧
面试指南
- 回答技术问题时,先给出整体架构设计思路,再展开具体实现细节,体现系统级思考
- 结合项目经验,用STAR法则(情景、任务、行动、结果)描述经历,突出个人贡献
- 如果遇到不确定的问题,可以坦诚说明,同时提出解决思路和权衡,展示学习能力
- 在RLHF训练中,如何解决推理和训练速度不匹配的问题?请谈谈你的设计思路
- 如果要管理多个模型(策略/价值/参考)的显存,你会采用哪些策略?为什么?
- 你如何理解PPO和GRPO的区别?在工程实现上需要注意什么?
- 对于十万级环境并行,如何设计状态管理和容错恢复机制?
- 请介绍一个你使用分布式训练框架(如DeepSpeed、vLLM)的项目,并说明其优化点
职位点评
72
综合评分
前沿RL Infra技术岗,学习成长空间巨大,但工作强度大,福利未明确。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
适合追求技术成长、能接受高强度工作并愿意在第一线攻坚的AI人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展95
工作生活45
使命价值80
薪资福利
55较低
作为实习岗,薪资有一定竞争力但福利不明确,公司平台稳定,但整体补偿性一般。
薪资信号未披露(AI估算:6K-12K/月)
成长发展
95较高
该岗位处于前沿技术领域,能深入接触大模型RL基础设施,学习曲线陡峭,成长空间巨大。
技术前沿前沿/新兴技术
技术栈PPO、GRPO、PyTorch、分布式系统、GPU集群、vLLM、DeepSpeed、Kubernetes、RLHF、AgentRL
业务类型ambiguous
工作生活
45较低
办公地点涵盖合肥和北京,须现场办公,未提及弹性或远程,工作强度可能较大,生活平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
该岗位致力于突破大模型RL的系统瓶颈,推动AI技术前沿发展,有较强的技术使命感和行业价值。
行业发展高速增长赛道
社会影响中性/一般
创新程度稳健跟随主流
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs