
科大讯飞
【星火X计划】面向通用大模型智能体强化学习的Infra工程(J13988)
【星火X计划】面向通用大模型智能体强化学习的Infra工程(J13988)
发布于 大约 8 小时前普通员工/个人贡献者
合肥市 / 北京市
无经验要求
实习生
仅现场办公
硕士
平台工程
Deepspeed
Grpo
Megatron-Lm
Ppo
Pytorch
Sglang
Vllm
分布式系统
强化学习
AI 估算 · 3k–6k
实习岗位,AI头部公司,硕士学历,合肥/北京薪资水平中等,基于实习日薪150-250估算。
职位详情
关于这个职位
这是科大讯飞星火X顶尖AI人才计划下的RL Infra工程岗位,专注于通用大模型智能体强化学习的系统基础设施
你将参与设计异步流水线架构和动态资源调度器,解决多模型混合训练、大规模环境并行、分布式通信优化等核心挑战,大幅提升GPU集群利用率和RL迭代效率
岗位适合对分布式系统、高性能计算和强化学习有浓厚兴趣的在校硕士/博士,技术挑战大、成长空间高
最低要求
届及以后在读硕士及以上学历,人工智能、计算机科学、分布式系统、数学、高性能计算等相关专业
其他专业但具备突出工程能力者同样欢迎
扎实的深度学习与强化学习基础,熟悉 PPO、GRPO、DPO、REINFORCE 等后训练算法及在线/多智能体 RL 范式,深入理解 Transformer/MoE 架构与分布式并行范式
精通 C/C++ 或 Python,熟练 PyTorch
熟悉分布式通信与集合通信拓扑优化,具备大规模 GPU 集群调优经验
具备分布式系统、高性能网络、存储或资源调度背景
拥有独立建模、系统架构设计与大规模实验能力,能搭建端到端 RL 评测基线,对标前沿方案并提出创新解法
良好跨团队协作能力,能协同算法、模型、推理、环境模拟与业务团队推进落地,具备解决工业集群复杂工程瓶颈的抗压能力
工作职责
【课题介绍】
当前大模型 RL 后训练面临多模型(策略/价值/参考/奖励/验证器)并存带来的显存压力、生成回滚与梯度更新的同步等待、海量轨迹数据的传输存储开销等核心痛点
而 AgentRL 场景中,智能体需与十万级并发环境实例进行数十至上百轮交互,长程上下文累积、环境状态异构性与故障频发、推理与训练速度失配等问题进一步加剧系统复杂度
两类场景在分布式通信拓扑优化、经验流数据管道、显存感知调度、容错恢复与资源弹性等层面具有高度一致的系统挑战
本课题将针对上述瓶颈,设计统一的异步流水线架构与动态资源调度器,突破多模型混合训练与大规模环境并行的扩展限制,大幅缩短 RL 迭代周期,显著提升 GPU 集群利用率,并形成自研工程方案与开源贡献,提升公司在 RL Infra 领域的技术影响力
【课题挑战】
高吞吐生成与多轮推理加速:设计异步流水线生成服务,使推理与训练过程解耦匹配,降低生成等待时延
针对 AgentRL 多轮交互,实现 KV Cache 增量复用、跨轮注意力掩码管理及长上下文显存换入换出,显著降低推理延迟,支持长期决策与复杂工具调用链调用
多模型混合部署与显存管理:制定动态换入换出、参数分片与共享、显存感知调度策略,在有限显存下承载策略/价值/参考/奖励/验证器及环境编码器等组件,避免显存溢出与碎片化
实现多组件协同下的显存弹性分配,兼顾计算效率与模型规模
大规模环境并行与状态管理:支持十万级并发环境实例(浏览器沙箱、代码解释器等)的编排、生命周期管理、状态快照/恢复,设计轻量化环境抽象层、环境池预热与弹性扩缩容策略
解决异构状态(文本、结构化、工具结果)的序列化、压缩传输与版本管理,降低 I/O 与存储开销
分布式 RL 算法系统化与通信优化:将 PPO/GRPO 的优势计算、重要性采样、KL 惩罚等环节映射到张量/数据并行策略,设计 All-Reduce 与 All-Gather 协同的异构通信拓扑,降低多模型同步开销
在 Actor-Rollout 解耦架构下构建异步消息队列与键值状态同步机制,应对网络分区与积压,保障系统可观测性
经验流系统与分级存储数据管道:研发内存优先 + 分级存储(内存/SSD/远端)的经验回放缓冲系统,支持海量轨迹(含状态、动作、奖励、优势值、工具调用结果等)的实时持久化、优先级采样与流式回放,应对数据倾斜与 I/O 瓶颈
针对多模态异构数据设计压缩传输与零拷贝序列化方案
混合负载调度与资源弹性:设计在线弹性扩缩容与资源池动态切分调度器,实现推理生成、环境交互与梯度更新的异步并行与资源错峰复用,最大化集群整体利用率
支持 CPU 密集型环境模拟与 GPU 密集型推理/训练的资源隔离与超卖控制,降低硬件成本
沙箱安全、容错与长稳运行:构建轻量级执行沙箱,实现动作白名单、越权拦截、资源配额与超时控制,防范系统风险
嵌入端到端加密、访问令牌与审计日志,保障数据安全
设计自动 Checkpoint、异常恢复、节点与环境实例热迁移、部分故障降级机制,保障数天至数周训练任务的持续收敛与数据一致性
【课题价值】
大幅提升 RLVR/AgentRL 后训练效率:通过异步流水线与动态调度,缩短 PPO/GRPO 迭代周期,同时提升异步AgentRL 多轮交互训练吞吐,加速智能体策略研发与验证
突破系统扩展瓶颈:支撑千亿级主模型与多辅助模型协同后训练,同时支持十万级环境实例与千亿参数策略网络的 AgentRL 任务,形成适配超大规模混合集群的自研 RL 工程方案,赋能公司智能体产品线规模化部署
显著降低硬件成本:利用推理-训练-环境三者的资源错峰与弹性复用,提升 GPU 集群有效利用率,大幅降低大模型对齐与智能体部署的综合运行开销
输出学术论文、开源模块与最佳实践:为开源社区贡献核心系统优化,推动 RL 工程化标准演进,提升公司在 RL Infra 方向的行业影响力
优先资格
有 DeepSpeed/Megatron-LM/vLLM/sglang 二次开发经验者优先
有 RLHF/RLVR/AgentRL 全链路工程落地经验者优先
有 Kubernetes/Slurm 集群编排经验者优先
在 ICLR/NeurIPS/ICML 等顶会发表分布式训练、系统优化、RL 或智能体相关论文者优先
拥有开源 RL 训练框架(verl/slime/OpenRLHF)或 AgentRL 框架贡献经验,推理引擎深度集成或沙箱技术贡献者优先
AI 洞察
优缺点分析
优点
- 公司平台大,资源充足,有机会接触千亿级模型和十万级并发环境的真实场景
- 鼓励开源和学术输出,可发表顶会论文,提升个人在AI工程社区的影响力
- 课题难度大,涉及分布式系统、强化学习、高性能计算等多领域交叉,学习曲线陡峭
- 实习岗位,若表现优异可能转正,但需长期投入,时间成本大
缺点 / 挑战
- 前沿技术领域,课题挑战大,能够深度参与大模型RL基础设施的核心研发,技术积累价值极高
- 工作强度可能较高,需要解决实际工业集群中的复杂工程问题,抗压能力要求高
- 适合对系统底层技术有强烈热情、具备扎实编程和分布式基础、愿意深入挑战硬核工程问题的在校硕博生
角色解读
- 在RL Infra领域积累稀缺的系统设计经验,可成长为分布式系统架构师或AI基础设施专家
- 有机会参与顶会论文发表和开源项目贡献,提升行业影响力,为未来进入顶尖AI实验室或创业奠定基础
- 内部可横向拓展至算法、推理引擎、平台工程等方向,职业发展路径宽泛
- 设计并实现大模型强化学习后训练的基础设施,包括异步流水线、资源调度和分布式通信优化,解决多模型并存和长期训练的系统瓶颈
- 开发支持十万级并发环境实例的AgentRL系统,处理环境编排、状态管理、容错恢复等复杂问题,保障大规模训练任务稳定运行
- 优化GPU集群利用率,通过弹性扩缩容、显存感知调度和分级存储等方案降低训练成本,提升整体迭代效率
- 扎实的深度学习与强化学习基础,熟悉PPO、GRPO等主流后训练算法及Transformer/MoE架构
- 精通C/C++或Python,熟练使用PyTorch,并有分布式训练框架(如DeepSpeed、Megatron-LM)的实操经验
- 熟悉分布式系统、集合通信、Kubernetes/Slurm等集群编排工具,具备大规模GPU集群调优能力
申请策略
- 关注科大讯飞在星火大模型上的战略布局,理解RL Infra的商业价值
- 在简历和面试中展现对课题挑战的深入思考,例如提出自己的系统设计思路
- 重点突出分布式系统、RL训练框架(如RLHF/PPO)相关的项目经历,特别是涉及大规模GPU集群调优的案例
- 展示对PyTorch、DeepSpeed、vLLM等工具的深入使用和二次开发经验,体现工程能力
- 强调开源贡献或顶会论文,这是加分项
- 若没有,可突出独立解决复杂系统问题的能力
- 提前熟悉vLLM、sglang等推理引擎的架构和源码
- 深入了解AgentRL场景下环境并行和KV Cache管理的常见方案
面试指南
- 分析问题本质:先拆解问题背后的系统瓶颈(如通信开销、资源失衡、I/O瓶颈),再针对性地给出解决方案
- 结构化表述:结合具体场景,说明方案的技术选型、实现路径和预期效果,必要时补充权衡取舍
- 强调落地性:展示你对现有框架(如DeepSpeed、vLLM)的熟悉程度,并说明如何与算法深度结合
- 请简要描述PPO算法的主要流程,以及分布式训练中如何实现优势计算和策略更新?
- 在设计大规模RL训练系统时,如何解决推理和训练的速度失配问题?
- 面对多模型并存导致的显存不足,你会采取哪些策略?
- 请谈谈你对Kubernetes在RL训练中编排资源池的理解,以及如何实现弹性扩缩容?
- 如果让你设计一个AgentRL环境状态存储系统,你会如何权衡性能与一致性?
职位点评
73
综合评分
前沿RL Infra课题,技术成长极高,现场办公,薪资未明,适合硬核技术爱好者。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
最适合追求技术深度和前沿挑战、对薪酬敏感度较低的在校硕博生。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利45
成长发展95
工作生活55
使命价值78
薪资福利
45较低
岗位未明确薪资和福利,实习薪资可能不高,但公司平台大,转正后薪酬有竞争力。整体补偿性满足有限。
薪资信号未披露(AI估算:3K-6K/月)
成长发展
95较高
岗位处于AI Infra前沿领域,课题挑战顶尖,技术成长和学术机会多,发展性动机得到极强满足。
技术前沿前沿/新兴技术
技术栈PPO、GRPO、Transformer、MoE、PyTorch、DeepSpeed、Megatron-LM、vLLM、sglang、Kubernetes、Slurm、分布式系统
业务类型ambiguous
工作生活
55较低
要求现场办公,地点为合肥或北京,未提及弹性工作或远程,WLB信号不足。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
78中等
课题致力于提升RL训练效率、降低硬件成本,并推动开源和学术进步,社会与技术意义较强,但未明确直接社会效益。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs