iFLYTEK logo
科大讯飞
【星火X计划】面向通用大模型智能体强化学习的Infra工程(J13800)

【星火X计划】面向通用大模型智能体强化学习的Infra工程(J13800)

发布于 大约 8 小时前

普通员工/个人贡献者

合肥市 / 北京市
无经验要求
全职员工
仅现场办公
硕士
机器学习工程
Deepspeed
Grpo
Ppo
Pytorch
Rlhf
Vllm
分布式训练
大模型
强化学习

AI 估算 · 25k–45k

大模型Infra方向技术稀缺,顶尖计划薪酬竞争力强,结合城市水平综合估算。

职位详情

关于这个职位

加入科大讯飞星火X计划,负责大模型强化学习(RL)基础设施的研发,致力于解决多模型混合训练、十万级环境并行、显存管理、通信优化等核心难题,直接推动 RLVR/AgentRL 技术落地

适合对系统架构和深度学习有深厚兴趣、勇于挑战前沿难题的工程师

最低要求

-27届硕士及以上学历,人工智能、计算机科学、分布式系统、数学、高性能计算等相关专业

其他专业但具备突出工程能力者同样欢迎
扎实的深度学习与强化学习基础,熟悉 PPO、GRPO、DPO、REINFORCE 等后训练算法及在线/多智能体 RL 范式,深入理解 Transformer/MoE 架构与分布式并行范式
精通 C/C++ 或 Python,熟练 PyTorch
熟悉分布式通信与集合通信拓扑优化,具备大规模 GPU 集群调优经验
具备分布式系统、高性能网络、存储或资源调度背景
拥有独立建模、系统架构设计与大规模实验能力,能搭建端到端 RL 评测基线,对标前沿方案并提出创新解法
良好跨团队协作能力,能协同算法、模型、推理、环境模拟与业务团队推进落地,具备解决工业集群复杂工程瓶颈的抗压能力

工作职责

高吞吐生成与多轮推理加速:设计异步流水线生成服务,使推理与训练过程解耦匹配,降低生成等待时延

针对 AgentRL 多轮交互,实现 KV Cache 增量复用、跨轮注意力掩码管理及长上下文显存换入换出,显著降低推理延迟,支持长期决策与复杂工具调用链调用
多模型混合部署与显存管理:制定动态换入换出、参数分片与共享、显存感知调度策略,在有限显存下承载策略/价值/参考/奖励/验证器及环境编码器等组件,避免显存溢出与碎片化
实现多组件协同下的显存弹性分配,兼顾计算效率与模型规模
大规模环境并行与状态管理:支持十万级并发环境实例(浏览器沙箱、代码解释器等)的编排、生命周期管理、状态快照/恢复,设计轻量化环境抽象层、环境池预热与弹性扩缩容策略
解决异构状态(文本、结构化、工具结果)的序列化、压缩传输与版本管理,降低 I/O 与存储开销
分布式 RL 算法系统化与通信优化:将 PPO/GRPO 的优势计算、重要性采样、KL 惩罚等环节映射到张量/数据并行策略,设计 All-Reduce 与 All-Gather 协同的异构通信拓扑,降低多模型同步开销
在 Actor-Rollout 解耦架构下构建异步消息队列与键值状态同步机制,应对网络分区与积压,保障系统可观测性
经验流系统与分级存储数据管道:研发内存优先 + 分级存储(内存/SSD/远端)的经验回放缓冲系统,支持海量轨迹(含状态、动作、奖励、优势值、工具调用结果等)的实时持久化、优先级采样与流式回放,应对数据倾斜与 I/O 瓶颈
针对多模态异构数据设计压缩传输与零拷贝序列化方案
混合负载调度与资源弹性:设计在线弹性扩缩容与资源池动态切分调度器,实现推理生成、环境交互与梯度更新的异步并行与资源错峰复用,最大化集群整体利用率
支持 CPU 密集型环境模拟与 GPU 密集型推理/训练的资源隔离与超卖控制,降低硬件成本
沙箱安全、容错与长稳运行:构建轻量级执行沙箱,实现动作白名单、越权拦截、资源配额与超时控制,防范系统风险
嵌入端到端加密、访问令牌与审计日志,保障数据安全
设计自动 Checkpoint、异常恢复、节点与环境实例热迁移、部分故障降级机制,保障数天至数周训练任务的持续收敛与数据一致性

优先资格

有 DeepSpeed/Megatron-LM/vLLM/sglang 二次开发经验者优先

有 RLHF/RLVR/AgentRL 全链路工程落地经验者优先
有 Kubernetes/Slurm 集群编排经验者优先
在 ICLR/NeurIPS/ICML 等顶会发表分布式训练、系统优化、RL 或智能体相关论文者优先
拥有开源 RL 训练框架(verl/slime/OpenRLHF)或 AgentRL 框架贡献经验,推理引擎深度集成或沙箱技术贡献者优先

AI 洞察

优缺点分析

优点

  • 公司平台大,星火X计划资源倾斜,有顶尖导师和团队支持
  • 可贡献开源项目并发表顶会论文,扩大行业影响力
  • 薪资福利有竞争力,职业起点高
  • 课题技术难度大,涉及分布式系统、强化学习、高性能计算多个领域,学习曲线陡峭
  • 对综合能力要求高,需要协调算法、模型、工程等多团队协作

缺点 / 挑战

  • 站在大模型基础设施技术前沿,课题具有挑战性和高价值,个人技术成长快
  • 工作强度可能较高,需应对复杂工程瓶颈和长时间训练任务的压力
  • 适合兼具扎实系统功底和深度强化学习兴趣,愿意挑战高难度基础设施难题,并希望在AI Infra赛道长期发展的优秀人才

角色解读

  • 作为星火X顶尖人才计划成员,获得公司核心资源投入,可快速成长为RL Infra领域专家
  • 有机会参与顶会论文发表和开源项目贡献,提升技术影响力
  • 未来可向技术专家或技术管理方向发展,领导大型分布式系统团队
  • 设计并实现面向大模型RL后训练的高性能异步流水线系统,优化推理与训练的解耦和并行效率
  • 开发多模型混合部署的显存管理机制,包括动态换入换出、参数分片和显存感知调度
  • 构建支持十万级并发环境实例的分布式编排和状态管理,确保AgentRL任务稳定运行
  • 优化分布式通信拓扑和资源调度,提升GPU集群利用率和系统容错能力
  • 扎实的深度学习和强化学习基础,熟悉PPO/GRPO/DPO等算法及Transformer/MoE架构
  • 精通C/C++或Python,熟练使用PyTorch,并有DeepSpeed/vLLM等框架的二次开发能力
  • 熟悉分布式系统、高性能网络和集合通信,具备大规模GPU集群调优经验
  • 了解Kubernetes/Slurm等集群编排工具,能进行资源调度和故障恢复设计

申请策略

  • 关注科大讯飞星火X计划的招聘流程,准备针对性项目案例
  • 了解企业业务方向,将经验与讯飞大模型平台结合阐述
  • 突出深度学习和强化学习项目经历,特别是涉及RLHF/AgentRL的工程实践
  • 强调分布式训练或系统优化项目,如大规模GPU集群调优、通信优化等
  • 展示开源贡献或论文发表,体现技术深度和社区影响力
  • 注明对PPO/GRPO、vLLM/DeepSpeed等工具的熟练掌握和二次开发经验
  • 提前学习RL Infra相关技术栈,如vLLM、DeepSpeed、OpenRLHF等,尝试复现和改造
  • 深入理解PPO/GRPO等算法的计算流程,并动手实现简化版RL训练管线

面试指南

  • 使用STAR法则:说清场景、任务、行动、结果,突出技术方案和量化效果
  • 系统设计问题:从需求分析、瓶颈识别、架构选型、关键模块设计到实现细节,逐步展开
  • 挑战类问题:强调思考过程和权衡,体现解决问题的闭环
  • 请介绍你在RL训练或分布式系统方面的实践项目,遇到了哪些挑战?
  • 如何设计一个支持千亿参数多模型混合训练的显存管理策略?
  • 在AgentRL场景中,如何处理推理与训练速度失配和长上下文问题?
  • 你如何优化分布式训练中的通信开销?请结合具体场景说明
  • 如果集群出现节点故障,如何保证训练任务不中断且数据一致?

职位点评

72
综合评分

大模型RL Infra前沿岗位,顶尖人才计划,技术成长性极高,但工作地点固定且无明确WLB信号。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合重视技术成长、追求前沿挑战的求职者,对薪资和灵活度有合理预期。
表现最好
成长发展
相对薄弱
工作生活
薪资福利72
成长发展88
工作生活45
使命价值70

薪资福利

72中等

公司为上市公司,星火X计划通常提供有竞争力的薪酬,但JD未披露具体薪资和福利,稳定性较好。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

88较高

前沿技术课题、顶尖人才计划、论文与开源机会,技术成长空间极大。

技术前沿前沿/新兴技术
技术栈PPO、GRPO、RLHF、Transformer、MoE、PyTorch、DeepSpeed、vLLM、Kubernetes
成长机会星火X顶尖AI人才计划、输出学术论文、开源模块与最佳实践
业务类型ambiguous

工作生活

45较低

工作地点固定(合肥/北京),无远程工作,JD未提及WLB,加班情况不明。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

大模型智能体技术处于高速增长赛道,但JD未强调社会价值导向,创新性较强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs