Ant Group logo
蚂蚁集团
蚂蚁数字科技-数科技术部-大模型强化学习研发专家

蚂蚁数字科技-数科技术部-大模型强化学习研发专家

发布于 大约 14 小时前

普通员工/个人贡献者

上海市 / 杭州市
专家级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Ai Agent
Areal
Deepspeed
Megatron-Lm
Sglang
Verl
Vllm
分布式训练
大模型

AI 估算 · 40k–60k

大模型强化学习专家稀缺,蚂蚁集团薪资竞争力强,上海杭州互联网高薪水平,16薪制。

职位详情

关于这个职位

该职位负责设计和开发实时高性能的强化学习框架,优化大模型训练和推理性能,与算法工程师协作提升分布式训练和推理效率

适合在大模型训练框架、分布式推理或强化学习领域有深入技术积累的研发专家,将参与蚂蚁数科的核心模型训练场景

最低要求

具备大模型训练框架或分布式推理框架开发经验,熟悉 Megatron-LM、DeepSpeed 等分布式训练框架,或具备 SGLang、vLLM 等大模型分布式推理与推理加速框架开发经验者优先

具备大模型强化学习框架相关经验者优先,例如 AReaL、veRL、Slime 等,对RL流程熟悉者优先
具备良好的逻辑分析能力,对复杂框架的模块设计、抽象边界和工程实现有一定理解,热爱技术且对强化学习领域有深入钻研优先
熟悉 Agent 工程或 AI Coding Agent 工具链者优先
有大模型训练经验优先

工作职责

负责实时高性能强化学习框架的设计与开发,服务蚂蚁数科的模型训练场景,如分布式训练加速策略、显存管理、算子融合、编译优化、模型量化、混合精度、异构硬件加速等

与算法工程师深度合作,针对大模型强化学习训练和推理场景,进行端到端性能分析和优化,包括分布式训练加速、显存优化、通信效率提升等,满足大规模 Agent 训练的性能要求

AI 洞察

优缺点分析

优点

  • 蚂蚁集团技术实力强,能接触到海量业务场景和前沿的大模型技术栈
  • 职位聚焦大模型强化学习这一热门方向,技术积累价值高,行业需求旺盛
  • 薪资优厚,公司福利完善(如五险一金、补充医疗、年终奖等)
  • 技术要求极高,需要同时掌握训练框架、推理框架和强化学习,学习曲线陡峭
  • 工作强度可能较大,涉及复杂的性能优化和迭代交付,需要较强的抗压能力
  • 需要与算法、工程等多团队紧密协作,沟通协调要求高
  • 适合拥有深厚系统底层功底、热爱技术钻研、对大规模分布式训练和强化学习有强烈兴趣的资深研发工程师

缺点 / 挑战

暂无明显挑战项

角色解读

  • 纵向深化:成为大模型训练/推理基础设施领域的顶尖专家,主导核心框架设计与优化
  • 横向拓展:向 AI 系统架构师方向发展,覆盖更多 AI 基础设施(如推理平台、训练平台)
  • 管理路径:未来可带领团队负责整个 AI 训练/推理框架的研发和落地
  • 设计和实现高性能强化学习框架,优化分布式训练和推理的加速策略、显存管理、算子融合等底层技术
  • 与算法工程师协作,针对大模型强化学习训练和推理场景进行端到端性能分析和优化,提升训练效率和推理速度
  • 探索和集成最新的模型量化、混合精度、异构硬件加速等技术,满足大规模 Agent 训练的性能需求
  • 精通大模型训练框架(如 Megatron-LM、DeepSpeed)或分布式推理框架(如 SGLang、vLLM),能进行二次开发
  • 熟悉强化学习框架(如 AReaL、veRL、Slime)和 RL 训练流程,有实际优化经验
  • 具备系统性能分析能力,包括显存优化、通信效率提升、算子融合等底层优化技能
  • 对 Agent 工程或 AI Coding Agent 工具有一定了解,能配合算法团队完成端到端优化

申请策略

  • 建议提前了解蚂蚁数科的业务方向(如金融、Agent),在面试中展示对业务场景的理解和适配
  • 准备一个完整的技术案例,从问题分析、方案设计到性能提升效果,体现系统化思维
  • 突出在大模型训练/推理框架(如 Megatron、DeepSpeed、vLLM)上的具体贡献,例如性能优化案例、代码贡献或核心模块设计
  • 强调强化学习框架的实践经验,包括使用 AReaL、veRL 等框架进行训练或优化的项目
  • 展示分布式系统性能优化能力,如显存管理、通信加速、算子融合等方面的成果
  • 列出参与的大模型相关项目,尤其是涉及 Agent 或 AI Coding 的场景,体现技术广度
  • 补充或加深对主流强化学习框架(如 veRL、AReaL)的源码理解和二次开发能力
  • 学习高性能计算优化技巧,如 CUDA 编程、算子融合、混合精度训练等

面试指南

  • 对于技术实现问题,采用 STAR 法则:先说明背景和目标,然后描述具体方案和技术选型,再展示量化结果和对比,最后总结经验和教训
  • 对于设计类问题,从需求出发,先分析关键约束(如性能、可扩展性、易用性),再给出分层设计或模块划分,最后讨论 trade-off
  • 请详细描述你在大模型分布式训练框架上的优化经验,具体解决了哪些性能瓶颈?
  • 你如何在训练和推理中优化显存使用?请举例说明
  • 请谈谈对 RLHF 或强化学习训练流程的理解,以及在大规模场景下的挑战
  • 假如需要设计一个支持大规模 Agent 训练的强化学习框架,你会考虑哪些关键设计?
  • 你如何评估和选择不同的分布式策略(如数据并行、模型并行、流水线并行)?
  • 复习 Megatron-LM 和 DeepSpeed 的论文及源码,特别是分布式策略和显存优化部分

职位点评

75
综合评分

大厂核心算法基础设施岗位,前沿技术栈、高薪资,但工作强度大、灵活性低。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和前沿方向、重视薪资和成长、能接受高强度和现场办公的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活40
使命价值70

薪资福利

85较高

该职位薪资水平较高,蚂蚁集团福利完善(五险一金、补充医疗等),但薪资未在JD中明确,综合判断补偿性动机满足较好。

薪资信号未披露(AI估算:40K-60K/月)

成长发展

90较高

职位聚焦大模型强化学习这一前沿技术,技术栈新颖,有大量成长机会,但JD中未明确提及培训或晋升通道。

技术前沿前沿/新兴技术
技术栈大模型、强化学习、分布式训练、Megatron-LM、DeepSpeed、SGLang、vLLM
业务类型profit_center

工作生活

40较低

职位要求现场办公,未提及远程或弹性工作,暗示可能强度较大,生活化动机满足有限。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

蚂蚁数科在金融科技领域有重要影响力,但JD未强调社会价值,意义感动机中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs