
蚂蚁集团
蚂蚁数字科技-数科技术部-大模型强化学习研发专家
蚂蚁数字科技-数科技术部-大模型强化学习研发专家
发布于 大约 14 小时前普通员工/个人贡献者
上海市 / 杭州市
专家级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Ai Agent
Areal
Deepspeed
Megatron-Lm
Sglang
Verl
Vllm
分布式训练
大模型
AI 估算 · 40k–60k
大模型强化学习专家稀缺,蚂蚁集团薪资竞争力强,上海杭州互联网高薪水平,16薪制。
职位详情
关于这个职位
该职位负责设计和开发实时高性能的强化学习框架,优化大模型训练和推理性能,与算法工程师协作提升分布式训练和推理效率
适合在大模型训练框架、分布式推理或强化学习领域有深入技术积累的研发专家,将参与蚂蚁数科的核心模型训练场景
最低要求
具备大模型训练框架或分布式推理框架开发经验,熟悉 Megatron-LM、DeepSpeed 等分布式训练框架,或具备 SGLang、vLLM 等大模型分布式推理与推理加速框架开发经验者优先
具备大模型强化学习框架相关经验者优先,例如 AReaL、veRL、Slime 等,对RL流程熟悉者优先
具备良好的逻辑分析能力,对复杂框架的模块设计、抽象边界和工程实现有一定理解,热爱技术且对强化学习领域有深入钻研优先
熟悉 Agent 工程或 AI Coding Agent 工具链者优先
有大模型训练经验优先
工作职责
负责实时高性能强化学习框架的设计与开发,服务蚂蚁数科的模型训练场景,如分布式训练加速策略、显存管理、算子融合、编译优化、模型量化、混合精度、异构硬件加速等
与算法工程师深度合作,针对大模型强化学习训练和推理场景,进行端到端性能分析和优化,包括分布式训练加速、显存优化、通信效率提升等,满足大规模 Agent 训练的性能要求
AI 洞察
优缺点分析
优点
- 蚂蚁集团技术实力强,能接触到海量业务场景和前沿的大模型技术栈
- 职位聚焦大模型强化学习这一热门方向,技术积累价值高,行业需求旺盛
- 薪资优厚,公司福利完善(如五险一金、补充医疗、年终奖等)
- 技术要求极高,需要同时掌握训练框架、推理框架和强化学习,学习曲线陡峭
- 工作强度可能较大,涉及复杂的性能优化和迭代交付,需要较强的抗压能力
- 需要与算法、工程等多团队紧密协作,沟通协调要求高
- 适合拥有深厚系统底层功底、热爱技术钻研、对大规模分布式训练和强化学习有强烈兴趣的资深研发工程师
缺点 / 挑战
暂无明显挑战项
角色解读
- 纵向深化:成为大模型训练/推理基础设施领域的顶尖专家,主导核心框架设计与优化
- 横向拓展:向 AI 系统架构师方向发展,覆盖更多 AI 基础设施(如推理平台、训练平台)
- 管理路径:未来可带领团队负责整个 AI 训练/推理框架的研发和落地
- 设计和实现高性能强化学习框架,优化分布式训练和推理的加速策略、显存管理、算子融合等底层技术
- 与算法工程师协作,针对大模型强化学习训练和推理场景进行端到端性能分析和优化,提升训练效率和推理速度
- 探索和集成最新的模型量化、混合精度、异构硬件加速等技术,满足大规模 Agent 训练的性能需求
- 精通大模型训练框架(如 Megatron-LM、DeepSpeed)或分布式推理框架(如 SGLang、vLLM),能进行二次开发
- 熟悉强化学习框架(如 AReaL、veRL、Slime)和 RL 训练流程,有实际优化经验
- 具备系统性能分析能力,包括显存优化、通信效率提升、算子融合等底层优化技能
- 对 Agent 工程或 AI Coding Agent 工具有一定了解,能配合算法团队完成端到端优化
申请策略
- 建议提前了解蚂蚁数科的业务方向(如金融、Agent),在面试中展示对业务场景的理解和适配
- 准备一个完整的技术案例,从问题分析、方案设计到性能提升效果,体现系统化思维
- 突出在大模型训练/推理框架(如 Megatron、DeepSpeed、vLLM)上的具体贡献,例如性能优化案例、代码贡献或核心模块设计
- 强调强化学习框架的实践经验,包括使用 AReaL、veRL 等框架进行训练或优化的项目
- 展示分布式系统性能优化能力,如显存管理、通信加速、算子融合等方面的成果
- 列出参与的大模型相关项目,尤其是涉及 Agent 或 AI Coding 的场景,体现技术广度
- 补充或加深对主流强化学习框架(如 veRL、AReaL)的源码理解和二次开发能力
- 学习高性能计算优化技巧,如 CUDA 编程、算子融合、混合精度训练等
面试指南
- 对于技术实现问题,采用 STAR 法则:先说明背景和目标,然后描述具体方案和技术选型,再展示量化结果和对比,最后总结经验和教训
- 对于设计类问题,从需求出发,先分析关键约束(如性能、可扩展性、易用性),再给出分层设计或模块划分,最后讨论 trade-off
- 请详细描述你在大模型分布式训练框架上的优化经验,具体解决了哪些性能瓶颈?
- 你如何在训练和推理中优化显存使用?请举例说明
- 请谈谈对 RLHF 或强化学习训练流程的理解,以及在大规模场景下的挑战
- 假如需要设计一个支持大规模 Agent 训练的强化学习框架,你会考虑哪些关键设计?
- 你如何评估和选择不同的分布式策略(如数据并行、模型并行、流水线并行)?
- 复习 Megatron-LM 和 DeepSpeed 的论文及源码,特别是分布式策略和显存优化部分
职位点评
75
综合评分
大厂核心算法基础设施岗位,前沿技术栈、高薪资,但工作强度大、灵活性低。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和前沿方向、重视薪资和成长、能接受高强度和现场办公的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活40
使命价值70
薪资福利
85较高
该职位薪资水平较高,蚂蚁集团福利完善(五险一金、补充医疗等),但薪资未在JD中明确,综合判断补偿性动机满足较好。
薪资信号未披露(AI估算:40K-60K/月)
成长发展
90较高
职位聚焦大模型强化学习这一前沿技术,技术栈新颖,有大量成长机会,但JD中未明确提及培训或晋升通道。
技术前沿前沿/新兴技术
技术栈大模型、强化学习、分布式训练、Megatron-LM、DeepSpeed、SGLang、vLLM
业务类型profit_center
工作生活
40较低
职位要求现场办公,未提及远程或弹性工作,暗示可能强度较大,生活化动机满足有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
蚂蚁数科在金融科技领域有重要影响力,但JD未强调社会价值,意义感动机中等。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs