Ant Group logo
蚂蚁集团
蚂蚁集团-AReaL强化学习框架研发工程师-北京/杭州

蚂蚁集团-AReaL强化学习框架研发工程师-北京/杭州

发布于 大约 8 小时前

普通员工/个人贡献者

北京市 / 杭州市
专家级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Agent工程
Areal
Claude Code
Deepspeed
Megatron-Lm
Opencode
Sglang
Vllm
分布式训练

AI 估算 · 35k–65k

大厂核心研发岗,技术壁垒高,强化学习框架稀缺性强,薪资对标阿里P7-P8水平。

职位详情

关于这个职位

该职位负责蚂蚁集团自研的 AReaL 强化学习开源框架的核心开发与生态建设

你将深度参与 Agent 工具集成、模型适配、分布式训练优化等前沿工作,推动大模型强化学习在真实场景落地
适合具备大模型分布式框架开发经验、熟悉 RL 或 Agent 工程的技术专家

最低要求

具备大模型训练框架或分布式推理框架开发经验

熟悉 Megatron-LM、DeepSpeed 等分布式训练框架,或具备 SGLang、vLLM 等大模型分布式推理与推理加速框架开发经验者优先
具备良好的逻辑分析能力,对复杂框架的模块设计、抽象边界和工程实现有一定理解
具备规范的代码提交习惯,熟悉 GitHub 协作流程,有开源社区积极参与经验者优先
具备大模型强化学习框架相关经验者优先,例如 AReaL、veRL、Slime 等, 对RL流程熟悉者优先
熟悉 Agent 工程或 AI Coding Agent 工具链者优先,例如 Claude Code、OpenCode 等,有相关开发或使用经验者优先

工作职责

负责将 Agent 开发工具集成到 AReaL 框架中,打通外部工具调用与内部训练体系之间的链路,支持 Agent工具在强化学习训练流程中的使用

参与 AReaL 开源框架的开发与维护,在 GitHub 上推进开源版本迭代,包括功能开发、文档编写、用户反馈的响应
负责主流 AI 模型在 AReaL 框架上的适配工作,包括模型迁移、训练与推理环境配置、运行链路打通,确保模型能够在 AReaL 中稳定、高效运行
系统性能优化:针对大模型强化学习训练和推理场景,进行端到端性能分析和优化,包括分布式训练加速、显存优化、通信效率提升等,满足大规模 Agent 训练的性能要求

AI 洞察

优缺点分析

优点

  • 前沿技术栈:直接参与强化学习和 Agent 工程最前沿,技术积累含金量高
  • 大厂平台:蚂蚁集团资源丰富,数据与算力支持充足,成果易落地
  • 开源影响力:AReaL 是开源项目,贡献成果可在全球 AI 社区获得认可
  • 技术门槛极高:需要同时掌握分布式系统、大模型训练、RL 和 Agent 工程,学习曲线陡峭

缺点 / 挑战

  • 工作强度可能较大:作为核心研发,需快速迭代并响应社区反馈,可能面临较大压力
  • 适合技术扎实、热爱挑战的工程师,特别是对分布式训练、强化学习或 AI Agent 有浓厚兴趣,希望在大厂前沿团队中快速成长的人

角色解读

  • 技术深耕:成为大模型分布式训练和强化学习领域的顶尖专家,主导核心框架设计与迭代
  • 影响力扩展:通过开源社区积累声誉,成为 AI 基础设施领域的意见领袖
  • 管理方向:带团队负责更大规模的框架或平台研发,转型技术管理
  • 开发并维护 AReaL 强化学习开源框架,集成 Agent 工具链,实现外部工具与训练体系的打通
  • 负责主流大模型在 AReaL 上的适配,包括模型迁移、环境配置与运行链路优化
  • 针对大模型强化学习训练和推理场景进行端到端性能优化,如分布式训练加速、显存与通信效率提升
  • 精通大规模分布式训练框架(如 Megatron-LM、DeepSpeed)或推理加速框架(如 vLLM、SGLang)
  • 熟悉强化学习基本流程及框架(如 AReaL、veRL),具备 AI Agent 工程经验者更佳
  • 具备扎实的系统性能分析和优化能力,了解 GPU 底层原理及并行策略
  • 良好的工程习惯和开源协作能力,熟悉 GitHub 工作流

申请策略

  • 在求职信中表达对开源的热情和具体贡献计划,展示对 AReaL 社区的了解
  • 提前熟悉 GitHub 上的 AReaL 仓库,关注现有的 issues 和 PR,可以在面试中提出改进思路
  • 突出分布式训练或推理框架的开发经验,详细描述你在 Megatron-LM、DeepSpeed、vLLM 等项目中的具体贡献
  • 展示你在强化学习领域的项目经历,包括 RL 训练流程、算法实现或工具链开发
  • 强调开源贡献经历,附上 GitHub 链接和代表性 PR/Issue
  • 提及 Agent 工程相关的经验,如使用或开发过 Claude Code、OpenCode 等工具
  • 如果还不熟悉 RL 框架,可以快速上手 AReaL 或 veRL,理解其训练流程和代码结构
  • 补充分布式训练性能优化的知识,例如并行策略(TP、PP、DP)、显存优化技术

面试指南

  • 对于技术原理类问题,从整体架构到细节逐步展开,结合具体参数和场景
  • 对于项目经验类问题,使用 STAR 法则(情境、任务、行动、结果)清晰叙述
  • 对于设计类问题,先明确设计目标,再拆解模块和接口,最后考虑性能与扩展性
  • 请详细解释 Megatron-LM 中的张量并行和流水线并行是如何工作的?
  • 在强化学习训练大模型时,如何解决奖励稀疏或不稳定的问题?
  • 你如何设计一个 Agent 工具集成到训练框架中?请描述关键链路
  • 请分析大模型推理时显存瓶颈在哪里,有哪些优化手段?
  • 描述你参与开源社区的一次经历,如何解决冲突或推动合并?

职位点评

77
综合评分

大厂核心、前沿强化学习框架、开源生态、技术成长极快,但工作强度可能较高。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术突破和快速成长,不太在意工作生活平衡的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值75

薪资福利

85较高

大厂核心岗位薪资具有强竞争力,但具体薪资未公开,需面议。福利未在JD中明确,但蚂蚁集团通常提供五险一金、补充医疗等。

薪资信号未披露(AI估算:35K-65K/月)

成长发展

95较高

该职位处于AI最前沿的强化学习与Agent技术领域,技术栈现代且稀缺,成长空间巨大。

技术前沿前沿/新兴技术
技术栈AReaL、强化学习、Megatron-LM、DeepSpeed、SGLang、vLLM、分布式训练、Agent工程
业务类型profit_center

工作生活

40较低

JD未提及远程或弹性工作,且大厂核心研发通常面临较高强度,WLB可能一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

75中等

推动强化学习框架开源和生态建设,技术影响力强,但直接的社会价值不太明显。

行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
Watch Jobs