Ant Group logo
蚂蚁集团
蚂蚁国际-预训练专家-生成式AI算法 / 支付行业模型预训练方向

蚂蚁国际-预训练专家-生成式AI算法 / 支付行业模型预训练方向

发布于 大约 8 小时前

普通员工/个人贡献者

上海市 / 杭州市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Deepspeed
Llm
Megatron-Lm
Pytorch
分布式训练
大模型预训练
强化学习
推荐系统
生成式Ai

AI 估算 · 40k–70k

资深AI算法专家,大模型方向热门,蚂蚁集团平台,一线城市薪资,40-70K/月。

职位详情

关于这个职位

该职位负责蚂蚁国际支付成功率算法团队中生成式AI大模型的端到端建模与预训练/后训练,涉及LLM、强化学习、分布式训练等前沿技术

需要3年以上经验,精通Python/PyTorch,对预训练、SFT/DPO/GRPO等有深入理解
适合追求技术深度和顶会论文产出的算法专家

最低要求

任职要求

计算机、人工智能或相关专业硕士及以上学历,3年算法或 AI 系统相关研发经验
精通 Python 与 PyTorch
扎实的大模型与推荐系统理论基础,能从论文级直接对话到工程落地
算法方向:在LLM预训练、后训练对齐闭环上有一线核心经验,熟悉序列建模、生成式排序、SFT/DPO/GRPO、奖励模型、因果推断与反事实评估等关键技术
框架方向:在分布式训练(DP/TP/PP/EP、ZeRO、混合精度、NCCL/RDMA)或高性能推理(动态批处理、PagedAttention、量化、投机解码、模型蒸馏)上有深度实践,主流训推框架(DeepSpeed/Megatron-LM 等)有核心模块研发经验
在所选方向上具备公认的技术影响力,能独立定义技术路线并解决复杂工程问题

工作职责

职位描述

主导生成式推荐与支付领域大模型的端到端建模与预训练/后训练全链路
持续跟踪生成式 AI、LLM、强化学习与高性能系统等领域的最新进展,推动技术创新与顶会论文产出
与算法、工程、业务团队紧密协作,将前沿研究快速工程化落地,驱动业务核心指标增长

优先资格

加分项

在 KDD、RecSys、WWW、SIGIR、NeurIPS、ICML、ICLR 等顶会发表过相关论文
有主流开源框架(Hugging Face Transformers、vLLM、Megatron-LM、ColossalAI 等)的核心贡献经验
熟悉 Transformer、MoE 等大模型架构的底层实现与优化技巧

AI 洞察

优缺点分析

优点

  • 技术前沿,涉及大模型、强化学习等热门领域,个人成长快
  • 团队专注于支付成功率,业务影响直接,价值明确
  • 蚂蚁集团平台大,资源丰富,有论文和开源机会
  • 预训练模型训练成本高,工作强度可能较大
  • 对技术要求极高,需同时掌握算法和工程框架
  • 适合对生成式AI和预训练有深度热情,具备扎实算法和工程能力,能接受高强度研发工作的资深工程师

缺点 / 挑战

  • 需要持续跟踪新技术,保持创新压力

角色解读

  • 成为大模型预训练领域的资深专家,主导核心技术方向
  • 可向技术管理或首席科学家方向发展,引领团队技术布局
  • 通过顶会论文和开源贡献提升行业影响力
  • 主导支付领域大模型的预训练与后训练全流程,包括数据、模型、训练和评估
  • 将生成式AI技术应用于支付成功率优化,为商户提供智能决策
  • 与工程和业务团队协作,将研究落地为线上系统,驱动业务指标增长
  • 精通Python与PyTorch,具备扎实的深度学习基础
  • 熟悉LLM预训练、SFT/DPO/GRPO等对齐技术,以及分布式训练框架
  • 掌握模型推理优化技术,如量化、PagedAttention等

申请策略

  • 准备一个完整的大模型训练案例,展示从数据到部署的链路
  • 关注蚂蚁国际业务,在面试中体现对支付决策场景的理解
  • 突出LLM预训练或后训练的项目经验,展示技术深度
  • 强调分布式训练或推理优化实践,体现工程能力
  • 附上顶会论文或开源贡献,增强竞争力
  • 熟悉DeepSpeed/Megatron-LM等框架,掌握分布式训练配置
  • 深入理解DPO/GRPO等对齐算法,了解因果推断基础
  • 了解支付或推荐业务场景,思考大模型如何落地

面试指南

  • 用STAR法则描述项目:情境、任务、行动、结果,突出技术难点和你的贡献
  • 对于算法问题,先给出整体思路,再深入细节,展示系统化思维
  • 遇到不会的问题,坦诚说明,并展示你的思考方向和解决路径
  • 请详细描述你参与过的一个LLM预训练项目,包括数据、模型、训练策略和遇到的问题
  • 如何设计一个生成式推荐模型?相比传统推荐有什么优势?
  • 在分布式训练中,你如何处理显存不足问题?请给出具体方案
  • 解释DPO和GRPO的区别和适用场景
  • 复习大模型基础,包括Transformer架构、训练技巧、推理优化

职位点评

74
综合评分

前沿AI预训练专家岗位,技术成长巨大,薪资优厚,但加班可能较常见。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和前沿突破的开发者,对薪资和稳定性也有较高预期,但需接受可能的工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利78
成长发展88
工作生活55
使命价值65

薪资福利

78中等

薪资水平预计较高,但JD未明确薪资福利细节,稳定性较好。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

88较高

技术前沿,有丰富的学习资源和论文产出机会,发展空间巨大。

技术前沿前沿/新兴技术
技术栈LLM、PyTorch、分布式训练、DeepSpeed、Megatron-LM、强化学习、推荐系统、SFT/DPO/GRPO、PagedAttention、量化
业务类型profit_center

工作生活

55较低

现场办公,未明确加班情况,预训练岗位可能强度较大,但大厂福利较好。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

支付智能化有助于商户降本增效,有一定商业价值,但社会意义不是特别突出。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs