Ant Group logo
蚂蚁集团
蚂蚁集团-大模型训练&推理加速-健康事业群

蚂蚁集团-大模型训练&推理加速-健康事业群

发布于 大约 14 小时前

普通员工/个人贡献者

上海市 / 杭州市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Cuda
Deepspeed
Gpu
Megatron
Pytorch
Tensorflow
大模型
推理加速
训练加速

AI 估算 · 35k–55k

蚂蚁集团大厂高级技术岗,大模型领域热度高,薪资竞争力强,参考市场水平月薪35k-55k。

职位详情

关于这个职位

该职位负责蚂蚁集团健康事业群的大模型训练和推理加速工作,涉及设计高效系统、优化算法和模型架构,利用GPU等硬件资源提升性能

适合对分布式机器学习有深入理解、擅长性能调优的技术专家

最低要求

深入理解机器学习算法和模型的原理和实践,包括常见的GPT-1、GPT-2、GPT-3、Transformer等

熟悉常见的机器学习框架,如 PyTorch、TensorFlow 等,并具有丰富的实际项目经验
熟悉常见的分布式机器学习框架,Megatron、DeepSpeed、HuggingFace
熟悉 GPU 和其他加速硬件的使用,有相关的性能调优经验,有FastTransformer、CUDA优化、TensorRT、Triton的一些经验更好
熟悉分布式计算和并行计算的概念和技术,有相关的实际经验
熟练使用编程语言,如 Python、C++ 等,在模型训练和推理的开发过程中有丰富的编码经验
具备良好的沟通和团队合作能力,能够与跨功能团队密切合作,解决问题并实现共同目标

工作职责

设计、开发和实现高效的大型模型训练和推理系统,以提高计算性能和加速模型收敛速度

与团队合作,优化算法和模型架构,以适应并充分利用硬件资源,如 GPU、TPU 等
进行模型性能分析和调优,识别和解决瓶颈问题,提高模型的训练和推理速度
实施并维护自动化工具和流程,以简化和加速模型训练和推理的部署过程
跟踪最新的研究进展和技术趋势,提出改进和创新的想法,推动团队的技术发展

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台实力雄厚,项目资源充足,能接触到前沿的大模型技术
  • 专注训练/推理加速,技术深度高,积累的核心经验在行业内极具价值
  • 健康事业群业务场景丰富,算法落地机会多,个人贡献影响力大
  • 大模型训练和推理对性能要求极高,调优难度大,需要持续学习新技术
  • 可能面临较大的工作强度和紧迫的项目周期,需要适应快速迭代的节奏
  • 岗位对综合能力要求高,需同时掌握算法、系统、硬件等多领域知识
  • 适合对高性能计算和大模型底层优化有浓厚兴趣,具备扎实工程功底和自驱力的技术极客

缺点 / 挑战

暂无明显挑战项

角色解读

  • 技术专家路线:深耕训练/推理加速,成为分布式系统或AI基础设施领域权威
  • 架构师路线:负责更大规模的模型训练平台设计,主导技术架构演进
  • 管理路线:带领团队攻克技术难题,逐步晋升为技术经理或总监
  • 设计并实现高效的大模型训练和推理系统,提升计算性能和模型收敛速度
  • 与团队合作优化模型架构,充分利用GPU/TPU等硬件资源
  • 进行性能分析与调优,解决计算瓶颈,并开发自动化部署工具
  • 深入理解Transformer等大模型原理及训练/推理流程
  • 精通PyTorch、TensorFlow等框架,及Megatron、DeepSpeed等分布式框架
  • 熟悉CUDA、TensorRT等GPU优化技术,具备性能调优经验
  • 熟练使用Python、C++,具备良好的工程实践能力

申请策略

  • 在简历中突出量化成果,如“将模型训练速度提升X%”或“降低推理延迟Y%”
  • 面试前复习经典论文(如GPT、BERT、Transformer),并了解蚂蚁集团在AI领域的布局
  • 突出大模型训练/推理相关项目经验,尤其是性能优化成果(如加速比、吞吐量提升)
  • 详细描述分布式框架(Megatron、DeepSpeed)和GPU优化(CUDA、TensorRT)的实际应用
  • 强调工程能力,如大规模集群上的稳定性、可扩展性设计
  • 系统学习CUDA编程和GPU架构,练习编写高性能kernel
  • 深入阅读Megatron-LM和DeepSpeed源码,理解分布式策略(数据并行、模型并行、流水线并行)
  • 熟悉LLM推理优化技术(如vLLM、FlashAttention、量化)

面试指南

  • 先明确问题所属领域(训练/推理/分布式),再分点阐述核心原理,结合具体案例说明
  • 对于性能优化问题,遵循“分析瓶颈→提出方案→实施验证→量化结果”的步骤
  • 对于架构设计问题,先考虑系统目标(吞吐、延迟、可扩展性),再比较不同方案优缺
  • 请解释Megatron-LM中的模型并行策略及其优缺点
  • 如何优化Transformer的推理速度?列举几种常用技术
  • 描述一次你通过CUDA优化显著提升性能的经历
  • 在多机多卡训练中,如何处理通信瓶颈?
  • 谈谈你对FlashAttention的理解及其如何加速注意力计算

职位点评

81
综合评分

大厂核心AI岗位,前沿技术栈,薪资优厚,但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和快速成长、对薪资有较高期望,且能接受高强度工作节奏的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利90
成长发展95
工作生活50
使命价值75

薪资福利

90较高

蚂蚁集团提供行业领先的薪资和福利,大模型岗位薪资处于市场高位,补偿性动机得到强力满足。

薪资信号偏高 (35K-55K/月)

成长发展

95较高

岗位聚焦大模型训练和推理加速,属前沿技术领域,能深度参与核心技术研发,成长空间巨大。

技术前沿前沿/新兴技术
技术栈大模型、训练加速、推理加速、分布式机器学习、GPU、CUDA、PyTorch、Megatron、DeepSpeed
业务类型profit_center

工作生活

50较低

工作地点在上海和杭州,需现场办公。大模型训练岗位通常加班较多,但JD未明确提及工作强度或弹性工作。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

75中等

健康事业群通过AI技术改善医疗健康,具有一定社会价值,大模型技术属于高速增长赛道。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs