
蚂蚁集团
蚂蚁集团-大模型训练&推理加速-健康事业群
蚂蚁集团-大模型训练&推理加速-健康事业群
发布于 大约 14 小时前普通员工/个人贡献者
上海市 / 杭州市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Cuda
Deepspeed
Gpu
Megatron
Pytorch
Tensorflow
大模型
推理加速
训练加速
AI 估算 · 35k–55k
蚂蚁集团大厂高级技术岗,大模型领域热度高,薪资竞争力强,参考市场水平月薪35k-55k。
职位详情
关于这个职位
该职位负责蚂蚁集团健康事业群的大模型训练和推理加速工作,涉及设计高效系统、优化算法和模型架构,利用GPU等硬件资源提升性能
适合对分布式机器学习有深入理解、擅长性能调优的技术专家
最低要求
深入理解机器学习算法和模型的原理和实践,包括常见的GPT-1、GPT-2、GPT-3、Transformer等
熟悉常见的机器学习框架,如 PyTorch、TensorFlow 等,并具有丰富的实际项目经验
熟悉常见的分布式机器学习框架,Megatron、DeepSpeed、HuggingFace
熟悉 GPU 和其他加速硬件的使用,有相关的性能调优经验,有FastTransformer、CUDA优化、TensorRT、Triton的一些经验更好
熟悉分布式计算和并行计算的概念和技术,有相关的实际经验
熟练使用编程语言,如 Python、C++ 等,在模型训练和推理的开发过程中有丰富的编码经验
具备良好的沟通和团队合作能力,能够与跨功能团队密切合作,解决问题并实现共同目标
工作职责
设计、开发和实现高效的大型模型训练和推理系统,以提高计算性能和加速模型收敛速度
与团队合作,优化算法和模型架构,以适应并充分利用硬件资源,如 GPU、TPU 等
进行模型性能分析和调优,识别和解决瓶颈问题,提高模型的训练和推理速度
实施并维护自动化工具和流程,以简化和加速模型训练和推理的部署过程
跟踪最新的研究进展和技术趋势,提出改进和创新的想法,推动团队的技术发展
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台实力雄厚,项目资源充足,能接触到前沿的大模型技术
- 专注训练/推理加速,技术深度高,积累的核心经验在行业内极具价值
- 健康事业群业务场景丰富,算法落地机会多,个人贡献影响力大
- 大模型训练和推理对性能要求极高,调优难度大,需要持续学习新技术
- 可能面临较大的工作强度和紧迫的项目周期,需要适应快速迭代的节奏
- 岗位对综合能力要求高,需同时掌握算法、系统、硬件等多领域知识
- 适合对高性能计算和大模型底层优化有浓厚兴趣,具备扎实工程功底和自驱力的技术极客
缺点 / 挑战
暂无明显挑战项
角色解读
- 技术专家路线:深耕训练/推理加速,成为分布式系统或AI基础设施领域权威
- 架构师路线:负责更大规模的模型训练平台设计,主导技术架构演进
- 管理路线:带领团队攻克技术难题,逐步晋升为技术经理或总监
- 设计并实现高效的大模型训练和推理系统,提升计算性能和模型收敛速度
- 与团队合作优化模型架构,充分利用GPU/TPU等硬件资源
- 进行性能分析与调优,解决计算瓶颈,并开发自动化部署工具
- 深入理解Transformer等大模型原理及训练/推理流程
- 精通PyTorch、TensorFlow等框架,及Megatron、DeepSpeed等分布式框架
- 熟悉CUDA、TensorRT等GPU优化技术,具备性能调优经验
- 熟练使用Python、C++,具备良好的工程实践能力
申请策略
- 在简历中突出量化成果,如“将模型训练速度提升X%”或“降低推理延迟Y%”
- 面试前复习经典论文(如GPT、BERT、Transformer),并了解蚂蚁集团在AI领域的布局
- 突出大模型训练/推理相关项目经验,尤其是性能优化成果(如加速比、吞吐量提升)
- 详细描述分布式框架(Megatron、DeepSpeed)和GPU优化(CUDA、TensorRT)的实际应用
- 强调工程能力,如大规模集群上的稳定性、可扩展性设计
- 系统学习CUDA编程和GPU架构,练习编写高性能kernel
- 深入阅读Megatron-LM和DeepSpeed源码,理解分布式策略(数据并行、模型并行、流水线并行)
- 熟悉LLM推理优化技术(如vLLM、FlashAttention、量化)
面试指南
- 先明确问题所属领域(训练/推理/分布式),再分点阐述核心原理,结合具体案例说明
- 对于性能优化问题,遵循“分析瓶颈→提出方案→实施验证→量化结果”的步骤
- 对于架构设计问题,先考虑系统目标(吞吐、延迟、可扩展性),再比较不同方案优缺
- 请解释Megatron-LM中的模型并行策略及其优缺点
- 如何优化Transformer的推理速度?列举几种常用技术
- 描述一次你通过CUDA优化显著提升性能的经历
- 在多机多卡训练中,如何处理通信瓶颈?
- 谈谈你对FlashAttention的理解及其如何加速注意力计算
职位点评
81
综合评分
大厂核心AI岗位,前沿技术栈,薪资优厚,但工作强度可能较大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和快速成长、对薪资有较高期望,且能接受高强度工作节奏的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利90
成长发展95
工作生活50
使命价值75
薪资福利
90较高
蚂蚁集团提供行业领先的薪资和福利,大模型岗位薪资处于市场高位,补偿性动机得到强力满足。
薪资信号偏高 (35K-55K/月)
成长发展
95较高
岗位聚焦大模型训练和推理加速,属前沿技术领域,能深度参与核心技术研发,成长空间巨大。
技术前沿前沿/新兴技术
技术栈大模型、训练加速、推理加速、分布式机器学习、GPU、CUDA、PyTorch、Megatron、DeepSpeed
业务类型profit_center
工作生活
50较低
工作地点在上海和杭州,需现场办公。大模型训练岗位通常加班较多,但JD未明确提及工作强度或弹性工作。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
75中等
健康事业群通过AI技术改善医疗健康,具有一定社会价值,大模型技术属于高速增长赛道。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs