
滴滴出行
训练优化工程师
训练优化工程师
发布于 大约 8 小时前普通员工/个人贡献者
北京市
中级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Cuda
Gpu
Megatron-Lm
Pytorch
分布式训练
大模型
性能优化
AI 估算 · 30k–45k
大模型训练优化为高价值稀缺岗位,滴滴为上市公司,薪资竞争力强。
职位详情
关于这个职位
该职位主要负责滴滴自动驾驶大模型训练框架的开发与优化,深入底层进行性能调优,涉及GPU、分布式通信、显存优化等关键技术
你将跟踪前沿训练优化技术,解决实际生产中的性能瓶颈,适合对AI基础设施和性能优化有强烈兴趣的工程师
加入后能够接触大规模自动驾驶训练场景,在技术深度和广度上都有很大成长空间
最低要求
熟悉深度学习训练流程,精通PyTorch框架,了解常见模型结构及训练原理
熟练掌握 Python/C++ 编程语言,具备工具开发能力,能独立设计并实现性能优化工具
熟悉 GPU 架构、cuda编程及相关性能分析工具Nsight Compute、Nsight System等,具备模型训练优化经验,及实际业务优化落地经验
熟悉多机训练通信策略及通信优化
良好的沟通协作能力,能清晰理解业务需求并转化为技术方案
对AI算力优化有浓厚兴趣,具备较强的问题分析与解决能力
工作职责
负责大模型训练框架的开发、优化, 跟踪大模型训练优化前沿技术,并将其应用于自动驾驶大模型的训练
负责自动驾驶模型训练相关的资源及效率优化,深入分析大模型训练瓶颈,从数据处理、模型计算、多机通信、显存优化等多角度全链条开展优化
负责模型训练稳定性工具建设,能在模型训练异常时,通过监控指标及时发现问题原因并解决
从计算专业角度,赋能算法,影响算法设计硬件友好的模型结构
优先资格
熟悉PyTorch等深度学习框架实现细节、原理及分布式训练流程
熟悉 Megatron-LM,DeepSpeed等主流分布式框并行加速库,或者熟悉分布式训练并行技术
熟悉高性能异构计算及感兴趣的同学
AI 洞察
优缺点分析
优点
- 技术前沿,涉及大模型、GPU优化、分布式计算,个人技术成长快
- 薪资福利有竞争力
- 技术深度要求高,需要持续学习
- 适合对AI基础设施和性能优化有浓厚兴趣,喜欢底层技术钻研的工程师
缺点 / 挑战
- 滴滴作为上市公司,平台稳定,业务场景复杂,自动驾驶大模型训练具有挑战性
- 工作强度可能较大,面临大模型训练稳定性等压力
角色解读
- 从训练优化工程师成长为AI基础设施专家,负责更大规模的训练集群
- 可向技术管理方向发展,带领团队建设训练平台
- 深入底层计算,向高性能计算或芯片协同设计方向延伸
- 负责大模型训练框架的开发与优化,研究前沿训练技术并落地到自动驾驶场景
- 深入分析训练瓶颈,从数据处理、计算、通信、显存等多个维度进行全链路优化
- 建设训练稳定性工具,通过监控指标快速定位和解决训练异常
- 参与算法设计,推动硬件友好的模型结构改造
- 精通PyTorch和深度学习训练流程,理解常见模型结构
- 熟练Python/C++编程,能开发性能优化工具
- 熟悉GPU架构和CUDA编程,掌握Nsight等性能分析工具
- 熟悉分布式训练通信策略与优化
申请策略
- 了解滴滴自动驾驶Voyager部门的技术方向,在面试中展现对自动驾驶场景的理解
- 准备系统设计问题,如大规模训练集群的资源调度
- 突出大模型训练或分布式训练的实际项目经验
- 展示性能优化案例,如训练速度提升、显存优化等量化成果
- 强调PyTorch、CUDA、分布式通信等技能
- 如果有开源贡献或技术博客,可加分
- 深入学习Megatron-LM、DeepSpeed等分布式框架源码
- 加强CUDA编程和GPU架构知识
面试指南
- 用STAR法则描述项目经历,突出量化结果
- 展示系统性思维,从多个角度分析优化点
- 强调实验和监控的重要性
- 请介绍一个大模型训练优化的实际案例,如何定位并解决瓶颈?
- PyTorch分布式训练中如何选择数据并行、张量并行或流水线并行?
- 如何优化显存占用?谈谈ZeRO、激活重计算等技术
- 如何检测和诊断训练中的loss spike或NAN问题?
- 设计一个大规模GPU集群的训练任务调度方案
职位点评
72
综合评分
北京大厂,前沿技术栈,薪资中上,工作节奏未知。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和成长,能够接受加班和快节奏工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值70
薪资福利
75中等
滴滴作为上市大公司,薪酬福利具有竞争力,但职位描述未明确具体薪资范围。
薪资信号未披露(AI估算:30K-45K/月)
成长发展
85较高
该职位聚焦大模型训练优化,技术前沿,涉及GPU、分布式等关键领域,成长空间大。
技术前沿前沿/新兴技术
技术栈PyTorch、CUDA、分布式训练、大模型
业务类型ambiguous
工作生活
50较低
工作地点在北京,未提及远程或弹性工作,互联网公司通常加班较多,但JD未明确说明。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
自动驾驶是高速增长的赛道,职位对技术发展有推动作用,但社会影响力相对间接。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
滴滴出行 的其他在招职位
相似职位推荐
Watch Jobs