
地平线
AI Infa 后端研发工程师
AI Infa 后端研发工程师
发布于 大约 9 小时前普通员工/个人贡献者
北京市 / 南京市
中级经验
全职员工
仅现场办公
本科
软件工程
Deepspeed
Fsdp
Lance
Lmdb
Pytorch
Webdataset
分布式训练
自动驾驶
AI 估算 · 25k–45k
AI大模型领域技术门槛高,大厂薪酬体系完善,该岗位薪资具备较强竞争力。
职位详情
关于这个职位
加入地平线自动驾驶数据平台团队,负责大规模分布式训练的性能优化、数据集管理及训练框架工程化
你将攻坚IO瓶颈、训练加速等难题,参与自动驾驶与大模型训练链路建设,是技术挑战与成长空间兼备的核心研发岗位
最低要求
一、教育背景
本科及以上学历,计算机、自动化、电子工程、人工智能等相关专业
二、必备能力
熟练 Linux 开发环境,会常用调试、构建工具
熟练 Git 等研发协作工具
Python 基础扎实,了解多进程 / 多线程、内存管理基本原理
熟悉 PyTorch 等主流深度学习框架,有分布式训练基础认知即可
了解数据集版本管理、数据一致性基础概念
工作职责
训练性能与链路优化
参与分布式训练调优,优化显存 / 内存占用、通信效率与数据流水线
攻坚数据解码、加载、增强等预处理环节性能,结合 CPU/GPU 异构计算提升整体训练吞吐
大规模训练数据集管理
参与自动驾驶数据集版本管理、质量校验与分发
优化 Lance、WebDataset、LMDB 等数据读取链路,解决分布式训练 I/O 瓶颈,保障海量训练数据高效流转
训练框架维护与自动化建设
协助内部训练框架迭代维护,保障训练稳定性
参与训练流程模块化、自动化改造,配合搭建训练任务 CI/CD、性能度量与数据监控体系
系统问题排查与专项优化
协助定位训练过程 OOM、卡死、通信异常等问题,参与内存、性能 Profiling 等专项优化,提升框架可维护性
优先资格
熟悉 Lance、LMDB、WebDataset、Arrow 等数据存储与读取优化
了解 DDP、FSDP、DeepSpeed 等分布式训练策略
有大规模数据集管理、音视频 / 图像编解码优化相关项目经历
有自动驾驶、大模型训练、训练框架二次开发经验优先
AI 洞察
优缺点分析
优点
- 身处自动驾驶与AI大模型双热点赛道,技术成长快
- 参与大厂核心数据平台建设,接触大规模分布式训练实践
- 工作内容涉及底层性能优化,技能壁垒高,长期价值大
- 公司已上市,平台稳定,薪资福利有保障
- 技术难度高,需同时掌握深度学习、分布式系统、存储优化等多领域知识
- 训练任务可能涉及长时间调试与问题排查,工作强度较大
- 需要快速学习新工具和框架(如DeepSpeed、FSDP等),持续跟进前沿技术
- 适合对底层系统性能有浓厚兴趣、享受攻克技术难题的自驱型工程师,希望在AI基础设施领域深耕
缺点 / 挑战
暂无明显挑战项
角色解读
- 向AI基础设施架构师发展,成为训练性能优化领域的专家
- 横向扩展至自动驾驶全栈技术,或深入大模型训练框架核心开发
- 技术管理方向:带领团队攻克训练链路中的工程难题
- 专注于自动驾驶模型训练的分布式性能优化,解决显存、通信、数据流水线等瓶颈
- 管理大规模训练数据集,优化数据读取与版本控制,保障数据高效流转
- 维护并迭代内部训练框架,推动训练流程自动化和监控体系建设
- 排查训练过程中的异常问题,如OOM、卡死等,进行系统级Profiling和优化
- 扎实的Python和Linux开发基础,熟悉Git等协作工具
- 深入理解PyTorch等深度学习框架及分布式训练原理
- 了解数据集管理、数据存储格式(Lance、WebDataset等)优化方法
- 具备排查系统问题和性能调优的能力,熟悉CPU/GPU异构计算
申请策略
- 笔试或面试中可主动展示对训练链路瓶颈的思考,如数据加载如何影响GPU利用率
- 了解地平线自动驾驶业务方向,在面试中体现对量产模型训练的理解
- 突出分布式训练项目经验,如使用DDP/FSDP加速模型训练的具体案例
- 展示数据集管理和数据管道优化的成果,包括IO吞吐提升数据
- 强调Linux系统调优、Profiling工具使用经验
- 附上开源贡献或技术博客链接,体现自驱学习能力
- 提前学习PyTorch分布式模块(DistributedDataParallel、FSDP)和DeepSpeed实践
- 了解Lance、WebDataset等数据格式的读写原理和性能调优方法
面试指南
- 问题定位类:先复现问题→使用工具(torch.cuda.memory_summary等)定位瓶颈→提出优化方案(如梯度累积、混合精度)→验证效果
- 系统设计类:明确需求→拆解模块(存储、索引、分发)→对比不同方案优缺点→给出可落地的架构
- 如何排查PyTorch训练过程中显存不足(OOM)的问题?
- 描述一次你优化数据加载管道的经验,如何提升训练吞吐?
- DDP和FSDP的区别是什么?分别适用于什么场景?
- 如何设计一个大规模数据集版本管理系统?
- 你如何评估并优化GPU通信效率?
- 复习PyTorch分布式训练官方文档和常见踩坑总结
职位点评
67
综合评分
大厂核心AI基础设施岗,前沿技术栈,成长空间大,但工作强度较高且WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长、愿意在AI基础设施领域深耕的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活30
使命价值65
薪资福利
70中等
大厂上市背景,薪资水平有竞争力,但JD未明确薪资和福利,优势中等。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
90较高
岗位涉及自动驾驶、大模型训练等前沿技术,技术栈新,成长空间大,但未明确提及晋升通道。
技术前沿前沿/新兴技术
技术栈PyTorch、分布式训练、DeepSpeed、FSDP、Lance、WebDataset、LMDB、GPU、CPU
业务类型ambiguous
工作生活
30较低
仅现场办公,未提及弹性工作或WLB信息,推测可能有一定加班压力。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
65中等
自动驾驶属于高速增长赛道,社会影响力中等,但岗位本身偏技术实现,使命感信号不足。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
地平线 的其他在招职位
相似职位推荐
Watch Jobs