Horizon Robotics logo
地平线
AI Infa 后端研发工程师

AI Infa 后端研发工程师

发布于 大约 9 小时前

普通员工/个人贡献者

北京市 / 南京市
中级经验
全职员工
仅现场办公
本科
软件工程
Deepspeed
Fsdp
Lance
Lmdb
Pytorch
Webdataset
分布式训练
自动驾驶

AI 估算 · 25k–45k

AI大模型领域技术门槛高,大厂薪酬体系完善,该岗位薪资具备较强竞争力。

职位详情

关于这个职位

加入地平线自动驾驶数据平台团队,负责大规模分布式训练的性能优化、数据集管理及训练框架工程化

你将攻坚IO瓶颈、训练加速等难题,参与自动驾驶与大模型训练链路建设,是技术挑战与成长空间兼备的核心研发岗位

最低要求

一、教育背景

本科及以上学历,计算机、自动化、电子工程、人工智能等相关专业
二、必备能力
熟练 Linux 开发环境,会常用调试、构建工具
熟练 Git 等研发协作工具
Python 基础扎实,了解多进程 / 多线程、内存管理基本原理
熟悉 PyTorch 等主流深度学习框架,有分布式训练基础认知即可
了解数据集版本管理、数据一致性基础概念

工作职责

训练性能与链路优化

参与分布式训练调优,优化显存 / 内存占用、通信效率与数据流水线
攻坚数据解码、加载、增强等预处理环节性能,结合 CPU/GPU 异构计算提升整体训练吞吐
大规模训练数据集管理
参与自动驾驶数据集版本管理、质量校验与分发
优化 Lance、WebDataset、LMDB 等数据读取链路,解决分布式训练 I/O 瓶颈,保障海量训练数据高效流转
训练框架维护与自动化建设
协助内部训练框架迭代维护,保障训练稳定性
参与训练流程模块化、自动化改造,配合搭建训练任务 CI/CD、性能度量与数据监控体系
系统问题排查与专项优化
协助定位训练过程 OOM、卡死、通信异常等问题,参与内存、性能 Profiling 等专项优化,提升框架可维护性

优先资格

熟悉 Lance、LMDB、WebDataset、Arrow 等数据存储与读取优化

了解 DDP、FSDP、DeepSpeed 等分布式训练策略
有大规模数据集管理、音视频 / 图像编解码优化相关项目经历
有自动驾驶、大模型训练、训练框架二次开发经验优先

AI 洞察

优缺点分析

优点

  • 身处自动驾驶与AI大模型双热点赛道,技术成长快
  • 参与大厂核心数据平台建设,接触大规模分布式训练实践
  • 工作内容涉及底层性能优化,技能壁垒高,长期价值大
  • 公司已上市,平台稳定,薪资福利有保障
  • 技术难度高,需同时掌握深度学习、分布式系统、存储优化等多领域知识
  • 训练任务可能涉及长时间调试与问题排查,工作强度较大
  • 需要快速学习新工具和框架(如DeepSpeed、FSDP等),持续跟进前沿技术
  • 适合对底层系统性能有浓厚兴趣、享受攻克技术难题的自驱型工程师,希望在AI基础设施领域深耕

缺点 / 挑战

暂无明显挑战项

角色解读

  • 向AI基础设施架构师发展,成为训练性能优化领域的专家
  • 横向扩展至自动驾驶全栈技术,或深入大模型训练框架核心开发
  • 技术管理方向:带领团队攻克训练链路中的工程难题
  • 专注于自动驾驶模型训练的分布式性能优化,解决显存、通信、数据流水线等瓶颈
  • 管理大规模训练数据集,优化数据读取与版本控制,保障数据高效流转
  • 维护并迭代内部训练框架,推动训练流程自动化和监控体系建设
  • 排查训练过程中的异常问题,如OOM、卡死等,进行系统级Profiling和优化
  • 扎实的Python和Linux开发基础,熟悉Git等协作工具
  • 深入理解PyTorch等深度学习框架及分布式训练原理
  • 了解数据集管理、数据存储格式(Lance、WebDataset等)优化方法
  • 具备排查系统问题和性能调优的能力,熟悉CPU/GPU异构计算

申请策略

  • 笔试或面试中可主动展示对训练链路瓶颈的思考,如数据加载如何影响GPU利用率
  • 了解地平线自动驾驶业务方向,在面试中体现对量产模型训练的理解
  • 突出分布式训练项目经验,如使用DDP/FSDP加速模型训练的具体案例
  • 展示数据集管理和数据管道优化的成果,包括IO吞吐提升数据
  • 强调Linux系统调优、Profiling工具使用经验
  • 附上开源贡献或技术博客链接,体现自驱学习能力
  • 提前学习PyTorch分布式模块(DistributedDataParallel、FSDP)和DeepSpeed实践
  • 了解Lance、WebDataset等数据格式的读写原理和性能调优方法

面试指南

  • 问题定位类:先复现问题→使用工具(torch.cuda.memory_summary等)定位瓶颈→提出优化方案(如梯度累积、混合精度)→验证效果
  • 系统设计类:明确需求→拆解模块(存储、索引、分发)→对比不同方案优缺点→给出可落地的架构
  • 如何排查PyTorch训练过程中显存不足(OOM)的问题?
  • 描述一次你优化数据加载管道的经验,如何提升训练吞吐?
  • DDP和FSDP的区别是什么?分别适用于什么场景?
  • 如何设计一个大规模数据集版本管理系统?
  • 你如何评估并优化GPU通信效率?
  • 复习PyTorch分布式训练官方文档和常见踩坑总结

职位点评

67
综合评分

大厂核心AI基础设施岗,前沿技术栈,成长空间大,但工作强度较高且WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长、愿意在AI基础设施领域深耕的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活30
使命价值65

薪资福利

70中等

大厂上市背景,薪资水平有竞争力,但JD未明确薪资和福利,优势中等。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

90较高

岗位涉及自动驾驶、大模型训练等前沿技术,技术栈新,成长空间大,但未明确提及晋升通道。

技术前沿前沿/新兴技术
技术栈PyTorch、分布式训练、DeepSpeed、FSDP、Lance、WebDataset、LMDB、GPU、CPU
业务类型ambiguous

工作生活

30较低

仅现场办公,未提及弹性工作或WLB信息,推测可能有一定加班压力。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

自动驾驶属于高速增长赛道,社会影响力中等,但岗位本身偏技术实现,使命感信号不足。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs