
地平线
【2027届校招】大模型AI Infra/MLSys工程师
【2027届校招】大模型AI Infra/MLSys工程师
发布于 大约 9 小时前普通员工/个人贡献者
北京市 / 上海市
初级经验
全职员工
仅现场办公
硕士
机器学习工程
Ai Infra
Cuda
Deepspeed
Gpu
Kv Cache
Megatron-Lm
Moe
Npu
Pytorch
AI 估算 · 25k–45k
大模型AI基础设施岗位技术门槛高,校招薪资竞争力强,一线城市,预估月薪25K-45K,年终奖丰厚。
职位详情
关于这个职位
该职位面向2027届硕士及以上毕业生,专注于大模型AI基础设施与机器学习系统方向
你将负责千卡级集群的模型训练优化、推理加速与异构硬件适配,深度参与大模型架构设计与性能调优
适合对大规模分布式系统和大模型性能优化充满热情的应届生,技术挑战大、成长空间广阔
最低要求
计算机、人工智能、数学、电子工程等相关专业硕士及以上学历
具备大模型结构设计、训练优化或底层系统开发经验
千卡集群实战经验: 具备千卡及以上规模 GPU/NPU 等集群(如 B300 / B200 / H100 / H800 / A100 等)的实际训练速度优化与模型调优经验
熟悉大规模分布式训练中的并行策略、通信优化与性能分析
大模型相关经验: 主导或深度参与过 10B 参数以上大模型的结构设计、预训练或微调项目
对主流大模型体系(如 DeepSeek、千问、豆包等)有深入理解,具备相关结构优化经验者优先
工程能力: 精通 Python / C++
熟练掌握 PyTorch 及至少一种主流分布式训练框架,如 Megatron-LM、DeepSpeed、vLLM
熟悉 CUDA、TensorRT、Kernel 优化或推理框架者优先
工作职责
训练稳定性与性能优化: 负责超大规模模型训练过程中的稳定性、收敛效率与系统性能优化,提升千卡集群下的整体训练效率与资源利用率
异构硬件适配: 统一适配各种主流与国产 GPU/NPU 芯片,解决异构计算集群的通信与调度问题
集群稳定性保障: 解决千卡/万卡集群训练时的显存瓶颈、断点续训(Checkpoint)、通信拓扑优化及算力调度问题
模型推理加速与部署优化:针对 GPU进行推理性能优化,包括 Kernel Fusion、算子优化、KV Cache、并行策略及部署系统优化等
新一代高效率模型架构探索: 探索高效率模型结构与训练范式,包括 Sparse / Linear Attention、Hybrid Architecture、MoE Scaling、多模态融合等前沿方向
优先资格
具备相关结构优化经验者优先
熟悉 CUDA、TensorRT、Kernel 优化或推理框架者优先
AI 洞察
优缺点分析
优点
- 技术前沿,接触大规模集群和最新大模型优化技术
- 公司为上市公司,平台稳定,薪资福利有竞争力
- 技术难度高,需要不断学习新知识
- 工作强度可能较大,涉及复杂系统问题
- 对数学和计算机底层基础要求高
- 适合对大规模分布式系统和AI基础设施充满热情,具备扎实的编程和系统能力,喜欢攻克技术难题的应届生
缺点 / 挑战
- 团队氛围好,技术挑战大,成长快速
角色解读
- 可成长为AI基础设施领域的资深专家,负责更大规模集群的系统设计
- 可转向芯片软硬件协同设计,深入底层优化
- 可晋升为技术负责人或架构师,带领团队
- 负责千卡级大模型训练性能优化,提升训练效率和资源利用率
- 进行GPU/NPU等芯片的推理加速,包括算子优化、Kernel Fusion、KV Cache等
- 解决大规模分布式训练中的通信、调度、断点续训等问题
- 探索新一代模型架构(如MoE、Sparse Attention、多模态融合等)
- 精通Python/C++,掌握PyTorch及主流分布式训练框架
- 熟悉CUDA编程、GPU架构和推理优化技术
- 理解大规模分布式并行策略和通信优化
- 对大模型结构和训练范式有深入理解
申请策略
- 关注地平线的技术博客和开源项目,了解技术栈
- 在面试中展示对大规模系统性能分析的思考
- 突出参与过的分布式训练项目,包括集群规模、优化效果
- 强调CUDA、PyTorch等底层优化经验,如有Kernel优化案例更佳
- 展示对大模型结构的理解,如MoE、Attention机制
- 提前熟悉Megatron-LM、DeepSpeed等框架源码
- 学习GPU架构和CUDA优化,尝试动手写Kernel
- 了解主流大模型(如Llama、DeepSeek)的结构
面试指南
- 对于技术问题,先阐述基本概念,再结合具体场景分析瓶颈,最后给出优化思路和权衡
- 对于项目经验,采用STAR法则,突出个人贡献和量化结果
- 对于开放性问题,结构化思考,从模型、数据、硬件、系统等多角度分析
- 如何优化Transformer在GPU上的推理性能?
- 在大规模分布式训练中,如何处理通信瓶颈?
- 解释一下混合并行(数据并行、张量并行、流水线并行)的优劣势
- 你是否做过CUDA Kernel优化?具体如何做的?
- 如何设计断点续训机制以支持万卡集群?
职位点评
80
综合评分
前沿技术栈、高薪、成长快,但工作强度和现场办公是挑战。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
该职位最适合追求技术成长、对AI基础设施有强烈兴趣,并能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活50
使命价值75
薪资福利
85较高
薪资竞争力强,且为上市大厂,福利稳定。未在JD中看到具体福利描述,但行业普遍提供有竞争力的薪酬。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
95较高
该岗位深度参与大模型训练和推理优化,前沿技术栈,技能成长极快。
技术前沿前沿/新兴技术
技术栈大模型、AI Infra、MLSys、GPU、NPU、PyTorch、分布式训练、CUDA、TensorRT、Megatron-LM、DeepSpeed、vLLM、Kernel Fusion、KV Cache、MoE
业务类型cost_center
工作生活
50较低
工作地点在北京/上海,需现场办公,JD未提及弹性工作或加班情况。AI基础设施工作强度可能较高。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
AI基础设施是热门方向,对社会有广泛影响,但JD未提及明确使命感。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
地平线 的其他在招职位
相似职位推荐
Watch Jobs