
华为
AI Infra工程师
AI Infra工程师
发布于 大约 14 小时前普通员工/个人贡献者
北京市 / 上海市
其它
全职员工
仅现场办公
学历未注明
机器学习工程
Ascendc
Tilelang
分布式训练
大语言模型
推理优化
数据工程
算子开发
AI 估算 · 25k–45k
AI基础设施核心岗位,技术门槛高,华为薪资有竞争力,结合行业水平估算。
职位详情
关于这个职位
作为华为AI Infra工程师,你将深入大模型训练与推理底层,参与建模仿真、AI算子开发、训推系统及数据系统四大方向
通过优化分布式策略、算子性能和数据处理流水线,直接提升AI系统效率
适合热爱底层技术、精通C++/Python并愿意挑战性能极限的工程师
最低要求
【建模仿真】1. 计算机、人工智能、数学、控制科学与工程等相关专业
熟悉AI调度框架建模仿真技术,能实现高吞吐、低时延的资源调度及高可用性分析
具备较强编程能力,精通主流编程语言(C++/Java/Python),熟悉分布式训练框架底层逻辑,掌握并行计算与通信优化基础技术,具备系统级性能调优能力
【AI算子技术】1. 人工智能、机器学习、计算数学、应用数学、软件工程、计算机科学、体系结构、统计数学、数据科学等相关专业
具备较强的代码编写和算法实现能力,了解大模型架构、AI框架、AI系统、分布式计算与存储系统、并行软件开发
具备较强的学习能力、自驱意识、团队意识和责任意识,能够积极参与团队协作,快速适应技术迭代
【AI训推系统】1. 人工智能、机器学习、软件工程、计算机科学、体系结构、统计数学、数据科学等相关专业
具备较强的代码编写和算法实现能力,了解大模型架构、AI框架、AI系统、分布式计算与存储系统、并行软件开发
具备较强的学习能力、自驱意识、团队意识和责任意识,能够积极参与团队协作,快速适应技术迭代
【AI数据系统】1. 计算机科学、软件工程、人工智能、计算机工程、机器学习、数据工程等相关专业,具备扎实的计算机系统基础
具备较强的代码编写和算法实现能力,熟悉模型架构、数据工程、操作系统、分布式计算与存储系统、并行软件开发
具备较强的学习能力、自驱意识、团队意识和责任意识,能够积极参与团队协作,快速适应技术迭代
工作职责
【建模仿真】1、参与构建面向大语言模型(LLM)及多模态系统的数学模型与仿真框架,以及超参规模下的分布式训练策略、集群/端侧推理优化开发
参与仿真系统开发与关键指标验证:开发大模型仿真平台,验证训练稳定性,优化集群资源利用率
参与定位大模型训练瓶颈,优化训练任务优先级动态调整
构建端到端性能预测模型,输出算力资源配置决策树,提升训练效率和推理性能
【AI算子技术】1、参与大模型训练推理算子的设计与开发,涵盖大模型训练、推理、生成式推荐、数据合成等关键业务场景,实现算子加速,推动成果落地产品并产生商业价值
参与算子性能优化、精度分析和计算图优化等方案的开发,通过数学等价变换、流水编排、深度融合、调度优化、Tile优化等手段提升算子性能,为端到端训推系统性能提供基础支撑
参与高性能算子库、基础加速库、算子开发框架的编码与测试,包括AscendC、Triton、TileLang等编程语言的相关实现
参与自动算子生成工具的研发,利用AI Agent技术提升算子开发的自动化程度和效率
参与业界前沿技术调研,协助专利申请和技术报告撰写,参与开源社区贡献,与团队共同提升华为在业界的技术影响力
【AI训推系统】1、参与Agent、语言、多模态、生成式推荐、空间智能等大模型训练和推理的关键技术与系统架构的开发与实现,协助完成算法突破,并将成果落地产品,产生商业价值
参与训推框架和加速特性的设计与开发,包括预训练、RL后训练、Agentic AI、推理引擎和服务化、AI训推技术辅助编程等模块的编码与调试
参与AI训练/推理系统的优化方案设计和开发,在计算、内存、通信、IO等方面开展软硬协同优化,提升系统性能,支撑下一代训推系统构建
跟踪业界和学术界AI计算集群训推算法、训练系统优化、推理系统优化领域的最新进展,参与业界顶会,参与开源社区贡献,学习并引入先进技术,持续提升系统竞争力
【AI数据系统】1、参与语言、多模态与 Agent场景下数据生产与流转体系的开发,构建高吞吐、可扩展的数据基础设施,优化数据采集、处理、存储与分发效率,支撑规模化模型训练与行业调优
参与面向异构分布式环境的数据处理与调度系统的开发,实现分布式数据流水线与推理服务化架构,支持多模型推理、数据合成与蒸馏的高并发执行,提升资源利用率与整体吞吐
参与统一数据格式与版本管理体系的实现,参与面向大规模训练与推理的存储架构开发,提升数据可追溯性与生命周期管理能力,支撑 PB 级数据规模扩展
参与大模型数据工程平台与工具链能力的建设,包括任务编排、指标采集、失败恢复与自动扩缩容等模块的实现,推动数据生产与验证的自动化闭环,支撑数据飞轮高效运转
跟踪分布式计算、存储与推理加速等前沿技术,与算法及平台团队协作,推动数据工程与训练系统、推理服务及 Agent架构的融合落地,持续提升工程成熟度与技术竞争力
优先资格
【建模仿真】- 熟悉大模型分布式训练策略与推理加速技术,具备算力系统优化与异构计算架构性能调优经验者优先
【AI算子技术】- 具有大模型训推系统、算子开发调测实践经验者优先,掌握算子优化和性能调测的常用方法和工具(如Profiling工具、Tiling策略等)者优先
有相关实习经验或高水平数学/计算机竞赛(如ACM/ICPC、各类数学竞赛)获奖经验者优先
在领域顶级会议(如NeurIPS、ICML、AAAI、VLDB等)发表过文章者更佳
【AI训推系统】- 具有语言/多模态/Agent/空间智能等大模型训练和推理实践经验者优先,掌握训推系统优化的常用方法和工具者优先
有相关实习经验或高水平竞赛(如ACM)获奖经验者优先
在领域顶级会议(如NeurIPS、ICML、AAAI、ISCA、VLDB等)发表过文章者更佳
【AI数据系统】- 具备良好的工程实现能力,熟悉分布式计算与存储系统,有高性能数据处理与调度系统开发经验,或有推理服务化部署、集群性能优化经验者优先
有相关实习经验或高水平竞赛(如 ACM、ICPC 等)获奖经历者优先
在领域顶级会议(如 NeurIPS、ICML、AAAI、VLDB等)发表论文者更佳
AI 洞察
优缺点分析
优点
- 华为作为全球领先的ICT企业,AI基础设施投入巨大,技术平台扎实
- 涉及大模型训练、算子、数据系统全栈,技术广度与深度兼备
- 与顶尖技术团队合作,有机会接触自研AI芯片和框架,成长快速
- 多地办公选择,城市灵活
- 技术门槛高,需同时掌握系统、算法、数学等多方面知识
- 岗位方向细分,初期可能局限于某一模块,需要主动拓宽视野
- 适合对AI底层系统充满热情,喜欢钻研性能优化,且抗压能力强、愿意深耕基础设施领域的工程师
缺点 / 挑战
- 大厂节奏快,可能面临高强度工作压力
角色解读
- 从专项工程师成长为AI基础设施技术专家,深入单点技术领域
- 可横向扩展至AI芯片、编译器、或系统架构设计等方向
- 有机会参与业界顶级会议和开源社区,提升技术影响力,走向技术管理或首席架构师
- 参与构建大模型及多模态系统的数学模型与仿真框架,开发分布式训练策略和推理优化
- 设计并优化AI算子(如AscendC、Triton等)性能,实现算子加速和计算图优化
- 参与AI训推系统的架构开发,包括预训练、RL后训练、推理引擎等模块
- 构建大规模数据基础设施,优化数据生产、处理、存储与分发流程
- 精通C++/Java/Python等编程语言,熟悉分布式系统与并行计算
- 深入理解大模型架构、AI框架(如PyTorch)和底层系统优化
- 掌握算子优化方法、Profiling工具和性能调优技巧
- 具备数据工程经验,熟悉分布式存储与调度系统
申请策略
- 提前了解华为自研昇腾AI生态,在面试中展现对Ascend的兴趣
- 根据自身背景选择侧重方向(仿真、算子、训推、数据),在简历中突出匹配度
- 突出分布式训练或推理系统的项目经验,量化性能优化成果(如吞吐提升百分比)
- 展示C++/Python高性能编程能力,可附上GitHub或开源贡献链接
- 强调竞赛获奖或顶会论文,证明算法与工程双实力
- 如有算子开发或数据系统经验,重点描述使用的工具和优化手段
- 补充学习AscendC、Triton等算子编程语言,动手实现简单算子
- 熟悉PyTorch分布式训练源码,理解DDP/FSDP等机制
面试指南
- 使用STAR法则(情境、任务、行动、结果)回答项目经验问题
- 面对系统设计问题,先明确需求和约束,再架构拆解,最后举具体策略
- 展示学习能力和自驱力,提到关注开源社区和顶会论文
- 如何定位并优化大模型训练中的通信瓶颈?
- 解释你熟悉的分布式训练框架(如PyTorch DDP)的底层实现
- 如何设计一个高性能算子?请举例说明
- 在数据系统设计中,如何保证高吞吐和可扩展性?
- 如何看待AI Infra领域未来的技术趋势?
职位点评
73
综合评分
华为AI Infra工程师,前沿技术栈、成长性极强,但工作强度未知且未透露具体福利。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合注重技术成长和职业发展、对AI底层系统有浓厚兴趣,且能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值70
薪资福利
75中等
华为薪酬在业内处于中上水平,稳定性高,但JD未明确具体薪资福利。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
90较高
职位聚焦大模型基础设施,技术前沿,成长空间大。
技术前沿前沿/新兴技术
技术栈大语言模型、分布式训练、推理优化、算子开发、AscendC、Triton、TileLang、C++、Python、数据工程
业务类型ambiguous
工作生活
50较低
办公地点灵活但需现场,未提及弹性工作,可能存在较大工作压力。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI行业高速发展,但日常工作偏底层,社会意义间接。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
华为 的其他在招职位
相似职位推荐
Watch Jobs