HUAWEI logo
华为
AI Infra研究员

AI Infra研究员

发布于 大约 11 小时前

普通员工/个人贡献者

深圳市 / 上海市
专家级经验
全职员工
仅现场办公
学历未注明
机器学习工程
分布式系统
大模型
并行计算
数据工程
算子开发
系统架构
高性能计算
训练推理优化

AI 估算 · 35k–70k

AI基础设施核心研发岗,技术门槛高,华为薪酬竞争力强,月薪约5万。

职位详情

关于这个职位

该职位是华为AI Infra实验室的核心研究岗,专注于大模型时代的数据系统、建模仿真、训练推理系统和算子加速技术

你将负责主导高吞吐数据基础设施、分布式调度、弹性资源调度等创新研究,并通过顶会论文与开源社区贡献技术影响力
适合在大模型和分布式系统领域有深厚积累的研究人才

最低要求

【AI数据系统】 1、计算机科学、软件工程、人工智能、计算机工程、机器学习、数据工程等相关专业,具备扎实的计算机系统基础和深厚的理论功底

具备扎实的算法和代码实现能力,深入理解模型架构、数据工程、操作系统、分布式计算与存储系统、并行软件开发原理,并有相关研究或项目经验
具备出色的学习能力、自驱意识、团队意识和责任意识,能够独立开展创新性研究,并带领团队突破关键技术难题
具备卓越的系统设计与工程实现能力,对分布式计算与存储系统有深入研究,有高性能数据处理与调度系统架构经验,或推理服务化部署、集群性能优化方面的创新成果者优先
在领域顶级会议(如 NeurIPS、ICML、ICLR、CVPR、ACL、OSDI、SOSP、EuroSys、FAST、SC、VLDB、SIGMOD、ICDE 等)以第一作者或主要贡献者发表过多篇高质量论文,或有顶级研究机构实习经验/高水平竞赛(如 ACM、ICPC 等)获奖经历者优先
【建模仿真】 1、计算机、人工智能、数学、控制科学与工程等相关专业
精通AI训练推理核心性能优化算法,精通大模型分布式训练策略与推理加速技术,具备算力系统优化与异构计算架构性能调优经验者优先
精通AI调度框架建模仿真技术,能实现高吞吐、低时延的资源调度及高可用性分析
具备较强编程能力,精通主流编程语言(C++/Java/Python),熟悉分布式训练框架底层逻辑,掌握并行计算与通信优化基础技术,具备系统级性能调优能力
【AI训推系统】 1、人工智能、机器学习、软件工程、计算机科学、体系结构、统计数学、数据科学等相关专业
具备扎实的算法和代码实现能力,深入理解大模型架构、AI框架、AI系统、分布式计算与存储系统、并行软件开发原理
具备出色的学习能力、自驱意识、团队意识和责任意识,能够独立开展创新性研究,并带领团队突破技术难题
具有语言/多模态/Agent/空间智能等大模型训练和推理的深入研究经验,熟练掌握训推系统优化的前沿方法和工具
在领域顶级会议(如NeurIPS、ICML、ICLR、CVPR、ACL、ISCA、MICRO、HPCA、ASPLOS、OSDI、SOSP、VLDB等)以第一作者或主要贡献者发表过多篇高质量论文,或有顶级研究机构实习经验/高水平竞赛(如ACM)获奖经验者优先
【AI算子技术】 1、人工智能、机器学习、计算数学、应用数学、软件工程、计算机科学、体系结构、统计数学、数据科学等相关专业
具备扎实的算法和代码实现能力,深入理解大模型架构、AI框架、AI系统、分布式计算与存储系统、并行软件开发原理,并有相关研究或项目经验
具备出色的学习能力、自驱意识、团队意识和责任意识,能够独立开展创新性研究,并带领团队突破关键技术难题
具有大模型训推系统、算子开发调测的深入研究经验,熟练掌握算子优化和性能调测的前沿方法与工具,对硬件架构和编译优化有深刻理解者优先
在领域顶级会议(如NeurIPS、ICML、ICLR、CVPR、ACL、ISCA、MICRO、HPCA、ASPLOS、OSDI、SOSP、PLDI、VLDB等)以第一作者或主要贡献者发表过多篇高质量论文,或有顶级研究机构实习经验/高水平数学/计算机竞赛(如ACM/ICPC、各类数学竞赛)获奖经验者优先

工作职责

【AI数据系统】 1、负责语言、多模态与 Agent场景下数据生产与流转体系的创新研究,主导高吞吐、可扩展数据基础设施的架构设计,突破数据采集、处理、存储与分发效率瓶颈,支撑规模化模型训练与行业调优

主导面向异构分布式环境的数据处理与调度系统研究,创新分布式数据流水线与推理服务化架构,优化多模型推理、数据合成与蒸馏的高并发执行,实现资源利用率与整体吞吐的跨越式提升
主导统一数据格式与版本管理体系的架构设计,创新面向大规模训练与推理的存储架构,提升数据可追溯性与生命周期管理能力,支撑 PB 级数据规模的平滑扩展
领导大模型数据工程平台与工具链能力建设,主导任务编排、指标采集、失败恢复与自动扩缩容等核心模块的研究与设计,构建数据生产与验证的智能化自动化闭环,驱动数据飞轮高效运转
把握分布式计算、存储与推理加速等领域的前沿技术趋势,与算法及平台团队协同创新,推动数据工程与训练系统、推理服务及 Agent架构的深度融合,持续提升工程成熟度与技术竞争力
【建模仿真】 1、负责AI系统建模与仿真策略制定:参与构建面向大语言模型(LLM)及多模态系统的数学模型与仿真框架,研究超参规模下的分布式训练策略、集群/端侧推理优化方案
制定性能验证方案,覆盖训练吞吐、推理时延、能效比等核心指标
负责仿真系统开发与关键指标验证:开发大模型仿真平台,验证训练稳定性,优化集群资源利用率
建立量化验证体系,确保仿真结果可靠性
负责系统优化与方案决策:定位大模型训练瓶颈,设计弹性资源调度算法,实现训练任务优先级动态调整
构建端到端性能预测模型,输出算力资源配置决策树,提升训练效率和推理性能
模拟真实AI工作负载下的数据流、控制流,分析算力互联控制机制、拓扑结构对AI负载性能的影响,提出改进方案并通过仿真验证其有效性
支持算力互联架构设计、资源调度策略等系统级优化
【AI训推系统】 1、负责Agent、语言、多模态、生成式推荐、空间智能等大模型训练和推理的关键技术与系统架构的创新研究,引领业界方向,实现关键算法和技术突破,推动成果落地产品并产生商业价值
主导训推框架和加速特性的前沿设计与研究,包括预训练、RL后训练、Agentic AI、推理引擎和服务化、AI训推技术辅助编程等方向,探索下一代技术方案
主导AI训练/推理系统的优化方案研究,开展AI模型算法与计算系统的联合创新优化,通过计算、内存、通信、IO等软硬协同设计,支撑下一代训推系统竞争力构建
把握并引领业界和学术界AI计算集群训推算法、训练系统优化、推理系统优化领域的最新研究进展和技术趋势,参与业界顶会,参与开源社区贡献,持续提升AI算力集群系统竞争力,将前沿成果融入研发
【AI算子技术】 1、负责大模型训练推理算子的创新设计与研究,涵盖大模型训练、推理、生成式推荐、数据合成等关键业务场景,主导算子加速技术突破,推动成果落地产品并产生商业价值
主导算子性能优化、精度分析和计算图优化等前沿方案研究,通过数学等价变换、流水编排、深度融合、调度优化、Tile优化等创新方法,实现算子性能的跨越式提升,为下一代训推系统奠定基础
主导高性能算子库、基础加速库、算子开发框架的架构设计与核心开发,包括AscendC、Triton、TileLang等编程语言的关键技术创新
领导自动算子生成工具的研发,结合AI Agent技术构建智能化算子开发体系,大幅提升开发效率和自动化水平
负责业界前沿技术研究和技术规划,主导专利申请和高质量论文撰写,领导开源项目,代表华为与全球专家交流合作,构建公司在AI计算领域的技术影响力

优先资格

有高性能数据处理与调度系统架构经验,或推理服务化部署、集群性能优化方面的创新成果者优先

在领域顶级会议(如 NeurIPS、ICML、ICLR、CVPR、ACL、OSDI、SOSP、EuroSys、FAST、SC、VLDB、SIGMOD、ICDE 等)以第一作者或主要贡献者发表过多篇高质量论文,或有顶级研究机构实习经验/高水平竞赛(如 ACM、ICPC 等)获奖经历者优先
具备算力系统优化与异构计算架构性能调优经验者优先
在领域顶级会议(如NeurIPS、ICML、ICLR、CVPR、ACL、ISCA、MICRO、HPCA、ASPLOS、OSDI、SOSP、VLDB等)以第一作者或主要贡献者发表过多篇高质量论文,或有顶级研究机构实习经验/高水平竞赛(如ACM)获奖经验者优先
对硬件架构和编译优化有深刻理解者优先
在领域顶级会议(如NeurIPS、ICML、ICLR、CVPR、ACL、ISCA、MICRO、HPCA、ASPLOS、OSDI、SOSP、PLDI、VLDB等)以第一作者或主要贡献者发表过多篇高质量论文,或有顶级研究机构实习经验/高水平数学/计算机竞赛(如ACM/ICPC、各类数学竞赛)获奖经验者优先

AI 洞察

优缺点分析

优点

  • 华为作为科技巨头,提供极具竞争力的薪酬和福利,平台稳定
  • 研究方向处于AI最前沿(大模型、分布式、算力优化),技术成长空间巨大
  • 拥有丰富的资源和数据,可参与大规模实际系统落地,成就感强
  • 要求极高,需具备顶尖的学术背景(顶会论文)和工程能力,竞争激烈
  • 技术复杂度和不确定性高,需持续学习,不断拥抱快速变化的AI技术

缺点 / 挑战

  • 工作强度大,可能面临高压力和高时长,尤其是项目高峰期
  • 适合对AI底层技术充满热情、具备扎实计算机系统功底和研究能力、愿意接受高挑战并追求技术极致的研究型人才

角色解读

  • 成为AI基础设施领域的顶尖专家,引领业界技术方向,参与行业标准制定
  • 有机会晋升为研究团队的技术负责人或架构师,带领团队突破关键技术
  • 通过顶级会议论文、开源项目和专利,建立个人技术品牌和全球影响力
  • 负责大模型数据生产与流转体系的架构设计,主导高吞吐数据基础设施、分布式调度和存储系统的创新研究
  • 进行AI系统建模仿真,开发仿真平台,验证训练稳定性,优化集群资源利用率
  • 研究训练推理关键技术,优化预训练、RL训练、推理引擎等,推动软硬协同设计
  • 设计高性能算子,通过数学变换和调度优化实现算子加速,并参与开源项目和专利撰写
  • 扎实的计算机系统基础,深入理解分布式计算、存储系统、操作系统和并行编程
  • 熟练掌握主流编程语言(C++/Java/Python),具备优秀的算法和代码实现能力
  • 精通大模型训练推理原理,熟悉AI框架(如PyTorch等)和训推系统优化方法
  • 具备系统性能分析和调优能力,熟悉异构计算架构(如GPU/NPU)和编译优化技术

申请策略

  • 了解华为AI战略和昇腾生态,在面试中体现与公司方向的契合
  • 准备一个能体现系统能力的技术分享,如大型集群调优案例
  • 突出在分布式系统、AI训练推理或算子优化方面的项目经验,展示具体成果和数据提升
  • 强调顶会论文发表经历或顶级竞赛获奖,证明研究能力
  • 展示对大模型架构和AI框架底层的深入理解,如技术博客、开源贡献
  • 补强C++/Python编程能力,熟悉分布式训练框架(如DeepSpeed、Megatron)的底层实现
  • 学习GPU/华为昇腾等异构计算架构,掌握性能分析工具和编译优化方法
  • 关注AI Infra领域最新论文,尝试复现并思考改进方向

面试指南

  • 使用STAR法则:情境-任务-行动-结果,突出个人贡献和量化成果
  • 从系统、算法、硬件多角度分析问题,展示全局观和深度思考
  • 结合华为的业务场景(如昇腾芯片、大模型训练),体现针对性
  • 请描述你参与过的最具挑战性的分布式系统优化项目,如何定位瓶颈并解决?
  • 大语言模型训练中,如何设计数据流水线以减少训练时间?
  • 解释一下FlashAttention的原理,你会如何进一步优化?
  • 如何评估一个AI系统的性能?从哪些维度进行?
  • 为什么选择华为AI Infra?你对未来AI基础设施的发展趋势有何看法?

职位点评

70
综合评分

华为AI Infra研究员,前沿技术、高薪稳定,但工作强度大,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求前沿技术、愿意投身AI基础设施深入研究、不太注重工作生活平衡的研究型人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展92
工作生活25
使命价值70

薪资福利

80较高

华为薪资水平具有高度竞争力,平台稳定,但JD未明确具体福利,补偿性动机较好满足。

薪资信号未披露(AI估算:35K-70K/月)

成长发展

92较高

该职位聚焦AI基础设施最前沿技术,拥有顶会交流、开源领导机会,发展空间极大。

技术前沿前沿/新兴技术
技术栈大模型、分布式系统、数据工程、训练推理优化、算子优化、并行计算、C++、Python、AI框架
成长机会领导开源项目、代表华为与全球专家交流合作、构建技术影响力
业务类型ambiguous

工作生活

25较低

华为普遍高强度,JD未提及弹性工作或远程,生活化动机满足程度低。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

70中等

AI基础设施对行业有推动意义,但JD未强调社会价值,意义感中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs