
浪潮
大模型算法架构师
大模型算法架构师
发布于 大约 5 小时前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
博士
软件工程
Cuda
Pytorch
Rlhf
Sglang
Vllm
分布式并行
大模型
微调
预训练
AI 估算 · 40k–70k
博士+大模型架构师属于高稀缺人才,北京市场资深薪资较高,结合上市大厂和面议,预估月薪4-7万
职位详情
关于这个职位
该职位负责大模型的预训练、微调、强化学习及推理部署优化,需要深入掌握大模型分布式并行策略和推理框架
作为核心技术成员,你将参与前沿大模型研发,推动模型在垂直领域的能力提升,并落地行业客户场景
适合对大模型底层技术有深厚兴趣、追求技术挑战的博士人才
最低要求
博士学历,熟悉大语言模型、多模态模型结构和基础算法,精通python编程,熟悉pytorch深度学习框架
具备服务器使用、容器化部署、Linux基础操作、并行计算等基础知识,了解并行计算、cuda、多进程、多线程编程技术
掌握大模型分布式并行策略、张量并行、流水并行、专家并行算法
熟练使用大模型推理服务框架vllm、sglang等,具备对框架优化的能力,熟悉c++、cutlass、trition,具备算子性能优化的能力
工作职责
负责大模型预训练、微调、强化学习及性能优化,根据数据迭代持续优化训练大模型,提升大模型逻辑分析能力
完成大模型推理服务部署吞度性能优化,协助其他团队部署大模型推理服务
跟踪并分析业内最新研究成果和技术动态,持续优化和改进现有大模型生成方案,同步推理评测大模型能力提升效果,完成大模型在垂直领域的能力提升
负责大模型软件栈数据工具方案设计与功能开发,落地行业客户场景
根据外部团队需求,开展技术交流与沟通,设计定制化大模型构建方案,编写大模型相关技术文档及发明专利
AI 洞察
优缺点分析
优点
- 大模型是当前最前沿方向,技术难度高,能积累稀缺的分布式训练与推理优化经验,市场价值极高
- 浪潮是行业龙头,有丰富的算力和客户资源,可参与大型项目,接触真实落地场景
- 博士学历硬性要求,筛选出高学历同侪,学术氛围与技术深度并存
- 大模型迭代速度快,需要持续学习新论文和技术,工作强度可能较大
- 纯技术岗位,对数学和工程能力要求极高,需要同时掌握多个技术栈(PyTorch、CUDA、分布式等)
缺点 / 挑战
- 薪资面议可能存在谈判压力,需提前做好市场调研
- 适合有博士背景、对大模型底层原理有强烈兴趣、擅长分布式系统与性能优化、乐于挑战高难度问题的技术极客
角色解读
- 纵向深入成为大模型核心技术专家,主导更大规模模型研发(千亿/万亿参数)
- 横向拓展至AI Infra架构师,负责深度学习平台与工具链设计
- 管理方向:带团队成为技术负责人,或转向AI产品架构师推动商业化落地
- 负责大模型从预训练到推理的全链路优化,包括数据准备、模型训练、微调与强化学习,持续提升模型逻辑推理能力
- 部署和优化大模型推理服务,使用vLLM、SGLang等框架进行吞吐量和延迟优化,并协助其他团队交付服务
- 跟踪业界最新技术(如MoE、长上下文、多模态),设计新的训练方案,并在垂直领域落地定制化大模型
- 扎实的深度学习基础,精通PyTorch,熟悉Transformer架构及大模型训练范式(预训练、SFT、RLHF)
- 熟悉分布式并行策略(张量并行、流水并行、专家并行),具备大规模训练调优经验
- 熟练使用vLLM、SGLang等推理引擎,能进行CUDA算子优化,了解C++、Cutlass、Triton
- 掌握容器化部署、Linux、并行计算基础知识
申请策略
- 了解浪潮在AI领域的布局(如AI服务器、大模型平台),在面试中展现对业务场景的理解
- 准备一个端到端的大模型项目案例,从数据到训练到推理,展示系统思考能力
- 突出博士期间或工作中的大模型相关项目,如预训练、指令微调、RLHF等,并量化模型规模与性能提升
- 详细描述分布式训练经验,包括使用的并行策略、集群规模、优化器选择等
- 强调推理优化成果,如使用vLLM/SGLang进行的延迟/吞吐改进,或CUDA算子优化案例
- 若对推理框架不熟,可快速上手vLLM和SGLang的源码并做小实验
- 补充CUDA性能调优知识,如使用NVIDIA Nsight工具,了解Tensor Core编程
- 系统梳理大模型最新技术(如MoE、Flash Attention、LoRA),准备面试中的深度提问
面试指南
- 采用STAR法则:先说明场景(Situation)和任务(Task),再详细描述你采取的行动(Action),最后强调结果(Result)
- 对于技术原理问题,先给出核心定义,再画图或类比解释,最后结合你的实践经验
- 遇到不确定的问题,可以诚实地说明“没有直接做过,但我可以从基本原理推测”,展示思考过程
- 请详细讲解大模型分布式训练中数据并行、张量并行、流水并行的区别与适用场景
- 如何优化vLLM推理的吞吐量?请分析影响吞吐的关键因素及优化手段
- 在RLHF中,PPO算法如何实现?你遇到过的训练不稳定问题如何解决?
- 描述一次你参与的大模型训练项目,从数据准备到最终性能,你做了什么?
- 请解释Flash Attention的原理以及它如何加速训练/推理
职位点评
72
综合评分
大模型核心研发岗,技术前沿、成长极快、薪资优厚,但工作强度大、WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长和前沿探索的求职者,对薪资和稳定性要求较高,但需接受高强度工作节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展95
工作生活40
使命价值80
薪资福利
70中等
薪资面议,但博士+大模型高薪行业,预期薪资较高;上市公司福利完善,稳定性好。但薪资未公开,谈判空间存在不确定性。
薪资信号面议 (40K-70K/月)
成长发展
95较高
该职位处于技术最前沿,接触大模型核心研发,技能成长极快。公司有丰富资源,可积累分布式训练、推理优化等稀缺经验。
技术前沿前沿/新兴技术
技术栈大模型、分布式训练、PyTorch、vLLM、SGLang、CUDA
业务类型profit_center
工作生活
40较低
仅现场办公,北京核心地段,但大模型研发高强度,可能存在加班。JD未提WLB,预期工作与生活平衡一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
80较高
大模型推动AI行业进步,社会影响力高。浪潮服务政企客户,有实际落地场景,使命感较强。行业高速增长。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
浪潮 的其他在招职位
相似职位推荐
Watch Jobs