
浪潮
大模型推理应用工程师
大模型推理应用工程师
发布于 大约 5 小时前普通员工/个人贡献者
济南市
无经验要求
全职员工
仅现场办公
硕士
软件工程
Llm
Pytorch
Sglang
Vllm
推理加速
模型剪枝
模型量化
AI 估算 · 25k–40k
硕士学历+大模型热门方向,浪潮作为上市大厂薪资有竞争力,但济南薪酬水平略低于一线,综合预估月薪2.5-4万。
职位详情
关于这个职位
该职位主要负责开源大模型(如Llama、Qwen)的本地化推理部署、性能优化与运维保障
你将参与推理环境搭建、模型量化加速、K8S部署及线上问题排查,支撑AI业务场景落地
适合对大模型推理技术有浓厚兴趣、具备Python基础且愿意深入工程实践的求职者
最低要求
硕士及以上学历,计算机、人工智能、软件工程、大数据、自动化等相关专业,有无经验均可,具备相关项目或实习经历者优先
具备扎实的计算机基础知识,熟练掌握Python编程语言,熟悉数据结构、操作系统、计算机网络相关理论,代码规范,具备基础问题排查能力
熟悉大模型基础原理与Transformer核心架构,掌握大模型推理基本流程,了解Qwen、Llama、Baichuan等开源模型及VLLM、Sglang等推理框架者优先
善于借助AI研发工具辅助编码、调试与技术分析,能够利用AI工具提升脚本开发、问题排查与方案落地效率,熟练赋能研发全流程者优先
自主学习能力突出,可快速跟进大模型前沿技术,乐于技术沉淀与经验分享,具备良好的文档撰写、沟通协作能力与岗位责任心,可独立负责模块落地工作
工作职责
协助完成Llama、Qwen、Baichuan等开源大模型本地化、私有化推理部署工作,负责推理环境搭建、调试与试运行,保障大模型推理服务稳定可用,支撑AI业务场景落地
参与大模型推理性能优化工作,落地模型量化、剪枝、推理加速、显存优化等关键技术,有效降低推理延迟、提升吞吐效率,适配多类硬件推理场景
负责大模型推理服务常态化监控、故障排查与迭代优化,梳理推理异常与性能瓶颈,输出专项优化报告,持续提升推理服务稳定性与响应效率
依托Linux、K8S环境完成大模型应用工程化部署、接口联调与功能测试,排查线上报错及性能问题,实现模型轻量化部署与稳定运维
配合团队推进大模型推理相关项目落地、测试与验收工作,协同产品及业务团队解决推理环节技术问题,助力业务智能化迭代升级
AI 洞察
优缺点分析
优点
- 紧跟业界前沿技术,积累大模型推理与优化经验,市场稀缺度高
- 浪潮作为国产服务器龙头,硬件资源丰富,可接触多种GPU和推理硬件
- 需要快速学习大量新工具(VLLM、Sglang、量化工具等),技术迭代快
- 推理部署涉及硬件适配和性能调优,问题排查难度较大
- 适合对AI工程化有浓厚兴趣、喜欢动手实践和调优技术细节的硕士毕业生或初级工程师
缺点 / 挑战
- 岗位对经验要求宽松,硕士应届生也有机会,职业起点较高
- 岗位需要同时关注稳定性和性能,运维压力可能存在
角色解读
- 技术纵深发展:成为大模型推理与部署专家,深入GPU优化、分布式推理等方向
- 横向拓展:转向AI平台架构或MLOps,负责大规模AI服务集群的架构设计
- 管理路径:积累项目经验后晋升为技术Leader,带领推理优化团队
- 部署和调优开源大模型(如Llama、Qwen),搭建推理环境并保障服务稳定运行
- 使用模型量化、剪枝等技术优化推理性能,降低延迟提升吞吐
- 在Linux和K8S环境下完成模型工程化部署、接口联调和监控运维
- 配合团队推进项目落地,协同业务解决推理技术问题
- 扎实的Python编程能力,熟悉数据结构、操作系统等计算机基础
- 理解Transformer架构和大模型推理流程,了解VLLM/Sglang等推理框架
- 具备Linux和Kubernetes操作经验,能独立完成部署与排障
- 善于使用AI工具辅助开发,具备较强的自学能力和文档撰写能力
申请策略
- 深入了解浪潮在AI基础设施方面的业务,面试中可结合公司产品(如AI服务器)展示匹配度
- 准备一个完整的推理部署案例(如从模型下载到API服务),以体现工程落地能力
- 突出大模型相关项目或实习经历,尤其是模型部署、推理加速的经验
- 展示Python编程能力和Linux/K8S使用经验,可附上GitHub代码示例
- 强调学习能力和技术热情,比如参与开源项目或技术博客
- 提前熟悉VLLM、Sglang等推理框架的安装和使用
- 学习模型量化(如GPTQ、AWQ)和剪枝的基本原理与工具
- 补充K8S和Docker的实操经验,能独立部署服务
面试指南
- 技术原理类:先给出核心概念,再结合实际项目说明应用场景和效果
- 问题排查类:采用“观察现象→定位根因→解决方案→验证结果”的结构化逻辑
- 开放性设计类:从多个维度(性能、成本、稳定性)权衡,给出具体方案
- 请解释Transformer中Self-Attention的计算过程及推理时的显存占用
- 如何优化大模型推理的延迟和吞吐?列举常用方法
- 描述一次你使用K8S部署服务并排查故障的经历
- 模型量化有哪几种方式?各自优缺点是什么?
- 如果线上推理服务突然变慢,你会如何排查?
职位点评
72
综合评分
浪潮济南大模型推理岗,技术前沿、成长潜力大,薪资面议但预期可观,WLB信息较少。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合重视技术成长和前沿技能积累的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活60
使命价值65
薪资福利
70中等
薪资面议但浪潮为上市大厂,济南薪酬水平中等偏上,福利较完善,但具体薪资需面试确认。
薪资信号面议 (25K-40K/月)
成长发展
85较高
岗位涉及大模型推理前沿技术,技能成长空间大,公司平台能提供丰富实践机会,但JD未明确晋升路径。
技术前沿前沿/新兴技术
技术栈LLM、VLLM、Sglang、模型量化、剪枝、Kubernetes、Transformer
业务类型profit_center
工作生活
60中等
仅现场办公,济南生活成本较低,但JD未提及弹性工作或WLB信息。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
65中等
大模型技术推动AI产业进步,有一定社会价值,但岗位偏工程实现,使命感不强。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
浪潮 的其他在招职位
相似职位推荐
Watch Jobs