Inspur logo
浪潮
大模型推理应用工程师

大模型推理应用工程师

发布于 大约 5 小时前

普通员工/个人贡献者

济南市
无经验要求
全职员工
仅现场办公
硕士
软件工程
Llm
Pytorch
Sglang
Vllm
推理加速
模型剪枝
模型量化

AI 估算 · 25k–40k

硕士学历+大模型热门方向,浪潮作为上市大厂薪资有竞争力,但济南薪酬水平略低于一线,综合预估月薪2.5-4万。

职位详情

关于这个职位

该职位主要负责开源大模型(如Llama、Qwen)的本地化推理部署、性能优化与运维保障

你将参与推理环境搭建、模型量化加速、K8S部署及线上问题排查,支撑AI业务场景落地
适合对大模型推理技术有浓厚兴趣、具备Python基础且愿意深入工程实践的求职者

最低要求

硕士及以上学历,计算机、人工智能、软件工程、大数据、自动化等相关专业,有无经验均可,具备相关项目或实习经历者优先

具备扎实的计算机基础知识,熟练掌握Python编程语言,熟悉数据结构、操作系统、计算机网络相关理论,代码规范,具备基础问题排查能力
熟悉大模型基础原理与Transformer核心架构,掌握大模型推理基本流程,了解Qwen、Llama、Baichuan等开源模型及VLLM、Sglang等推理框架者优先
善于借助AI研发工具辅助编码、调试与技术分析,能够利用AI工具提升脚本开发、问题排查与方案落地效率,熟练赋能研发全流程者优先
自主学习能力突出,可快速跟进大模型前沿技术,乐于技术沉淀与经验分享,具备良好的文档撰写、沟通协作能力与岗位责任心,可独立负责模块落地工作

工作职责

协助完成Llama、Qwen、Baichuan等开源大模型本地化、私有化推理部署工作,负责推理环境搭建、调试与试运行,保障大模型推理服务稳定可用,支撑AI业务场景落地

参与大模型推理性能优化工作,落地模型量化、剪枝、推理加速、显存优化等关键技术,有效降低推理延迟、提升吞吐效率,适配多类硬件推理场景
负责大模型推理服务常态化监控、故障排查与迭代优化,梳理推理异常与性能瓶颈,输出专项优化报告,持续提升推理服务稳定性与响应效率
依托Linux、K8S环境完成大模型应用工程化部署、接口联调与功能测试,排查线上报错及性能问题,实现模型轻量化部署与稳定运维
配合团队推进大模型推理相关项目落地、测试与验收工作,协同产品及业务团队解决推理环节技术问题,助力业务智能化迭代升级

AI 洞察

优缺点分析

优点

  • 紧跟业界前沿技术,积累大模型推理与优化经验,市场稀缺度高
  • 浪潮作为国产服务器龙头,硬件资源丰富,可接触多种GPU和推理硬件
  • 需要快速学习大量新工具(VLLM、Sglang、量化工具等),技术迭代快
  • 推理部署涉及硬件适配和性能调优,问题排查难度较大
  • 适合对AI工程化有浓厚兴趣、喜欢动手实践和调优技术细节的硕士毕业生或初级工程师

缺点 / 挑战

  • 岗位对经验要求宽松,硕士应届生也有机会,职业起点较高
  • 岗位需要同时关注稳定性和性能,运维压力可能存在

角色解读

  • 技术纵深发展:成为大模型推理与部署专家,深入GPU优化、分布式推理等方向
  • 横向拓展:转向AI平台架构或MLOps,负责大规模AI服务集群的架构设计
  • 管理路径:积累项目经验后晋升为技术Leader,带领推理优化团队
  • 部署和调优开源大模型(如Llama、Qwen),搭建推理环境并保障服务稳定运行
  • 使用模型量化、剪枝等技术优化推理性能,降低延迟提升吞吐
  • 在Linux和K8S环境下完成模型工程化部署、接口联调和监控运维
  • 配合团队推进项目落地,协同业务解决推理技术问题
  • 扎实的Python编程能力,熟悉数据结构、操作系统等计算机基础
  • 理解Transformer架构和大模型推理流程,了解VLLM/Sglang等推理框架
  • 具备Linux和Kubernetes操作经验,能独立完成部署与排障
  • 善于使用AI工具辅助开发,具备较强的自学能力和文档撰写能力

申请策略

  • 深入了解浪潮在AI基础设施方面的业务,面试中可结合公司产品(如AI服务器)展示匹配度
  • 准备一个完整的推理部署案例(如从模型下载到API服务),以体现工程落地能力
  • 突出大模型相关项目或实习经历,尤其是模型部署、推理加速的经验
  • 展示Python编程能力和Linux/K8S使用经验,可附上GitHub代码示例
  • 强调学习能力和技术热情,比如参与开源项目或技术博客
  • 提前熟悉VLLM、Sglang等推理框架的安装和使用
  • 学习模型量化(如GPTQ、AWQ)和剪枝的基本原理与工具
  • 补充K8S和Docker的实操经验,能独立部署服务

面试指南

  • 技术原理类:先给出核心概念,再结合实际项目说明应用场景和效果
  • 问题排查类:采用“观察现象→定位根因→解决方案→验证结果”的结构化逻辑
  • 开放性设计类:从多个维度(性能、成本、稳定性)权衡,给出具体方案
  • 请解释Transformer中Self-Attention的计算过程及推理时的显存占用
  • 如何优化大模型推理的延迟和吞吐?列举常用方法
  • 描述一次你使用K8S部署服务并排查故障的经历
  • 模型量化有哪几种方式?各自优缺点是什么?
  • 如果线上推理服务突然变慢,你会如何排查?

职位点评

72
综合评分

浪潮济南大模型推理岗,技术前沿、成长潜力大,薪资面议但预期可观,WLB信息较少。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合重视技术成长和前沿技能积累的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活60
使命价值65

薪资福利

70中等

薪资面议但浪潮为上市大厂,济南薪酬水平中等偏上,福利较完善,但具体薪资需面试确认。

薪资信号面议 (25K-40K/月)

成长发展

85较高

岗位涉及大模型推理前沿技术,技能成长空间大,公司平台能提供丰富实践机会,但JD未明确晋升路径。

技术前沿前沿/新兴技术
技术栈LLM、VLLM、Sglang、模型量化、剪枝、Kubernetes、Transformer
业务类型profit_center

工作生活

60中等

仅现场办公,济南生活成本较低,但JD未提及弹性工作或WLB信息。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

大模型技术推动AI产业进步,有一定社会价值,但岗位偏工程实现,使命感不强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs