Shouqianba logo
收钱吧
【27届校招】LLM/多模态部署工程师(J11448)

【27届校招】LLM/多模态部署工程师(J11448)

发布于 大约 8 小时前

普通员工/个人贡献者

上海市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Cuda
Llm
Pytorch
Tensorrt-Llm
Vllm
多模态
推理优化

AI 估算 · 20k–35k

AI大模型部署人才稀缺,上海互联网校招薪资较高,结合岗位技能要求,估算月薪2-3.5万,14薪。

职位详情

关于这个职位

作为LLM/多模态部署工程师,你将负责人/多模态大模型的服务化部署与运维,参与推理性能优化(量化、KV Cache等),搭建推理平台并管理GPU资源池

这是技术深度强、贴近AI基础设施的岗位,适合对AI工程化充满热情的应届生

最低要求

本科及以上学历,计算机、人工智能、软件工程等相关专业

扎实的计算机基础:操作系统、计算机网络、数据结构与算法
熟悉 Linux 环境与 Shell 脚本
熟练掌握 Python,了解 PyTorch 等深度学习框架
熟悉 C++ 或 CUDA 者优先
了解主流大模型架构(Transformer、LLM、多模态模型),有模型推理、微调或部署相关项目 / 实习经验者优先
了解 Docker、Kubernetes 等容器化技术,有 GPU 环境使用经验(NVIDIA CUDA 生态)者优先
了解常用推理优化手段(量化、批处理、流式输出等)或推理框架(vLLM 等)者优先
自驱力强,对 AI 技术有热情,具备良好的问题排查能力与沟通协作能力
加分项
)有 vLLM / TensorRT-LLM / SGLang / Triton 等推理框架的实际使用或二次开发经验
)有国产化芯片(昇腾、寒武纪等)适配经验
)有开源项目贡献、技术博客或 AI 相关竞赛经历(如 Kaggle、天池等)
)有 RAG、Agent、多模态应用(图文 / 音视频)相关落地经验

工作职责

负责人 / 多模态大模型的部署、服务化与运维,保障线上服务的稳定性与高可用

参与推理性能优化,包括但不限于量化(INT8/INT4)、KV Cache 优化、算子融合、显存治理,持续降低推理成本
搭建和维护模型推理平台(如 vLLM、TensorRT-LLM、SGLang、Triton 等),支持业务侧的模型接入与迭代
参与 GPU 资源池的规划、监控与调度,输出容量评估与成本分析
跟进业界前沿推理优化技术与开源生态,推动落地到实际业务场景

优先资格

)有 vLLM / TensorRT-LLM / SGLang / Triton 等推理框架的实际使用或二次开发经验

)有国产化芯片(昇腾、寒武纪等)适配经验
)有开源项目贡献、技术博客或 AI 相关竞赛经历(如 Kaggle、天池等)
)有 RAG、Agent、多模态应用(图文 / 音视频)相关落地经验

AI 洞察

优缺点分析

优点

  • 接触前沿的大模型部署与优化技术,技术含量高,成长快
  • 真实业务场景和完整GPU资源,实践机会多
  • 公司提供完善导师带教和培养体系,应届生友好
  • AI赛道热度高,跳槽选择面广
  • 大模型推理优化涉及底层算子、显存管理,技术门槛高,学习曲线陡
  • AI领域变化快,需要持续跟进新技术和开源社区,要求终身学习

缺点 / 挑战

  • 需要保证线上服务稳定,可能面临较大的工作压力和on-call
  • 适合对AI工程化有强烈兴趣、计算机基础扎实、喜欢挑战底层性能优化问题的应届生

角色解读

  • 从模型部署工程师向AI基础设施专家发展,成为推理性能和成本优化的技术专家
  • 可横向扩展至MLOps、AI平台架构师等方向,或深入底层算子开发
  • 大模型落地需求旺盛,职业发展前景广阔
  • 负责LLM/多模态大模型的服务化部署与线上运维,确保系统稳定高可用
  • 参与推理性能优化,包括量化、KV Cache、算子融合等,降低推理成本
  • 搭建和维护推理平台(vLLM、TensorRT-LLM等),支持业务模型接入与迭代
  • 规划GPU资源池,进行容量评估与成本分析
  • 扎实的计算机基础(操作系统、网络、数据结构算法),熟悉Linux和Shell
  • 熟练掌握Python,了解PyTorch,最好有C++/CUDA经验
  • 了解主流大模型架构和推理优化技术,熟悉vLLM等推理框架
  • 了解Docker/Kubernetes容器化技术,有GPU环境使用经验

申请策略

  • 在简历中明确写清与LLM部署相关的项目和成果,量化性能提升指标
  • 了解收钱吧的业务场景(移动支付SaaS),思考AI如何赋能支付场景
  • 突出项目或实习中涉及模型部署、推理优化的经历,如使用vLLM、TensorRT-LLM等
  • 详述GPU环境使用经验,包括CUDA、Docker部署等
  • 展示开源贡献或竞赛经历,体现技术热情与学习能力
  • 强调计算机基础(操作系统、数据结构等)扎实
  • 提前学习vLLM、TensorRT-LLM等推理框架的使用和原理
  • 了解量化、KV Cache等优化手段,可尝试复现简单的优化案例

面试指南

  • STAR法则:情境(Situation)、任务(Task)、行动(Action)、结果(Result),描述项目经验
  • 从原理到实践:先解释基础概念,再结合自己的实践说明
  • 对比分析:对比不同方案(如FP16vsINT8),说明你的选择和理由
  • 你用过哪些推理框架?请介绍一次模型部署的完整流程和遇到的挑战
  • 解释一下量化(INT8/INT4)的原理和对推理性能的影响?
  • 如何优化vLLM的显存占用?KV Cache有什么作用?
  • 在GPU服务中,如何保证高可用和低延迟?
  • 你对多模态大模型的部署有什么理解?与纯文本模型有什么不同?

职位点评

69
综合评分

AI大模型部署校招岗,技术前沿且培养体系完善,但薪资福利未明确,WLB未知。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求技术深度和快速成长、对大模型工程化有热情的应届生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展90
工作生活50
使命价值70

薪资福利

55较低

JD未披露薪资和具体福利,但AI岗位市场薪资普遍较高,稳定性尚可,补偿性动机满足有限。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

90较高

JD明确提到完善的导师带教机制与校招培养体系,且岗位涉及LLM部署前沿技术,技能成长空间大。

技术前沿前沿/新兴技术
技术栈LLM、多模态、推理优化、vLLM、TensorRT-LLM、SGLang、Triton、CUDA
成长机会导师带教机制、校招培养体系
业务类型cost_center

工作生活

50较低

JD未提及工作模式、加班情况,地点上海,通勤未知,生活化动机满足度中等偏下。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

大模型部署属于高速增长赛道,技术前瞻性强,但JD未强调社会价值,意义感主要来自技术本身。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs