Alibaba logo
阿里巴巴
平头哥-边缘AI芯片算法部署工程师-上海

平头哥-边缘AI芯片算法部署工程师-上海

发布于 大约 3 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Agent框架
Ai推理优化
Cuda
Npu
Tensorrt
性能分析
端侧部署

AI 估算 · 40k–70k

AI芯片与边缘部署方向热门,上海一线大厂,5年+经验,薪资竞争力强,月薪40-70k合理。

职位详情

关于这个职位

该职位负责将大模型高效部署到端侧和边缘设备,优化多模型推理性能与资源利用率

你将基于主流Agent框架设计端侧运行时架构,并深入分析芯片微架构性能瓶颈,推动软硬件协同优化
适合对AI推理、并行计算和底层系统优化有深厚经验的工程师

最低要求

计算机科学、电子工程、微电子、自动化等相关专业硕士及以上学历

具备Agent框架工程实践经验:了解OpenClaw(ReAct+Skills模式、MCP集成)或Hermes-Agent(自我改进机制、子Agent委派、上下文压缩)等主流Agent框架的架构原理和部署模式
有将Agent框架适配到端侧硬件平台(边缘服务器、嵌入式AI模组、机器人计算平台)的实践经验者优先
具备3年以上AI推理优化相关工作经验,深刻理解并行计算和CUDA编程,熟悉TensorRT和TensorRT-LLM的模型部署和优化
熟练掌握C/C++,熟悉Python,具备优化计算编程能力
熟悉边缘AI芯片上模型部署使用者优先
理解GPU/GPU/NPU的计算架构原理,包括计算流水线、内存层次结构、带宽与延迟的权衡
熟悉Linux系统,精通系统性能分析工具的使用和分析,如nsight-sys/nsight-compute/xperf/eBPF等
能从算子级、图级、系统级多层次定位性能瓶颈
良好的口头和书面表达能力,包括英文读写能力,良好的沟通能力和团队合作意识
具备良好的文档输出能力,能撰写结构清晰、数据翔实的性能分析报告和优化建议书

工作职责

负责大模型在端侧/边缘设备的高效部署,优化多模型部署、多任务调度、多线程/多进程加速,提升推理性能与资源利用率

基于主流Agent框架,设计端侧Agent运行时架构与产品方案
优化Agent上下文管理(包括上下文窗口、缓存策略、压缩算法),提升长对话和复杂任务的执行效率等
深入分析端侧AI软件栈和芯片微架构性能瓶颈(如核心利用率、内存带宽、指令流水线等),持续输出优化建议,推动芯片架构和SDK持续优化

优先资格

有端侧大模型推理优化经验(量化、KV Cache优化、Speculative Decoding、FlashAttention适配等)

有CUDA/OpenCL/类CUDA编程模型的算子开发或优化经验
有Transformer架构的深度理解和推理优化经验(Attention机制优化、KV Cache管理、Prefill/Decode分离等)
有开源社区贡献经验(如vLLM、llama.cpp、TVM等项目)

AI 洞察

优缺点分析

优点

  • 阿里巴巴平头哥是行业领先的AI芯片团队,平台大,技术积累深厚
  • 能够接触芯片底层微架构和Agent框架,技能壁垒高,市场竞争力强
  • 薪资福利具有竞争力,公司资源丰富
  • 需要深厚的底层优化功底,工作强度可能较大,技术门槛高
  • 边缘AI部署生态尚在早期,需要应对较多不确定性

缺点 / 挑战

  • 涉及大模型端侧部署前沿方向,技术挑战大,成长空间高
  • 对跨领域能力(算法+硬件+系统)要求高,学习压力持续存在
  • 适合对AI推理优化和底层系统有强烈兴趣,喜欢挑战技术难题,并愿意在芯片软硬件协同领域深耕的工程师

角色解读

  • 在AI芯片公司可深入底层软硬件协同优化,成为端侧AI部署专家
  • 积累Agent框架和端侧推理经验,可向AI系统架构师或芯片解决方案专家方向发展
  • 有开源社区贡献机会,提升行业影响力,也有机会转向技术管理岗位
  • 负责将大模型高效部署到边缘设备,优化多模型调度与并行加速,提升推理性能
  • 设计端侧Agent运行时架构,优化上下文管理、缓存和压缩策略,提升复杂任务执行效率
  • 深入分析芯片微架构和软件栈的性能瓶颈,输出优化建议并推动芯片与SDK改进
  • 精通CUDA编程和TensorRT/TensorRT-LLM,具备丰富的AI推理优化经验
  • 熟练掌握C/C++和Python,具备系统级性能分析能力,熟悉nsight-sys、eBPF等工具
  • 理解主流Agent框架(如OpenClaw、Hermes-Agent)的架构原理,并有端侧适配经验
  • 熟悉GPU/GPU/NPU计算架构,能够从算子级、图级、系统级定位性能瓶颈

申请策略

  • 建议在简历中用量化指标凸显优化成果,例如推理延迟降低X%,吞吐量提升Y%
  • 可提前了解平头哥芯片产品线和生态,展现对公司技术方向的认同
  • 突出大模型推理优化的实际项目经验,例如量化、KV Cache优化或TensorRT部署
  • 强调CUDA/OpenCL算子开发或性能优化的成果,用具体数据说明性能提升
  • 展示对Agent框架的了解或实践,尤其是端侧适配经验
  • 提及开源贡献经历,特别是vLLM、llama.cpp、TVM等项目
  • 系统复习CUDA编程、TensorRT部署和性能分析工具,准备深度学习推理优化的经典案例
  • 动手研究主流Agent框架(如OpenClaw、Hermes-Agent)的源代码,理解其部署模式

面试指南

  • 采用STAR法则:情境-任务-行动-结果,突出量化成果和你的思考过程
  • 对于技术问题,先讲原理,再结合项目经验,最后总结方法论
  • 展示对性能优化的系统思维,从算子级、图级、系统级逐层分析
  • 请描述一个你做过的大模型部署优化项目,如何分析性能瓶颈并解决的?
  • TensorRT-LLM的部署中,如何优化KV Cache和Attention?
  • 你对Agent框架在端侧设备上的部署有什么见解?如何控制内存和功耗?
  • 解释一下CUDA编程中的内存层次结构,如何优化数据访问?
  • 如何从系统级层面定位AI应用性能瓶颈?使用过哪些工具?

职位点评

76
综合评分

大厂AI芯片前沿岗,技术成长极强,薪资高,但WLB可能一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合对技术成长有强烈追求,愿意在AI推理优化领域深耕,能接受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活45
使命价值70

薪资福利

85较高

该职位薪资水平较高,公司福利好,但JD中未明确写出具体福利,但属于大厂标准。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

该职位技术前沿,涉及AI推理优化、Agent框架和芯片架构,有大量学习机会和成长空间。

技术前沿前沿/新兴技术
技术栈CUDA、TensorRT、Agent框架、端侧推理、NPU、性能优化、eBPF
成长机会推动芯片架构和SDK持续优化
业务类型ambiguous

工作生活

45较低

工作地点固定在上海,JD未提及远程或弹性工作,也未说明加班情况,但大厂高压力或成常态。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

从事AI芯片和边缘智能方向,具有技术影响力,但未直接体现社会价值使命。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs