
阿里巴巴
平头哥-边缘AI芯片算法部署工程师-上海
平头哥-边缘AI芯片算法部署工程师-上海
发布于 大约 3 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Agent框架
Ai推理优化
Cuda
Npu
Tensorrt
性能分析
端侧部署
AI 估算 · 40k–70k
AI芯片与边缘部署方向热门,上海一线大厂,5年+经验,薪资竞争力强,月薪40-70k合理。
职位详情
关于这个职位
该职位负责将大模型高效部署到端侧和边缘设备,优化多模型推理性能与资源利用率
你将基于主流Agent框架设计端侧运行时架构,并深入分析芯片微架构性能瓶颈,推动软硬件协同优化
适合对AI推理、并行计算和底层系统优化有深厚经验的工程师
最低要求
计算机科学、电子工程、微电子、自动化等相关专业硕士及以上学历
具备Agent框架工程实践经验:了解OpenClaw(ReAct+Skills模式、MCP集成)或Hermes-Agent(自我改进机制、子Agent委派、上下文压缩)等主流Agent框架的架构原理和部署模式
有将Agent框架适配到端侧硬件平台(边缘服务器、嵌入式AI模组、机器人计算平台)的实践经验者优先
具备3年以上AI推理优化相关工作经验,深刻理解并行计算和CUDA编程,熟悉TensorRT和TensorRT-LLM的模型部署和优化
熟练掌握C/C++,熟悉Python,具备优化计算编程能力
熟悉边缘AI芯片上模型部署使用者优先
理解GPU/GPU/NPU的计算架构原理,包括计算流水线、内存层次结构、带宽与延迟的权衡
熟悉Linux系统,精通系统性能分析工具的使用和分析,如nsight-sys/nsight-compute/xperf/eBPF等
能从算子级、图级、系统级多层次定位性能瓶颈
良好的口头和书面表达能力,包括英文读写能力,良好的沟通能力和团队合作意识
具备良好的文档输出能力,能撰写结构清晰、数据翔实的性能分析报告和优化建议书
工作职责
负责大模型在端侧/边缘设备的高效部署,优化多模型部署、多任务调度、多线程/多进程加速,提升推理性能与资源利用率
基于主流Agent框架,设计端侧Agent运行时架构与产品方案
优化Agent上下文管理(包括上下文窗口、缓存策略、压缩算法),提升长对话和复杂任务的执行效率等
深入分析端侧AI软件栈和芯片微架构性能瓶颈(如核心利用率、内存带宽、指令流水线等),持续输出优化建议,推动芯片架构和SDK持续优化
优先资格
有端侧大模型推理优化经验(量化、KV Cache优化、Speculative Decoding、FlashAttention适配等)
有CUDA/OpenCL/类CUDA编程模型的算子开发或优化经验
有Transformer架构的深度理解和推理优化经验(Attention机制优化、KV Cache管理、Prefill/Decode分离等)
有开源社区贡献经验(如vLLM、llama.cpp、TVM等项目)
AI 洞察
优缺点分析
优点
- 阿里巴巴平头哥是行业领先的AI芯片团队,平台大,技术积累深厚
- 能够接触芯片底层微架构和Agent框架,技能壁垒高,市场竞争力强
- 薪资福利具有竞争力,公司资源丰富
- 需要深厚的底层优化功底,工作强度可能较大,技术门槛高
- 边缘AI部署生态尚在早期,需要应对较多不确定性
缺点 / 挑战
- 涉及大模型端侧部署前沿方向,技术挑战大,成长空间高
- 对跨领域能力(算法+硬件+系统)要求高,学习压力持续存在
- 适合对AI推理优化和底层系统有强烈兴趣,喜欢挑战技术难题,并愿意在芯片软硬件协同领域深耕的工程师
角色解读
- 在AI芯片公司可深入底层软硬件协同优化,成为端侧AI部署专家
- 积累Agent框架和端侧推理经验,可向AI系统架构师或芯片解决方案专家方向发展
- 有开源社区贡献机会,提升行业影响力,也有机会转向技术管理岗位
- 负责将大模型高效部署到边缘设备,优化多模型调度与并行加速,提升推理性能
- 设计端侧Agent运行时架构,优化上下文管理、缓存和压缩策略,提升复杂任务执行效率
- 深入分析芯片微架构和软件栈的性能瓶颈,输出优化建议并推动芯片与SDK改进
- 精通CUDA编程和TensorRT/TensorRT-LLM,具备丰富的AI推理优化经验
- 熟练掌握C/C++和Python,具备系统级性能分析能力,熟悉nsight-sys、eBPF等工具
- 理解主流Agent框架(如OpenClaw、Hermes-Agent)的架构原理,并有端侧适配经验
- 熟悉GPU/GPU/NPU计算架构,能够从算子级、图级、系统级定位性能瓶颈
申请策略
- 建议在简历中用量化指标凸显优化成果,例如推理延迟降低X%,吞吐量提升Y%
- 可提前了解平头哥芯片产品线和生态,展现对公司技术方向的认同
- 突出大模型推理优化的实际项目经验,例如量化、KV Cache优化或TensorRT部署
- 强调CUDA/OpenCL算子开发或性能优化的成果,用具体数据说明性能提升
- 展示对Agent框架的了解或实践,尤其是端侧适配经验
- 提及开源贡献经历,特别是vLLM、llama.cpp、TVM等项目
- 系统复习CUDA编程、TensorRT部署和性能分析工具,准备深度学习推理优化的经典案例
- 动手研究主流Agent框架(如OpenClaw、Hermes-Agent)的源代码,理解其部署模式
面试指南
- 采用STAR法则:情境-任务-行动-结果,突出量化成果和你的思考过程
- 对于技术问题,先讲原理,再结合项目经验,最后总结方法论
- 展示对性能优化的系统思维,从算子级、图级、系统级逐层分析
- 请描述一个你做过的大模型部署优化项目,如何分析性能瓶颈并解决的?
- TensorRT-LLM的部署中,如何优化KV Cache和Attention?
- 你对Agent框架在端侧设备上的部署有什么见解?如何控制内存和功耗?
- 解释一下CUDA编程中的内存层次结构,如何优化数据访问?
- 如何从系统级层面定位AI应用性能瓶颈?使用过哪些工具?
职位点评
76
综合评分
大厂AI芯片前沿岗,技术成长极强,薪资高,但WLB可能一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合对技术成长有强烈追求,愿意在AI推理优化领域深耕,能接受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活45
使命价值70
薪资福利
85较高
该职位薪资水平较高,公司福利好,但JD中未明确写出具体福利,但属于大厂标准。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
90较高
该职位技术前沿,涉及AI推理优化、Agent框架和芯片架构,有大量学习机会和成长空间。
技术前沿前沿/新兴技术
技术栈CUDA、TensorRT、Agent框架、端侧推理、NPU、性能优化、eBPF
成长机会推动芯片架构和SDK持续优化
业务类型ambiguous
工作生活
45较低
工作地点固定在上海,JD未提及远程或弹性工作,也未说明加班情况,但大厂高压力或成常态。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
从事AI芯片和边缘智能方向,具有技术影响力,但未直接体现社会价值使命。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs