AgiBot logo
智元机器人
具身智能算法实习生(训练效率方向)

具身智能算法实习生(训练效率方向)

发布于 大约 7 小时前

实习/见习

上海市
无经验要求
实习生
仅现场办公
本科
研究与开发 (研发)
Cuda
Gpu
并行计算
性能优化
深度学习
算子融合
Cuda Graph

AI 估算 · 4k–6k

上海AI算法实习生市场月薪约4000-6000元,训练效率方向技术含量高,但实习薪资通常不高。

职位详情

关于这个职位

这是一个面向具身智能(Embodied AI)训练效率优化的算法实习岗位,你将参与预训练与后训练全链路的性能度量与优化

工作内容包括GPU利用率监控、算子融合、CUDA Graph等底层加速技术,以及并行通信和数据加载效率提升
适合对深度学习底层计算有强烈兴趣、动手能力强的同学

最低要求

计算机、AI 等相关专业硕士在读或优秀本科生

熟悉 Python/C++,有 CUDA 编程经验或 GPU 性能调优兴趣
对深度学习模型架构与训练算法有基本理解,愿意深入学习计算特性与优化方法
具备良好的工程意识与代码规范
实习 3 个月以上优先,能长期实习更佳

工作职责

参与具身智能训练效率的度量、分析与系统性优化,覆盖预训练与后训练全链路

理解不同模型架构与训练算法的计算特性,参与针对性优化方案的设计与实现
参与训练效率监控体系建设,包括 GPU 利用率、训练吞吐、通信效率等核心指标的可视化与自动化追踪
参与模型训练效率优化:算子融合、CUDA graph、kernel 调优等
参与并行与通信效率优化:梯度同步、云边通信、权重分发等通信开销分析与优化
参与数据加载效率优化:数据预处理 pipeline、IO 吞吐优化

优先资格

有 CUDA graph / 算子融合 / Triton kernel 开发经验

有性能分析工具(Nsight Systems / PyTorch Profiler)使用经验
有论文复现或相关研究经验

AI 洞察

优缺点分析

优点

  • 参与前沿具身智能领域,技术栈涉及CUDA、算子融合、分布式训练等底层优化,技能积累价值高
  • 公司为B轮中大型企业,具身智能赛道热门,未来成长空间大
  • 工作内容涉及全链路优化,能系统提升对大规模训练系统的理解
  • 实习薪资在AI行业中处于中等水平,且需要全职现场办公,灵活性较低
  • 适合对深度学习底层计算有浓厚兴趣、享受性能调优成就感、且能投入较长时间(3个月以上)的计算机或AI专业同学

缺点 / 挑战

  • 需要较强的C++/CUDA基础,学习曲线陡峭,对没有底层经验的同学挑战较大
  • 训练效率优化往往需要反复调试,工作强度可能较高,但成就感也强

角色解读

  • 从算法实习生起步,深入掌握GPU底层优化技术,成为高性能计算工程师或AI系统优化专家
  • 积累具身智能领域经验后,可转向机器人算法全栈开发或训练框架研发
  • 长期可向架构师或技术负责人发展,主导训练效率优化平台建设
  • 参与具身智能模型训练全链路的效率度量与优化,包括预训练和后训练阶段
  • 使用CUDA、算子融合、CUDA Graph等技术对模型训练进行底层加速
  • 构建训练效率监控体系,可视化GPU利用率、吞吐等指标,并自动化追踪异常
  • 优化并行通信和数据加载流程,降低梯度同步、I/O等瓶颈
  • 扎实的Python/C++编程能力,熟悉CUDA编程或对GPU性能调优有强烈兴趣
  • 对深度学习模型架构和训练算法(如Transformer、分布式训练)有基本理解
  • 良好的工程习惯,能编写高效、可维护的代码
  • 对性能分析工具(Nsight Systems、PyTorch Profiler)有使用经验者优先

申请策略

  • 简历中附上GitHub链接,展示相关代码或项目,尤其是性能优化方面的
  • 在面试中表达对具身智能和训练效率的热情,可以准备对现有训练框架(如Megatron、DeepSpeed)的简单思考
  • 突出CUDA编程经历或GPU优化项目,如矩阵乘法优化、算子融合实现等
  • 展示深度学习训练调优经验,例如调整batch size、混合精度训练等对吞吐的影响
  • 如果有性能分析工具(Nsight、Profiler)使用经验,务必具体说明分析过程与结果
  • 提到参与的论文复现或相关研究工作,体现对模型架构的理解
  • 提前学习CUDA编程基础与Triton语言,动手实现简单的算子融合
  • 熟悉PyTorch Profiler和Nsight Systems的使用,了解如何定位训练瓶颈

面试指南

  • 针对性能优化问题:描述具体场景→使用的工具→优化的参数/方法→量化结果提升(如吞吐量提高X%)
  • 针对概念理解问题:先给出定义或原理→结合实际例子说明→指出常见挑战或优化方向
  • 请介绍一次你使用CUDA进行性能优化的经历,具体优化了哪些方面?
  • 如何衡量深度学习训练的效率?有哪些关键指标?
  • 解释一下算子融合的原理,并举例说明如何实现
  • 你了解哪些分布式训练中的通信模式?如何减少通信开销?
  • 如果发现GPU利用率低,你会从哪些方面排查?
  • 复习CUDA编程模型、GPU架构基础(如SM、warp、shared memory)

职位点评

67
综合评分

前沿具身智能算法实习,技术成长性强,但薪资一般且需全职现场。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
最适合以技术成长为核心驱动、不计较短期薪资和WLB的求职者。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利40
成长发展88
工作生活50
使命价值75

薪资福利

40较低

实习薪资未披露,按市场水平一般,且没有提及福利,补偿性动机满足程度较低。

薪资信号未披露(AI估算:4K-6K/月)

成长发展

88较高

技术栈前沿(CUDA、算子融合、分布式优化),能深入底层训练系统,成长性强,但JD未明确提及培训或晋升路径。

技术前沿前沿/新兴技术
技术栈CUDA、Python、C++、深度学习、GPU、算子融合、CUDA Graph、Triton
业务类型profit_center

工作生活

50较低

需要现场办公,地点在上海,未提及弹性工作制,WLB信号不明。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

具身智能是高速增长的赛道,有很强的技术前沿性,但社会影响力一般,创新程度较高。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs