
智元机器人
具身智能算法实习生(训练效率方向)
具身智能算法实习生(训练效率方向)
发布于 大约 7 小时前实习/见习
上海市
无经验要求
实习生
仅现场办公
本科
研究与开发 (研发)
Cuda
Gpu
并行计算
性能优化
深度学习
算子融合
Cuda Graph
AI 估算 · 4k–6k
上海AI算法实习生市场月薪约4000-6000元,训练效率方向技术含量高,但实习薪资通常不高。
职位详情
关于这个职位
这是一个面向具身智能(Embodied AI)训练效率优化的算法实习岗位,你将参与预训练与后训练全链路的性能度量与优化
工作内容包括GPU利用率监控、算子融合、CUDA Graph等底层加速技术,以及并行通信和数据加载效率提升
适合对深度学习底层计算有强烈兴趣、动手能力强的同学
最低要求
计算机、AI 等相关专业硕士在读或优秀本科生
熟悉 Python/C++,有 CUDA 编程经验或 GPU 性能调优兴趣
对深度学习模型架构与训练算法有基本理解,愿意深入学习计算特性与优化方法
具备良好的工程意识与代码规范
实习 3 个月以上优先,能长期实习更佳
工作职责
参与具身智能训练效率的度量、分析与系统性优化,覆盖预训练与后训练全链路
理解不同模型架构与训练算法的计算特性,参与针对性优化方案的设计与实现
参与训练效率监控体系建设,包括 GPU 利用率、训练吞吐、通信效率等核心指标的可视化与自动化追踪
参与模型训练效率优化:算子融合、CUDA graph、kernel 调优等
参与并行与通信效率优化:梯度同步、云边通信、权重分发等通信开销分析与优化
参与数据加载效率优化:数据预处理 pipeline、IO 吞吐优化
优先资格
有 CUDA graph / 算子融合 / Triton kernel 开发经验
有性能分析工具(Nsight Systems / PyTorch Profiler)使用经验
有论文复现或相关研究经验
AI 洞察
优缺点分析
优点
- 参与前沿具身智能领域,技术栈涉及CUDA、算子融合、分布式训练等底层优化,技能积累价值高
- 公司为B轮中大型企业,具身智能赛道热门,未来成长空间大
- 工作内容涉及全链路优化,能系统提升对大规模训练系统的理解
- 实习薪资在AI行业中处于中等水平,且需要全职现场办公,灵活性较低
- 适合对深度学习底层计算有浓厚兴趣、享受性能调优成就感、且能投入较长时间(3个月以上)的计算机或AI专业同学
缺点 / 挑战
- 需要较强的C++/CUDA基础,学习曲线陡峭,对没有底层经验的同学挑战较大
- 训练效率优化往往需要反复调试,工作强度可能较高,但成就感也强
角色解读
- 从算法实习生起步,深入掌握GPU底层优化技术,成为高性能计算工程师或AI系统优化专家
- 积累具身智能领域经验后,可转向机器人算法全栈开发或训练框架研发
- 长期可向架构师或技术负责人发展,主导训练效率优化平台建设
- 参与具身智能模型训练全链路的效率度量与优化,包括预训练和后训练阶段
- 使用CUDA、算子融合、CUDA Graph等技术对模型训练进行底层加速
- 构建训练效率监控体系,可视化GPU利用率、吞吐等指标,并自动化追踪异常
- 优化并行通信和数据加载流程,降低梯度同步、I/O等瓶颈
- 扎实的Python/C++编程能力,熟悉CUDA编程或对GPU性能调优有强烈兴趣
- 对深度学习模型架构和训练算法(如Transformer、分布式训练)有基本理解
- 良好的工程习惯,能编写高效、可维护的代码
- 对性能分析工具(Nsight Systems、PyTorch Profiler)有使用经验者优先
申请策略
- 简历中附上GitHub链接,展示相关代码或项目,尤其是性能优化方面的
- 在面试中表达对具身智能和训练效率的热情,可以准备对现有训练框架(如Megatron、DeepSpeed)的简单思考
- 突出CUDA编程经历或GPU优化项目,如矩阵乘法优化、算子融合实现等
- 展示深度学习训练调优经验,例如调整batch size、混合精度训练等对吞吐的影响
- 如果有性能分析工具(Nsight、Profiler)使用经验,务必具体说明分析过程与结果
- 提到参与的论文复现或相关研究工作,体现对模型架构的理解
- 提前学习CUDA编程基础与Triton语言,动手实现简单的算子融合
- 熟悉PyTorch Profiler和Nsight Systems的使用,了解如何定位训练瓶颈
面试指南
- 针对性能优化问题:描述具体场景→使用的工具→优化的参数/方法→量化结果提升(如吞吐量提高X%)
- 针对概念理解问题:先给出定义或原理→结合实际例子说明→指出常见挑战或优化方向
- 请介绍一次你使用CUDA进行性能优化的经历,具体优化了哪些方面?
- 如何衡量深度学习训练的效率?有哪些关键指标?
- 解释一下算子融合的原理,并举例说明如何实现
- 你了解哪些分布式训练中的通信模式?如何减少通信开销?
- 如果发现GPU利用率低,你会从哪些方面排查?
- 复习CUDA编程模型、GPU架构基础(如SM、warp、shared memory)
职位点评
67
综合评分
前沿具身智能算法实习,技术成长性强,但薪资一般且需全职现场。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
最适合以技术成长为核心驱动、不计较短期薪资和WLB的求职者。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利40
成长发展88
工作生活50
使命价值75
薪资福利
40较低
实习薪资未披露,按市场水平一般,且没有提及福利,补偿性动机满足程度较低。
薪资信号未披露(AI估算:4K-6K/月)
成长发展
88较高
技术栈前沿(CUDA、算子融合、分布式优化),能深入底层训练系统,成长性强,但JD未明确提及培训或晋升路径。
技术前沿前沿/新兴技术
技术栈CUDA、Python、C++、深度学习、GPU、算子融合、CUDA Graph、Triton
业务类型profit_center
工作生活
50较低
需要现场办公,地点在上海,未提及弹性工作制,WLB信号不明。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
具身智能是高速增长的赛道,有很强的技术前沿性,但社会影响力一般,创新程度较高。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs