
智元机器人
高性能计算工程师-Genie业务部
高性能计算工程师-Genie业务部
发布于 大约 14 小时前普通员工/个人贡献者
北京市 / 上海市
高级经验
全职员工
仅现场办公
学历未注明
信息技术与基础设施
Cuda
Gpu架构
Hpc
Pytorch
国产芯片
并行计算
异构计算
性能优化
AI 估算 · 30k–60k
HPC/CUDA优化人才稀缺,技术门槛高,北京上海薪资水平高,B轮公司为吸引人才提供有竞争力薪酬。
职位详情
关于这个职位
该职位负责高性能计算核心算法设计与开发,专注于CPU/GPU/ASIC多芯片性能优化,涉及CUDA编程、算子开发与模型加速
你将参与异构计算集群构建,使用Triton、CUTLASS等工具解决性能瓶颈,提升AI模型运行效率
适合对底层计算优化充满热情、精通CUDA的工程师
最低要求
有高性能计算(HPC)或 AI 优化加速相关工作经验
精通 CUDA 生态,熟悉编译流程,深入理解 GPU 架构、内存模型及并行计算原理,具备扎实的 CUDA 编程功底,能独立编写、调试并优化 CUDA Kernel
熟练使用 Triton、CUTLASS 等工具,有基于这些工具进行算子开发、模型加速的实战经验
理解 PyTorch/TensorFlow 等 AI 框架及常见 AI 模型(VLA, LLM等)
熟悉 Nsys, NCU 等性能分析工具,能精准定位并解决 GPU 计算中的性能瓶颈
熟悉国产芯片的运行流程及编译链路,具备相关算子开发实战经验
工作职责
负责 HPC 核心算法设计开发,优化 CPU/GPU/ASIC 多芯片性能,追求极致吞吐量与延迟
对接业务场景,定位并解决计算性能瓶颈,提升业务运行效率
参与异构计算集群的构建,推进异构计算方案落地与迭代
AI 洞察
优缺点分析
优点
- 技术前沿性强,HPC和AI加速是当前热门方向,技能含金量高
- 接触CUDA、Triton等底层优化工具,积累深厚的技术功底
- 公司处于B轮,业务发展快,有较大成长空间
- 工作技术难度大,需要持续学习并解决复杂性能问题
- 要求软硬件结合深度理解,入门门槛高
缺点 / 挑战
- 性能优化常需反复调试迭代,可能面临较大的工作压力
- 适合对底层计算和性能优化有浓厚兴趣、喜欢挑战技术难题、具备扎实C++/CUDA功底且耐心细致的工程师
角色解读
- 向资深HPC/性能优化专家方向发展,成为GPU计算领域的技术权威
- 转向AI基础设施架构师,负责大规模异构计算集群设计
- 深入国产芯片生态,成为软硬件协同优化的稀缺人才
- 负责HPC核心算法设计开发,优化CPU/GPU/ASIC多芯片性能,追求极致吞吐量和延迟
- 对接业务场景,定位并解决计算性能瓶颈,提升业务运行效率
- 参与异构计算集群构建,推进异构计算方案落地与迭代
- 精通CUDA编程,深入理解GPU架构、内存模型和并行计算原理
- 熟练使用Triton、CUTLASS进行算子开发和模型加速
- 熟悉Nsys、NCU等性能分析工具,能精准定位性能瓶颈
- 理解PyTorch/TensorFlow等AI框架和常见AI模型(VLA、LLM等)
申请策略
- 在简历中量化性能优化成果(如“延迟降低30%”)
- 关注智元机器人的业务方向(具身智能),了解其计算需求
- 突出CUDA/Kernel优化项目经验,如性能提升倍数、具体优化手段
- 展示使用Triton/CUTLASS进行算子开发的实例
- 强调性能分析工具(Nsys/NCU)的使用经验
- 提及对常见AI模型(如LLM)的加速经验
- 深入复习GPU体系结构和CUDA优化技术,熟悉最新特性
- 学习Triton和CUTLASS框架,尝试开源算子优化项目
面试指南
- 先明确问题本质,再结合具体项目经验回答,突出优化过程和结果
- 用“问题-分析-方案-效果”的结构组织答案
- 展示对底层原理的理解,而不只停留在工具使用层面
- 请解释CUDA中grid、block、warp之间的关系,以及如何设置合适的block size
- 你遇到过哪些GPU性能瓶颈?你是如何定位和解决的?
- 如何优化一个矩阵乘法kernel?请从访存和计算角度分析
- Triton和CUTLASS各有什么优缺点?你如何选择?
- 你对国产AI芯片的现状有什么了解?如何迁移CUDA代码到国产芯片?
职位点评
71
综合评分
前沿技术岗位,薪资竞争力强,技术成长快,但工作强度和不确定性较高。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度、渴望在HPC/AI计算领域成长、对工作弹性要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值65
薪资福利
75中等
该职位虽未明确薪资,但结合技术难度和城市,预计提供有竞争力的薪酬,福利未在JD中提及。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
85较高
技术前沿,涉及CUDA、Triton等高级优化工具,个人技能成长空间大,但JD未明确晋升路径。
技术前沿前沿/新兴技术
技术栈CUDA、Triton、CUTLASS、HPC、GPU、并行计算、PyTorch
业务类型ambiguous
工作生活
50较低
仅现场办公,地理位置一线城市,但未提及弹性工作或WLB信息,工作灵活性有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
65中等
具身智能行业前景广阔,技术本身对业务推动价值明显,但直接社会意义中性。
行业发展新兴领域(暂难判断)
社会影响中性/一般
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs