Xiaohongshu logo
小红书
AI Infra 研发实习生(搜广推训练推理平台)

AI Infra 研发实习生(搜广推训练推理平台)

发布于 大约 14 小时前

实习/见习

北京市 / 上海市
无经验要求
实习生
仅现场办公
本科
机器学习工程
Ai Infra
Go
Pytorch
Tensorflow
云原生
分布式训练

AI 估算 · 6k–12k

一线大厂AI方向实习,日薪约300-500,月薪在6k-12k区间,技术含金量高,平台溢价明显。

职位详情

关于这个职位

这个实习岗位将让你深入小红书搜索、推荐、广告的核心AI基础设施,参与模型训练与推理平台的建设,接触从分布式训练到在线服务的完整技术链路

你将同时学习算法生产、分布式系统和云原生知识,获得真实的大规模系统实战经验,是进入AI基础设施领域的绝佳机会

最低要求

计算机、软件工程、人工智能或相关专业本科及以上在读

熟悉 Python、Java、Go 中至少一种语言,具备良好的编码和工程实践能力
具备扎实的计算机基础,对操作系统、计算机网络、数据结构和分布式系统有基本理解
对机器学习系统、云原生基础设施或大规模后端平台有浓厚兴趣
具备较强的学习能力和问题分析能力,愿意深入代码和系统链路理解问题本质
每周实习 4 天及以上,可连续实习 4 个月以上

工作职责

参与搜广推训练推理平台的核心能力建设,包括任务编排、分布式训练、资源调度、模型管理、发布更新和在线服务

深入训练与推理运行链路,理解模型任务在大规模异构算力环境中的执行机制,持续优化平台的稳定性、效率和使用体验
参与复杂系统问题的分析与解决,建立从平台控制面、调度系统到 Kubernetes Runtime 和模型应用的端到端视角
参与平台架构演进,将高频经验沉淀为标准能力、诊断工具和自动化系统
探索 AI Agent 在研发、运维和故障诊断场景中的应用,提升机器学习平台的智能化水平

优先资格

了解搜索、推荐或广告系统的基本架构

使用过 PyTorch、TensorFlow 等训练框架
了解分布式训练、模型推理、模型发布或在线服务
熟悉 Docker、Kubernetes、Kubeflow、Volcano、Argo Workflows 等技术
有分布式系统、AI Infra、云原生或开源项目经历
对 GPU 调度、异构计算、训练效率或高性能推理有实践或研究兴趣

AI 洞察

优缺点分析

优点

  • 全面接触模型生产全生命周期,建立系统级技术视野,对职业发展非常有帮助
  • 团队提供明确技术指导,有独立负责项目的成长机会,适合自我驱动型实习生
  • 公司平台大,技术氛围浓,能接触大规模分布式系统真实场景
  • AI Infra涉及系统、算法、云原生多个领域,学习曲线陡峭,需要较强自驱力
  • 实习需要每周4天以上且连续4个月,时间投入要求高,可能与学业冲突
  • 大规模系统问题排查复杂,对分析和解决能力要求高
  • 适合对机器学习系统、分布式计算和云原生技术有强烈兴趣,具备扎实计算机基础和主动学习能力,且能投入较长实习时间的技术型学生

缺点 / 挑战

  • 参与小红书核心业务(搜索/推荐/广告)的AI基础设施,业务价值高,技术挑战大

角色解读

  • 深入AI Infra领域,可向机器学习平台架构师或技术专家方向发展
  • 积累大规模系统经验,未来可转向推荐/广告/搜索等业务算法或平台研发方向
  • 通过真实生产环境锻炼,有机会独立负责模块,快速成长
  • 参与搜广推场景下机器学习平台的核心模块开发,包括任务编排、资源调度、分布式训练和模型服务
  • 深入训练推理链路,分析和优化大规模异构算力环境下的系统稳定性和效率
  • 参与平台架构演进,开发自动化工具和诊断系统,并探索AI Agent在运维场景的应用
  • 扎实的编程能力,熟悉Python/Java/Go至少一种语言
  • 理解操作系统、网络、数据结构等计算机基础,对分布式系统有基本认识
  • 对云原生技术栈(如Kubernetes、Docker)和机器学习框架(PyTorch/TensorFlow)有浓厚兴趣

申请策略

  • 简历中体现对搜广推系统的好奇心,比如分析过推荐系统架构或做过相关demo
  • 关注小红书技术博客或开源项目,了解团队技术风格,在面试中体现匹配度
  • 突出项目经验中与分布式系统、机器学习训练/推理或云原生相关的部分,即使只是课程设计或开源贡献
  • 强调编程能力和底层基础,如操作系统、网络相关课程或竞赛经历
  • 如果使用过PyTorch、Kubernetes等工具,务必明确列出并说明实际应用场景
  • 展示学习能力和问题解决能力,如技术博客、Github项目等
  • 提前学习Kubernetes和Docker基础,了解Pod、调度、容器网络等核心概念
  • 熟悉PyTorch分布式训练基本用法(如DDP),了解训练任务如何与资源调度结合

面试指南

  • 对于系统设计类问题,建议从需求分析、核心模块划分、技术选型、关键挑战和优化方向五步阐述
  • 对于经验类问题,用STAR法则(情境、任务、行动、结果)结构化回答,突出个人贡献和思考
  • 对于工程能力问题,可以展示代码风格和调试思路,并说明如何通过单测和监控保证质量
  • 介绍一下你在项目中使用过的分布式训练或资源调度方案?遇到了什么问题?怎么解决的?
  • 你对Kubernetes的调度原理了解多少?如何实现一个自定义调度器?
  • 结合你的经历,谈谈对AI Infra这个方向的理解以及未来的技术趋势?
  • 如何设计一个任务编排系统来管理多个训练任务?需要考虑哪些关键点?
  • 练习:手写一个简单的生产者消费者模型并说明如何应对背压

职位点评

70
综合评分

大厂AI Infra实习,技术含量高、成长快,但薪资有限且需现场办公。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
该职位最适合追求技术成长和系统能力提升的求职者,他们渴望在大平台接触核心AI基础设施,对薪资要求相对宽松。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利45
成长发展88
工作生活60
使命价值72

薪资福利

45较低

作为实习岗位,薪资水平有限,但平台背书和福利待遇优于一般实习,稳定性相对可控。

薪资信号未披露(AI估算:6K-12K/月)

成长发展

88较高

该岗位提供明确的技能成长路径,深入AI Infra核心领域,有导师指导和独立项目机会,发展性动机得到充分满足。

技术前沿前沿/新兴技术
技术栈Python、Java、Go、Kubernetes、Docker、PyTorch、TensorFlow、分布式训练、资源调度、云原生
成长机会技术指导、独立负责
业务类型ambiguous

工作生活

60中等

现场办公,JD未提及弹性工时或远程,工作强度可能因业务节奏波动,但作为实习岗位时间相对可控。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

72中等

AI基础设施是行业增长最快的方向之一,参与小红书核心业务的技术底座,具有较高的技术影响力和行业价值。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs