
小红书
AI Infra 研发实习生(搜广推训练推理平台)
AI Infra 研发实习生(搜广推训练推理平台)
发布于 大约 14 小时前实习/见习
北京市 / 上海市
无经验要求
实习生
仅现场办公
本科
机器学习工程
Ai Infra
Go
Pytorch
Tensorflow
云原生
分布式训练
AI 估算 · 6k–12k
一线大厂AI方向实习,日薪约300-500,月薪在6k-12k区间,技术含金量高,平台溢价明显。
职位详情
关于这个职位
这个实习岗位将让你深入小红书搜索、推荐、广告的核心AI基础设施,参与模型训练与推理平台的建设,接触从分布式训练到在线服务的完整技术链路
你将同时学习算法生产、分布式系统和云原生知识,获得真实的大规模系统实战经验,是进入AI基础设施领域的绝佳机会
最低要求
计算机、软件工程、人工智能或相关专业本科及以上在读
熟悉 Python、Java、Go 中至少一种语言,具备良好的编码和工程实践能力
具备扎实的计算机基础,对操作系统、计算机网络、数据结构和分布式系统有基本理解
对机器学习系统、云原生基础设施或大规模后端平台有浓厚兴趣
具备较强的学习能力和问题分析能力,愿意深入代码和系统链路理解问题本质
每周实习 4 天及以上,可连续实习 4 个月以上
工作职责
参与搜广推训练推理平台的核心能力建设,包括任务编排、分布式训练、资源调度、模型管理、发布更新和在线服务
深入训练与推理运行链路,理解模型任务在大规模异构算力环境中的执行机制,持续优化平台的稳定性、效率和使用体验
参与复杂系统问题的分析与解决,建立从平台控制面、调度系统到 Kubernetes Runtime 和模型应用的端到端视角
参与平台架构演进,将高频经验沉淀为标准能力、诊断工具和自动化系统
探索 AI Agent 在研发、运维和故障诊断场景中的应用,提升机器学习平台的智能化水平
优先资格
了解搜索、推荐或广告系统的基本架构
使用过 PyTorch、TensorFlow 等训练框架
了解分布式训练、模型推理、模型发布或在线服务
熟悉 Docker、Kubernetes、Kubeflow、Volcano、Argo Workflows 等技术
有分布式系统、AI Infra、云原生或开源项目经历
对 GPU 调度、异构计算、训练效率或高性能推理有实践或研究兴趣
AI 洞察
优缺点分析
优点
- 全面接触模型生产全生命周期,建立系统级技术视野,对职业发展非常有帮助
- 团队提供明确技术指导,有独立负责项目的成长机会,适合自我驱动型实习生
- 公司平台大,技术氛围浓,能接触大规模分布式系统真实场景
- AI Infra涉及系统、算法、云原生多个领域,学习曲线陡峭,需要较强自驱力
- 实习需要每周4天以上且连续4个月,时间投入要求高,可能与学业冲突
- 大规模系统问题排查复杂,对分析和解决能力要求高
- 适合对机器学习系统、分布式计算和云原生技术有强烈兴趣,具备扎实计算机基础和主动学习能力,且能投入较长实习时间的技术型学生
缺点 / 挑战
- 参与小红书核心业务(搜索/推荐/广告)的AI基础设施,业务价值高,技术挑战大
角色解读
- 深入AI Infra领域,可向机器学习平台架构师或技术专家方向发展
- 积累大规模系统经验,未来可转向推荐/广告/搜索等业务算法或平台研发方向
- 通过真实生产环境锻炼,有机会独立负责模块,快速成长
- 参与搜广推场景下机器学习平台的核心模块开发,包括任务编排、资源调度、分布式训练和模型服务
- 深入训练推理链路,分析和优化大规模异构算力环境下的系统稳定性和效率
- 参与平台架构演进,开发自动化工具和诊断系统,并探索AI Agent在运维场景的应用
- 扎实的编程能力,熟悉Python/Java/Go至少一种语言
- 理解操作系统、网络、数据结构等计算机基础,对分布式系统有基本认识
- 对云原生技术栈(如Kubernetes、Docker)和机器学习框架(PyTorch/TensorFlow)有浓厚兴趣
申请策略
- 简历中体现对搜广推系统的好奇心,比如分析过推荐系统架构或做过相关demo
- 关注小红书技术博客或开源项目,了解团队技术风格,在面试中体现匹配度
- 突出项目经验中与分布式系统、机器学习训练/推理或云原生相关的部分,即使只是课程设计或开源贡献
- 强调编程能力和底层基础,如操作系统、网络相关课程或竞赛经历
- 如果使用过PyTorch、Kubernetes等工具,务必明确列出并说明实际应用场景
- 展示学习能力和问题解决能力,如技术博客、Github项目等
- 提前学习Kubernetes和Docker基础,了解Pod、调度、容器网络等核心概念
- 熟悉PyTorch分布式训练基本用法(如DDP),了解训练任务如何与资源调度结合
面试指南
- 对于系统设计类问题,建议从需求分析、核心模块划分、技术选型、关键挑战和优化方向五步阐述
- 对于经验类问题,用STAR法则(情境、任务、行动、结果)结构化回答,突出个人贡献和思考
- 对于工程能力问题,可以展示代码风格和调试思路,并说明如何通过单测和监控保证质量
- 介绍一下你在项目中使用过的分布式训练或资源调度方案?遇到了什么问题?怎么解决的?
- 你对Kubernetes的调度原理了解多少?如何实现一个自定义调度器?
- 结合你的经历,谈谈对AI Infra这个方向的理解以及未来的技术趋势?
- 如何设计一个任务编排系统来管理多个训练任务?需要考虑哪些关键点?
- 练习:手写一个简单的生产者消费者模型并说明如何应对背压
职位点评
70
综合评分
大厂AI Infra实习,技术含量高、成长快,但薪资有限且需现场办公。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
该职位最适合追求技术成长和系统能力提升的求职者,他们渴望在大平台接触核心AI基础设施,对薪资要求相对宽松。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利45
成长发展88
工作生活60
使命价值72
薪资福利
45较低
作为实习岗位,薪资水平有限,但平台背书和福利待遇优于一般实习,稳定性相对可控。
薪资信号未披露(AI估算:6K-12K/月)
成长发展
88较高
该岗位提供明确的技能成长路径,深入AI Infra核心领域,有导师指导和独立项目机会,发展性动机得到充分满足。
技术前沿前沿/新兴技术
技术栈Python、Java、Go、Kubernetes、Docker、PyTorch、TensorFlow、分布式训练、资源调度、云原生
成长机会技术指导、独立负责
业务类型ambiguous
工作生活
60中等
现场办公,JD未提及弹性工时或远程,工作强度可能因业务节奏波动,但作为实习岗位时间相对可控。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
72中等
AI基础设施是行业增长最快的方向之一,参与小红书核心业务的技术底座,具有较高的技术影响力和行业价值。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
小红书 的其他在招职位
相似职位推荐
Watch Jobs