
小红书
【练习生】离线计算引擎工程师(AGI数据工程)
【练习生】离线计算引擎工程师(AGI数据工程)
发布于 大约 14 小时前实习/见习
上海市 / 北京市
无经验要求
实习生
仅现场办公
本科
软件工程
Agi
Celeborn
分布式计算
大模型
数据工程
AI 估算 · 4k–8k
大厂实习薪资有竞争力,技术门槛高,AGI方向前景好,但实习通常按日薪,月薪估算约4-8k。
职位详情
关于这个职位
该实习岗位参与小红书AGI大模型预训练数据的离线计算引擎研发,基于Spark、Hive等工具进行数据链路重构与性能优化
你将获得资深导师一对一指导,深入分布式引擎底层技术,直面超大规模集群难题,是技术成长极快的核心岗位
最低要求
学历:本科及以上,计算机、大数据、人工智能等相关专业,2027届应届毕业生,学业基础扎实
编程能力:熟练掌握Java/C++/Python任一语言,编码功底良好,代码逻辑清晰
核心素养:热爱分布式引擎底层研发与AGI数据方向,学习能力强,敢于攻坚复杂技术问题
综合素质:沟通协作良好,做事踏实严谨,有意长期深耕大数据引擎与AGI基建方向
工作职责
数据链路研发:基于Spark引擎,参与AGI大模型预训练数据采集、去重、清洗等核心链路重构,从引擎层适配大模型数据处理场景
引擎优化维稳:负责Spark、Celeborn、Hive等离线计算引擎的维护、性能调优、资源优化,解决海量数据场景下的性能与稳定性问题
底层技术攻坚:结合AGI数据处理需求,参与计算引擎定制化改造,攻坚超大规模数据计算的高难度技术问题
技术迭代沉淀:跟进大数据前沿技术,落地优化方案,完善AGI数据基础设施体系
优先资格
有大模型AGI数据链路、大数据相关项目/实习/竞赛经历
熟悉Spark核心原理(RDD、DAG、Shuffle等),掌握分布式计算基础,具备基础的问题排查与调优能力
算法能力突出,具备海量数据处理、分布式架构攻坚经验者优先
AI 洞察
优缺点分析
优点
- 核心技术方向:AGI数据引擎是行业前沿,技术稀缺性高,职业前景广阔
- 资深导师一对一培养,学习曲线陡峭,能快速提升底层技术能力
- 直面超大规模集群难题,实战经验含金量高,对简历加分显著
- 公司平台大、资源多,技术氛围浓厚,适合长期职业发展
- 工作强度可能较大,涉及集群维护和性能攻坚,需要较强抗压能力
- 实习期需快速上手,独立负责核心模块,对适应能力要求高
- 适合对分布式系统和大数据引擎有浓厚兴趣、喜欢钻研底层技术、希望在AGI领域深耕的实习生
缺点 / 挑战
- 技术难度高,需要扎实的分布式系统基础和持续学习能力,入门门槛较高
角色解读
- 从实习生成长为离线计算引擎专家,深入掌握Spark内核与AGI数据处理技术
- 可向大数据架构师或AGI数据基础设施负责人方向发展
- 积累超大规模集群实战经验,成为稀缺的AGI数据工程人才
- 参与AGI大模型预训练数据的离线计算引擎研发,使用Spark重构数据采集、去重、清洗等核心链路
- 负责Spark、Hive等引擎的维护与性能调优,解决海量数据场景下的稳定性问题
- 结合AGI数据处理需求,进行计算引擎的定制化改造,攻克超大规模数据计算的技术难点
- 跟踪大数据前沿技术,推动优化方案落地,完善AGI数据基础设施
- 熟练掌握Java/C++/Python之一,编码能力强,逻辑清晰
- 熟悉Spark核心原理(RDD、DAG、Shuffle),有分布式计算基础
- 了解大数据生态(Hive、Celeborn等),具备问题排查与调优能力
- 热爱底层技术,学习能力强,敢于攻坚复杂问题
申请策略
- 提前了解小红书的技术栈和AGI数据布局,在面试中展现对业务的热情
- 准备好一个Spark调优或分布式计算的案例,能清晰讲解问题、分析过程和优化效果
- 突出大数据相关项目或实习经历,特别是Spark、Hive等引擎的使用或调优经验
- 强调编程能力:展示Java/C++/Python的代码示例或GitHub链接,体现编码规范
- 如果有AGI或大模型相关项目,务必详细描述,尤其是数据处理链路部分
- 显示学习能力和攻坚精神:如参与过的技术竞赛、开源贡献或复杂问题解决案例
- 深入学习Spark内核(RDD、DAG、Shuffle、内存管理),动手搭建集群进行调优实验
- 补充分布式系统理论基础,如一致性、容错、调度等
面试指南
- 回答技术原理时,先给出清晰定义,然后用图示或例子说明,最后联系实际应用
- 优化类问题:先分析瓶颈(CPU/IO/网络),再给出具体调参或架构改进方案,最后说明效果
- 项目经历:使用STAR法(情境、任务、行动、结果),突出你的角色和量化成果
- 请解释Spark中RDD、DAG、Shuffle的工作原理
- 如何优化Spark作业的性能?请举例说明
- 大规模数据去重有哪些方法?在分布式环境下如何实现?
- 在AGI大模型的数据预处理中,你遇到过哪些挑战?如何解决?
- Describe a time you debugged a complex distributed system issue.
职位点评
61
综合评分
前沿AGI数据引擎实习,技术成长极高,但薪资一般且需现场办公,适合技术狂热者。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
该职位最适合追求技术深度和前沿方向、愿意投入高强度学习以换取快速成长的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利45
成长发展95
工作生活30
使命价值70
薪资福利
45较低
实习薪资处于大厂中等水平,但福利未在JD中明确,整体补偿性动机满足度一般。
薪资信号未披露(AI估算:4K-8K/月)
成长发展
95较高
岗位聚焦AGI数据引擎前沿技术,提供一对一导师带教和超大规模集群实战机会,成长空间极大。
技术前沿前沿/新兴技术
技术栈Spark、AGI、大模型、分布式计算、Hive、Celeborn
成长机会专家一对一带教、核心赛道成长、硬核技术平台
业务类型ambiguous
工作生活
30较低
实习要求现场办公,未提及弹性工作或WLB,结合技术攻坚强度,生活化动机满足度较低。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AGI是高速增长赛道,岗位参与核心数据基础设施,有一定社会影响力,但JD未强调使命感。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
小红书 的其他在招职位
相似职位推荐
Watch Jobs