Xiaohongshu logo
小红书
【练习生】离线计算引擎工程师(AGI数据工程)

【练习生】离线计算引擎工程师(AGI数据工程)

发布于 大约 14 小时前

实习/见习

上海市 / 北京市
无经验要求
实习生
仅现场办公
本科
软件工程
Agi
Celeborn
分布式计算
大模型
数据工程

AI 估算 · 4k–8k

大厂实习薪资有竞争力,技术门槛高,AGI方向前景好,但实习通常按日薪,月薪估算约4-8k。

职位详情

关于这个职位

该实习岗位参与小红书AGI大模型预训练数据的离线计算引擎研发,基于Spark、Hive等工具进行数据链路重构与性能优化

你将获得资深导师一对一指导,深入分布式引擎底层技术,直面超大规模集群难题,是技术成长极快的核心岗位

最低要求

学历:本科及以上,计算机、大数据、人工智能等相关专业,2027届应届毕业生,学业基础扎实

编程能力:熟练掌握Java/C++/Python任一语言,编码功底良好,代码逻辑清晰
核心素养:热爱分布式引擎底层研发与AGI数据方向,学习能力强,敢于攻坚复杂技术问题
综合素质:沟通协作良好,做事踏实严谨,有意长期深耕大数据引擎与AGI基建方向

工作职责

数据链路研发:基于Spark引擎,参与AGI大模型预训练数据采集、去重、清洗等核心链路重构,从引擎层适配大模型数据处理场景

引擎优化维稳:负责Spark、Celeborn、Hive等离线计算引擎的维护、性能调优、资源优化,解决海量数据场景下的性能与稳定性问题
底层技术攻坚:结合AGI数据处理需求,参与计算引擎定制化改造,攻坚超大规模数据计算的高难度技术问题
技术迭代沉淀:跟进大数据前沿技术,落地优化方案,完善AGI数据基础设施体系

优先资格

有大模型AGI数据链路、大数据相关项目/实习/竞赛经历

熟悉Spark核心原理(RDD、DAG、Shuffle等),掌握分布式计算基础,具备基础的问题排查与调优能力
算法能力突出,具备海量数据处理、分布式架构攻坚经验者优先

AI 洞察

优缺点分析

优点

  • 核心技术方向:AGI数据引擎是行业前沿,技术稀缺性高,职业前景广阔
  • 资深导师一对一培养,学习曲线陡峭,能快速提升底层技术能力
  • 直面超大规模集群难题,实战经验含金量高,对简历加分显著
  • 公司平台大、资源多,技术氛围浓厚,适合长期职业发展
  • 工作强度可能较大,涉及集群维护和性能攻坚,需要较强抗压能力
  • 实习期需快速上手,独立负责核心模块,对适应能力要求高
  • 适合对分布式系统和大数据引擎有浓厚兴趣、喜欢钻研底层技术、希望在AGI领域深耕的实习生

缺点 / 挑战

  • 技术难度高,需要扎实的分布式系统基础和持续学习能力,入门门槛较高

角色解读

  • 从实习生成长为离线计算引擎专家,深入掌握Spark内核与AGI数据处理技术
  • 可向大数据架构师或AGI数据基础设施负责人方向发展
  • 积累超大规模集群实战经验,成为稀缺的AGI数据工程人才
  • 参与AGI大模型预训练数据的离线计算引擎研发,使用Spark重构数据采集、去重、清洗等核心链路
  • 负责Spark、Hive等引擎的维护与性能调优,解决海量数据场景下的稳定性问题
  • 结合AGI数据处理需求,进行计算引擎的定制化改造,攻克超大规模数据计算的技术难点
  • 跟踪大数据前沿技术,推动优化方案落地,完善AGI数据基础设施
  • 熟练掌握Java/C++/Python之一,编码能力强,逻辑清晰
  • 熟悉Spark核心原理(RDD、DAG、Shuffle),有分布式计算基础
  • 了解大数据生态(Hive、Celeborn等),具备问题排查与调优能力
  • 热爱底层技术,学习能力强,敢于攻坚复杂问题

申请策略

  • 提前了解小红书的技术栈和AGI数据布局,在面试中展现对业务的热情
  • 准备好一个Spark调优或分布式计算的案例,能清晰讲解问题、分析过程和优化效果
  • 突出大数据相关项目或实习经历,特别是Spark、Hive等引擎的使用或调优经验
  • 强调编程能力:展示Java/C++/Python的代码示例或GitHub链接,体现编码规范
  • 如果有AGI或大模型相关项目,务必详细描述,尤其是数据处理链路部分
  • 显示学习能力和攻坚精神:如参与过的技术竞赛、开源贡献或复杂问题解决案例
  • 深入学习Spark内核(RDD、DAG、Shuffle、内存管理),动手搭建集群进行调优实验
  • 补充分布式系统理论基础,如一致性、容错、调度等

面试指南

  • 回答技术原理时,先给出清晰定义,然后用图示或例子说明,最后联系实际应用
  • 优化类问题:先分析瓶颈(CPU/IO/网络),再给出具体调参或架构改进方案,最后说明效果
  • 项目经历:使用STAR法(情境、任务、行动、结果),突出你的角色和量化成果
  • 请解释Spark中RDD、DAG、Shuffle的工作原理
  • 如何优化Spark作业的性能?请举例说明
  • 大规模数据去重有哪些方法?在分布式环境下如何实现?
  • 在AGI大模型的数据预处理中,你遇到过哪些挑战?如何解决?
  • Describe a time you debugged a complex distributed system issue.

职位点评

61
综合评分

前沿AGI数据引擎实习,技术成长极高,但薪资一般且需现场办公,适合技术狂热者。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
该职位最适合追求技术深度和前沿方向、愿意投入高强度学习以换取快速成长的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利45
成长发展95
工作生活30
使命价值70

薪资福利

45较低

实习薪资处于大厂中等水平,但福利未在JD中明确,整体补偿性动机满足度一般。

薪资信号未披露(AI估算:4K-8K/月)

成长发展

95较高

岗位聚焦AGI数据引擎前沿技术,提供一对一导师带教和超大规模集群实战机会,成长空间极大。

技术前沿前沿/新兴技术
技术栈Spark、AGI、大模型、分布式计算、Hive、Celeborn
成长机会专家一对一带教、核心赛道成长、硬核技术平台
业务类型ambiguous

工作生活

30较低

实习要求现场办公,未提及弹性工作或WLB,结合技术攻坚强度,生活化动机满足度较低。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AGI是高速增长赛道,岗位参与核心数据基础设施,有一定社会影响力,但JD未强调使命感。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs