Xiaohongshu logo
小红书
文本预训练实习生

文本预训练实习生

发布于 1 天前

实习/见习

北京市
无经验要求
实习生
仅现场办公
本科
实习与临时职位
Nlp
Pytorch
Tensorflow
大模型预训练
数据清洗
机器学习
深度学习
数据画像
文本合成

AI 估算 · 3k–5k

实习生岗位,薪资水平中等,北京地区互联网大厂实习薪资约3000-5000元/月。

职位详情

关于这个职位

该实习岗位主要负责文本大模型的预训练数据处理工作,包括海量文本的数据清洗、过滤和合成

你将接触到最前沿的NLP技术,如文本合成和SOTA算法,并有机会将研究成果应用于大规模预训练
适合对自然语言处理和深度学习有热情的同学积累实战经验

最低要求

计算机相关方向本科及以上学历

良好的编程能力,熟练运用Python语言,熟悉常见的机器学习框架
熟悉常见的机器学习和NLP算法,了解当前热点和前沿技术
有高水平会议或期刊论文者优先
可尽快到岗者优先,至少实习3个月,每周工作日出勤至少4天

工作职责

海量文本数据处理,包括基于模型和启发式规则的数据解析、数据清洗/过滤、数据画像等

跟踪探索文本合成的sota算法,完成T级别数据合成,包括通用数据合成、问答数据合成、数学数据合成等
跟踪最新NLP研究成果,并应用到文本大模型预训练中

优先资格

有高水平会议或期刊论文者优先

可尽快到岗者优先

AI 洞察

优缺点分析

优点

  • 接触前沿技术:直接参与文本大模型预训练,跟踪SOTA算法,技术提升快
  • 大厂平台:小红书作为超大型互联网公司,算力和数据资源丰富,项目含金量高
  • 成长空间:实习期间可独立负责数据合成任务,积累实战经验,对后续求职大模型岗位非常有利
  • 技术门槛:要求对NLP前沿技术有较深理解,实习初期适应期可能较长
  • 适合对NLP和大模型有强烈兴趣、编程和算法基础扎实、希望深入参与核心预训练项目的在校学生

缺点 / 挑战

  • 工作强度:需要处理T级别数据,可能面临较高的数据量和时间压力

角色解读

  • 从数据预处理到模型训练全流程参与,积累大规模预训练实战经验
  • 表现优秀可转正为正式员工,往算法工程师方向深入发展
  • 后续可转向大模型研发、NLP算法研究等前沿岗位
  • 处理海量文本数据,包括数据解析、清洗、过滤和画像,为预训练提供高质量数据
  • 跟踪并实现文本合成的最新算法,完成T级别的通用/问答/数学数据合成
  • 将前沿NLP研究成果应用到文本大模型预训练中,优化模型性能
  • 扎实的编程能力:熟练使用Python,熟悉至少一种深度学习框架(如PyTorch、TensorFlow)
  • 机器学习与NLP基础:熟悉常见算法(如Transformer、BERT)及当前热点技术(如大规模预训练、文本生成)
  • 数据处理能力:能够设计或应用规则/模型进行数据清洗、过滤,具备数据敏感度

申请策略

  • 在简历中强调自己能够尽快到岗且保证实习时长,这是优先条件
  • 关注小红书的技术博客或开源项目,了解他们在大模型方面的布局,面试时展示你的了解
  • 突出Python编程能力和机器学习/NLP项目经验,尤其与文本处理、预训练相关的经历
  • 如果有相关论文发表或开源贡献,一定要重点列出
  • 体现数据处理经验,比如大规模数据清洗、特征工程等
  • 提前学习文本合成相关论文(如GPT系列、LLaMA数据合成方法)
  • 熟悉常用深度学习框架(PyTorch)和分布式训练基础
  • 练习数据清洗和预处理技巧,熟悉常用工具(如pandas、Spark)

面试指南

  • 对于项目类问题:按照背景、任务、方法、结果四步结构回答,突出自己的贡献和技术难点
  • 对于技术类问题:先给出核心概念定义,再说明原理,最后结合实际例子展示理解深度
  • 对于开放设计问题:从数据采集、清洗、平衡、质量评估等维度系统思考,体现工程思维
  • 请介绍一下你参与过的NLP项目,特别是数据处理部分
  • 如何处理脏数据?请举例说明数据清洗的常用方法
  • 你知道哪些文本数据合成的方法?请简要介绍
  • 你对Transformer架构的理解?为什么它在大模型中如此重要?
  • 如果让你用1000万条文本数据构建一个预训练数据集,你会考虑哪些步骤?

职位点评

68
综合评分

大模型预训练实习,技术前沿高成长,薪资低且需现场办公。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
优先追求技术成长和前沿经验的求职者,对薪资和WLB要求不高。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利35
成长发展90
工作生活55
使命价值70

薪资福利

35较低

实习岗位薪资较低,福利有限,补偿性满足程度低。

薪资信号未披露(AI估算:3K-5K/月)

成长发展

90较高

岗位涉及大模型前沿技术,有大量成长机会,发展性满足程度高。

技术前沿前沿/新兴技术
技术栈Python、NLP、机器学习、深度学习、文本合成、大模型、预训练
业务类型ambiguous

工作生活

55较低

实习需出勤4天/周,现场办公,WLB一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

参与大模型研发具有行业价值,但实习岗位使命感中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs