
小红书
预训练算法实习生_模型结构
预训练算法实习生_模型结构
发布于 1 天前实习/见习
上海市 / 北京市
无经验要求
实习生
仅现场办公
本科
研究与开发 (研发)
Attention
Cuda
Llm
Moe
Pytorch
Scaling
大语言模型
模型并行
AI 估算 · 5k–10k
大厂算法实习薪资较高,月薪约5k-10k,无年终奖,但含补贴和福利。
职位详情
关于这个职位
作为预训练算法实习生,你将深度参与小红书大语言模型(LLM)的架构设计与迭代优化,探索模型高效 Scaling 技术及下一代推理友好的模型结构
你将与 Infra 团队协作,关注 Attention 机制、MoE、优化器等前沿方向,适合对 LLM 算法有浓厚兴趣的同学
最低要求
本科及以上在读(年级不限),人工智能、计算机、自动化、数学等相关专业优先,懂infra的算法同学
具备出色的代码实现能力与扎实的算法功底:熟练运用 PyTorch 框架
拥有坚实的大模型基础知识(如掌握 CS336 课程核心内容,熟悉大模型精度问题、常见模型并行原理实现及推理优化方法)
在大模型领域具备丰富实战经验,熟悉常见大模型结构及改进方案,在LLM某一算法方向有深入实践,具备创新研究能力
具备良好的沟通协作能力,责任心强,积极主动,乐于挑战,能与团队共同探索新技术、推进技术进步
工作职责
与 Infra 团队深度协作,结合模型训练与推理瓶颈,深度参与大语言模型(LLM)的架构设计及迭代优化
探索模型高效 Scaling 技术及新的 Scaling 方向(如 Context Scaling、Parameter Scaling 等),探索下一代 GPU 推理友好的模型结构与算法
探索方向涵盖但不限于 Attention 机制、MoE 机制、优化器策略及学习范式创新
优先资格
发表过具有一定影响力的学术论文
深度参与知名开源 LLM 项目
熟悉 Triton 或 CUDA,并具备性能分析能力(如具有编写 FlashAttention 的能力)
有 ACM/ICPC、IOI/NOI、Topcoder 等算法竞赛获奖经历
AI 洞察
优缺点分析
优点
- 参与前沿大模型研究,接触最新技术如MoE、Attention改进,技能积累快
- 小红书平台海量数据和应用场景,研究落地机会多
- 团队技术氛围浓厚,与Infra等团队紧密合作,视野开阔
- 算法实习生竞争激烈,需具备较强的代码和理论基础
- 研究方向不确定性高,可能需要快速试错和调整
- 大模型训练资源消耗大,可能需要适应高强度的工作节奏
- 适合对大语言模型有浓厚兴趣、具备扎实编程和算法基础、希望深入参与前沿研究的同学
缺点 / 挑战
暂无明显挑战项
角色解读
- 从实习生转正为正式研究员或算法工程师,深入参与核心模型研发
- 向大模型架构专家或Scaling方向专家发展,成为技术领军人物
- 积累顶级会议论文和开源项目经验,提升行业影响力
- 深度参与大语言模型的架构设计,与Infra团队协作优化模型训练和推理效率
- 探索模型高效Scaling技术,如Context Scaling和Parameter Scaling,推动模型性能提升
- 研究下一代GPU推理友好的模型结构,包括Attention机制、MoE等创新方向
- 扎实的算法功底和代码能力,熟练使用PyTorch框架,了解大模型基础知识和模型并行原理
- 在大模型领域有实战经验,熟悉常见LLM结构及改进方案,具备创新研究能力
- 良好的沟通协作能力,责任心强,能够主动探索新技术
申请策略
- 了解小红书技术博客或开源项目,在面试中展示对公司的研究兴趣
- 准备1-2个深入的技术项目案例,能够清晰讲述问题、方案和成果
- 突出大模型相关项目经验,如参与过LLM训练或推理优化、熟悉某种模型结构
- 展示代码能力,包括PyTorch使用、并行编程经验或开源贡献
- 如果有学术论文或竞赛获奖,务必重点提及
- 复习CS336课程(Stanford大模型课程)内容,确保基础知识扎实
- 尝试复现经典模型或实现FlashAttention等,提升CUDA/Triton编程能力
- 关注最新Scaling论文和开源项目,保持技术敏感度
面试指南
- 对于原理类问题:先给出定义,再从数学公式或伪代码层面解释,最后结合实际应用场景
- 对于项目类问题:采用STAR原则(情境、任务、行动、结果),突出个人贡献和思考
- 对于设计类问题:先明确目标和约束,然后提出方案,分析利弊,最后给出优化方向
- 请详细解释Transformer中的Self-Attention机制及其变体(如FlashAttention)的实现原理
- 如何在大规模分布式训练中实现模型并行和数据并行?请举例说明
- 你如何看待MoE架构的优缺点?请设计一个简单的MoE层
- 描述一个你做过的大模型相关项目,遇到的最大技术挑战是什么?如何解决的?
- 你对LLM的Scaling Law有何理解?如何选择模型的参数量和训练数据量?
职位点评
64
综合评分
大厂算法实习,前沿大模型技术栈,技能成长快,但工作强度大且无远程弹性。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
最适合追求技术成长和前沿研究、对薪资和WLB要求不高的同学。
表现最好
成长发展
相对薄弱
工作生活
薪资福利50
成长发展95
工作生活40
使命价值70
薪资福利
50较低
实习生薪资属于市场水准,福利未在JD中明确,且无年终奖,补偿性动机满足一般。
薪资信号未披露(AI估算:5K-10K/月)
成长发展
95较高
该职位处于大模型前沿技术领域,涉及Scaling、MoE等创新方向,技能成长空间极大,发展性动机满足程度非常高。
技术前沿前沿/新兴技术
技术栈大语言模型、LLM、PyTorch、模型并行、Attention、MoE、CUDA、Triton、Scaling、Transformer
业务类型ambiguous
工作生活
40较低
仅现场办公,未提及弹性工时或WLB,大厂算法实习强度可能较高,生活化动机满足有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI技术处于高速增长赛道,对社会有积极影响,但未直接关联使命感,意义感动机中等偏上。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
小红书 的其他在招职位
相似职位推荐
Watch Jobs