miHoYo logo
米哈游
大模型-LLM数据处理

大模型-LLM数据处理

发布于 大约 2 小时前

普通员工/个人贡献者

上海市 / 北京市
无经验要求
全职员工
仅现场办公
本科
数据工程
Llm
Pyspark
Pytorch
Sglang
Vllm
数据Pipeline
数据处理

AI 估算 · 20k–35k

大模型方向薪资高,上海北京一线城市,公司平台优质,校招薪资竞争力强。

职位详情

关于这个职位

该职位负责大语言模型(LLM)的训练数据处理工作,包括数据清洗、质量过滤、数据集构建和数据处理Pipeline的运维优化

你将与算法团队紧密协作,通过高质量数据推动模型效果提升,是AI领域的前沿技术岗位
适合对大数据和人工智能有浓厚兴趣的应届生

最低要求

计算机/软件工程等相关专业本科以上学历

熟悉常见数据处理流程,拥有大模型数据处理与合成经验
熟悉Python,了解大模型训练和推理框架(PyTorch、vLLM、SGLang等),了解分布式数据处理框架(Spark/PySpark、Ray等),具备数据任务开发调试能力
具备优秀的分析和解决问题能力,良好的团队合作精神及沟通意识

工作职责

参与LLM大模型的数据准备、数据清洗、质量过滤及数据实验等工作,交付高质量训练数据

参与建设对标业内前沿的LLM训练数据集,并在此基础上持续迭代,进一步提升数据质量和多样性
参与构建和维护高性能LLM数据处理Pipeline,优化链路成本,提升性能和稳定性
与算法同学协作,参与大模型训练数据的质量分析、评估体系建设和数据迭代,推动模型效果提升

优先资格

拥有LLM相关专业硕士/博士学位者优先

有一线互联网大模型数据处理实习经历者优先

AI 洞察

优缺点分析

优点

  • LLM是当下最热门的技术方向,该岗位能让你深入接触前沿AI技术
  • 米哈游是超大型游戏公司,平台大,资源丰富,为职业发展提供良好起点
  • 数据处理是AI模型的基础,掌握数据Pipeline的核心技能,应用面广
  • 大模型领域技术迭代快,需要持续学习和跟上行业步伐
  • 作为校招生,需要快速掌握分布式框架和工具,学习曲线可能较陡
  • 适合对数据敏感、喜欢钻研技术细节,并对AI大模型有浓厚兴趣的应届生

缺点 / 挑战

  • 数据处理工作可能较重复,需要耐心和细致,对数据质量负责

角色解读

  • 纵向深耕数据工程领域,成为资深数据工程师或数据架构师
  • 横向转型为大模型算法工程师,利用数据经验优势切入模型训练与优化
  • 在米哈游可参与核心AI项目,积累前沿技术经验,未来可向技术专家或管理方向发展
  • 负责LLM大模型训练数据的准备、清洗、质量过滤和数据实验,确保数据高质量交付
  • 参与建设并迭代业内前沿的LLM训练数据集,提升数据多样性和覆盖度
  • 构建和维护高性能数据处理Pipeline,优化链路成本与稳定性
  • 与算法团队协作,进行数据质量分析和评估体系建设,推动模型效果提升
  • 熟练使用Python进行数据处理开发,具备调试和优化能力
  • 了解大模型训练/推理框架(PyTorch、vLLM、SGLang等)基本用法
  • 熟悉分布式数据处理框架(Spark、Ray等),能处理大规模数据
  • 具备优秀的问题分析和解决能力,以及良好的团队协作和沟通意识

申请策略

  • 关注米哈游的招聘动态,了解他们当前的AI业务方向,针对性准备
  • 提前了解公司文化和产品,展现对游戏行业和AI的热情
  • 突出数据处理相关项目经验,如数据清洗、特征工程、Pipeline构建等
  • 强调Python编程能力,并展示使用PyTorch、Spark等框架的实际案例
  • 如果有大模型相关的实习或科研经历,务必重点说明
  • 展示解决问题的思路和成果,用数据量化影响力
  • 系统学习Python数据处理库(如Pandas、NumPy)和分布式计算框架(Spark、Ray)
  • 了解LLM基础知识和数据准备流程,尝试参与开源大模型数据处理项目

面试指南

  • 对于技术实现类问题,可采用STAR法则:先描述背景,再说明任务,具体行动,最后结果
  • 对于系统设计类问题,先明确需求,再拆解模块,考虑数据流、性能瓶颈和优化方案
  • 对于开放性问题,展现逻辑思维和持续学习态度,并联系实际案例
  • 请描述一个你处理过的大型数据集,如何保证数据质量和清洗效率?
  • 什么是数据去重?在海量文本中如何高效去重?
  • 你了解哪些分布式数据处理框架?它们在数据处理Pipeline中如何协作?
  • 如果训练数据出现偏差,你会如何分析和解决?
  • 你如何评估数据质量?有哪些量化指标?

职位点评

70
综合评分

大厂大模型前沿数据岗位,技术成长快,但薪资和WLB未明确。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求前沿技术成长、对AI大模型充满热情、愿意在数据领域深耕的应届生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展85
工作生活50
使命价值70

薪资福利

65中等

公司平台和行业薪资水平较高,但JD未披露具体薪资福利,补偿性激励有一定保障但不确定性存在。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

85较高

岗位涉及LLM前沿技术,提供大模型数据处理的实战机会,技术成长空间大。

技术前沿前沿/新兴技术
技术栈Python、PyTorch、vLLM、SGLang、Spark、Ray
业务类型ambiguous

工作生活

50较低

工作地点在上海/北京,未明确工作模式与加班情况,生活平衡方面信息不足。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

LLM赛道高速增长,岗位对AI发展有基础性贡献,但社会影响力中规中矩。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs