iFLYTEK logo
科大讯飞
AI研究算法工程师-大模型预训练数据研究方向(J13369)

AI研究算法工程师-大模型预训练数据研究方向(J13369)

发布于 大约 3 小时前

普通员工/个人贡献者

合肥市 / 武汉市
无经验要求
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Acl
Neurips
Pytorch
代码智能体
多模态
大模型
数据合成
深度学习
预训练

AI 估算 · 18k–28k

AI算法岗需求旺盛,科大讯飞作为AI龙头,薪资具备竞争力;合肥/武汉生活成本较低,综合估算月薪中位数约23K。

职位详情

关于这个职位

该职位专注于大模型预训练数据的研究与工程,负责构建高质量的数据体系、优化数据合成方法,并建立自动化评测框架

你将深入探索多语言文本、代码智能体及多模态数据,为基模训练提供核心支撑,同时与上下游团队紧密协作,推动预训练技术的创新突破
适合对通用人工智能有热情、具备扎实深度学习背景和编程能力的应届生

最低要求

拥有强烈科研热忱与长远科研信念,对通用人工智能充满探索欲,能形成独有的模型行为认知,主动挖掘、攻坚全新研究问题

具备严谨的科研素养,逻辑思维突出,拥有良好研究审美,深耕深度学习领域并在至少一条细分方向形成体系化、深度独立见解
专业技术与工程能力过硬,编程功底扎实,熟练运用各类前沿 AI 工具赋能研发,高效推进实验与落地工作
秉持务实踏实的做事态度,重视数据核心价值,愿意沉下心完善数据与模型相关基础工作,独立快速吃透新兴研究赛道
具备开放包容的协作意识,认同协同共进的团队文化,沟通顺畅、敢于理性质疑,待人平等,拥有全局大局观
广泛且深入跟进行业前沿动态,拥有自主思考与笃定的研究思路,主动探索创新解法,持续推进预训练相关基础研究突破

工作职责

构建完善的预训练数据体系,覆盖多语言文本数据、代码智能体数据、多模态数据等,为基模训练提供有效数据支撑

迭代完善数据生产链路,搭建标准化、高效的数据治理体系,联动上下游团队协作,保障高效及高质的数据供给
探索多样的数据合成方法,提升无监督数据多样性
探索调优数据筛选规则与各类数据分配比例
搭建自动化评测框架,全方位评测和监控无监督模型效果,为模型训练提供有效指导
紧跟行业前沿,深耕预训练数据相关基础创新研究

优先资格

以第一作者在NeurIPS、ICML、ICLR、ACL、EMNLP等AI顶会发表大模型、代码智能体等相关论文,若引用达到100以上优先

深度使用Claude Code、Codex等AI编程工具,对代码大模型能力边界、优化方向有真实实践认知
拥有LLM、Agent、代码大模型相关开源项目贡献经历,GitHub有活跃开源协作成果
参与过算法、代码、奥数类权威竞赛并取得优异名次,具备扎实的算法与代码功底
在顶尖 AI 公司或实验室的核心团队有过长期实习经历,并有重要研究成果落地到基模大模型

AI 洞察

优缺点分析

优点

  • 处于大模型最核心的数据环节,技能稀缺性强,行业前景广阔
  • 科大讯飞在AI领域积累深厚,平台资源丰富,能接触前沿研究
  • 工作涉及多模态等热门方向,有利于个人技术积累和跳槽竞争力
  • 可与顶尖研究者和工程师合作,快速成长
  • 预训练数据研究尚在早期,方法论不成熟,需大量探索和试错
  • 数据工作可能较为繁琐,需要耐心和细致
  • 适合对人工智能有强烈科研热情、愿意深耕数据领域、具备扎实编程和深度学习基础的应届硕士/博士生

缺点 / 挑战

  • 工作内容偏研究型,对独立创新和论文产出有较高期待

角色解读

  • 从数据研究员向预训练算法专家发展,主导数据策略和模型优化
  • 可转向模型训练、模型评估等关联岗位,拓宽技术广度
  • 未来可晋升为技术Leader,带领数据团队或算法团队
  • 负责预训练数据的全链路构建与优化,包括多语言文本、代码、多模态数据的采集、清洗与合成
  • 设计自动化评测框架,监控模型效果,指导训练数据迭代
  • 探索数据增强和筛选规则,提升数据多样性与模型性能
  • 跟踪前沿研究,将最新方法落地到数据生产中
  • 扎实的深度学习理论基础,熟悉Transformer、预训练范式等
  • 精通Python和主流深度学习框架(PyTorch/TensorFlow),具备工程化能力
  • 对数据敏感,有数据清洗、分析、合成相关经验
  • 了解大模型(LLM)、多模态、代码智能体等前沿方向

申请策略

  • 了解科大讯飞的大模型产品(如星火大模型)及其数据策略
  • 在简历中展示对数据驱动AI的独特见解,体现思考深度
  • 突出相关项目经历,如参与过大模型训练、数据合成或评测工作
  • 强调论文发表、竞赛获奖或开源贡献,体现研究能力
  • 展示编程实力,如GitHub项目或技术博客
  • 体现对数据质量的重视和工程落地经验
  • 系统学习预训练数据相关论文(如数据筛选、课程学习等)
  • 动手复现一些数据增强或合成方法,积累实践经验

面试指南

  • STAR法则:情境(Situation)、任务(Task)、行动(Action)、结果(Result)
  • 从问题定义、方案设计、实验验证、结果分析四个步骤展开
  • 结合前沿论文和自身实践,体现思考深度与批判性思维
  • 请谈谈你对预训练数据质量重要性的理解,以及如何评估数据质量
  • 描述一个你参与过的数据合成或清洗项目,遇到了哪些困难,如何解决?
  • 你如何看待当前大模型预训练数据的局限性?有哪些改进方向?
  • 解释一下数据多样性对模型性能的影响,如何量化?
  • 你熟悉哪些自动化的模型评测方法?请举例说明

职位点评

74
综合评分

AI大厂核心研究岗,前沿技术栈、高成长性,但工作强度未知。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合追求技术成长和行业影响力、愿意投入时间和精力在研究上的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活40
使命价值85

薪资福利

75中等

科大讯飞作为上市公司,薪资福利具有竞争力,但具体待遇未披露;合肥/武汉生活成本较低,综合性价比不错。

薪资信号未披露(AI估算:18K-28K/月)

成长发展

90较高

职位深度参与大模型核心数据研究,技能前沿,成长空间大;明确鼓励研究创新和论文发表,发展性动机满足度高。

技术前沿前沿/新兴技术
技术栈大模型、预训练、多模态、代码智能体、数据合成
成长机会紧跟行业前沿、基础创新研究、研究突破
业务类型ambiguous

工作生活

40较低

未提及远程或弹性工作,工作地点在合肥/武汉,多为现场办公;未涉及WLB信息,可能有一定工作强度。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

参与通用人工智能前沿研究,推动大模型技术进步,社会价值高;AI行业高速增长,使命感强。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号对通用人工智能充满探索欲
创新程度开拓性创新(行业首创)
Watch Jobs