
科大讯飞
AI数据工程师-基座大模型方向(J13364)
AI数据工程师-基座大模型方向(J13364)
发布于 大约 7 小时前普通员工/个人贡献者
合肥市 / 武汉市
无经验要求
全职员工
仅现场办公
本科
软件工程
大语言模型
数据合成
数据处理Pipeline
数据挖掘
数据清洗
机器学习
自然语言处理
AI 估算 · 12k–18k
校招岗位,涉及大模型前沿领域,薪资有竞争力,合肥武汉生活成本较低,预计月薪12-18K。
职位详情
关于这个职位
作为AI数据工程师,你将深入参与科大讯飞基座大模型训练数据的全流程处理,包括数据采集、清洗、合成与供给,与算法团队紧密协作,通过高质量数据驱动模型效果提升
这是一个技术导向的校招岗位,适合对大规模数据处理和LLM有浓厚兴趣的应届生
最低要求
重点院校计算机科学、软件工程、人工智能、数据科学、数学、自动化等专业毕业,本科及以上学历
具有扎实的编程和计算机基础,熟练掌握 Python等语言,具备良好的编程习惯和代码调试能力,熟悉 Linux 开发环境,能够使用 Git及AICoding类常用研发工具
对大语言模型和训练数据具有浓厚的兴趣,认同训练数据质量对模型能力的重要性,愿意深入分析数据问题及其对模型效果的影响
具备较强的学习能力、问题分析能力和实际动手能力,能够独立完成任务并持续优化结果
具有良好的沟通能力和团队协作意识
工作职责
参与大模型训练数据从采集、解析、清洗、去重、质量评估、合成加工到训练供给的完整流程,与模型算法团队紧密协作,持续优化数据质量、数据结构和数据处理效率
参与代码、智能体、通用推理等多种类型数据的生产与管理,开发和维护大规模数据处理Pipeline,提升数据处理任务的自动化程度、运行效率和稳定性
参与数据合成、自动标注系统建设、高质量数据体系建设等工作,保证训练数据可追踪、可复现和可评估
与模型算法和评测团队协作,基于真实应用场景反馈,分析训练数据与模型效果之间的关系,参与错误案例分析和数据迭代,推动模型效果持续进步
参与构建代码工程、AI搜索、工具调用、任务规划和多轮交互等复杂智能体任务轨迹数据
优先资格
在算法编程竞赛、数学竞赛或其他相关比赛中取得过较好成绩
在大语言模型、自然语言处理、机器学习等方向发表过高水平论文,或参与过有影响力的开源项目
有大语言模型、数据挖掘、机器学习相关的实习或科研经历
AI 洞察
优缺点分析
优点
- 参与前沿大模型训练数据工程,技术成长快,积累宝贵的大规模数据处理经验
- 公司为AI上市公司,平台大,资源丰富,有成熟的培训体系和导师制
- 数据工程工作可能较为枯燥,需要耐心处理大量细节问题
- 大模型领域迭代快,需要持续学习新技术和工具
- 与算法团队紧密协作,需要较强的沟通和问题拆解能力
- 适合对数据处理和AI训练有浓厚兴趣、善于分析问题、动手能力强、希望在技术深度上持续发展的应届毕业生
缺点 / 挑战
- 合肥/武汉生活成本较低,薪资相对有竞争力,生活质量较高
角色解读
- 从数据工程师起步,深入理解大模型训练数据体系,可向数据科学家或算法工程师方向发展
- 积累大规模数据处理经验后,可晋升为数据团队负责人或技术专家
- 在科大讯飞内部,有机会接触核心模型训练环节,向模型算法研发转型
- 参与大模型训练数据的全流程处理,包括采集、清洗、合成与供给,确保数据质量
- 开发和维护大规模数据处理Pipeline,提升自动化程度与运行效率
- 与模型算法团队协作,分析数据对模型效果的影响,迭代数据策略
- 构建复杂智能体任务轨迹数据,支持模型在代码、推理等场景的能力提升
- 扎实的Python编程能力和计算机基础,熟悉Linux和Git
- 对数据结构和算法有深入理解,能高效处理大规模数据
- 对大语言模型和训练数据有浓厚兴趣,愿意深入分析数据问题
- 良好的沟通协作能力和学习能力,能独立完成任务
申请策略
- 在面试中展示对数据质量重要性的理解和具体案例
- 了解科大讯飞的大模型产品(如星火大模型),体现对公司的兴趣
- 突出Python编程项目经验,尤其是数据处理、Pipeline开发相关经历
- 如果有大模型、机器学习或数据挖掘的课程项目或实习,重点描述
- 强调竞赛获奖、论文发表或开源贡献等加分项
- 展现对数据质量的关注和解决复杂问题的能力
- 提前熟悉Linux命令行、Git版本控制和Python数据处理库(如Pandas、NumPy)
- 了解大模型基础知识和数据处理流程,可以阅读相关论文或技术博客
面试指南
- 按STAR法则:情境、任务、行动、结果,结构化回答项目经历
- 对于开放性问题,先拆解问题,再给出步骤式解决方案
- 突出数据质量意识:如何确保准确性、一致性、完整性
- 你如何处理一个大规模数据集中的脏数据?请举例说明
- 描述一个你参与过的数据处理Pipeline,并说明优化点
- 你如何理解训练数据对大模型效果的影响?
- 假如需要生成一批高质量的训练数据,你会设计怎样的流程?
- 你对Python的哪些数据处理库比较熟悉?遇到过什么坑?
职位点评
75
综合评分
科大讯飞校招AI数据工程师,前沿大模型技术栈,发展空间大,但WLB一般。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
该职位最适合追求技术成长和前沿领域、愿意在合肥/武汉稳定发展的应届生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活60
使命价值70
薪资福利
75中等
科大讯飞作为上市公司,薪酬福利体系完善,薪资在合肥/武汉有竞争力,但校招薪资上限可能不如一线互联网公司。
薪资信号未披露(AI估算:12K-18K/月)
成长发展
85较高
职位涉及大模型前沿技术,有导师制和内部培训机会,晋升路径清晰,技术成长空间大。
技术前沿前沿/新兴技术
技术栈大语言模型、数据处理Pipeline、数据合成、机器学习、自然语言处理
业务类型profit_center
工作生活
60中等
工作地点为合肥/武汉,生活成本较低,但未提及弹性办公或远程,可能为常规办公模式。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
70中等
大模型是当前科技前沿,对社会生产力有较大影响,但岗位偏工程实现,直接社会意义一般。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
科大讯飞 的其他在招职位
相似职位推荐
Watch Jobs