iFLYTEK logo
科大讯飞
AI研究算法工程师-大模型训练/推理Infra方向(J13367)

AI研究算法工程师-大模型训练/推理Infra方向(J13367)

发布于 大约 6 小时前

普通员工/个人贡献者

合肥市 / 北京市
初级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Cuda
Deepspeed
Megatron-Lm
Pytorch
Vllm
分布式系统
大模型训练
推理优化
算子开发

AI 估算 · 20k–35k

科大讯飞上市大厂,大模型方向校招薪资竞争力强,合肥生活成本较低,综合估算月薪2-3.5万。

职位详情

关于这个职位

该职位专注于通用大模型的训练与推理全链路工程性能优化,涉及万卡级分布式训练、强化学习后训练系统、推理引擎加速及训推一体架构

你将与算法团队深度协作,攻坚底层技术瓶颈,持续提升算力效率,是推动大模型技术落地的关键角色
适合对底层系统性能有极致追求、热爱分布式计算和AI基础设施的同学

最低要求

本科及以上学历,计算机相关专业,具备扎实的计算机体系结构、操作系统、数据结构与算法基础

精通 C++/Python,具备良好的工程代码能力
深入理解 Transformer 模型原理,熟悉 PyTorch 等深度学习框架底层执行机制
满足至少一项核心实践经验:
有 DeepSpeed/Megatron-LM/VERL/SLIME 等分布式训练框架的调优与二次开发经验,熟悉多机多卡通信原理与显存优化方案
有 vLLM/SGLang/TensorRT-LLM 等推理框架的优化或二次开发经验,掌握 KV Cache、动态批处理、模型量化等核心推理技术
掌握 AscendC/CUDA/Triton/Tilang 等至少一种算子开发语言,有独立的高性能 GPU 算子开发与性能调优经验
对极致性能有追求,具备较强的系统瓶颈分析与问题定位能力

工作职责

大规模分布式训练系统:攻坚万卡级集群下的通信优化、显存墙突破与计算协同调度,构建国产算力集群的深度适配与性能调优能力

前沿RL后训练系统:构建强化学习高吞吐异步训推框架,优化PPO/GRPO/ReMax等算法工程流水线,设计AgentRL分布式环境交互系统,支撑RLVR/OPD等新算法快速迭代
推理引擎全链路加速:深耕算子融合、KV Cache多级管理与调度优化、动态批处理调度、量化推理及长上下文推理优化,同时主导推理后端在国产芯片上的异构适配与SLA保障
训推一体架构与算法协同:与算法团队深度耦合,设计训推一体工程架构,打通模型训练到推理部署的快速反馈闭环,前瞻探索MoE/Attention等新架构在分布式系统上的最佳落地路径

优先资格

有 MoE 模型训推优化、强化学习训练加速相关项目经验

有主流开源训推框架的核心代码贡献经历
有高性能计算领域竞赛获奖或顶会论文产出
在 SC/ISC/ASC 等高性能计算赛事或 ICPC/NOI 等算法竞赛中取得优异成绩
对技术有极致追求,习惯于从底层原理出发分析和解决系统性能问题

AI 洞察

优缺点分析

优点

  • 处于AI大模型前沿赛道,技术含量高,能够参与底层核心系统研发,积累稀缺的分布式计算经验
  • 科大讯飞平台资源丰富,提供国产芯片适配环境,技术影响力大
  • 团队技术氛围浓厚,有机会与顶尖算法和工程人才合作,快速提升技术深度
  • 对知识广度要求高,需要同时掌握分布式系统、深度学习框架、算子优化等多个领域
  • 国产芯片适配存在不确定性,需要灵活应对技术兼容性问题
  • 适合对系统性能有极致追求、热爱底层优化和分布式计算的技术型人才,尤其是希望在AI基础设施领域深耕的应届生

缺点 / 挑战

  • 工作强度较大,需要攻坚底层技术瓶颈,可能面临长期的技术攻关压力

角色解读

  • 可在技术方向深耕,成为大模型训练/推理领域的专家或架构师
  • 也可转向技术管理,带领团队攻坚底层系统难题,或跨团队协调推进训推一体架构
  • 未来可拓展至AI基础设施全栈,从芯片适配到上层算法优化形成闭环能力
  • 负责大规模分布式训练系统的通信优化、显存管理和计算调度,确保万卡集群高效稳定运行
  • 构建强化学习后训练系统,优化PPO、GRPO等算法工程流水线,设计AgentRL分布式环境交互
  • 主导推理引擎全链路加速,包括算子融合、KV Cache优化、动态批处理、量化推理等,适配国产芯片
  • 精通C++和Python,具备扎实的系统编程能力,熟悉Transformer模型原理和PyTorch底层机制
  • 掌握至少一种分布式训练框架(DeepSpeed/Megatron-LM等)或推理框架(vLLM/TensorRT-LLM等)的优化经验
  • 具备高性能算子开发能力,熟悉CUDA/Triton等,能独立进行GPU算子开发与性能调优

申请策略

  • 提前了解科大讯飞的星火大模型技术路线,在面试中展示对多模态、MoE等新架构的理解
  • 重点突出分布式训练或推理相关的项目经历,特别是使用DeepSpeed/Megatron-LM等框架的优化经验
  • 强调高性能计算或算法竞赛获奖(如ICPC、SC、ASC等),体现工程能力和竞争力
  • 如有开源贡献或顶会论文,务必列出,特别是与训推框架、算子开发相关的工作
  • 补充强化学习训练系统的工程实践,如PPO/GRPO的分布式实现
  • 深入学习国产芯片(如华为Ascend)的编程模型,熟悉昇腾CANN或类似平台

面试指南

  • 回答技术问题时,先梳理核心原理,再结合具体实践案例说明,展示系统思考能力
  • 对于优化问题,采用“现状-瓶颈-方案-效果”的结构,突出量化指标(如吞吐、延迟提升百分比)
  • 请详细解释DeepSpeed的ZeRO优化策略,以及你如何调优通信以提升效率?
  • 针对大模型推理,如何优化KV Cache?有哪些常用技术?
  • 在分布式训练中,你遇到过哪些显存瓶颈?如何突破?
  • 描述一个你参与的性能调优案例,从问题定位到解决方案的完整过程
  • 复习Transformer模型结构及PyTorch自动求导、分布式数据并行原理
  • 准备1-2个详细的分布式训练/推理项目,包括架构设计、遇到的挑战和解决过程

职位点评

69
综合评分

大模型底层技术岗,前沿技术栈,成长空间极大,但工作强度高,WLB一般。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合追求技术成长和前沿知识的求职者,愿意为技术深度付出高强度努力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展92
工作生活35
使命价值70

薪资福利

65中等

科大讯飞作为上市公司,校招薪资具有竞争力,但未明确具体薪资和福利,合肥生活成本较低,整体待遇合理。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

92较高

该职位处于大模型前沿技术领域,涉及分布式训练、推理优化、国产芯片适配等稀缺技能,成长空间极大,技术深度和广度并存。

技术前沿前沿/新兴技术
技术栈大模型训练、分布式系统、算子开发、GPU性能调优、国产芯片适配
业务类型ambiguous

工作生活

35较低

职位未提及工作模式或WLB,且描述中强调“攻坚”“极致”,暗示高强度工作,可能面临较大压力。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI大模型是高速增长赛道,推动技术进步具有行业影响力,但职位偏向底层工程,直接社会价值感中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs