iFLYTEK logo
科大讯飞
【星火X计划】大规模集群下超大尺寸模型推理性能极致优化(J13985)

【星火X计划】大规模集群下超大尺寸模型推理性能极致优化(J13985)

发布于 大约 8 小时前

普通员工/个人贡献者

合肥市 / 北京市
初级经验
全职员工
仅现场办公
硕士
平台工程
Go
Kvcache
Rdma
云原生
分布式系统
异构算力
性能优化
推理集群

AI 估算 · 25k–50k

顶尖AI人才计划,硕士学历,高难度技术岗,薪酬应高于市场平均水平;合肥和北京薪酬差异,综合定位中高端。

职位详情

关于这个职位

本职位是科大讯飞星火X顶尖AI人才计划的一部分,专注于超大尺寸通用大模型API服务场景,基于国产异构算力芯片构建高性能分布式推理集群

你将围绕KVCache优化、动态调度、弹性异构基础设施等核心任务,通过工程技术创新推动延迟、成本与可靠性的极致优化,打造高性价比的大模型服务基础设施
适合对分布式系统和高性能计算有浓厚兴趣、喜欢挑战技术极限的工程师

最低要求

-27届硕士及以上学历,计算机、软件工程、数学及相关专业优先

具备扎实系统基础、优秀学习能力或突出工程实践能力者同样欢迎
熟练掌握C++、Python、Go等至少一种语言,具备大型工程项目开发能力,能够完成良好实现与性能优化
对KVCache系统有深入理解,具备KV存储、压缩、传输、缓存复用等性能优化实践
熟悉RDMA、SSD/HDD存储体系,熟悉Mooncake或同类型项目
熟悉云原生及分布式系统架构,掌握容器编排、服务治理、负载均衡、分布式故障定位及系统性能优化方法
具备优秀的工程意识和系统设计能力,能够针对复杂技术问题从第一性原理出发进行分析,建立体系化解决方案,并推动端到端闭环

工作职责

【课题介绍】本课面向超大尺寸通用大模型规模化的 API 服务场景,基于国产异构算力芯片构建大规模、高性能的分布式推理集群

围绕多级 KVCache、实时动态计算调度、弹性异构基础设施等核心任务,通过工程技术的持续创新,不断追求用户延迟体验、服务成本以及可靠性工程等方面的极致优化,构建高性价比的大模型 API 服务能力,加速形成普惠的token经济
【课题挑战】
大规模发散流量场景下,用户请求动态变化、业务负载高度随机、异构算力瓶颈差异显著、云际异构集群间流量峰谷波动大,在保障用户体验的同时需实现跨集群、跨资源池的全局负载最优分配与潮汐弹性调度,逼近集群吞吐与资源利用率极限
长上下文、高并发推理场景,KVCache增长导致显存、存储及传输成本急剧上升,分布式异构集群下缓存路径、路由策略与资源调度高度耦合,在保证首响时延和效果的前提下,突破KV压缩、跨节点复用和分级缓存效率瓶颈,KV利用率与成本的全局最优

优先资格

对分布式推理集群的设计、研发有比较深入的理解,具有大规模高性能系统设计或研发经验

在大型开源软件中有深度贡献,或有优秀个人开源项目

AI 洞察

优缺点分析

优点

  • 公司为上市企业,平台稳定,资源充足,有机会接触十万卡级异构算力集群
  • 星火X计划作为顶尖人才项目,通常伴有高薪酬、快晋升等资源倾斜
  • 技术难度大,需同时掌握KVCache、分布式系统、底层存储等多领域知识,学习曲线陡峭
  • 涉及大批量流量场景,系统调优需要极致细致,可能面临高强度工作和紧急排查

缺点 / 挑战

  • 身处AI大模型基础设施前沿,技术挑战大,成长空间极高,可积累稀缺的大规模推理优化经验
  • 算法与工程结合紧密,需要应对快速迭代的模型和服务请求,压力较大
  • 适合对分布式系统和高性能计算有浓厚兴趣,喜爱钻研底层技术、善于解决复杂系统问题,并愿意在高压力下持续攻坚的工程师

角色解读

  • 在AI基础设施领域深耕,从推理性能优化工程师成长为系统架构师或技术专家
  • 参与国产算力平台的核心研发,积累大规模分布式系统的设计与调优经验,未来可向AI平台技术负责人方向发展
  • 在科大讯飞大模型业务中,逐步承担更广的技术架构职责,或转向大模型训练、计算等领域
  • 负责超大尺寸通用大模型的分布式推理集群设计与优化,涉及KVCache多级缓存、动态计算调度、弹性异构基础设施等核心模块
  • 针对大规模发散流量和长上下文场景,优化KVCache的存储、压缩、传输与复用,降低显存和带宽瓶颈,提升缓存利用率
  • 参与跨集群、跨资源池的全局负载均衡与潮汐弹性调度,逼近集群吞吐和资源利用率极限,支撑高并发、低延迟的API服务
  • 与团队协作推进国产异构算力平台的技术演进,构建高性价比、普惠化的token经济基础设施
  • 扎实的C++/Python/Go编程能力,能进行大型工程项目开发与性能调优
  • 深入理解KVCache系统,有KV存储、压缩、传输、缓存复用等优化经验,熟悉RDMA、SSD/HDD存储体系
  • 熟悉云原生架构,掌握容器编排、服务治理、负载均衡、分布式排障和性能优化方法
  • 具备从第一性原理分析复杂问题的能力,能建立体系化解决方案并推动落地

申请策略

  • 关注科大讯飞在国产算力和大模型基础设施上的布局,在面试中展示对业务痛点的理解
  • 由于是校园招聘计划,可主动联系内部员工了解项目组技术栈,并针对性地准备内推
  • 突出与KVCache、分布式推理或高性能计算相关的项目,写明具体优化手段和量化收益
  • 强调C++/Python/Go的项目经验,尤其是大型并发系统的工程实践
  • 如有RDMA、SSD/HDD、Mooncake相关经验或开源贡献,务必详细列出
  • 体现系统设计能力,展示从问题分析到落地的完整案例
  • 提前研读KVCache相关论文(如PagedAttention)和Mooncake框架源码,深入理解机制
  • 动手实践分布式推理框架(如vLLM、TensorRT-LLM),尝试调优KV缓存或调度策略

面试指南

  • 对技术类问题,遵循'定义问题-分析瓶颈-方案对比-落地验证'的框架,重点展示量化指标和第一性原理思考
  • 对于系统设计题,从数据流、组件交互、扩展性、容错等角度展开,并主动提及优势和权衡
  • 对于项目介绍,采用STAR法则,突出个人贡献和难点突破
  • 请详细介绍一个你做过的高性能系统优化项目,面临什么问题,如何分析,最终效果如何?
  • 谈谈你对KVCache的理解,以及它在大模型推理中的瓶颈有哪些?你会如何优化?
  • 在分布式集群中,如何设计KV缓存复用策略?跨节点传输时如何考虑RDMA和存储层次?
  • 假设大规模流量涌入,集群出现负载不均,你会从哪些维度进行调度和弹性伸缩?
  • 如何用C++或Python实现一个高性能的缓存组件?需要注意哪些性能关键点?

职位点评

74
综合评分

顶尖AI人才计划,技术前沿性强、薪酬预期高,但工作强度大、WLB一般。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合极度重视技术成长、愿意在高强度下挑战前沿难题的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值70

薪资福利

75中等

公司为上市大厂,顶尖人才计划通常提供有竞争力的薪酬,但JD未披露具体薪资和福利,因此补偿性动机的满足程度中等偏上。

薪资信号未披露(AI估算:25K-50K/月)

成长发展

90较高

该职位处于AI基础设施前沿,涉及KVCache优化、异构算力等核心技术,能够快速积累稀缺的系统设计经验,发展空间极大。

技术前沿前沿/新兴技术
技术栈KVCache、RDMA、Mooncake、分布式系统、C++、Python
业务类型profit_center

工作生活

50较低

工作地点在合肥和北京,JD未提及远程或弹性办公,也未明确工作强度,但AI大厂核心技术岗通常加班较多,WLB一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

大模型推理优化推动AI普惠化,具有较高的行业价值,但公司角度主要强调商业竞争力,社会意义层面中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs