
蚂蚁集团
OceanBase-Maas研发工程师/大模型研发工程师-OceanBase
OceanBase-Maas研发工程师/大模型研发工程师-OceanBase
发布于 1 天前普通员工/个人贡献者
北京市 / 杭州市
高级经验
全职员工
仅现场办公
不限
机器学习工程
Gpu
Llm
Maas
Rerank
Sglang
Tensorrt-Llm
Vllm
推理优化
AI 估算 · 40k–70k
大模型平台研发岗,技术要求高,大厂高薪,市场竞争力强。
职位详情
关于这个职位
作为MaaS研发工程师,你将负责构建和优化蚂蚁集团核心AI能力的高可用模型服务平台,直接参与LLM、Embedding、Rerank等大模型的生产级部署与推理优化
工作涉及vLLM/SGLang等前沿推理框架的深度调优,以及K8s环境下的GPU集群管理和服务治理,技术挑战大、成长空间广阔
适合对AI基础设施和性能优化有热情的资深工程师
最低要求
基础能力:具备扎实的数据结构、算法及多线程/协程开发能力
云原生与基础设施: 熟悉 Docker、了解 K8s Operator 或调度器扩展者优先
推理框架经验:理解Transformer原理,熟悉TP/PP/EP/DP等并行推理技术,有vLLM、SGLang、NVIDIA TensorRT-LLM实际生产环境应用或二次开发经验者优先
综合素质:对大模型技术栈(RAG、Agent)有热情,关注领域内论文
具备良好的系统化思维,能从监控数据中定位性能瓶颈
工作职责
负责MaaS平台的整体架构设计,支持Chat、Embedding、Rerank等多种类型模型的高效托管与服务化
设计并实现智能模型路由(Model Router)机制,支持多模型版本灰度、AB测试、基于负载/成本/延迟的动态调度
异构GPU集群管理: 负责模型服务在K8s环境下的自动化部署、扩缩容及生命周期管理
实现GPU池化,屏蔽异构GPU的差异
推理性能优化:针对不同规格 GPU进行推理参数调优,实现算力资源的最优配置
深度优化vLLM、SGLang等主流推理框架,提升模型吞吐量(Throughput)并降低首字延迟(TTFT)
服务治理与高可用:设计并实现针对推理场景的负载均衡策略,构建全方位的监控告警体系,覆盖 GPU 利用率、KV Cache 占用、Token 速率及 API 成功率等
优先资格
有自研过模型路由层(Router)或 Gateway 经验,支持 Token 级流控与计费
熟悉分布式推理(Tensor Parallelism / Pipeline Parallelism)
有Embedding模型生产环境大规模优化经验
AI 洞察
优缺点分析
优点
- 技术前沿,深度参与大模型推理优化,积累稀缺的AI工程化经验
- 蚂蚁集团平台型公司,技术氛围浓厚,成长和资源支持充足
- 薪资福利有竞争力,职业晋升空间广阔
- 技术门槛高,需要同时掌握分布式系统、并行计算和深度学习,学习成本高
- 大模型迭代快,需要持续跟进业界最新研究和框架更新,保持技术敏感度
- 适合对AI底层技术有浓厚兴趣,喜欢性能优化和大规模系统工程,且抗压能力强、愿意持续学习的资深工程师
缺点 / 挑战
- 平台规模大,能接触海量GPU集群和高并发场景,技术挑战和影响力兼备
- 平台基础设施团队可能面临较大的稳定性压力,必要时可能需要值班或应急响应
角色解读
- 技术专家路线:深耕推理引擎和底层性能优化,成为大模型基础设施领域的技术大牛
- 架构师路线:主导MaaS平台整体架构演进,成长为系统架构师
- 管理路线:带领团队负责AI基础设施方向,向技术管理岗位发展
- 负责MaaS平台核心架构,设计模型路由和调度机制,支撑多种大模型的高效服务化
- 管理异构GPU集群,在K8s环境中实现自动化部署、扩缩容和生命周期管理
- 针对vLLM、SGLang等推理框架进行深度性能优化,提升吞吐并降低延迟
- 构建监控告警体系,保障模型服务的稳定性与高可用性
- 扎实的编程基础,熟悉数据结构、算法及多线程/协程开发
- 熟悉容器化技术,了解Kubernetes及其扩展机制
- 深入理解Transformer原理和并行推理技术(TP/PP/EP/DP),有实际推理框架调优经验
- 对大模型技术生态(RAG、Agent)有热情,能快速学习前沿技术
申请策略
- 在申请时展示你对大模型技术的热情和持续学习能力,例如GitHub项目或技术博客
- 了解蚂蚁OceanBase的技术栈和业务方向,在面试中体现系统性思考和问题解决能力
- 突出在vLLM/SGLang/TensorRT-LLM等推理框架的生产经验,包括具体优化项目和量化指标提升
- 展示Kubernetes和GPU集群管理的经验,特别是大规模部署、调度和资源分配相关项目
- 强调对并行推理技术的掌握,如TP/PP/EP/DP的实践案例
- 如有模型服务治理或网关开发经验,务必详细描述,这是加分项
- 若缺少推理框架二次开发经验,可提前研究vLLM源码,了解PagedAttention、Continuous Batching等核心机制
- 加深对TensorRT-LLM和SGLang的理解,了解各自优势场景
面试指南
- 对于系统设计类问题,先明确需求场景,然后分层阐述架构:接入层、路由层、推理层、资源层,并说明关键设计取舍
- 对于性能优化问题,从系统性角度考虑:数据准备、模型加载、推理引擎配置、硬件特性、并发调度等,给出可量化的实验方法
- 对于技术原理问题,用清晰的逻辑解释核心概念,并结合实际项目经验说明应用场景
- 如何设计一个高可用的MaaS平台?你会如何实现模型路由和动态调度?
- 在vLLM或SGLang中,如何优化TTFT(首字延迟)和吞吐量?请简述关键参数和思路
- 请解释Tensor Parallelism和Pipeline Parallelism的原理,以及在多机多卡环境下的配置实践
- 如何监控和诊断GPU集群中的性能瓶颈?例如GPU利用率低或KV Cache溢出的处理
- 你如何看待当前大模型推理技术(如投机采样、量化)的发展趋势?
职位点评
76
综合评分
前沿大模型平台研发,技术挑战大、成长空间高,但工作节奏可能紧张。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度成长、愿意在大模型驱动的高压环境中挑战自我的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利78
成长发展95
工作生活50
使命价值70
薪资福利
78中等
该职位来自蚂蚁集团,薪资水平在行业内具有较强竞争力,但JD未提及具体福利和薪酬细节。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
95较高
岗位深度聚焦大模型推理和MaaS平台,技术前沿性和挑战性极高,能显著提升专业能力和行业影响力。
技术前沿前沿/新兴技术
技术栈LLM、vLLM、SGLang、TensorRT-LLM、K8s、GPU、Embedding、Rerank、RAG、Agent
业务类型ambiguous
工作生活
50较低
JD未提及弹性工作或远程办公,大厂研发岗位通常工作节奏较快,可能面临加班。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
大模型和AI基础设施是当前最重要的技术方向,行业前景广阔,但具体岗位社会价值中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs