
腾讯
腾讯云 EdgeOne-推理平台高级工程师
腾讯云 EdgeOne-推理平台高级工程师
发布于 大约 6 小时前普通员工/个人贡献者
深圳市
高级经验
全职员工
仅现场办公
本科
软件工程
Cuda
Gpu优化
Sglang
Tensorrt-Llm
Triton Inference Server
Vllm
分布式推理
AI 估算 · 35k–55k
腾讯高级工程师薪资在深圳属顶尖水平,结合大模型推理岗位稀缺性,月薪中位数约45K。
职位详情
关于这个职位
作为腾讯云EdgeOne推理平台高级工程师,你将专注于大模型推理服务的性能优化与架构设计
核心工作包括优化推理延迟、吞吐量和GPU利用率,管理KV Cache和显存,以及探索分布式推理策略
你将与团队一起推动推理平台的技术演进,解决高并发场景下的挑战
最低要求
本科及以上学历,计算机、人工智能、电子、自动化、软件工程等相关专业,有大模型推理系统优化经验者优先
熟练掌握 Linux 环境下 C/C++/Rust/Python/等 1 至 2 种以上语言
熟悉 LLM 推理基本流程,理解模型加载、Prefill、Decode、Serving、Batching、调度、并发控制、显存管理、KV Cache、分布式推理等核心机制以及相关优化实践
熟悉 TensorRT-LLM、vLLM、SGLang、Triton Inference Server、ORCA 等主流推理框架、推理引擎或调度机制
具备良好的性能分析和系统优化能力,能够定位推理链路中的调度、显存、算子、通信和资源利用率瓶颈
有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速响应线上问题并推动解决
工作职责
负责大模型推理服务的调度与性能优化,提升首 Token 延迟、Decode 延迟、吞吐、显存利用率和 GPU 利用率
负责推理请求调度、动态 Batching、KV Cache 管理与调度、显存管理等等推理性能与效率的核心能力建设
负责分布式推理优化,结合模型结构、硬件资源和业务流量特点,优化 TP/PP/EP 等推理策略
负责推理引擎优化,围绕模型加载、算子执行、CUDA/GPU 性能、并发执行等方向持续提升推理性能和稳定性
跟进并引入 LLM Serving、推理引擎、分布式推理、GPU 性能优化等前沿技术,推动推理平台持续演进
AI 洞察
优缺点分析
优点
- 大模型推理是当前最热门技术方向,职业前景广阔
- 团队技术氛围浓厚,可接触到最前沿的推理优化技术
- 薪资待遇优厚,大厂福利完善
- 技术迭代快,需要持续学习新框架和优化方法
- 对系统底层和CUDA优化要求高,学习曲线陡峭
缺点 / 挑战
- 腾讯云EdgeOne平台提供海量真实业务场景,技术挑战大
- 工作强度较高,可能需要应对线上性能问题和高压力
- 适合对高性能计算和AI推理有浓厚兴趣,热衷挑战技术难题,具备扎实系统编程能力的资深工程师
角色解读
- 可向推理系统架构师发展,主导大规模推理平台设计
- 也可转向AI基础设施方向,负责GPU集群调度与优化
- 未来可成为技术专家或团队负责人,带领推理优化团队
- 优化大模型推理服务的性能,包括首Token延迟、吞吐量和GPU利用率
- 设计和实现推理请求调度、动态Batching、KV Cache管理等核心模块
- 针对分布式推理场景,优化TP/PP/EP等策略,提升整体效率
- 跟踪前沿技术,如vLLM、TensorRT-LLM,推动推理平台演进
- 扎实的C++/Python编程能力,能高效实现底层系统
- 深入理解LLM推理流程,包括Prefill、Decode、显存管理
- 熟悉主流推理框架,如vLLM、TensorRT-LLM、SGLang
- 具备系统性能分析能力,能定位GPU、通信、算子瓶颈
申请策略
- 了解腾讯云EdgeOne的产品方向,思考推理优化如何落地于边缘场景
- 在面试中展示对性能指标的量化分析和系统调优思路
- 重点展示大模型推理优化相关项目经验,如推理延迟降低、吞吐提升
- 突出在vLLM、TensorRT-LLM等框架上的实际优化成果
- 强调GPU性能分析、显存优化、分布式策略等具体技术细节
- 如果有开源贡献或相关论文,务必列出
- 深入学习CUDA编程和GPU架构,掌握算子优化技巧
- 熟悉主流推理框架源码,理解Batching、KV Cache调度原理
面试指南
- 对于优化案例类问题,使用STAR法则:情境、任务、行动、结果,突出量化数据
- 对于技术对比类问题,从核心原理、性能、适用场景三个维度分析
- 对于瓶颈分析类问题,先描述排查思路(profiling工具、关键指标),再给出优化方案
- 请介绍一个你优化大模型推理延迟的具体案例,用了哪些方法?
- KV Cache的管理有哪些策略?如何平衡显存与计算效率?
- vLLM和TensorRT-LLM在调度上有什么不同?你更倾向于哪个?
- 如何分析GPU利用率和显存瓶颈?请举例
- 在分布式推理中,TP和PP的优缺点分别是什么?如何选择?
职位点评
73
综合评分
大厂核心推理优化岗,前沿技术栈,薪资丰厚但WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长、希望深耕大模型推理领域的工程师,愿意为前沿技术投入时间和精力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活40
使命价值70
薪资福利
75中等
腾讯高级工程师薪资在行业内具有竞争力,但JD未明确披露具体数字,福利方面未提及,综合评分中等偏上。
薪资信号未披露(AI估算:35K-55K/月)
成长发展
95较高
该职位处于大模型推理前沿技术赛道,技术挑战大,成长空间广阔,JD明确要求跟踪前沿技术,发展性极强。
技术前沿前沿/新兴技术
技术栈LLM推理、vLLM、TensorRT-LLM、SGLang、CUDA、GPU优化、分布式推理
成长机会跟进并引入前沿技术、持续演进
业务类型profit_center
工作生活
40较低
深圳现场办公,未提及弹性工作或远程,腾讯大厂工作强度较高,WLB信号不明确。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
70中等
云计算和大模型推理是高速增长赛道,但职位本身偏技术执行,社会影响力中性,没有明确使命感信号。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
腾讯 的其他在招职位
相似职位推荐
Watch Jobs