
腾讯
混元Agent评测Infra工程师(北京/上海/深圳)
混元Agent评测Infra工程师(北京/上海/深圳)
发布于 大约 14 小时前普通员工/个人贡献者
北京市 / 上海市
中级经验
全职员工
仅现场办公
本科
平台工程
Go
Infra
任务调度
分布式系统
容器化
腾讯混元
评测
AI 估算 · 25k–40k
腾讯作为一线大厂,薪资有竞争力;Infra工程师属于核心岗位,3年经验在北京/上海/深圳月薪通常在25k-40k之间,加年终奖等综合较高。
职位详情
关于这个职位
该职位负责构建和优化腾讯混元大模型Agent评测的基础设施,确保大规模评测的稳定、高效和可复现
你将深入参与沙盒环境、任务调度、网络访问等关键能力建设,并作为算法与工程团队之间的桥梁,推动评测需求高质量落地
适合有后端/Infra经验、对AI评测感兴趣的技术人才
最低要求
计算机相关专业本科及以上学历,3年及以上后端 / 平台 / Infra 研发经验
精通至少一门主流后端语言(Python / Go / Java 等),主导过中大型平台或系统的设计与落地,具备优秀的系统设计与工程实现能力
熟悉容器化与沙盒隔离、分布式系统、任务调度与并发控制,有大规模任务编排或性能优化经验
熟悉网络通信与代理机制,能处理外部接口访问与稳定性问题
具备丰富的跨团队协作经验,能在算法、平台、底层基础设施等多方之间有效拉通与推进
具备较强的技术主导力与 Owner 意识,面对复杂不确定问题有冲劲、能扛事、能落地
工作职责
构建评测运行底座:统筹沙盒环境、依赖管理、网络访问、并发调度等关键能力建设,保障大规模评测在生产环境下的稳定、可复现与高效运行
保障评测质量与可观测性:从 Harness 与打分逻辑出发,确保平台化改造后评测结果的准确可信,并建立完善的诊断与问题归因能力
衔接算法与工程:深入理解各 Benchmark 所考察的模型能力维度,作为算法与平台之间的技术桥梁,推动评测需求高质量落地
AI 洞察
优缺点分析
优点
- 腾讯混元是AI大模型核心项目,技术前沿且投入大,能接触大规模分布式系统和AI评测全流程
- 作为Infra工程师,技术积累扎实,含金量高,跳槽竞争力强
- 团队跨算法、平台、基础设施,能积累多维度协作经验,职业发展空间大
- 需要同时掌握多种技术栈(容器化、调度、网络等),学习曲线较陡
- 跨团队沟通多,需平衡算法需求与工程实现,对协调能力要求高
- 适合有3年以上后端/Infra经验、对AI大模型评测感兴趣、喜欢解决复杂系统问题且具备强Owner意识的技术人才
缺点 / 挑战
- 评测平台对稳定性和准确性要求极高,运维压力大,需快速定位并解决复杂问题
角色解读
- 在AI基础设施方向深耕,成长为评测平台架构师或技术负责人,主导更大规模的系统设计
- 横向拓展到AI平台其他领域(如训练平台、推理平台),成为全栈AI基础设施专家
- 深入理解AI模型评估方法论,向算法团队过渡或成为AI评测领域的专业顾问
- 负责设计并实现大规模AI评测的底层基础设施,包括沙盒环境、任务调度和并发控制,确保评测流程稳定高效
- 从Harness和打分逻辑入手,保障评测结果的准确性和可观测性,建立问题诊断和归因机制
- 深入理解Benchmark考察的模型能力维度,作为算法与工程团队之间的桥梁,推动评测需求落地
- 精通至少一门主流后端语言(Python/Go/Java),具备中大型平台或系统的设计与落地能力
- 熟悉容器化与沙盒隔离、分布式系统、任务调度与并发控制,有大规模任务编排或性能优化经验
- 熟悉网络通信与代理机制,能处理外部接口访问与稳定性问题,具备跨团队协作和问题推进能力
申请策略
- 面试前可了解腾讯混元大模型的技术架构和评测方案,思考当前评测体系的痛点
- 准备好系统设计面试,针对评测平台场景设计高并发、高可用的架构方案
- 突出参与过的大规模平台或系统的设计与落地经历,体现系统设计和工程实现能力
- 强调容器化、任务调度、分布式系统优化等具体项目经验,最好有数据或效果对比
- 展示跨团队协作案例,说明如何推动多方需求落地
- 补充或加深对主流容器编排(Kubernetes)和任务调度框架(如Airflow、Argo)的理解
- 提前了解大模型评测常见Benchmark(如MMLU、HumanEval)和评测流程,准备相关知识
面试指南
- 对于系统设计问题,采用分层架构思路,先明确需求(功能/非功能),再划分模块(调度、沙盒、存储、监控),最后讨论关键设计(一致性、容错、扩展性)
- 对于问题排查类,使用STAR原则:情境、任务、行动、结果,突出分析过程和系统性方法
- 对于与算法协作的场景,强调主动沟通、技术翻译能力,以及将模糊需求转化为具体工程方案的能力
- 如何设计一个支持大规模并发评测任务的调度系统?
- 如何保证评测结果的可复现性和准确性?你会采取哪些措施?
- 描述一次你解决复杂分布式系统问题的经历,你是如何定位和修复的?
- 如果你需要为多个算法团队提供评测平台,你会如何设计API和资源隔离?
- 你对大模型评测有哪些了解?你觉得当前评测体系有哪些挑战?
职位点评
72
综合评分
大厂核心AI基础设施岗,薪资高、技术前沿,但WLB一般、需现场办公。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求高薪资和高技术成长的求职者,但需能接受现场办公和可能的加班。
表现最好
薪资福利
相对薄弱
工作生活
薪资福利85
成长发展80
工作生活40
使命价值70
薪资福利
85较高
腾讯作为上市公司,薪资福利具有市场竞争力,但JD未明确薪资和福利细节,满足程度较高但非最高。
薪资信号未披露(AI估算:25K-40K/月)
成长发展
80较高
涉及前沿AI基础设施和大模型评测,技术栈现代,有成长空间,但JD未明确培训或晋升路径,所以评分中等偏上。
技术前沿前沿/新兴技术
技术栈Python、Go、Java、容器化、分布式系统、任务调度
业务类型ambiguous
工作生活
40较低
未提及弹性工作或远程办公,大厂通常要求现场办公,可能加班较多,所以评分较低。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI大模型是高速增长赛道,但职位本身偏Infra,社会影响力有限,评分中等。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
腾讯 的其他在招职位
相似职位推荐
Watch Jobs