miHoYo logo
米哈游
大模型路由与评测工程师

大模型路由与评测工程师

发布于 大约 9 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Llm
Prompt
大语言模型
数据分析
智能路由
机器学习
模型评测

AI 估算 · 30k–60k

大模型方向人才稀缺,米哈游平台大,薪资竞争力强,估算30-60K/月*16薪

职位详情

关于这个职位

该职位负责米哈游内部大模型及Agent的智能路由与评测体系建设,需要设计路由策略并搭建评测体系,以平衡效果、成本与延迟

工作涉及数据分析、系统开发和模型选型,适合对AI工程化有热情、具备Python和LLM基础的技术人才

最低要求

熟练使用 Python,具备数据处理、实验设计和工程实现能力

熟悉大语言模型的使用方式,理解 Prompt、Embedding、工具调用和 Agent 的基本原理
能够将业务需求转化为可执行的评测任务和清晰的衡量指标
对实验结果保持严谨,能够处理样本偏差、模型波动和自动评分误差

工作职责

建设规则路由、Embedding 语义路由和模型驱动路由,根据任务类型和模型能力选择合适的模型

建设模型能力标签、任务分类、路由策略版本和灰度实验机制,使路由结果可解释、可回滚
搭建模型及 Agent 评测数据集、评分器和回归测试,覆盖代码、工具使用、长程任务及内部业务场景
对比固定强模型、固定低成本模型和智能路由在成功率、成本、延迟、Fallback 和错路由方面的表现
分析异常评测结果,区分模型能力变化、数据问题、评分问题和评测基础设施问题
将离线评测、线上 Trace、用户反馈和生产指标用于模型选型及路由策略迭代

优先资格

使用过 EvalScope、Inspect AI、Langfuse、Promptfoo 或 OpenCompass

运行过 SWE-bench、Terminal-Bench、τ-bench、GAIA 等模型或 Agent 评测
有推荐、搜索、分类、在线实验或成本优化经验

AI 洞察

优缺点分析

优点

  • 前沿技术领域,深度参与大模型在游戏场景的落地,技能积累快
  • 薪资福利有竞争力,公司资金充裕,项目稳定
  • 岗位涉及评测、路由和系统建设,综合性高,锻炼系统设计能力
  • 大模型领域发展快,需要持续学习新技术,更新知识库
  • 适合对AI工程化有热情、喜欢解决复杂系统问题、具备强动手能力和数据敏感度的技术人才

缺点 / 挑战

  • 米哈游作为头部游戏平台,数据和应用场景丰富,有挑战性
  • 评测和路由效果直接影响到业务,压力较大,需要严谨细致
  • 跨团队协作多,需理解不同业务方需求,沟通成本较高

角色解读

  • 技术方向:成为AI基础设施专家,负责更大规模模型编排和推理优化
  • 管理方向:晋升为AI平台团队技术Leader,主导下一代模型服务架构
  • 横向发展:向AI产品经理或数据科学家转型,深入业务场景
  • 设计和实现智能路由策略,根据任务类型选择最合适的模型,平衡效果和成本
  • 搭建模型及Agent的评测数据集和评分器,通过自动化回归测试保障模型质量
  • 分析线上数据和离线实验结果,优化路由策略和模型选型决策
  • 开发灰度实验和可解释性机制,确保路由结果可追踪和回滚
  • 精通Python,具备扎实的数据处理和工程实现能力
  • 深入理解大语言模型原理,包括Prompt、Embedding、Agent等核心概念
  • 熟悉模型评测方法论,能设计科学实验并处理数据偏差
  • 具备系统架构思维,能搭建可扩展的评测和路由框架

申请策略

  • 在面试中强调对效果和成本平衡的理解,展示系统化思考能力
  • 了解米哈游的业务方向(如游戏AI、虚拟世界),思考如何应用大模型提升体验
  • 突出Python项目经验,尤其是数据处理和实验框架搭建相关
  • 展示对大模型的理解,如使用过LangChain、LlamaIndex等框架完成Agent任务
  • 强调评测相关经验,如设计过测试集、对比不同模型效果、分析过模型偏差
  • 如果有路由或推荐系统经验,务必详述
  • 熟悉至少一个评测框架(如EvalScope、Langfuse),掌握其设计思路
  • 动手运行一些公开评测基准(如SWE-bench、GAIA),理解评测流程

面试指南

  • 对于开放设计题,先明确目标和约束(效果、成本、延迟),再分模块阐述(路由策略、评测体系、迭代机制)
  • 对于问题分析题,采用假设驱动,列举可能原因,并说明如何验证(如A/B测试、错误分析)
  • 对于经验题,使用STAR法则(背景、任务、行动、结果),突出严谨性和方法论
  • 请描述你设计一个模型路由系统的思路,需要考虑哪些维度?
  • 如何评估一个LLM在特定任务上的表现?你会选择哪些指标?
  • 如果发现模型A在评测中得分高但线上表现差,可能是什么原因?
  • 请举例说明你如何处理实验中的样本偏差问题
  • 你对Agent的评测有哪些方法?如何处理长程任务的不确定性?

职位点评

76
综合评分

大厂高薪前沿技术岗,工作节奏较快,发展空间大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和薪资回报,对WLB要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活50
使命价值60

薪资福利

85较高

米哈游薪资福利好,但未明确具体数值,属于市场偏高水准。年终奖和股票期权可能丰厚。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

90较高

该岗位直接接触大模型前沿技术,涉及智能路由和评测,技能成长空间大。但JD未明确晋升路径,需自行争取。

技术前沿前沿/新兴技术
技术栈Python、大语言模型、LLM、Embedding、Agent、路由、评测
业务类型ambiguous

工作生活

50较低

米哈游为游戏公司,通常工作节奏较快,未明确WLB,但上海办公室可能在科技园区,交通便利性一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

游戏行业属文娱,有一定社会影响力但非强使命驱动。米哈游产品面向全球,但岗位本身偏向基础设施,意义感中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs