Alibaba logo
阿里巴巴
算法工程师-大模型评测

算法工程师-大模型评测

发布于 大约 3 小时前

普通员工/个人贡献者

北京市 / 杭州市
其它
全职员工
仅现场办公
本科
机器学习工程
Agent评测
Dpo
Pytorch
Reward Model
Rlhf
Tensorflow
大模型评测
强化学习

AI 估算 · 25k–50k

一线互联网核心算法岗,技术门槛高,市场竞争力强,薪资处于行业高位。

职位详情

关于这个职位

该职位专注于大模型评测与对齐技术,包括设计自动化评测方案、训练奖励模型(Reward Model)并通过强化学习提升模型能力

你将深度探索大模型在复杂任务中的弱点,参与前沿研究与工程落地,与顶尖团队协作,适合对LLM技术充满热情且具备扎实工程与算法能力的候选人

最低要求

本科及以上学历,计算机、人工智能、软件工程、数学、自动化等相关专业优先

深入理解 Transformer 架构及大语言模型基础知识,熟悉模型评测方案(Evaluation)或具有后训练(Post-training,如 SFT、RLHF、DPO 等)经验
具备卓越的代码工程能力,精通 Python 编程及 PyTorch、TensorFlow 等深度学习框架
有模型训练、推理加速或自动化数据合成经验者优先
具备系统性研究思维,在国际顶级计算机会议/期刊(如 NeurIPS、ICML、ICLR、ACL、EMNLP 等)发表过一作论文,或在知名开源社区、顶级竞赛(如 ACM/ICPC、Kaggle)中有突出成果
具备跨学科视野,良好的沟通能力和团队协作精神,能与产品、工程团队紧密配合推动落地

工作职责

深度挖掘大模型在复杂任务、长尾场景中的弱点,设计并构建具有可扩展性的自动化评测方案及高质量数据集

参与 LLM-as-a-Judge 方案的设计与实现,训练高精度的 Reward Model(奖励模型),建模人类偏好,提升模型在指令遵循、安全性及复杂逻辑上的表现
设计高效的 Reward Signal(奖励信号)并合成对应数据,通过强化学习(RL)算法持续提升模型的能力上限与泛化性
参与开发 Evaluation 与 Reward System 所需的工程框架,简化多任务测试流程,提升大规模模型集成与实验的效率
跟踪全球大模型最新进展(如 Agent 评测、多模态对齐、自动化数据合成等),推动研究成果在真实业务场景中的落地

AI 洞察

优缺点分析

优点

  • 大模型评测是当前AI核心方向,行业前景广阔,技能积累价值高
  • 平台大,与顶尖团队合作,有机会接触前沿研究和业务场景
  • 人才竞争激烈,需要持续学习保持竞争力

缺点 / 挑战

  • 阿里巴巴提供丰富的算力和数据资源,技术挑战大,成长快
  • 技术要求高,需同时具备算法和工程能力,学习压力大
  • 互联网节奏快,可能面临较高的加班强度
  • 适合对LLM技术有强烈兴趣,具备扎实算法基础、热爱挑战和创新、希望在AI领域深耕的工程师

角色解读

  • 从算法工程师成长为技术专家,深耕大模型对齐和评测方向
  • 向技术管理方向发展,带领团队负责核心评测体系建设
  • 有机会参与前沿研究,在顶级会议发表论文,成为行业KOL
  • 设计大模型评测方案,构建高质量数据集,挖掘模型在复杂任务中的弱点
  • 训练奖励模型(Reward Model),用于LLM-as-a-Judge和偏好建模
  • 通过强化学习(RL)算法优化模型,提升指令遵循、安全性和逻辑能力
  • 开发评测与奖励系统的工程框架,加速大规模模型实验和迭代
  • 深入理解Transformer架构和大语言模型原理
  • 扎实的Python编程能力,熟练掌握PyTorch或TensorFlow
  • 熟悉模型评测(Evaluation)和后训练(SFT/RLHF/DPO)方法
  • 具备研究思维和论文/竞赛成果,能推动前沿技术落地

申请策略

  • 关注阿里巴巴达摩院或通义实验室的招聘动态,了解业务方向
  • 准备展示你在真实项目中解决复杂问题的案例,突出研究深度
  • 突出大模型相关项目经验,特别是评测、RLHF或奖励模型方向
  • 强调发表的论文、开源贡献或竞赛成绩,这是重要加分项
  • 展示Python和深度学习框架的熟练度,以及工程实现能力
  • 补充强化学习和奖励模型建模知识,如DPO、PPO等算法
  • 熟悉主流评测基准(如MMLU、HumanEval)和Agent评测方法
  • 动手实践开源大模型(如LLaMA)的微调和评测流程

面试指南

  • 先结构化拆解问题,提出评测维度和具体指标
  • 结合项目经验,用STAR法则讲述实际案例
  • 展示思考过程,强调权衡取舍和扩展性设计
  • 如何设计一个针对大模型安全性的评测方案?
  • 请解释RLHF的流程,以及Reward Model训练中的挑战
  • 你如何评估一个模型在指令遵循上的表现?
  • 描述一次你通过强化学习提升模型性能的经历
  • 如何平衡评测数据质量和标注成本?

职位点评

73
综合评分

一线互联网核心算法岗,技术前沿、薪资优厚,但工作强度大、WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
追求技术成长和自我实现,对前沿AI方向充满热情,能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展95
工作生活45
使命价值80

薪资福利

70中等

阿里巴巴提供具有竞争力的薪酬福利,但JD未透露具体数字,整体待遇在业内属于较高水平。

薪资信号未披露(AI估算:25K-50K/月)

成长发展

95较高

大模型评测是前沿技术方向,涉及RLHF、Reward Model等创新领域,成长空间巨大。

技术前沿前沿/新兴技术
技术栈大模型、RLHF、Reward Model、DPO、强化学习、LLM-as-a-Judge
业务类型ambiguous

工作生活

45较低

北京/杭州现场办公,互联网大厂节奏快,未提及弹性工作安排,工作强度可能较大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

从事大模型对齐与评测,推动AI安全和发展,具有较高技术价值和社会意义。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs