
阿里巴巴
算法工程师-大模型评测
算法工程师-大模型评测
发布于 大约 3 小时前普通员工/个人贡献者
北京市 / 杭州市
其它
全职员工
仅现场办公
本科
机器学习工程
Agent评测
Dpo
Pytorch
Reward Model
Rlhf
Tensorflow
大模型评测
强化学习
AI 估算 · 25k–50k
一线互联网核心算法岗,技术门槛高,市场竞争力强,薪资处于行业高位。
职位详情
关于这个职位
该职位专注于大模型评测与对齐技术,包括设计自动化评测方案、训练奖励模型(Reward Model)并通过强化学习提升模型能力
你将深度探索大模型在复杂任务中的弱点,参与前沿研究与工程落地,与顶尖团队协作,适合对LLM技术充满热情且具备扎实工程与算法能力的候选人
最低要求
本科及以上学历,计算机、人工智能、软件工程、数学、自动化等相关专业优先
深入理解 Transformer 架构及大语言模型基础知识,熟悉模型评测方案(Evaluation)或具有后训练(Post-training,如 SFT、RLHF、DPO 等)经验
具备卓越的代码工程能力,精通 Python 编程及 PyTorch、TensorFlow 等深度学习框架
有模型训练、推理加速或自动化数据合成经验者优先
具备系统性研究思维,在国际顶级计算机会议/期刊(如 NeurIPS、ICML、ICLR、ACL、EMNLP 等)发表过一作论文,或在知名开源社区、顶级竞赛(如 ACM/ICPC、Kaggle)中有突出成果
具备跨学科视野,良好的沟通能力和团队协作精神,能与产品、工程团队紧密配合推动落地
工作职责
深度挖掘大模型在复杂任务、长尾场景中的弱点,设计并构建具有可扩展性的自动化评测方案及高质量数据集
参与 LLM-as-a-Judge 方案的设计与实现,训练高精度的 Reward Model(奖励模型),建模人类偏好,提升模型在指令遵循、安全性及复杂逻辑上的表现
设计高效的 Reward Signal(奖励信号)并合成对应数据,通过强化学习(RL)算法持续提升模型的能力上限与泛化性
参与开发 Evaluation 与 Reward System 所需的工程框架,简化多任务测试流程,提升大规模模型集成与实验的效率
跟踪全球大模型最新进展(如 Agent 评测、多模态对齐、自动化数据合成等),推动研究成果在真实业务场景中的落地
AI 洞察
优缺点分析
优点
- 大模型评测是当前AI核心方向,行业前景广阔,技能积累价值高
- 平台大,与顶尖团队合作,有机会接触前沿研究和业务场景
- 人才竞争激烈,需要持续学习保持竞争力
缺点 / 挑战
- 阿里巴巴提供丰富的算力和数据资源,技术挑战大,成长快
- 技术要求高,需同时具备算法和工程能力,学习压力大
- 互联网节奏快,可能面临较高的加班强度
- 适合对LLM技术有强烈兴趣,具备扎实算法基础、热爱挑战和创新、希望在AI领域深耕的工程师
角色解读
- 从算法工程师成长为技术专家,深耕大模型对齐和评测方向
- 向技术管理方向发展,带领团队负责核心评测体系建设
- 有机会参与前沿研究,在顶级会议发表论文,成为行业KOL
- 设计大模型评测方案,构建高质量数据集,挖掘模型在复杂任务中的弱点
- 训练奖励模型(Reward Model),用于LLM-as-a-Judge和偏好建模
- 通过强化学习(RL)算法优化模型,提升指令遵循、安全性和逻辑能力
- 开发评测与奖励系统的工程框架,加速大规模模型实验和迭代
- 深入理解Transformer架构和大语言模型原理
- 扎实的Python编程能力,熟练掌握PyTorch或TensorFlow
- 熟悉模型评测(Evaluation)和后训练(SFT/RLHF/DPO)方法
- 具备研究思维和论文/竞赛成果,能推动前沿技术落地
申请策略
- 关注阿里巴巴达摩院或通义实验室的招聘动态,了解业务方向
- 准备展示你在真实项目中解决复杂问题的案例,突出研究深度
- 突出大模型相关项目经验,特别是评测、RLHF或奖励模型方向
- 强调发表的论文、开源贡献或竞赛成绩,这是重要加分项
- 展示Python和深度学习框架的熟练度,以及工程实现能力
- 补充强化学习和奖励模型建模知识,如DPO、PPO等算法
- 熟悉主流评测基准(如MMLU、HumanEval)和Agent评测方法
- 动手实践开源大模型(如LLaMA)的微调和评测流程
面试指南
- 先结构化拆解问题,提出评测维度和具体指标
- 结合项目经验,用STAR法则讲述实际案例
- 展示思考过程,强调权衡取舍和扩展性设计
- 如何设计一个针对大模型安全性的评测方案?
- 请解释RLHF的流程,以及Reward Model训练中的挑战
- 你如何评估一个模型在指令遵循上的表现?
- 描述一次你通过强化学习提升模型性能的经历
- 如何平衡评测数据质量和标注成本?
职位点评
73
综合评分
一线互联网核心算法岗,技术前沿、薪资优厚,但工作强度大、WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
追求技术成长和自我实现,对前沿AI方向充满热情,能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展95
工作生活45
使命价值80
薪资福利
70中等
阿里巴巴提供具有竞争力的薪酬福利,但JD未透露具体数字,整体待遇在业内属于较高水平。
薪资信号未披露(AI估算:25K-50K/月)
成长发展
95较高
大模型评测是前沿技术方向,涉及RLHF、Reward Model等创新领域,成长空间巨大。
技术前沿前沿/新兴技术
技术栈大模型、RLHF、Reward Model、DPO、强化学习、LLM-as-a-Judge
业务类型ambiguous
工作生活
45较低
北京/杭州现场办公,互联网大厂节奏快,未提及弹性工作安排,工作强度可能较大。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
从事大模型对齐与评测,推动AI安全和发展,具有较高技术价值和社会意义。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs