
普通员工/个人贡献者
AI 估算 · 30k–60k
作为阿里巴巴AI推理平台的大模型评测工程师,你将主导大模型及AI应用的效果评估全流程,构建多维评测体系,设计对抗性测试,推动效果回归与用户体验闭环,并开发自动化评测工具
学历与理论基础:计算机科学、人工智能、统计学或相关专业硕士及以上学历,具备扎实的机器学习/深度学习理论基础,熟悉常见的模型评价指标(如F1-Score、PPL、METEOR、BERTScore等)及其适用场景
负责AI产品核心效果评估与精度度量:主导大模型及AI应用在业务场景下的效果评测全流程,包括构建多维度评测指标体系(如准确率、召回率、幻觉率、Rouge/BLEU及任务完成率),制定严谨的AB实验方案,并对评测数据进行深度统计与归因分析
有AI模型效果调优、指令微调(SFT)或强化学习(RLHF)中对Reward Model效果评估的经验
优点
缺点 / 挑战
大厂AI评测专家岗,技术前沿,薪资优厚,但工作地点固定,WLB未知。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
阿里巴巴作为大厂,薪资福利具有竞争力,但具体薪资未披露,综合判断补偿性动机满足度较高。
职位涉及前沿大模型评测技术,有明确的技能成长和职业发展空间,发展性动机满足度高。
工作地点在北京或杭州,未提及远程或弹性办公,可能需现场办公,生活化动机满足度一般。
AI评测对提升AI产品质量和安全性有积极意义,行业前景好,意义感动机满足度较高。