
蚂蚁集团
蚂蚁集团-AI算法评测工程师-端智能
蚂蚁集团-AI算法评测工程师-端智能
发布于 大约 1 小时前普通员工/个人贡献者
杭州市 / 深圳市
其它
全职员工
仅现场办公
本科
机器学习工程
Llm
Prompt Engineering
Pytorch
Rlhf
Sft
Sql
Tensorflow
Vlm
AI 估算 · 25k–45k
大厂算法岗,LLM/VLM方向稀缺,薪资竞争力强,但评测岗可能略低于核心算法岗,综合15薪。
职位详情
关于这个职位
作为AI算法评测工程师,你将专注于大语言模型(LLM)和视觉语言模型(VLM)的效果与性能评测,构建评测体系和自动化平台
你将参与评测数据集建设、开发自动化评测流水线,并基于数据洞察驱动模型优化
该岗位需要扎实的Python编程基础和深度学习知识,适合对AI模型质量保障感兴趣的技术人才
最低要求
计算机科学、人工智能、数学或相关专业本科及以上学历
技术栈:精通Python编程,熟悉PyTorch/TensorFlow等深度学习框架
熟练掌握SQL,具备扎实的数据处理能力
领域知识:深入理解LLM/VLM原理,熟悉主流开源模型(如Llama, Qwen等)及其生态
熟悉常见的LLM/VLM评测基准(如MMLU, GSM8K, HumanEval, MT-Bench, AlpacaEval等)及评测方法论
模型能力:具备模型微调(SFT/RLHF)实战经验,能够训练或优化Judge Model用于自动化评估
具备优秀的Prompt Engineering能力
综合素质:具备极强的逻辑思维与数据分析能力,对数据敏感,善于从复杂数据中发现规律
具备良好的沟通协作能力,能推动跨团队项目落地
工作职责
评测体系与标准构建:负责AI Agent、LLM(大语言模型)及VLM(视觉语言模型)的效果与性能评测体系建设
协同算法与产品团队,拆解业务场景,定义科学、客观且可量化的评测指标(Metrics),构建覆盖多场景、多难度等级的Benchmark
评测数据集建设与管理:设计并构建高质量、多样化的评测数据集(包括指令微调数据、偏好对齐数据等)
建立数据清洗、去重、质量校验的标准流程(SOP),确保评测数据的准确性与代表性,解决数据污染问题
自动化评测平台开发:搭建高效、可扩展的自动化评测流水线(Evaluation Pipeline),实现从数据输入到报告生成的全流程自动化
研发基于LLM的自动化打分模型(Judge Model/Reward Model),通过Prompt Engineering或SFT提升自动评测与人工评测的一致性(Correlation)
深度分析与算法迭代驱动:对评测结果进行多维度统计分析与Bad Case归因,输出可视化的深度评测报告
基于数据洞察发现模型短板,为算法优化、Prompt改进及数据合成提供明确方向,形成“评测-反馈-优化”的研发闭环,持续提升模型线上表现
AI 洞察
优缺点分析
优点
- 蚂蚁集团为巨头企业,平台大、资源丰富,接触前沿的LLM/VLM技术,专业积累快
- 评测岗位是AI研发闭环中不可或缺的一环,重要性日益凸显,具备技术深度和影响力
- 薪资和福利在行业内具有竞争力,工作地点选择多(杭州/深圳),利于个人发展
缺点 / 挑战
- 评测工作涉及大量数据清洗和重复性实验,对细致度和耐心要求高,可能有些枯燥
- 需要持续跟进快速迭代的模型和评测方法,知识更新压力大
- 大厂节奏快,跨团队协作频繁,对沟通能力和主动性要求较高
- 适合对AI模型质量充满热情、具备扎实算法基础和数据分析能力,喜欢在快节奏环境中解决挑战性问题的技术型人才
角色解读
- 在评测方向深耕,成为AI评测领域的专家,负责更核心的评测架构设计和基准制定
- 向算法优化方向拓展,利用评测洞察驱动模型迭代,逐步转型为算法工程师或技术负责人
- 依托大厂平台,可向数据科学、AI产品等方向横向发展,积累丰富的AI落地经验
- 设计并构建LLM/VLM的评测体系和Benchmark,定义科学可量化的评测指标,覆盖多场景多难度等级
- 建设高质量评测数据集,包括指令微调、偏好对齐等数据,并建立清洗、去重、质量校验的SOP流程
- 开发自动化评测流水线和基于LLM的打分模型,通过Prompt Engineering或SFT提升自动化评测与人工评测的一致性
- 对评测结果进行多维度分析和Bad Case归因,输出深度报告,为算法优化和数据合成提供方向
- 精通Python,熟悉PyTorch/TensorFlow等深度学习框架,具备扎实的数据处理能力(SQL)
- 深入理解LLM/VLM原理,熟悉Llama、Qwen等主流开源模型及生态,掌握MMLU、GSM8K等常见评测基准
- 具备模型微调(SFT/RLHF)实战经验,能够训练或优化Judge Model,同时具备优秀的Prompt Engineering能力
- 拥有极强的逻辑思维与数据分析能力,善于从复杂数据中发现规律,并具备良好的跨团队沟通协作能力
申请策略
- 了解蚂蚁集团在端智能方向的布局,以及其在AI领域的战略重点,在面试中展现对业务场景的理解
- 准备一个完整的评测项目案例,从指标体系设计到结果分析,展示全流程的思考和实践能力
- 突出参与过的LLM/VLM相关项目,尤其是评测体系建设、基准测试或模型微调经验,并量化成果
- 重点展示Python编程能力和数据处理经历,如使用SQL处理大规模数据、构建数据管道等
- 强调对主流评测基准的熟悉程度,可附上在MMLU、GSM8K等上的实践对比
- 如果有跨团队协作或推动项目落地的经验,务必具体写清你的贡献和影响
- 熟练掌握主流评测工具和框架,如HuggingFace、lm-eval-harness,并尝试复现一些Benchmark
- 深入学习SFT/RLHF原理,尝试训练一个简单的Judge Model,理解Prompt Engineering的调优技巧
面试指南
- 采用“目标-方法-验证”结构化回答:先明确评测目标,再拆解指标和数据集设计,最后通过实验验证效果
- 突出数据驱动的思维:说明如何从数据中发现规律,如何设计对照实验,以及如何用数据支撑结论
- 展示协作能力:回答中提及与算法、产品团队的配合方式,强调闭环优化的逻辑
- 如何为一个新的LLM应用场景设计评测指标?
- 如何保证自动评测与人工评测的一致性?你会如何处理偏差?
- 请描述一次你通过数据分析发现模型问题并推动优化的经历
- 你对MMLU、MT-Bench等评测基准有何了解?各自的优缺点是什么?
- 如果让你训练一个Reward Model,你会如何设计数据收集和训练过程?
职位点评
72
综合评分
大厂AI算法评测岗,前沿技术栈,薪资优厚,但工作强度可能较高。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿、渴望在AI领域快速成长,能接受大厂快节奏的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活50
使命价值60
薪资福利
80较高
薪资优厚,大厂福利稳定,但具体薪资未披露。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
85较高
LLM/VLM评测是新兴热点,技术成长快,有明确的算法优化闭环。
技术前沿前沿/新兴技术
技术栈Python、PyTorch、TensorFlow、SQL、LLM、VLM、SFT、RLHF、Benchmark、Prompt Engineering
业务类型ambiguous
工作生活
50较低
工作地点为杭州或深圳,互联网大厂节奏,工作强度可能较大,无明确WLB信息。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
通过评测提升模型质量,有技术价值,但直接社会价值不明显。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs