
蚂蚁集团
蚂蚁集团-大模型算法专家-模型评测-北京/杭州【AGI专项】
蚂蚁集团-大模型算法专家-模型评测-北京/杭州【AGI专项】
发布于 大约 8 小时前普通员工/个人贡献者
北京市 / 杭州市
专家级经验
全职员工
仅现场办公
硕士
机器学习工程
Aigc
Nlp
后训练
大模型评测
机器学习
深度思考
预训练
AI 估算 · 35k–60k
大模型方向热门,蚂蚁集团薪资竞争力强,算法专家级别薪酬较高
职位详情
关于这个职位
该职位负责蚂蚁集团语言大模型的评测算法研究与体系建设,需搭建业界领先的评测体系,精准评估大模型能力
工作涉及利用AIGC技术构建高质量评测数据集,结合公开Benchmark,深入大模型各训练阶段,通过高效评测提升模型能力与用户体验
适合具备扎实机器学习基础、熟悉大模型且有较强工程能力的求职者
最低要求
硕士及以上学历,计算机科学、人工智能、软件工程、数学等相关专业
具备扎实的机器学习算法基础,熟悉语言大模型的基本理论和算法
具备扎实的工程能力,熟练掌握Python编程,能高效进行代码开发和调试
具有良好的学习和沟通能力,有好奇心和责任心,具有钻研精神
工作职责
负责蚂蚁集团语言大模型的评测算法研究与应用,搭建业界领先的大模型评测体系,精准全面地评估大模型的能力
基于AIGC等技术建设高质量评测数据集,与业界公开评测集有机结合,深入大模型预训练、后训练、深度思考等各个阶段,利用大模型等技术提高评测效率和准确性,通过高效高质量评测提升语言大模型、垂域大模型的能力和用户体验
优先资格
具有大模型评测等相关经验,熟悉常见的大模型评测Benchmark和评测方法优先
在NeurIPS、ICML、ICLR、KDD、SIGIR等国际顶会发表过论文优先
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台大,资源丰富,能够接触大规模实际业务场景和顶级计算资源
- 大模型领域处于高速发展期,评测方向具有高技术壁垒和长期价值
- 团队技术氛围浓厚,有机会与行业顶尖专家合作,并参与顶级会议论文发表
- 大模型评测标准仍在演进,需要持续跟踪前沿研究并快速迭代方法论
- 对综合能力要求高,不仅需要算法深度,还需要较强的工程与沟通能力
缺点 / 挑战
- 薪资和福利具有竞争力,大厂稳定性较高
- 工作强度可能较高,尤其是在模型迭代关键期需要深度投入
- 适合对大模型技术有浓厚兴趣、具备扎实算法和工程能力、喜欢挑战性研究工作的求职者
角色解读
- 纵向发展:从评测专家进阶为大模型算法负责人,主导模型评估与优化策略
- 横向拓展:转向大模型训练、推理或应用方向,成为全栈大模型算法专家
- 行业机会:随着大模型在各行各业落地,评测专家可成为AI质量保障领域的稀缺人才
- 设计和构建大模型评测体系,制定评测标准与流程,确保评估的全面性和准确性
- 开发基于AIGC的自动化评测数据集生成工具,提升评测数据的质量和覆盖度
- 深入分析模型在各训练阶段的表现,与算法团队协作定位问题,推动模型能力提升
- 跟踪前沿评测方法,将公开Benchmark与内部评测相结合,持续优化评测技术
- 扎实的机器学习基础和深度学习理论,熟悉Transformer、预训练、RLHF等大模型技术
- 熟练掌握Python及常用深度学习框架(如PyTorch),具备高效工程实现能力
- 了解大模型评测常用Benchmark(如MMLU、HumanEval、GSM8K等)及评测方法论
- 具备较强的数据分析与实验设计能力,能够设计和执行对比实验并解读结果
申请策略
- 提前了解蚂蚁集团的大模型战略和已有产品(如蚂蚁百灵),在面试中展示对业务的理解
- 准备好一个完整的项目案例,展示从问题定义、实验设计到结论输出的全流程
- 突出大模型相关项目经验,尤其是涉及模型评测、评估或对比分析的工作
- 展示对常用Benchmark的熟悉程度,以及自己设计的评测方案或工具
- 强调学术成果(顶会论文)和开源贡献,体现研究能力和影响力
- 详细描述工程能力,如使用Python开发评测框架、数据处理管线等
- 系统学习大模型评测领域的最新成果,如LLM-as-Judge、自动化评测等方向
- 动手实践主流的开源大模型评测工具(如lm-evaluation-harness、OpenCompass等)
面试指南
- STAR法则:描述情境、任务、行动、结果,重点展示你的思考过程和权衡取舍
- 对比分析:在讨论评测方法时,主动对比不同方法的优缺点,展示全局视野
- 数据驱动:强调用数据和实验说话,量化指标和效果,避免空泛论述
- 请介绍你参与过的某个大模型评测项目,包括评测指标、数据集构建及结论
- 如何看待当前主流评测Benchmark的局限性?如何设计更有效的评测方法?
- 如何评估一个语言模型在特定垂域(如金融)的能力?需要哪些步骤和数据?
- 你熟悉哪些大模型训练技术(如RLHF、DPO),如何设计评测指标来评估这些技术带来的效果提升?
- 给定一个模型生成的回答集合,如何自动化评测其质量和安全性?
职位点评
71
综合评分
大厂大模型评测岗,技术前沿、薪资优厚,但WLB一般,适合技术驱动型求职者。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、愿意接受高强度工作、对大模型前沿有强烈兴趣的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活40
使命价值65
薪资福利
75中等
蚂蚁集团作为互联网大厂,薪资待遇属于市场偏高水平,但JD未明确薪资和福利细节,补偿性动机满足程度较好。
薪资信号未披露(AI估算:35K-60K/月)
成长发展
90较高
该职位专注于前沿大模型技术,技术栈先进,且有顶会论文要求,成长空间大,发展性动机满足程度很高。
技术前沿前沿/新兴技术
技术栈大模型评测、AIGC、预训练、后训练、深度思考、Python、Benchmark
业务类型ambiguous
工作生活
40较低
JD仅提到北京/杭州办公,未提及弹性工作或远程选项,互联网大厂工作节奏可能较快,生活化动机满足有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
65中等
大模型方向属于高速增长赛道,但评测岗位主要支撑内部模型研发,社会影响力有限,意义感动机中等。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs