
蚂蚁集团
蚂蚁集团-多模态理解及应用-多模态大模型评测-杭州/北京【AGI专项】
蚂蚁集团-多模态理解及应用-多模态大模型评测-杭州/北京【AGI专项】
发布于 大约 3 小时前普通员工/个人贡献者
北京市 / 杭州市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Nlp
Pytorch
Tensorflow
多模态大模型
大模型评测
计算机视觉
AI 估算 · 30k–50k
高级多模态算法岗,聚焦大模型评测前沿方向,北京/杭州一线城市薪资高,大厂福利好。
职位详情
关于这个职位
该职位负责蚂蚁集团多模态大模型评测体系的建设与优化,包括评测基准设计、评测方法研究和自动化平台开发
你将深入探索多模态模型的能力边界,与算法、工程、产品团队紧密协作,推动顶尖AI产品落地
适合具备扎实算法功底和工程能力、对大模型评测有热情的候选人
最低要求
学历背景: 计算机科学、人工智能、电子工程或相关领域的硕士及以上学历
专业经验: 3年以上在多模态学习、自然语言处理(NLP)、计算机视觉(CV)处理领域的算法研究和工程开发经验
工程能力: 具备出色的编程能力,精通 Python,并熟练掌握至少一种深度学习框架(如 PyTorch, TensorFlow)
具备很强的动手能力,能够独立完成评测系统的设计和开发
评测专长: 对大模型(特别是多模态大模型)的评测有深入的理解和丰富的实践经验,熟悉主流的图文、视频、语音评测基准和方法(如 MMBench, MMMU, V-Bench, SEED-Bench, Audio-Eval 等)
研究与分析能力: 具备优秀的分析和解决问题能力,能够独立设计实验、分析评测数据并形成有价值的结论和洞察
沟通与协作: 具备良好的团队合作精神和沟通能力,能够跨团队高效协作,推动复杂项目落地
工作职责
评测体系设计与搭建: 负责设计和搭建业界领先的全模态(图文、音视频)大模型评测体系,建立科学、全面、高效的评测流程、标准和自动化平台
评测基准 (Benchmark) 建设: 主导全模态评测基准的建设,持续追踪和引入学界、业界最新成果,并结合业务场景,设计和构建能反映模型真实能力的评测数据集
核心能力度量: 深入研究全模态大模型的能力边界,设计创新性的评测方法和指标(Metrics),精准度量模型在跨模态理解、内容生成、多轮交互、逻辑推理、鲁棒性及安全性等维度的综合能力
技术落地与效率提升: 发挥强大的工程和动手能力,主导评测工具链和平台的开发与优化,实现评测流程的自动化和规模化,大幅提升评测效率和质量
跨团队协作: 与算法、工程、产品团队紧密合作,将评测结果有效转化为模型能力提升和用户体验优化的具体行动,共同打造顶尖的全模态AI产品
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台资源丰富,业务场景多样,可接触业内领先的AI基础设施
- 岗位职责核心,与算法、工程、产品团队深度合作,影响力大
- 薪资竞争力强,大厂福利完善
- 多模态评测方法论尚不成熟,需要较强的创新能力和独立探索精神
- 需要同时掌握算法、工程、数据分析等多方面技能,综合要求高
- 适合热爱技术钻研、对大模型评测有浓厚兴趣,并希望在AI前沿领域深度发展的算法工程师
缺点 / 挑战
- 大模型评测是AI领域关键环节,前沿性强,技术挑战高,能快速积累核心竞争力
- 互联网大厂节奏快,可能面临一定的工作强度和压力
角色解读
- 可向多模态算法专家方向发展,深入模型能力边界研究,成为评测领域权威
- 有机会晋升为技术团队负责人,带领评测团队搭建更完善的基础设施
- 积累大模型全栈经验,可转向模型训练、调优或AI产品设计等方向
- 设计并搭建全模态大模型评测体系,涵盖图文、音视频等多模态数据,制定评测流程和标准
- 主导评测基准(Benchmark)建设,追踪学术界和业界最新成果,构建能反映模型真实能力的评测数据集
- 研究创新性的评测方法和指标,度量模型在跨模态理解、内容生成、多轮交互、逻辑推理、鲁棒性及安全性等维度的能力
- 开发优化评测工具链和自动化平台,实现评测流程的规模化,并与算法、工程、产品团队协作推动模型提升
- 精通Python,熟练使用PyTorch或TensorFlow等深度学习框架
- 扎实的多模态学习、NLP、CV算法基础,熟悉主流大模型评测基准和方法
- 具备独立设计和开发评测系统的工程能力,能高效实现自动化流程
- 出色的数据分析与问题解决能力,能设计实验并产出有价值的结论
申请策略
- 深入研究蚂蚁集团的AI业务方向,特别是AGI专项的布局,在面试中展示你的理解
- 准备一个你主导评测体系或相关算法的详细案例,用数据说明你带来的提升
- 突出多模态或大模型相关的研究和项目经历,特别是评测基准设计或评测方法优化的案例
- 详细描述你在算法工程上的落地能力,如搭建过自动化评测平台、开发过数据处理工具链等
- 展示你对最新评测基准(MMBench、MMMU等)的了解,以及你如何运用它们评估模型
- 强调跨团队协作经验,尤其是与产品、工程团队合作推动模型改进的成果
- 系统学习多模态大模型的前沿评测方法,阅读相关论文并尝试复现
- 动手操作主流评测基准和工具,如MMBench、MMMU、V-Bench等,熟悉其设计原理
面试指南
- 回答评测设计问题时,可以按'目标-方法-数据-指标-验证'的结构,突出你的系统性和创新性
- 针对基准局限,可结合具体场景,指出其覆盖面、标注质量或指标偏向等问题,并提出可操作改进方案
- 遇到冲突情况时,强调数据分析和归因能力,举例说明如何通过误差分析、人工抽样等方法定位问题
- 请介绍你设计过的评估一个多模态大模型能力的评测方案,包括指标选择和数据集构建
- 如何评估一个模型在跨模态内容生成上的鲁棒性?举例说明你采用的方法
- 针对MMMU或SEED-Bench这类基准,你认为它们有哪些局限?你会如何改进?
- 如果评测结果与人工主观感受不一致,你会如何分析和处理?
- 如何设计一个自动化评测平台?关键技术点有哪些?
职位点评
69
综合评分
大厂AGI专项,前沿技术,高薪,但工作现场化和强度未明确,适合技术驱动型人才。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿、渴望深度参与大模型核心工作的算法工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值60
薪资福利
70中等
蚂蚁集团为业内顶级平台,薪资福利竞争力强,但JD未披露具体薪资,故评分为中等偏上。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
85较高
多模态大模型评测属于前沿技术方向,能深度参与核心算法建设,技术成长空间大。
技术前沿前沿/新兴技术
技术栈Python、PyTorch、TensorFlow、多模态大模型、NLP、计算机视觉、Benchmark
业务类型ambiguous
工作生活
50较低
工作地点在北京/杭州,需现场办公,未提及弹性或远程政策,互联网大厂工作强度可能较大。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
AI大模型评测对技术发展有贡献,行业前景好,但岗位更偏技术支撑,直接社会意义感一般。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs