Ant Group logo
蚂蚁集团
蚂蚁集团-多模态语料质量评估与优化工程师-杭州/上海

蚂蚁集团-多模态语料质量评估与优化工程师-杭州/上海

发布于 大约 3 小时前

普通员工/个人贡献者

上海市 / 杭州市
中级经验
全职员工
仅现场办公
本科
数据工程
Llm
Pytorch
多模态
数据合成
数据治理
数据质量
自然语言处理
质检

AI 估算 · 25k–40k

岗位涉及多模态与大模型前沿技术,大厂平台,薪资竞争力强。

职位详情

关于这个职位

该职位负责构建多模态语料的质量评估体系,通过自动化和算法手段量化语料质量,并优化数据以提升大模型性能

你将涉及文本、图像、音频等多模态数据的质量度量、结构化增强以及数据-模型质量飞轮驱动,推动以数据质量为核心的模型持续优化
适合对数据治理、多模态分析和NLP有深入理解的技术人才

最低要求

教育背景:计算机、数学、人工智能、自然语言处理或相关领域本科及以上学历,硕士/博士优先

专业经验:
2年以上自然语言处理、多模态数据处理或数据科学研发经验,有大模型预训练/微调语料治理经验者优先
)深入掌握信息抽取(实体/关系/属性)、数据清洗、标注一致性评估、数据合成中的至少一项核心技术
)具备多模态对齐分析或跨模态质量度量项目实践
技术能力:
)精通PyTorch/TensorFlow,熟练使用Transformers、LangChain等工具链
)熟悉大规模数据处理框架及分布式计算优化
)有基于LLM或Diffusion模型的合成数据生成与验证实践经验
数据质量能力:
)具备数据敏感度,能从多模态数据分布中识别系统性偏差、噪声模式及知识缺口,并转化为可执行的优化策略
)具备构建自动化质检、设计数据SLA、建立质量监控看板的工程化能力
)善于通过消融实验、反向验证、模型探针等方法,量化评估语料质量对下游任务的影响
综合能力:
)逻辑严谨,擅长从复杂数据中提炼质量规则,具备根因定位与系统性优化能力
)跨模态思维能力强,能贯通“原始数据-结构知识-模型能力-评估反馈”全链路
)对数据治理、标注一致性、合成数据可信度等质量议题有深度认知与落地热情

工作职责

多模态语料质量评估体系建设:

)设计覆盖文本、图像、音频、视频等多模态数据的质量评估维度(如一致性、完整性、跨模态对齐度等),建立可量化、自动化的质量度量框架,定义多模态场景下的质量验收基线与SOP
)研发基于语义理解的自动化质检算法,开发可视化质检平台与诊断工具,支持跨团队(算法/数据/工程)协同的数据质量分析决策
结构化语料优化与增强:
构建从非结构化多模态数据到高质量结构化知识(图谱、合成链路等)的生成与验证闭环,利用可控Agent生成技术检测高保真、多样化逻辑推理样本,提升数据的逻辑密度与可解释性,并通过对抗验证与消融实验评估其对模型泛化能力的增益
数据-模型质量飞轮驱动:
通过质量导向的数据消融实验,量化分析语料结构质量、分布均衡性、噪声水平对模型推理能力与知识记忆的影响边界,建立“低质样本诊断->清洗/合成策略迭代->模型性能验证”的闭环流程,推动以数据质量为核心的模型持续优化

优先资格

)在ACL/CVPR/NeurIPS等顶会发表过数据质量、信息抽取或合成数据方向论文

)有高质量开源数据集构建或数据质量相关工具开源经验
)熟悉Prompt工程、程序化数据生成等前沿技术并应用于质量增强场景

AI 洞察

优缺点分析

优点

  • 蚂蚁集团大厂平台,海量多模态数据和丰富的计算资源,技术氛围浓厚
  • 岗位处于AI前沿,多模态和大模型数据质量是稀缺方向,技能积累价值高
  • 工作涉及全链路数据治理,有助于建立系统性思维,职业发展空间大
  • 多模态数据复杂度高,需要跨文本、图像、音频等多领域知识,学习曲线陡峭
  • 数据质量优化需要持续实验和迭代,工作强度较大,且跨团队协作要求高
  • 技术更新快,需不断跟进LLM、合成数据等前沿研究,保持知识更新

缺点 / 挑战

  • 适合对数据质量有热情、具备NLP/多模态背景、喜欢解决复杂系统问题且能承受一定工作压力的技术人才

角色解读

  • 技术深耕:从数据质量工程师成长为多模态数据专家或大模型数据架构师
  • 管理方向:带领数据质量团队,负责全链路数据治理和优化策略
  • 交叉领域:向模型评测、AI安全等方向扩展,成为数据与模型双栖人才
  • 构建多模态语料质量评估体系,设计自动化质检算法和可视化平台,确保数据一致性、完整性和跨模态对齐
  • 对非结构化多模态数据进行结构化增强,利用Agent生成技术创建高质量合成数据,提升模型推理能力
  • 通过消融实验量化数据质量对模型性能的影响,驱动数据清洗和合成策略的迭代优化
  • 深入掌握NLP、多模态数据处理,精通PyTorch/TensorFlow及Transformers、LangChain等工具
  • 具备信息抽取、数据清洗、数据合成或质量度量等核心技能,熟悉大规模数据处理框架
  • 拥有数据敏感度和工程化能力,能构建自动化质检和SLA监控体系,熟练运用消融实验等方法

申请策略

  • 深入了解蚂蚁在金融AI领域的数据特点,思考如何将数据质量方法论应用于实际业务
  • 可提前准备一个数据质量优化的案例,展示系统化解决问题的思路
  • 突出多模态或NLP数据相关项目,强调数据质量改进的量化成果(如准确率提升、噪声降低等)
  • 展示使用PyTorch、Transformers等工具链的实际经验,以及大规模数据处理案例
  • 如有论文、开源数据集或质检工具经验,务必在简历中重点标注
  • 补充多模态对齐、数据合成等前沿技术,熟悉Diffusion模型和LLM数据生成方法
  • 强化工程化能力,学习Spark、Flink等分布式框架,以及可视化工具如Grafana

面试指南

  • STAR法则:结合具体项目,从背景、任务、行动、结果四个维度结构化回答
  • 技术方法论:先定义问题,再提出多种方案并进行对比,最后选择最优解并解释理由
  • 数据驱动:强调量化指标(如准确率、召回率、噪声比例等)和实验验证过程
  • 请描述你如何评估多模态数据的质量?具体维度有哪些?
  • 如何设计一个自动化质检系统?请结合一个实际项目说明
  • 消融实验如何设计?如何量化数据质量对模型性能的影响?
  • 你对合成数据在模型训练中的作用和风险怎么看?
  • 如何处理多模态数据中的跨模态对齐问题?

职位点评

73
综合评分

大厂前沿多模态数据岗,技术成长快,薪资有竞争力,但需现场办公且WLB未明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合高发展动机的求职者,重视技能成长和技术前沿,能接受现场办公和一定工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活40
使命价值85

薪资福利

75中等

薪资未在JD中明确,但蚂蚁集团作为大厂通常提供有竞争力的薪酬和福利,整体补偿性较好。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

90较高

岗位涉及多模态、LLM等前沿技术,数据质量是AI核心方向,学习机会丰富,技术成长空间大。

技术前沿前沿/新兴技术
技术栈多模态、自然语言处理、PyTorch、Transformers、LangChain、数据合成、LLM、数据治理
业务类型ambiguous

工作生活

40较低

JD未提及远程或弹性工作,工作地点在杭州/上海,推测为现场办公;未明确WLB信息,可能存在一定工作强度。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

数据质量直接影响AI模型效果,工作具有较高技术价值和行业影响力;AI赛道高速增长,岗位意义感强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs