Ant Group logo
蚂蚁集团
蚂蚁集团-非结构化数据挖掘工程师-具身智能方向

蚂蚁集团-非结构化数据挖掘工程师-具身智能方向

发布于 大约 8 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
硕士
数据科学
具身智能
向量数据库
多模态表征
大模型微调
数据挖掘
数据清洗
聚类算法
非结构化数据
关键帧挖掘

AI 估算 · 30k–50k

具身智能为AI热点方向,蚂蚁集团平台大,数据挖掘工程师薪资在上海处于较高水平,技能要求高,估值合理。

职位详情

关于这个职位

该职位负责蚂蚁集团具身智能方向的海量非结构化数据挖掘,包括机器人传感器轨迹、视频和深度数据

你将设计数据清洗与关键帧挖掘流程,构建多模态向量数据库和标签体系,为具身智能模型训练提供高质量数据支持
适合有扎实数据挖掘功底并对前沿AI方向感兴趣的工程师

最低要求

学历与工作经验:计算机科学、人工智能、统计学或相关领域硕士及以上学历,3年以上数据挖掘相关工作经验

智驾数据挖掘相关经验者优先,有具身智能领域数据挖掘经验者优先
核心技能:具备丰富的非结构化数据处理实操经验,熟练处理视频数据、深度数据、轨迹数据
深刻理解多模态表征学习理念,熟练使用常见聚类算法
精通数据清洗、过滤流程,具备关键帧/关键片段挖掘、困难样本挖掘相关实操经验,能适配具身智能场景数据需求
专项能力:具备向量数据库建设经验,熟练掌握跨模态统一表征的设计与实现方法
对数据标签体系的设计、优化和数据发布流程有清晰的理解和实践经验,能够独立主导或深度参与具身智能场景下标签体系搭建

工作职责

数据挖掘与核心场景挖掘:处理和分析大规模、多源的非结构化数据,重点聚焦具身智能场景下的机器人传感器轨迹数据、视频数据和深度数据

设计并实施数据清洗、过滤流程,结合数据预处理与增强手段,确保数据质量
专项负责关键帧/关键片段挖掘,精准提取数据中的核心有效信息,适配具身智能算法训练需求
开展困难样本挖掘工作,结合持续学习(Continuous Learning)理念,挖掘模型训练所需的高价值困难样本,助力具身智能模型性能迭代升级
特征工程与向量数据库建设:针对具身智能场景下的不同模态数据,研究和应用先进的多模态数据表征方法,实现跨模态信息的对齐、融合与联合表征,构建统一的向量表征体系
负责向量数据库的设计、搭建与优化,实现跨模态统一表征的高效存储、检索与管理,支撑具身智能下游算法快速调用
运用和优化经典及前沿的聚类算法,从非结构化数据中挖掘潜在模式、群体特征及异常信息,为具身智能算法任务提供高质量特征支撑
数据标签体系建设:主导或深度参与具身智能特定业务场景的数据标签体系设计、优化与迭代,结合具身智能算法训练、产品落地需求,定义标签标准、分类规则及标注规范,确保标签体系的科学性、实用性和可扩展性,全面支撑具身智能算法训练与产品化落地
标准数据集建设与发布:建立标准化的数据发布管道,整合清洗过滤后的数据、提取的特征集及相关模型,实现数据集的版本化管理、安全管控与高效交付,确保高质量数据能够安全、高效地服务于内部算法团队训练、模型微调及具身智能产品化需求
技术探索与落地:关注具身智能领域多模态数据挖掘、持续学习、大模型微调等前沿技术,结合业务场景进行技术探索与实践
配合算法团队完成具身智能相关数据的技术支持,推动技术成果落地应用,提升具身智能模型的数据适配能力

优先资格

加分项:具备大模型微调经验者优先

熟悉具身智能或智驾场景下的数据特点、业务需求及算法训练流程者优先
具备良好的问题解决能力、沟通协调能力和团队协作精神,能够高效推进具身智能相关数据挖掘项目落地

AI 洞察

优缺点分析

优点

  • 技术前沿,聚焦具身智能这一AI热门赛道,个人技术成长快
  • 蚂蚁集团平台大,资源丰富,数据场景多元
  • 涉及多模态、向量数据库、大模型微调等多项高价值技能
  • 薪资福利具有竞争力
  • 工作强度可能较大,需要适应快速迭代的技术环境
  • 非结构化数据处理复杂度高,需要较强的工程能力和耐心
  • 具身智能仍处于发展初期,方向存在不确定性

缺点 / 挑战

  • 适合对数据挖掘有热情、渴望接触具身智能前沿技术,并愿意接受挑战的工程师

角色解读

  • 可成长为具身智能领域的数据专家,深度参与前沿算法落地
  • 可向算法工程师、数据架构师方向发展,或晋升为技术管理者
  • 蚂蚁集团平台大,有机会接触海量业务场景和顶尖技术团队
  • 处理和分析具身智能场景下的机器人传感器轨迹、视频和深度数据,进行清洗、过滤和增强
  • 挖掘关键帧/关键片段和困难样本,为模型训练提供高质量数据
  • 设计多模态数据表征和向量数据库,支撑算法高效调用
  • 参与数据标签体系建设和数据集发布,保障数据资产安全高效流通
  • 扎实的数据挖掘和数据处理能力,熟悉视频、深度、轨迹数据
  • 精通数据清洗、过滤、关键帧/困难样本挖掘方法
  • 掌握多模态表征学习、聚类算法和向量数据库技术
  • 了解具身智能或智驾数据特点,具备大模型微调经验更佳

申请策略

  • 提前了解蚂蚁集团在具身智能方向的布局和成果
  • 在简历中量化数据规模、效果提升等指标
  • 突出非结构化数据处理项目经验,特别是视频、轨迹、深度数据
  • 强调数据清洗、关键帧/困难样本挖掘的实操案例
  • 展示多模态表征、向量数据库、聚类算法的应用实例
  • 如有具身智能、智驾或大模型微调经验,务必重点呈现
  • 熟悉具身智能领域常见数据格式(如ROS bag、传感器数据)和工具
  • 学习向量数据库(如Milvus、Faiss)的使用与优化

面试指南

  • 使用STAR法则:情境-任务-行动-结果,突出个人贡献和量化结果
  • 结合具体技术方案,展现对数据闭环的深入理解
  • 展示学习能力和对具身智能领域的热情
  • 请介绍一个你处理大规模非结构化数据的项目,如何保证数据质量?
  • 如何设计一个支持跨模态检索的向量数据库?
  • 在困难样本挖掘中,你用过哪些策略?效果如何?
  • 如何看待具身智能场景下数据与模型的关系?
  • 描述一次你设计数据标签体系的经历,如何平衡准确性和效率?

职位点评

76
综合评分

蚂蚁集团具身智能方向,技术前沿薪资优厚,需现场办公WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿和成长机会,对工作生活平衡要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展92
工作生活58
使命价值85

薪资福利

70中等

大厂薪资福利有吸引力,但JD未明确薪资福利。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

92较高

技术前沿,涉及具身智能、多模态、向量数据库等新兴方向,成长空间大。

技术前沿前沿/新兴技术
技术栈具身智能、多模态表征、向量数据库、聚类算法、持续学习、大模型微调
业务类型ambiguous

工作生活

58较低

工作地点在上海,需现场办公,JD未提及弹性工作,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

具身智能是未来人工智能的重要方向,参与前沿技术落地,有较强的使命感和行业影响力。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs