Ant Group logo
蚂蚁集团
蚂蚁集团-多模态理解及应用-OCR与复杂文档解析-杭州/北京【AGI专项】

蚂蚁集团-多模态理解及应用-OCR与复杂文档解析-杭州/北京【AGI专项】

发布于 大约 2 小时前

普通员工/个人贡献者

杭州市 / 北京市
高级经验
全职员工
仅现场办公
硕士
计算机视觉工程
Ocr
Pytorch
Tensorflow
Vlm
多模态大模型
文档解析
深度学习
版面分析
Docvqa

AI 估算 · 40k–70k

大厂核心算法岗,技术稀缺,薪资竞争力强,结合杭州/北京薪酬水平估算。

职位详情

关于这个职位

该职位聚焦多模态理解与OCR技术,负责复杂文档的结构化解析、文档智能问答及核心OCR能力提升,涉及版面分析、表格识别、关键信息抽取等前沿方向

你将加入蚂蚁集团AGI专项,与顶尖团队合作,推动技术预研与实际落地
适合具备扎实深度学习基础、热爱技术挑战的算法工程师

最低要求

学历背景:计算机科学、人工智能、模式识别、电子工程或相关领域的硕士或博士学位

从业经验:3年以上在OCR、文档理解或相关计算机视觉处理领域的算法研发经验
专业技能:精通至少一种主流深度学习框架(如PyTorch、TensorFlow),并具备丰富的模型开发与调优经验
拥有大规模多模态大模型(VLM)的训练、微调或应用经验
在以下至少两个方向有深入研究和实践经验:文字检测/识别、版面分析/KIE、表格识别和文档视觉问答 (DocVQA)
编程能力:具备出色的Python编程能力和扎实的数据结构与算法基础
学术能力:对领域内的前沿技术有敏锐的洞察力,有在CVPR, ICCV, ECCV, NeurIPS, ICML, ACL等顶级会议或期刊上发表论文者优先

工作职责

复杂文档结构化解析:专注于复杂文档的深度解析,包括版面分析(Layout Analysis)、公式表格识别(Formula Table Recognition & Reconstruction)、关键信息抽取(Key Information Extraction, KIE)等,将非结构化的文档图像或PDF高效地转换成机器可读的结构化数据

文档问答(DocVQA)系统构建:研发和迭代文档视觉问答模型,让大模型能够精准理解用户的自然语言提问,并结合视觉与文本信息,从复杂的文档(如研究报告、财务报表、合同、票据等)中定位、抽取并生成结构化答案
核心OCR能力提升:负责前沿OCR技术的研发与优化,攻克手写体、低质量图像、艺术字、复杂排版等挑战性场景下的文字检测与识别难题,显著提升多模态大模型底层的文字信息获取(Text-in-Image)精度与鲁棒性
前沿技术探索与创新:紧密跟踪多模态、OCR及文档智能领域的最新研究成果,结合业务需求进行技术预研、方案设计和原型实现,推动技术创新和专利产出
模型与系统优化:负责构建和完善相关方向的数据集、评测体系和模型训练/推理流程,并与工程团队紧密合作,推动算法模型的性能优化与实际落地

优先资格

有在CVPR, ICCV, ECCV, NeurIPS, ICML, ACL等顶级会议或期刊上发表论文者优先

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台大,业务场景丰富,技术落地性强
  • AGI专项投入大,研究前沿,有论文和专利产出机会
  • 团队研究氛围浓厚,可与顶级大牛合作交流
  • 技术难度高,需要深厚积累和持续学习能力
  • 对学术能力有要求,同行竞争激烈
  • 适合具备扎实CV/OCR基础、热爱前沿技术、追求高平台和快速成长的算法工程师

缺点 / 挑战

  • 业务压力大,项目节奏快,可能面临高强度工作

角色解读

  • 技术专家路线:深耕OCR和文档智能,成为领域专家
  • 管理路线:带领团队负责核心算法方向
  • 横向发展:转向多模态大模型其他应用领域
  • 负责复杂文档的结构化解析,实现版面分析、表格识别与关键信息抽取
  • 构建文档问答系统,提升大模型对文档的理解与问答能力
  • 优化OCR在低质量、手写体等场景下的识别精度,提升多模态模型底层能力
  • 跟踪前沿技术,设计算法方案并推动模型落地与迭代
  • 精通PyTorch或TensorFlow,能独立开发调优深度学习模型
  • 具备多模态大模型(VLM)训练和微调经验
  • 熟悉OCR、文档分析、KIE等至少两个方向,有实际项目经验
  • 扎实的Python编程能力和数据结构基础

申请策略

  • 了解蚂蚁在AI和AGI领域的布局,结合业务思考技术价值
  • 准备有深度的项目复盘,展示技术思考和落地能力
  • 突出OCR、文档理解项目的具体成果和量化数据
  • 展示在顶级会议发表的论文或专利
  • 强调多模态大模型训练和调优的实际经验
  • 详细描述复杂场景下的技术难点及解决方案
  • 深入理解VLM架构和训练方法,熟悉常见开源模型
  • 补充文档解析相关的数据增强和模型优化技巧

面试指南

  • 使用STAR法则结构化回答项目经验,突出挑战、行动和结果
  • 强调技术选型和权衡,展示创新点和思考深度
  • 结合业务场景阐述技术的实际价值,体现商业洞察
  • 如何解决低质量OCR图像的检测识别问题?
  • 介绍一下你参与过的多模态大模型训练过程?
  • 表格结构识别有哪些难点,如何建模?
  • 如何评估文档问答系统的性能?
  • 谈谈你对文档理解模型(如LayoutLM)的看法

职位点评

72
综合评分

大厂核心算法岗,前沿技术栈,薪资竞争力强,但工作节奏快。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和职业发展的算法工程师,能接受高强度工作。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值60

薪资福利

75中等

大厂算法岗薪资水平较高,福利完善,但JD未披露具体数字,综合评估较满意。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

该职位聚焦OCR与多模态前沿,技术挑战大,成长空间充足,并鼓励技术创新和专利产出。

技术前沿前沿/新兴技术
技术栈OCR、文档解析、DocVQA、多模态、VLM、PyTorch、TensorFlow、深度学习
业务类型ambiguous

工作生活

50较低

未提及工作生活平衡,大厂算法岗通常加班较多,灵活性一般。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

60中等

技术前沿,推动文档智能发展,但行业应用以商业业务为主,社会意义中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs