
蚂蚁集团
蚂蚁集团-多模态理解及应用-OCR与复杂文档解析-杭州/北京【AGI专项】
蚂蚁集团-多模态理解及应用-OCR与复杂文档解析-杭州/北京【AGI专项】
发布于 大约 2 小时前普通员工/个人贡献者
杭州市 / 北京市
高级经验
全职员工
仅现场办公
硕士
计算机视觉工程
Ocr
Pytorch
Tensorflow
Vlm
多模态大模型
文档解析
深度学习
版面分析
Docvqa
AI 估算 · 40k–70k
大厂核心算法岗,技术稀缺,薪资竞争力强,结合杭州/北京薪酬水平估算。
职位详情
关于这个职位
该职位聚焦多模态理解与OCR技术,负责复杂文档的结构化解析、文档智能问答及核心OCR能力提升,涉及版面分析、表格识别、关键信息抽取等前沿方向
你将加入蚂蚁集团AGI专项,与顶尖团队合作,推动技术预研与实际落地
适合具备扎实深度学习基础、热爱技术挑战的算法工程师
最低要求
学历背景:计算机科学、人工智能、模式识别、电子工程或相关领域的硕士或博士学位
从业经验:3年以上在OCR、文档理解或相关计算机视觉处理领域的算法研发经验
专业技能:精通至少一种主流深度学习框架(如PyTorch、TensorFlow),并具备丰富的模型开发与调优经验
拥有大规模多模态大模型(VLM)的训练、微调或应用经验
在以下至少两个方向有深入研究和实践经验:文字检测/识别、版面分析/KIE、表格识别和文档视觉问答 (DocVQA)
编程能力:具备出色的Python编程能力和扎实的数据结构与算法基础
学术能力:对领域内的前沿技术有敏锐的洞察力,有在CVPR, ICCV, ECCV, NeurIPS, ICML, ACL等顶级会议或期刊上发表论文者优先
工作职责
复杂文档结构化解析:专注于复杂文档的深度解析,包括版面分析(Layout Analysis)、公式表格识别(Formula Table Recognition & Reconstruction)、关键信息抽取(Key Information Extraction, KIE)等,将非结构化的文档图像或PDF高效地转换成机器可读的结构化数据
文档问答(DocVQA)系统构建:研发和迭代文档视觉问答模型,让大模型能够精准理解用户的自然语言提问,并结合视觉与文本信息,从复杂的文档(如研究报告、财务报表、合同、票据等)中定位、抽取并生成结构化答案
核心OCR能力提升:负责前沿OCR技术的研发与优化,攻克手写体、低质量图像、艺术字、复杂排版等挑战性场景下的文字检测与识别难题,显著提升多模态大模型底层的文字信息获取(Text-in-Image)精度与鲁棒性
前沿技术探索与创新:紧密跟踪多模态、OCR及文档智能领域的最新研究成果,结合业务需求进行技术预研、方案设计和原型实现,推动技术创新和专利产出
模型与系统优化:负责构建和完善相关方向的数据集、评测体系和模型训练/推理流程,并与工程团队紧密合作,推动算法模型的性能优化与实际落地
优先资格
有在CVPR, ICCV, ECCV, NeurIPS, ICML, ACL等顶级会议或期刊上发表论文者优先
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台大,业务场景丰富,技术落地性强
- AGI专项投入大,研究前沿,有论文和专利产出机会
- 团队研究氛围浓厚,可与顶级大牛合作交流
- 技术难度高,需要深厚积累和持续学习能力
- 对学术能力有要求,同行竞争激烈
- 适合具备扎实CV/OCR基础、热爱前沿技术、追求高平台和快速成长的算法工程师
缺点 / 挑战
- 业务压力大,项目节奏快,可能面临高强度工作
角色解读
- 技术专家路线:深耕OCR和文档智能,成为领域专家
- 管理路线:带领团队负责核心算法方向
- 横向发展:转向多模态大模型其他应用领域
- 负责复杂文档的结构化解析,实现版面分析、表格识别与关键信息抽取
- 构建文档问答系统,提升大模型对文档的理解与问答能力
- 优化OCR在低质量、手写体等场景下的识别精度,提升多模态模型底层能力
- 跟踪前沿技术,设计算法方案并推动模型落地与迭代
- 精通PyTorch或TensorFlow,能独立开发调优深度学习模型
- 具备多模态大模型(VLM)训练和微调经验
- 熟悉OCR、文档分析、KIE等至少两个方向,有实际项目经验
- 扎实的Python编程能力和数据结构基础
申请策略
- 了解蚂蚁在AI和AGI领域的布局,结合业务思考技术价值
- 准备有深度的项目复盘,展示技术思考和落地能力
- 突出OCR、文档理解项目的具体成果和量化数据
- 展示在顶级会议发表的论文或专利
- 强调多模态大模型训练和调优的实际经验
- 详细描述复杂场景下的技术难点及解决方案
- 深入理解VLM架构和训练方法,熟悉常见开源模型
- 补充文档解析相关的数据增强和模型优化技巧
面试指南
- 使用STAR法则结构化回答项目经验,突出挑战、行动和结果
- 强调技术选型和权衡,展示创新点和思考深度
- 结合业务场景阐述技术的实际价值,体现商业洞察
- 如何解决低质量OCR图像的检测识别问题?
- 介绍一下你参与过的多模态大模型训练过程?
- 表格结构识别有哪些难点,如何建模?
- 如何评估文档问答系统的性能?
- 谈谈你对文档理解模型(如LayoutLM)的看法
职位点评
72
综合评分
大厂核心算法岗,前沿技术栈,薪资竞争力强,但工作节奏快。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和职业发展的算法工程师,能接受高强度工作。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值60
薪资福利
75中等
大厂算法岗薪资水平较高,福利完善,但JD未披露具体数字,综合评估较满意。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
90较高
该职位聚焦OCR与多模态前沿,技术挑战大,成长空间充足,并鼓励技术创新和专利产出。
技术前沿前沿/新兴技术
技术栈OCR、文档解析、DocVQA、多模态、VLM、PyTorch、TensorFlow、深度学习
业务类型ambiguous
工作生活
50较低
未提及工作生活平衡,大厂算法岗通常加班较多,灵活性一般。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
60中等
技术前沿,推动文档智能发展,但行业应用以商业业务为主,社会意义中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs