Ant Group logo
蚂蚁集团
蚂蚁集团-数据采集工程师(LLM数据方向)-健康事业群

蚂蚁集团-数据采集工程师(LLM数据方向)-健康事业群

发布于 大约 8 小时前

普通员工/个人贡献者

北京市 / 上海市
初级经验
全职员工
仅现场办公
学历未注明
数据工程
Ai Agent
Go
Llm
分布式爬虫
反爬虫

AI 估算 · 20k–40k

蚂蚁大厂薪资竞争力强,数据采集技术要求高,LLM方向前景好,综合估算。

职位详情

关于这个职位

这是一个在蚂蚁集团健康事业群负责LLM数据方向的数据采集工程师岗位

你将主导构建支撑大模型训练的大规模分布式爬虫系统,攻克行业最前沿的反爬与风控技术,并利用LLM/AI技术实现智能化的数据提取
适合具备深厚爬虫攻防经验、热爱技术挑战的工程师

最低要求

必备条件

年以上爬虫实战经验,有千万级/亿级规模数据采集项目落地经验
攻防体系实战能力:丰富的反爬对抗背景,熟悉反溯源与反识别技术
反爬经验:解决过复杂验证码(图形/滑块/点选/行为验证)、WAF防护、Bot Management(Cloudflare/DataDome/PerimeterX等)等典型场景
AI爬虫经验:具备Crawlee/Scrapling/FireCrawl类AI爬虫项目经验,或独立实现过基于LLM的自动化数据提取系统
技术栈深度:精通Python或Go,对Scrapy、Playwright、Selenium、Puppeteer等框架有深入源码级理解
技术热情:对技术有强烈热忱,具备优秀的系统性思维和问题解决能力

工作职责

核心职责

构建千亿级数据采集基础设施
基于开源框架设计高并发、高可用的分布式爬虫架构设计,支撑日均数千万级页面的抓取吞吐量
深度对抗各类先进反爬机制:验证码体系(ReCaptcha/HCaptcha/行为验证)、JS混淆与动态指纹、TLS/JA3指纹检测、浏览器行为链分析等
构建反溯源与反识别体系:设计IP代理池智能调度、设备指纹动态生成、请求行为拟真等核心能力
建立实时监控预警与自动策略切换机制,实现对抗能力的持续迭代
主导AI驱动的智能爬虫系统
基于LLM构建类似FireCrawl/Crawlee的智能爬虫:无需规则即可自动理解页面结构、提取结构化数据
开发LLM Agent驱动的自适应爬虫:自动识别站点结构、动态生成抓取策略、智能处理异常场景
攻克复杂SPA/动态渲染页面的智能解析难题,实现多模态数据(图文混排、PDF、表格、视频字幕)的统一提取

优先资格

加分项

移动端采集:具备APP逆向与自动化操作经验
多模态技术栈:有视觉模型微调经验,能处理复杂版面的图文解析
安全与逆向功底:熟练掌握JS反混淆、APK逆向、动态调试等技术
LLM工程经验:深入理解Agent架构,有ReAct/CoT/多智能体系统的实际开发经验

AI 洞察

优缺点分析

优点

  • 蚂蚁大厂平台,资源丰富,影响力大
  • 与顶尖工程师合作,成长环境好
  • 数据采集是大模型基石,行业前景好
  • 大规模系统稳定性要求高,可能有突发问题

缺点 / 挑战

  • 前沿技术领域,挑战性高,技能积累快
  • 反爬对抗压力大,需持续学习和迭代
  • 工作强度和压力可能较大,但JD未明确
  • 适合热爱技术对抗、喜欢攻防挑战、追求技术深度的工程师

角色解读

  • 技术专家路线:深耕爬虫攻防与AI采集领域
  • 架构师路线:主导更大规模数据基础设施建设
  • 转LLM数据方向:成为大模型数据底座核心成员
  • 负责构建高并发分布式爬虫架构,支撑日均千万级页面抓取
  • 对抗验证码、JS混淆、TLS指纹等反爬机制,设计代理池与指纹生成体系
  • 基于LLM开发智能爬虫,自动理解页面结构并提取结构化数据
  • 建立监控预警与策略自动切换机制,持续迭代对抗能力
  • 精通Python或Go,熟悉Scrapy/Playwright等框架源码
  • 深入理解反爬与风控技术,具备实战攻防经验
  • 有AI爬虫或LLM应用经验,如Crawlee、FireCrawl
  • 具备高可用分布式系统设计能力

申请策略

  • 了解蚂蚁集团在LLM数据方向的具体业务需求
  • 准备详细的技术方案和项目复盘,突出攻防对抗的实战经验
  • 突出千万级数据采集项目落地经验
  • 强调反爬对抗的具体案例,如验证码、WAF、风控绕过
  • 展示LLM/AI爬虫项目,如基于LLM的自动化提取系统
  • 体现对Scrapy/Playwright等框架的源码级理解
  • 了解主流反爬方案,如DataDome、Cloudflare Bot Management
  • 学习LLM Agent开发,尝试实现基于LLM的爬虫

面试指南

  • 使用STAR法则:情境、任务、行动、结果
  • 从架构设计、技术选型、问题解决多角度回答
  • 结合具体数据指标展示效果
  • 描述一个你处理过的最复杂的反爬对抗案例
  • 如何设计一个支撑千万级抓取的分布式爬虫架构?
  • 面对动态渲染的SPA页面,如何提取数据?
  • 如何利用LLM实现无需规则的智能爬虫?
  • 如何处理IP被封或代理失效的情况?

职位点评

68
综合评分

大厂LLM数据方向爬虫工程师,技术前沿成长快,薪资未披露,WLB未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术成长和前沿挑战的求职者,对工作生活平衡要求不高且能接受较高强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活45
使命价值75

薪资福利

60中等

薪资未明确披露,但蚂蚁大厂通常有竞争力;福利未提及,整体补偿性一般。

薪资信号未披露(AI估算:20K-40K/月)

成长发展

90较高

岗位处于LLM和AI爬虫技术前沿,挑战大,成长机会多,发展性极佳。

技术前沿前沿/新兴技术
技术栈LLM、AI Agent、分布式爬虫、反爬虫、Python、Go、Scrapy、Playwright
成长机会技术成长
业务类型ambiguous

工作生活

45较低

工作地点在北京/上海/杭州,现场办公未提及弹性,WLB未知,生活化满足度较低。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

大模型底座建设有行业影响力,使命感较强,但社会直接影响中性。

行业发展高速增长赛道
社会影响中性/一般
使命信号赋能千万级用户
创新程度积极采用新技术
Watch Jobs