
蚂蚁集团
蚂蚁集团-数据采集工程师(LLM数据方向)-健康事业群
蚂蚁集团-数据采集工程师(LLM数据方向)-健康事业群
发布于 大约 8 小时前普通员工/个人贡献者
北京市 / 上海市
初级经验
全职员工
仅现场办公
学历未注明
数据工程
Ai Agent
Go
Llm
分布式爬虫
反爬虫
AI 估算 · 20k–40k
蚂蚁大厂薪资竞争力强,数据采集技术要求高,LLM方向前景好,综合估算。
职位详情
关于这个职位
这是一个在蚂蚁集团健康事业群负责LLM数据方向的数据采集工程师岗位
你将主导构建支撑大模型训练的大规模分布式爬虫系统,攻克行业最前沿的反爬与风控技术,并利用LLM/AI技术实现智能化的数据提取
适合具备深厚爬虫攻防经验、热爱技术挑战的工程师
最低要求
必备条件
年以上爬虫实战经验,有千万级/亿级规模数据采集项目落地经验
攻防体系实战能力:丰富的反爬对抗背景,熟悉反溯源与反识别技术
反爬经验:解决过复杂验证码(图形/滑块/点选/行为验证)、WAF防护、Bot Management(Cloudflare/DataDome/PerimeterX等)等典型场景
AI爬虫经验:具备Crawlee/Scrapling/FireCrawl类AI爬虫项目经验,或独立实现过基于LLM的自动化数据提取系统
技术栈深度:精通Python或Go,对Scrapy、Playwright、Selenium、Puppeteer等框架有深入源码级理解
技术热情:对技术有强烈热忱,具备优秀的系统性思维和问题解决能力
工作职责
核心职责
构建千亿级数据采集基础设施
基于开源框架设计高并发、高可用的分布式爬虫架构设计,支撑日均数千万级页面的抓取吞吐量
深度对抗各类先进反爬机制:验证码体系(ReCaptcha/HCaptcha/行为验证)、JS混淆与动态指纹、TLS/JA3指纹检测、浏览器行为链分析等
构建反溯源与反识别体系:设计IP代理池智能调度、设备指纹动态生成、请求行为拟真等核心能力
建立实时监控预警与自动策略切换机制,实现对抗能力的持续迭代
主导AI驱动的智能爬虫系统
基于LLM构建类似FireCrawl/Crawlee的智能爬虫:无需规则即可自动理解页面结构、提取结构化数据
开发LLM Agent驱动的自适应爬虫:自动识别站点结构、动态生成抓取策略、智能处理异常场景
攻克复杂SPA/动态渲染页面的智能解析难题,实现多模态数据(图文混排、PDF、表格、视频字幕)的统一提取
优先资格
加分项
移动端采集:具备APP逆向与自动化操作经验
多模态技术栈:有视觉模型微调经验,能处理复杂版面的图文解析
安全与逆向功底:熟练掌握JS反混淆、APK逆向、动态调试等技术
LLM工程经验:深入理解Agent架构,有ReAct/CoT/多智能体系统的实际开发经验
AI 洞察
优缺点分析
优点
- 蚂蚁大厂平台,资源丰富,影响力大
- 与顶尖工程师合作,成长环境好
- 数据采集是大模型基石,行业前景好
- 大规模系统稳定性要求高,可能有突发问题
缺点 / 挑战
- 前沿技术领域,挑战性高,技能积累快
- 反爬对抗压力大,需持续学习和迭代
- 工作强度和压力可能较大,但JD未明确
- 适合热爱技术对抗、喜欢攻防挑战、追求技术深度的工程师
角色解读
- 技术专家路线:深耕爬虫攻防与AI采集领域
- 架构师路线:主导更大规模数据基础设施建设
- 转LLM数据方向:成为大模型数据底座核心成员
- 负责构建高并发分布式爬虫架构,支撑日均千万级页面抓取
- 对抗验证码、JS混淆、TLS指纹等反爬机制,设计代理池与指纹生成体系
- 基于LLM开发智能爬虫,自动理解页面结构并提取结构化数据
- 建立监控预警与策略自动切换机制,持续迭代对抗能力
- 精通Python或Go,熟悉Scrapy/Playwright等框架源码
- 深入理解反爬与风控技术,具备实战攻防经验
- 有AI爬虫或LLM应用经验,如Crawlee、FireCrawl
- 具备高可用分布式系统设计能力
申请策略
- 了解蚂蚁集团在LLM数据方向的具体业务需求
- 准备详细的技术方案和项目复盘,突出攻防对抗的实战经验
- 突出千万级数据采集项目落地经验
- 强调反爬对抗的具体案例,如验证码、WAF、风控绕过
- 展示LLM/AI爬虫项目,如基于LLM的自动化提取系统
- 体现对Scrapy/Playwright等框架的源码级理解
- 了解主流反爬方案,如DataDome、Cloudflare Bot Management
- 学习LLM Agent开发,尝试实现基于LLM的爬虫
面试指南
- 使用STAR法则:情境、任务、行动、结果
- 从架构设计、技术选型、问题解决多角度回答
- 结合具体数据指标展示效果
- 描述一个你处理过的最复杂的反爬对抗案例
- 如何设计一个支撑千万级抓取的分布式爬虫架构?
- 面对动态渲染的SPA页面,如何提取数据?
- 如何利用LLM实现无需规则的智能爬虫?
- 如何处理IP被封或代理失效的情况?
职位点评
68
综合评分
大厂LLM数据方向爬虫工程师,技术前沿成长快,薪资未披露,WLB未知。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术成长和前沿挑战的求职者,对工作生活平衡要求不高且能接受较高强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活45
使命价值75
薪资福利
60中等
薪资未明确披露,但蚂蚁大厂通常有竞争力;福利未提及,整体补偿性一般。
薪资信号未披露(AI估算:20K-40K/月)
成长发展
90较高
岗位处于LLM和AI爬虫技术前沿,挑战大,成长机会多,发展性极佳。
技术前沿前沿/新兴技术
技术栈LLM、AI Agent、分布式爬虫、反爬虫、Python、Go、Scrapy、Playwright
成长机会技术成长
业务类型ambiguous
工作生活
45较低
工作地点在北京/上海/杭州,现场办公未提及弹性,WLB未知,生活化满足度较低。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
大模型底座建设有行业影响力,使命感较强,但社会直接影响中性。
行业发展高速增长赛道
社会影响中性/一般
使命信号赋能千万级用户
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs