Alibaba logo
阿里巴巴
面向多模态与Agentic 湖仓的 AI-aware 查询优化技术-阿里星/A Star

面向多模态与Agentic 湖仓的 AI-aware 查询优化技术-阿里星/A Star

发布于 大约 7 小时前

普通员工/个人贡献者

杭州市
无经验要求
全职员工
仅现场办公
博士
数据工程
Llm
Rag
分布式系统
向量检索
多模态
数据库系统
机器学习系统
查询优化
湖仓

AI 估算 · 50k–80k

阿里星博士项目,技术前沿,薪资处于市场高端

职位详情

关于这个职位

该职位聚焦AI-aware查询优化,研究如何让湖仓系统高效支持LLM、语义算子、向量检索等AI workload

你将参与构建下一代智能数仓,连接数据、模型与Agent,在前沿交叉领域实现技术突破

最低要求

计算机相关专业博士

熟悉数据库系统、分布式系统、查询优化技术、机器学习系统、向量检索、大规模数据处理中的一个或多个方向
对 AI Native 数据平台、Agent Native 工程体系、Agentic Lakehouse 和多模态数据处理有强烈兴趣,愿意探索 LLM、Agent、RAG、semantic operator、AI function、向量检索、全文检索、混合检索等前沿方向
具备较强的问题抽象、技术判断和工程落地能力,能够将前沿 AI 技术问题转化为可运行、可优化、可观测、可规模化落地的系统能力
愿意在 AI + Data Infrastructure 的交叉方向长期深耕,参与构建下一代 AI Native / Agent Native 湖仓基础设施

工作职责

探索 AI-aware 查询优化核心技术

面向 LLM、AI function、semantic operator 和多模态 workload,研究和实现下一代查询优化能力,包括 AI-aware cost model、语义算子重写、模型调用优化、推理成本优化、结果缓存与复用等
建设面向 AI workload 的 semantic operator 体系
设计和实现 AIFILTER、AICLASSIFY、AIAGG / AISUMMARYAGG、AIEMBED、AI_SIMILARITY 等语义算子的优化能力,使 AI 计算不再只是黑盒 UDF,而是可被系统理解、规划和优化的一等计算能力
优化向量检索、全文检索和混合检索执行路径
面向 RAG、知识检索、多模态搜索等场景,建设向量检索、全文检索、混合检索的统一查询优化能力,探索 filter pushdown、ANN / exact search 选择、top-k fusion、semantic rerank、retrieval + rerank 两阶段优化等策略
构建多模态 AI pipeline 的增量计算能力
结合湖仓增量计算能力,探索文档解析、embedding 生成、分类、摘要、RAG 预处理等 AI function 的增量维护机制,降低多模态 AI 数据处理的计算成本和刷新延迟
推动智能数仓走向 Agentic 自反馈优化
参与 Agentic AutoMV、智能数据排布、索引 / 排序 / clustering 推荐与自动应用等能力建设,探索由 agent 驱动的“发现问题—生成优化方案—自动应用—观测收益—自反馈调整”闭环
打造 AI Native 数据基础设施的技术影响力
围绕 AI-aware 查询优化技术、semantic operator、Agentic Lakehouse、多模态增量计算、混合检索优化等方向,沉淀高质量技术方案、论文、专利和系统能力,提升团队在 AI + Data Infrastructure 方向的业界影响力

优先资格

有数据库、分布式系统、AI 系统、机器学习系统、Agent 系统相关顶会论文、开源项目、竞赛或高质量实习经历者优先

AI 洞察

优缺点分析

优点

  • 处于AI与数据交叉的蓝海领域,技术前沿
  • 阿里巴巴集团资源丰富,数据规模大,有真实场景验证
  • 有机会与顶尖团队合作,快速成长
  • 研究性工作难度大,需要持续学习和创新

缺点 / 挑战

  • 可能需要承担较大的工作压力,项目周期长
  • 适合对技术有强烈热情、喜欢挑战前沿问题的博士或研究者

角色解读

  • 成为AI+数据基础设施领域的顶级专家
  • 可从技术专家方向晋升,或转向技术管理
  • 有机会发表顶会论文、申请专利,建立业界影响力
  • 研究并实现对LLM调用、语义算子等AI workload的查询优化,包括成本模型、算子重写等
  • 设计实现AI_FILTER等语义算子,使AI计算成为可优化的系统能力
  • 优化向量检索、全文检索和混合检索的执行路径,支持RAG等场景
  • 构建多模态AI pipeline的增量计算,降低计算成本
  • 扎实的数据库系统或分布式系统知识,理解查询优化原理
  • 熟悉机器学习系统或向量检索,有相关实践经验
  • 对LLM、RAG、Agent等前沿技术有深入理解和兴趣
  • 具备较强的问题抽象和工程落地能力

申请策略

  • 提前了解阿里云湖仓产品线,准备与技术团队的交流
  • 突出数据库/分布式系统/机器学习系统相关的研究成果
  • 展示顶会论文、开源项目或竞赛经历
  • 强调对AI+数据方向的兴趣和思考
  • 补充LLM、RAG、向量检索的实操经验
  • 熟悉至少一种数据库或分布式系统的内核实现

面试指南

  • 从问题定义、技术选型、实现细节和效果评估四方面回答
  • 强调系统的可扩展性和可观测性
  • 如何设计一个AI-aware的成本模型?
  • 向量检索与关系查询如何联合优化?
  • 你如何看待Agent在数据平台中的作用?
  • 谈谈你做过的系统优化项目
  • 复习经典查询优化论文
  • 准备一个关于LLM+数据的项目介绍

职位点评

69
综合评分

AI+Data前沿技术岗,成长性极强,薪资未披露,工作强度未知

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合追求技术深度和前沿创新的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展95
工作生活35
使命价值75

薪资福利

60中等

薪资未在JD中明示,但阿里巴巴属于大厂,通常提供有竞争力的薪酬和福利。

薪资信号未披露(AI估算:50K-80K/月)

成长发展

95较高

该职位处于AI和数据基础设施交叉前沿,研究挑战大,技能成长空间极高。

技术前沿前沿/新兴技术
技术栈查询优化、LLM、向量检索、RAG、多模态、Agent、湖仓、语义算子
业务类型ambiguous

工作生活

35较低

职位未提及弹性工作或远程,工作地点固定,可能面临较高强度。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

推动AI与数据基础设施融合,具有一定技术使命感。

行业发展高速增长赛道
社会影响中性/一般
创新程度稳健跟随主流
Watch Jobs