
阿里巴巴
面向多模态与Agentic 湖仓的 AI-aware 查询优化技术-阿里星/A Star
面向多模态与Agentic 湖仓的 AI-aware 查询优化技术-阿里星/A Star
发布于 大约 7 小时前普通员工/个人贡献者
杭州市
无经验要求
全职员工
仅现场办公
博士
数据工程
Llm
Rag
分布式系统
向量检索
多模态
数据库系统
机器学习系统
查询优化
湖仓
AI 估算 · 50k–80k
阿里星博士项目,技术前沿,薪资处于市场高端
职位详情
关于这个职位
该职位聚焦AI-aware查询优化,研究如何让湖仓系统高效支持LLM、语义算子、向量检索等AI workload
你将参与构建下一代智能数仓,连接数据、模型与Agent,在前沿交叉领域实现技术突破
最低要求
计算机相关专业博士
熟悉数据库系统、分布式系统、查询优化技术、机器学习系统、向量检索、大规模数据处理中的一个或多个方向
对 AI Native 数据平台、Agent Native 工程体系、Agentic Lakehouse 和多模态数据处理有强烈兴趣,愿意探索 LLM、Agent、RAG、semantic operator、AI function、向量检索、全文检索、混合检索等前沿方向
具备较强的问题抽象、技术判断和工程落地能力,能够将前沿 AI 技术问题转化为可运行、可优化、可观测、可规模化落地的系统能力
愿意在 AI + Data Infrastructure 的交叉方向长期深耕,参与构建下一代 AI Native / Agent Native 湖仓基础设施
工作职责
探索 AI-aware 查询优化核心技术
面向 LLM、AI function、semantic operator 和多模态 workload,研究和实现下一代查询优化能力,包括 AI-aware cost model、语义算子重写、模型调用优化、推理成本优化、结果缓存与复用等
建设面向 AI workload 的 semantic operator 体系
设计和实现 AIFILTER、AICLASSIFY、AIAGG / AISUMMARYAGG、AIEMBED、AI_SIMILARITY 等语义算子的优化能力,使 AI 计算不再只是黑盒 UDF,而是可被系统理解、规划和优化的一等计算能力
优化向量检索、全文检索和混合检索执行路径
面向 RAG、知识检索、多模态搜索等场景,建设向量检索、全文检索、混合检索的统一查询优化能力,探索 filter pushdown、ANN / exact search 选择、top-k fusion、semantic rerank、retrieval + rerank 两阶段优化等策略
构建多模态 AI pipeline 的增量计算能力
结合湖仓增量计算能力,探索文档解析、embedding 生成、分类、摘要、RAG 预处理等 AI function 的增量维护机制,降低多模态 AI 数据处理的计算成本和刷新延迟
推动智能数仓走向 Agentic 自反馈优化
参与 Agentic AutoMV、智能数据排布、索引 / 排序 / clustering 推荐与自动应用等能力建设,探索由 agent 驱动的“发现问题—生成优化方案—自动应用—观测收益—自反馈调整”闭环
打造 AI Native 数据基础设施的技术影响力
围绕 AI-aware 查询优化技术、semantic operator、Agentic Lakehouse、多模态增量计算、混合检索优化等方向,沉淀高质量技术方案、论文、专利和系统能力,提升团队在 AI + Data Infrastructure 方向的业界影响力
优先资格
有数据库、分布式系统、AI 系统、机器学习系统、Agent 系统相关顶会论文、开源项目、竞赛或高质量实习经历者优先
AI 洞察
优缺点分析
优点
- 处于AI与数据交叉的蓝海领域,技术前沿
- 阿里巴巴集团资源丰富,数据规模大,有真实场景验证
- 有机会与顶尖团队合作,快速成长
- 研究性工作难度大,需要持续学习和创新
缺点 / 挑战
- 可能需要承担较大的工作压力,项目周期长
- 适合对技术有强烈热情、喜欢挑战前沿问题的博士或研究者
角色解读
- 成为AI+数据基础设施领域的顶级专家
- 可从技术专家方向晋升,或转向技术管理
- 有机会发表顶会论文、申请专利,建立业界影响力
- 研究并实现对LLM调用、语义算子等AI workload的查询优化,包括成本模型、算子重写等
- 设计实现AI_FILTER等语义算子,使AI计算成为可优化的系统能力
- 优化向量检索、全文检索和混合检索的执行路径,支持RAG等场景
- 构建多模态AI pipeline的增量计算,降低计算成本
- 扎实的数据库系统或分布式系统知识,理解查询优化原理
- 熟悉机器学习系统或向量检索,有相关实践经验
- 对LLM、RAG、Agent等前沿技术有深入理解和兴趣
- 具备较强的问题抽象和工程落地能力
申请策略
- 提前了解阿里云湖仓产品线,准备与技术团队的交流
- 突出数据库/分布式系统/机器学习系统相关的研究成果
- 展示顶会论文、开源项目或竞赛经历
- 强调对AI+数据方向的兴趣和思考
- 补充LLM、RAG、向量检索的实操经验
- 熟悉至少一种数据库或分布式系统的内核实现
面试指南
- 从问题定义、技术选型、实现细节和效果评估四方面回答
- 强调系统的可扩展性和可观测性
- 如何设计一个AI-aware的成本模型?
- 向量检索与关系查询如何联合优化?
- 你如何看待Agent在数据平台中的作用?
- 谈谈你做过的系统优化项目
- 复习经典查询优化论文
- 准备一个关于LLM+数据的项目介绍
职位点评
69
综合评分
AI+Data前沿技术岗,成长性极强,薪资未披露,工作强度未知
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
最适合追求技术深度和前沿创新的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展95
工作生活35
使命价值75
薪资福利
60中等
薪资未在JD中明示,但阿里巴巴属于大厂,通常提供有竞争力的薪酬和福利。
薪资信号未披露(AI估算:50K-80K/月)
成长发展
95较高
该职位处于AI和数据基础设施交叉前沿,研究挑战大,技能成长空间极高。
技术前沿前沿/新兴技术
技术栈查询优化、LLM、向量检索、RAG、多模态、Agent、湖仓、语义算子
业务类型ambiguous
工作生活
35较低
职位未提及弹性工作或远程,工作地点固定,可能面临较高强度。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
推动AI与数据基础设施融合,具有一定技术使命感。
行业发展高速增长赛道
社会影响中性/一般
创新程度稳健跟随主流
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs