Meituan logo
美团
【北斗】大模型算法工程师 SFT/RL/Agent方向

【北斗】大模型算法工程师 SFT/RL/Agent方向

发布于 大约 15 小时前

普通员工/个人贡献者

北京市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Dpo
Grpo
Ppo
Rlvr
Sft
因果推断
大模型
强化学习
机器学习

AI 估算 · 25k–40k

北京大厂算法岗,大模型方向稀缺,校招薪资竞争力强,综合绩效和股票,月薪中位数约3万。

职位详情

关于这个职位

该岗位是美团核心本地商业团队的大模型算法工程师,专注于将SFT、RL、Agent技术应用于营销预算分配决策,构建决策智能体,实现策略自动化与研究闭环

工作涉及模型后训练、强化学习、因果推断与Agent基础设施,适合对大模型和决策智能有浓厚兴趣的校招生

最低要求

必要条件:2027届本科及以上学历,计算机/人工智能/统计学等相关专业

具备扎实的机器学习与深度学习理论基础

工作职责

决策智能体(Agent):将当前由人工策略规则承担的决策生成环节智能体化

构建面向营销决策的Agent系统,覆盖目标解析与任务分解、数据与模型工具链调用、候选策略生成、实验设计与结果归因、闭环迭代
主要技术挑战:长程规划与上下文管理、工具调用的鲁棒性与幂等性,以及高风险场景下的可控性、可解释性与安全边界——Agent输出直接对应真实资金支出
模型后训练与强化学习:面向业务语料与决策轨迹的后训练全链路:SFT、拒绝采样、偏好对齐(DPO / GRPO / PPO)、RLVR 与可验证奖励设计
LLM驱动的因果推断与智能决策:承接增量目标与全局耦合,要求可信的反事实估计和在预算约束下完成跨单元的边际效率对齐
探索大模型与已有uplift、LTV、在线学习与实时决策底座的耦合
AutoResearch:策略研究的自动化闭环,实现观察→假设→实验设计→执行→归因→认知修正的自动化
Agent基础设施与评测:负责Harness设计、离线评测集与仿真环境构建、决策质量自动化评估体系、训练与推理链路、实验平台
涉及轨迹级评测、rubric与LLM-as-judge的可信度校准、失败模式归因、评测集抗过拟合设计

优先资格

加分项:在WWW/KDD/SIGIR/NeurIPS/ICML/ICLR等顶会有较为丰富的论文成果

ACM/ICPC、Kaggle等竞赛获奖经历
具备Agent系统构建经验,对Harness设计、工具调用协议、上下文工程及Agent评测方法论有系统理解与实践
自动化研究系统经验(AI for Science / AI Scientist类工作、自动化假设生成与实验设计、Agent长期记忆与知识累积机制、自动化数据分析系统等)
因果推断背景(uplift modeling、CATE估计、双重机器学习与双重稳健估计、IPW/离线策略评估等)
搜索、推荐、广告算法背景(多目标排序、竞价与机制设计、在线学习与探索利用权衡、大规模稀疏模型)

AI 洞察

优缺点分析

优点

  • 稀缺的真实业务场景:具备硬约束、真实资金代价和小时级反馈闭环,研究环境比静态benchmark更有价值
  • 业务杠杆巨大:优化百亿级资金投放效率,成果直接可量化,个人贡献清晰可感
  • 团队人才密度高,有完善的老带新机制,鼓励创新试错,适合成长
  • 工作强度可能较大,互联网大厂节奏快,且需要持续关注前沿动态

缺点 / 挑战

  • 技术难度较高,要求综合掌握强化学习、Agent、因果推断等交叉领域的知识
  • 高风险场景下Agent可控性和可解释性要求严格,容错空间小,研发压力大
  • 适合对大模型、强化学习和Agent有强烈兴趣,喜欢挑战复杂真实问题,且具备抗压能力的应届生

角色解读

  • 从算法工程师成长为技术专家,深耕决策智能与大模型结合领域
  • 可横向拓展到流量分配、库存定价等通用序贯决策问题,具备跨业务迁移能力
  • 在美团北斗项目下,有潜力成为核心算法负责人,带领团队探索前沿方向
  • 将大模型后训练、强化学习与Agent技术应用于营销预算分配决策,优化数亿用户的补贴策略
  • 构建决策智能体,实现从目标解析、工具调用到策略生成、归因闭环的自动化决策
  • 负责SFT、DPO/GRPO/PPO、RLVR等模型后训练全链路,设计可验证奖励
  • 建设Agent基础设施与离线评测体系,包括Harness设计、仿真环境和自动化评估
  • 扎实的机器学习与深度学习理论基础,熟悉常见模型架构和训练方法
  • 了解大模型后训练技术,如SFT、RLHF、DPO、PPO等,有实际经验更佳
  • 具备Agent系统构建经验,理解工具调用、上下文工程、评测方法论
  • 加分项:因果推断、搜索推荐广告算法、竞赛或顶会论文

申请策略

  • 了解美团核心本地商业的业务场景,思考营销预算分配中的技术挑战,面试时展示对业务的理解
  • 关注美团北斗项目的培养计划,在面试中表达对长期成长和研究创新的期待
  • 突出相关项目经历:如大模型微调、RLHF、Agent构建或强化学习应用,展示具体成果和技术细节
  • 强调论文或竞赛经历(顶会、ACM/ICPC、Kaggle),体现学术能力和工程实现能力
  • 如果有因果推断、搜索推荐或广告算法经验,务必明确写出,匹配岗位加分项
  • 系统学习大模型后训练和RL算法(PPO、DPO、GRPO),动手实践开源模型
  • 深入理解Agent设计框架,如LangChain、AutoGPT,并尝试自己构建一个简单Agent
  • 补充因果推断知识,如uplift modeling、双重稳健估计,并思考如何与LLM结合

面试指南

  • 采用STAR法则:说明问题背景、具体任务、采取的行动和最终结果,突出量化成果
  • 对于算法设计题,先从问题定义和约束条件出发,再给出解决方案,并讨论优缺点和trade-off
  • 对于开放性问题,展示思考框架和逻辑性,结合实例说明,避免空谈
  • 请举例说明你如何设计一个RLVR的奖励函数,并确保其可验证性
  • 如何评估一个决策智能体的效果?你会构建哪些离线评测指标?
  • 在工具调用中,如何保证Agent的鲁棒性和幂等性?如果出现错误,如何设计容错机制?
  • 如何将因果推断方法应用于营销预算分配中的增量转化估计?
  • 谈谈你对大模型在决策智能方向未来发展的看法,以及你的研究兴趣

职位点评

74
综合评分

美团大模型算法岗,前沿技术栈,业务杠杆大,成长快,但工作强度不确定。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合追求技术成长和挑战前沿问题的求职者,能够接受一定的工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活50
使命价值75

薪资福利

70中等

薪资未在JD中说明,但作为上市大厂的核心算法岗,薪酬水平通常具有竞争力,且福利体系完善。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

90较高

岗位聚焦前沿技术(大模型、Agent、RL),提供真实业务场景和完整技术链路,成长空间极大,且团队有老带新机制。

技术前沿前沿/新兴技术
技术栈SFT、RL、Agent、DPO、GRPO、PPO、RLVR、因果推断、LLM
成长机会老带新机制、激励及评价体系
业务类型profit_center

工作生活

50较低

未提及弹性工作或远程,默认现场办公,且大厂算法岗可能工作强度较大,WLB不确定性高。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

属于高速增长的大模型赛道,对公司业务有直接贡献,但社会影响主要在于商业效率提升,使命感一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs