
美团
LongCat - 基座agent评测分析算法研究员(生产力方向)
LongCat - 基座agent评测分析算法研究员(生产力方向)
发布于 大约 15 小时前普通员工/个人贡献者
北京市
中级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
决策规划
大模型
工具调用
深度学习
自然语言处理
评测分析
AI 估算 · 25k–45k
算法研究员技术门槛高,大厂核心岗,薪资竞争力强,平均月薪约3.5万
职位详情
关于这个职位
该职位聚焦于大语言模型基座Agent的评测与分析,负责设计长路径、多步骤交互的评测任务集,探索Agent在工具调用、决策规划等复杂场景的能力边界
适合熟悉NLP、大模型及机器学习算法,具备工程能力和学术积累(顶会论文优先)的研究型人才
最低要求
硕士及以上学历,计算机、数学或相关专业
熟悉Java/Python/C++等编程语言,良好的编码习惯和一定的工程能力
具有机器学习或深度学习算法的基础知识,熟练掌握自然语言处理、多模态或大模型相关算法和模型
具备工匠精神,对每一行代码负责,对业务方负责
有良好的沟通合作意识和较强的问题解决能力
工作职责
负责围绕AI大模型算法的认知分析的研究工作,具体工作内容包括但不限于:
深入理解大规模语言模型的模型结构、训练过程以及评测方式,根据模型的训练过程以及评测结果,对大语言模型存在的问题进行研究
深度参与通用生产力在Claude Code/OpenClaw等场景下的基座模型能力优化迭代,设计具有长路径、多步骤交互特征的评测任务集,实现从“单次问答”到“闭环任务”的评测转型
探索长周期下Agent在复杂任务的能力边界,涵盖工具调用、决策规划和记忆管理等方向,对前沿评测范式如基于沙盒环境的动态评测和多agent协同效率等进行深入研究
优先资格
在计算机领域顶会(如ACL、EMNLP、NeurIPS、AAAI等)上以一作发表过论文者优先
具备从事相关行业人工智能开发、算法研究等相关工作经验者优先
对ClaudeCode和OpenClaw等agent框架有深入了解或丰富使用经验者优先
AI 洞察
优缺点分析
优点
- 岗位聚焦前沿大模型Agent评测,方向新颖,成长空间大
- 团队技术氛围浓厚,有完善的培训生态和顶会发表机会
- 技术门槛高,需要同时具备工程能力和学术研究能力
- 竞争激烈,对候选人的基础素质和项目经验要求严格
- 适合对AI前沿技术有浓厚兴趣、具备研究型思维和扎实工程能力的硕士及以上候选人,尤其是有顶会论文或大模型相关经验者
缺点 / 挑战
- 美团核心技术平台,接触超大规模集群和海量数据,技术挑战大
- 工作强度可能较高,涉及长周期复杂任务探索,需要较强的自驱力
角色解读
- 从算法研究员发展为技术专家,深耕大模型评测与Agent方向
- 可向AI架构师或技术Leader方向转型,带领团队推动技术落地
- 依托美团平台,有机会参与业界顶会论文发表和开源社区贡献
- 深入理解大语言模型结构、训练及评测方法,分析模型存在的问题并设计优化方案
- 设计长路径、多步骤交互评测任务集,推动从单次问答到闭环任务的评测转型
- 探索Agent在工具调用、决策规划、记忆管理等复杂任务中的能力边界
- 扎实的机器学习/深度学习基础,熟悉NLP、大模型相关算法和模型
- 熟练使用Python、Java或C++,具备良好的编码能力和工程实现能力
- 了解Agent框架(如Claude Code、OpenClaw)及评测范式者优先
申请策略
- 简历中量化成果,如模型指标提升、评测任务集规模等
- 提前了解美团在AI Agent方向的产品布局,面试中展现业务理解
- 突出大模型或NLP相关项目经验,尤其是评测、Agent方向的成果
- 列出顶会论文发表记录(如ACL、NeurIPS等),强调一作身份
- 展示工程能力,如用Python/C++实现复杂算法的项目
- 体现对Agent框架(如Claude Code、OpenClaw)的应用经验
- 系统学习大模型原理和Agent主流框架,动手实践开源项目
- 补全评测方法论,了解沙盒环境、多agent协同等前沿范式
面试指南
- 使用STAR法则(情境-任务-行动-结果)清晰描述项目经验
- 对于设计类问题,先拆解关键维度,再提出具体方案,体现系统性思考
- 对于代码题,注重边界条件和代码风格,展示工程思维
- 请介绍你做过的一个大模型评测项目,包括评测指标设计和结果分析
- 如何设计一个评测Agent长路径任务的benchmark?需要考虑哪些维度?
- 描述一下Transformer模型的结构和训练过程,以及常见的优化技巧
- 你如何看待当前Agent评测的挑战?未来有哪些发展方向?
- 请写一段代码实现一个简单的函数调用Agent
职位点评
73
综合评分
大厂核心岗,前沿Agent评测方向,技术成长快,薪资高,但WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和前沿探索的求职者,愿意在快节奏中持续学习。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值70
薪资福利
75中等
薪资处于行业较高水平,福利完善(五险一金、年终奖等),但未明确提及具体福利细节。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
90较高
岗位聚焦前沿Agent评测技术,技术栈新,有顶会发表和社区贡献机会,成长路径清晰。
技术前沿前沿/新兴技术
技术栈大模型、Agent、评测、NLP、深度学习
成长机会完善的互联网学习生态圈、重视底层逻辑和方法论、助力职业生涯的非线性成长
业务类型ambiguous
工作生活
50较低
工作地点在北京,未明确远程或弹性办公,美团的节奏通常较快,WLB一般。
工作模式未明确
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
70中等
属于互联网核心赛道,技术驱动行业变革,有一定社会影响力,但岗位本身偏技术研究,使命感一般。
行业发展高速增长赛道
社会影响中性/一般
使命信号驱动技术发展,创造行业价值
创新程度积极采用新技术
美团 的其他在招职位
相似职位推荐
Watch Jobs