Moonshot AI logo
月之暗面
Kimi Agent Eval 研究与产品实习生

Kimi Agent Eval 研究与产品实习生

发布于 大约 14 小时前

实习/见习

北京市
无经验要求
实习生
仅现场办公
不限
AI产品经理
Pipeline
产品设计
强化学习
数据分析
机器学习

AI 估算 · 4k–8k

AI领域实习薪资较高,北京生活成本高,月薪约4-8k。

职位详情

关于这个职位

这是一份聚焦Agent评测的研究与产品实习岗位

你将深入某个垂直专业领域,定义Agent的能力标杆,设计高难度评测任务,并参与搭建从专家经验到结构化benchmark的pipeline,从0到1构建评测平台产品
适合在金融、法律、生物信息学等方向有扎实积累,同时对AI Agent充满好奇的同学

最低要求

在某一个科学或专业领域有扎实的积累(如金融、法律、生物信息学、计算物理/化学、神经科学、应用数学等)

在科研/实习中使用过agent产品解决该专业领域的实际问题、或搭建工具以提升工作效率
实习时间至少 4 个月,每周至少 4 天,Base 北京

工作职责

定义专业领域的 Agent 能力标杆:作为某个垂直专业领域的深度用户,亲自定义 Agent 在该领域的SOTA标准,设计高难度的题目与verifier 挑战能力边界

将人类SOTA产物转化为优质的题目与训练数据:探索并搭建一套通用、规模化的“专家成果 → 结构化评测任务”pipeline,将非标与隐性的经验,提取为可运行、可复现的benchmark与数据
构建专家评估平台产品:从0到1定义Agent评测平台产品,设计并优化人机协作流程,推动关键环节的自动化与工具化

优先资格

有物理、生物、化学竞赛经验的优先

AI 洞察

优缺点分析

优点

  • 稀缺的交叉领域经验:既能深耕专业,又能接触前沿AI评测,职业竞争力强
  • 有机会独立负责模块,成长速度快,且与RL团队紧密协作,学习曲线陡峭
  • 深度参与Agent评测基础设施建设,这是当前AI领域的关键方向,发展前景好
  • 工作涉及多学科交叉(领域+工程+产品),需要快速学习和适应
  • 实习时间要求至少4个月,每周4天,需要投入较多精力,且仅支持现场办公
  • 适合在某个科学或专业领域有深厚积累,对AI Agent有热情,喜欢研究和产品结合,并且能保证稳定实习时间的在校学生

缺点 / 挑战

  • 对专业领域知识要求较高,需要真正“懂行”,入门门槛不低

角色解读

  • 短期可快速积累领域×AI评测的复合经验,成为稀缺的评测专家
  • 中期可转向Agent产品经理或AI研究岗位,尤其在评测和RL对齐方向
  • 长期可发展为AI基础设施领域的技术专家或产品负责人
  • 你将在某个专业领域(如金融、生物、化学等)定义Agent的能力标准,设计高难度评测题目,挑战模型边界
  • 你需要搭建一个pipeline,把领域专家的隐性经验转化为可运行的benchmark和结构化数据
  • 你将从0到1参与Agent评测平台的产品设计,优化人机协作流程,推动自动化工具落地
  • 扎实的专业领域知识,能够理解该领域的复杂问题和专家思维
  • 熟悉Agent产品(如ChatGPT、Kimi等)的使用,了解其能力边界,并能在实际场景中应用
  • 具备一定的工程化思维,熟悉Python、数据分析和基本的pipeline搭建
  • 有产品意识,能设计流程和工具,喜欢从无到有构建东西

申请策略

  • 投递邮件严格按照要求标题(Kimi Agent Eval-姓名-学校-专业),并在正文中附上你对该岗位的理解
  • 如果想增加竞争力,可以附上一份你设计的Agent评测思路或小实验
  • 突出你在专业领域的研究经历、竞赛奖项或项目成果,证明自己的扎实积累
  • 重点展示你使用Agent工具(如ChatGPT、Claude等)解决某个专业问题的具体案例
  • 如果有搭建工具、数据处理或编程经验,请强调你的工程化能力
  • 提前体验不同Agent产品,记录它们在你熟悉领域的优缺点,并思考评测维度
  • 学习评测方法论(如benchmark设计、验证集构建),可以看看相关论文和开源项目
  • 掌握基本的Python编程和数据处理能力,了解常见的pipeline工具

面试指南

  • 回答评测类问题可采用“目标-指标-场景”框架:先明确评测目标(如正确率、鲁棒性),再定义可量化的指标,最后设计覆盖典型难题的场景
  • 描述经历时使用STAR法则:情境(Situation)、任务(Task)、行动(Action)、结果(Result),突出你的个人贡献和思考
  • 对于产品设计问题,可以从用户(谁使用)、流程(评测如何执行)、效率(如何自动化)三个角度回答
  • 你如何评测一个Agent在你专业领域的能力?会设计哪些题目?
  • 你如何把专业经验转化为结构化的评测任务?请举例说明
  • 描述一次你使用Agent解决实际问题的经历,你觉得它的边界在哪里?
  • 如果要构建一个评测平台,你认为核心功能有哪些?
  • 你对Agent评测的现状和未来有什么看法?

职位点评

66
综合评分

前沿AI评测实习,成长性极强,薪资不明,需现场办公。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
最适合那些追求快速成长、热爱前沿技术、对AI兴趣浓厚且不以短期薪资为主要考虑的同学。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利40
成长发展88
工作生活50
使命价值70

薪资福利

40较低

实习薪资未在JD中披露,通常AI公司实习月薪尚可,但明显低于全职,且福利信息不明。对于追求稳定高薪的求职者吸引力有限。

薪资信号未披露(AI估算:4K-8K/月)

成长发展

88较高

JD强调“稀缺复合经验”、“独立负责模块”、“深度参与基础设施建设”,成长机会突出,能同时锻炼专业深度、工程能力和产品思维。

技术前沿前沿/新兴技术
技术栈Agent、Evaluation、Benchmark、Pipeline、强化学习、产品设计
成长机会self evolving、独立负责完整模块、深度参与
业务类型ambiguous

工作生活

50较低

仅支持现场办公,地点在北京,实习时长需4个月以上,每周4天,灵活性一般。没有明确的WLB信号。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

JD充满使命感和探索感,“定义智能的尺度”传递出较强的意义感,且AI行业本身处于高速增长期。

行业发展高速增长赛道
社会影响中性/一般
使命信号定义智能的尺度、真正解决专业领域的复杂问题
创新程度开拓性创新(行业首创)
Watch Jobs