
月之暗面
Kimi Agent Eval 研究与产品实习生
Kimi Agent Eval 研究与产品实习生
发布于 大约 14 小时前实习/见习
北京市
无经验要求
实习生
仅现场办公
不限
AI产品经理
Pipeline
产品设计
强化学习
数据分析
机器学习
AI 估算 · 4k–8k
AI领域实习薪资较高,北京生活成本高,月薪约4-8k。
职位详情
关于这个职位
这是一份聚焦Agent评测的研究与产品实习岗位
你将深入某个垂直专业领域,定义Agent的能力标杆,设计高难度评测任务,并参与搭建从专家经验到结构化benchmark的pipeline,从0到1构建评测平台产品
适合在金融、法律、生物信息学等方向有扎实积累,同时对AI Agent充满好奇的同学
最低要求
在某一个科学或专业领域有扎实的积累(如金融、法律、生物信息学、计算物理/化学、神经科学、应用数学等)
在科研/实习中使用过agent产品解决该专业领域的实际问题、或搭建工具以提升工作效率
实习时间至少 4 个月,每周至少 4 天,Base 北京
工作职责
定义专业领域的 Agent 能力标杆:作为某个垂直专业领域的深度用户,亲自定义 Agent 在该领域的SOTA标准,设计高难度的题目与verifier 挑战能力边界
将人类SOTA产物转化为优质的题目与训练数据:探索并搭建一套通用、规模化的“专家成果 → 结构化评测任务”pipeline,将非标与隐性的经验,提取为可运行、可复现的benchmark与数据
构建专家评估平台产品:从0到1定义Agent评测平台产品,设计并优化人机协作流程,推动关键环节的自动化与工具化
优先资格
有物理、生物、化学竞赛经验的优先
AI 洞察
优缺点分析
优点
- 稀缺的交叉领域经验:既能深耕专业,又能接触前沿AI评测,职业竞争力强
- 有机会独立负责模块,成长速度快,且与RL团队紧密协作,学习曲线陡峭
- 深度参与Agent评测基础设施建设,这是当前AI领域的关键方向,发展前景好
- 工作涉及多学科交叉(领域+工程+产品),需要快速学习和适应
- 实习时间要求至少4个月,每周4天,需要投入较多精力,且仅支持现场办公
- 适合在某个科学或专业领域有深厚积累,对AI Agent有热情,喜欢研究和产品结合,并且能保证稳定实习时间的在校学生
缺点 / 挑战
- 对专业领域知识要求较高,需要真正“懂行”,入门门槛不低
角色解读
- 短期可快速积累领域×AI评测的复合经验,成为稀缺的评测专家
- 中期可转向Agent产品经理或AI研究岗位,尤其在评测和RL对齐方向
- 长期可发展为AI基础设施领域的技术专家或产品负责人
- 你将在某个专业领域(如金融、生物、化学等)定义Agent的能力标准,设计高难度评测题目,挑战模型边界
- 你需要搭建一个pipeline,把领域专家的隐性经验转化为可运行的benchmark和结构化数据
- 你将从0到1参与Agent评测平台的产品设计,优化人机协作流程,推动自动化工具落地
- 扎实的专业领域知识,能够理解该领域的复杂问题和专家思维
- 熟悉Agent产品(如ChatGPT、Kimi等)的使用,了解其能力边界,并能在实际场景中应用
- 具备一定的工程化思维,熟悉Python、数据分析和基本的pipeline搭建
- 有产品意识,能设计流程和工具,喜欢从无到有构建东西
申请策略
- 投递邮件严格按照要求标题(Kimi Agent Eval-姓名-学校-专业),并在正文中附上你对该岗位的理解
- 如果想增加竞争力,可以附上一份你设计的Agent评测思路或小实验
- 突出你在专业领域的研究经历、竞赛奖项或项目成果,证明自己的扎实积累
- 重点展示你使用Agent工具(如ChatGPT、Claude等)解决某个专业问题的具体案例
- 如果有搭建工具、数据处理或编程经验,请强调你的工程化能力
- 提前体验不同Agent产品,记录它们在你熟悉领域的优缺点,并思考评测维度
- 学习评测方法论(如benchmark设计、验证集构建),可以看看相关论文和开源项目
- 掌握基本的Python编程和数据处理能力,了解常见的pipeline工具
面试指南
- 回答评测类问题可采用“目标-指标-场景”框架:先明确评测目标(如正确率、鲁棒性),再定义可量化的指标,最后设计覆盖典型难题的场景
- 描述经历时使用STAR法则:情境(Situation)、任务(Task)、行动(Action)、结果(Result),突出你的个人贡献和思考
- 对于产品设计问题,可以从用户(谁使用)、流程(评测如何执行)、效率(如何自动化)三个角度回答
- 你如何评测一个Agent在你专业领域的能力?会设计哪些题目?
- 你如何把专业经验转化为结构化的评测任务?请举例说明
- 描述一次你使用Agent解决实际问题的经历,你觉得它的边界在哪里?
- 如果要构建一个评测平台,你认为核心功能有哪些?
- 你对Agent评测的现状和未来有什么看法?
职位点评
66
综合评分
前沿AI评测实习,成长性极强,薪资不明,需现场办公。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
最适合那些追求快速成长、热爱前沿技术、对AI兴趣浓厚且不以短期薪资为主要考虑的同学。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利40
成长发展88
工作生活50
使命价值70
薪资福利
40较低
实习薪资未在JD中披露,通常AI公司实习月薪尚可,但明显低于全职,且福利信息不明。对于追求稳定高薪的求职者吸引力有限。
薪资信号未披露(AI估算:4K-8K/月)
成长发展
88较高
JD强调“稀缺复合经验”、“独立负责模块”、“深度参与基础设施建设”,成长机会突出,能同时锻炼专业深度、工程能力和产品思维。
技术前沿前沿/新兴技术
技术栈Agent、Evaluation、Benchmark、Pipeline、强化学习、产品设计
成长机会self evolving、独立负责完整模块、深度参与
业务类型ambiguous
工作生活
50较低
仅支持现场办公,地点在北京,实习时长需4个月以上,每周4天,灵活性一般。没有明确的WLB信号。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
JD充满使命感和探索感,“定义智能的尺度”传递出较强的意义感,且AI行业本身处于高速增长期。
行业发展高速增长赛道
社会影响中性/一般
使命信号定义智能的尺度、真正解决专业领域的复杂问题
创新程度开拓性创新(行业首创)
月之暗面 的其他在招职位
相似职位推荐
Watch Jobs