Cummins logo
康明斯
AI Lab - LLM Applied Evaluation and Benchmark Intern

AI Lab - LLM Applied Evaluation and Benchmark Intern

发布于 大约 2 小时前

实习/见习

北京市
无经验要求
实习生
混合式弹性办公
本科
NLP工程
Ai Agent
Chatbi
Llm
Prompt Engineering
Rag
Sql
大模型评测
数据脱敏

AI 估算 · 4k–8k

AI评测实习,技能门槛较高,北京市场实习薪资中等偏上

职位详情

关于这个职位

康明斯AI Lab招聘大模型应用评测实习生,主要负责设计评测框架、构建基准数据集,以及测试Chatbot/ChatBI等LLM应用

你将参与Agent系统的验证与输出质量分析,积累LLM评测与优化经验
适合对AI质量保障感兴趣的在读本科或研究生

最低要求

计算机科学 / 数据科学 / 人工智能或相关专业本科或研究生在读

熟悉软件测试方法:了解测试用例设计、边界测试与逻辑验证
具备良好的逻辑分析能力:能够系统性设计评测场景并识别问题
熟悉大语言模型(LLM)相关技术:如Prompt工程、RAG、Agent框架等
熟悉Python或其他编程语言:具备基础数据处理能力
了解数据隐私与脱敏方法:如匿名化、数据掩码等
具备良好的学习能力、问题解决能力和团队合作精神

工作职责

设计并执行大模型应用评测:针对Chatbot与ChatBI等应用,设计系统化测试方案,包括功能测试、逻辑测试与边界测试

构建评测数据与指标体系:构建评测数据集,并设计评估指标(如准确率、鲁棒性、一致性、幻觉率等)
参与Agent应用搭建与测试:参与AI Agent系统的构建与测试,验证多步骤推理与工具调用能力
执行模型输出评估:结合人工评测与自动评测(如LLM-as-a-judge)评估模型输出质量
分析模型问题与行为:识别模型幻觉、逻辑错误、偏差等问题,并提出优化建议
数据处理与脱敏:进行数据清洗与脱敏(如匿名化、掩码处理),确保符合数据隐私要求
撰写评测报告:输出评测方法、结果分析及优化建议,并向相关方汇报
向团队成员和相关方展示成果与洞察

优先资格

有Chatbot或数据问答相关经验者优先

熟悉AI开发框架(如LangChain、LlamaIndex、OpenAI API)者优先
有SQL或数据分析经验者优先(适用于ChatBI场景)

AI 洞察

优缺点分析

优点

  • 接触前沿LLM技术,学习评测体系构建,技能积累快
  • 在康明斯这样的大型跨国企业,能够了解AI在工业场景的应用
  • 提供完整的学习机会,导师指导可能,为职业发展打下基础
  • 工作内容涉及多个技术方向,如Prompt工程、RAG、Agent,拓宽视野
  • 评测工作需要严谨的逻辑和耐心,可能较为枯燥
  • 跨部门协作,需要与不同团队沟通,沟通成本高
  • 适合对AI质量保障和评测感兴趣,具备逻辑分析能力,且希望在工业场景应用AI的学生

缺点 / 挑战

  • 作为实习生,可能面临任务多样性和时间压力

角色解读

  • 积累大模型评测经验,可转向AI质量保障、AI产品经理或NLP工程方向
  • 通过Agent开发实践,向AI应用开发或机器学习工程方向发展
  • 在工业场景中落地AI,具备跨领域的职业竞争力
  • 设计并执行大模型应用的评测方案,包括功能、逻辑和边界测试
  • 构建和维护评测数据集与指标体系,评估模型准确率、鲁棒性、一致性等
  • 参与AI Agent的搭建与测试,验证多步骤推理和工具调用能力
  • 结合人工评测与自动评测(LLM-as-a-judge)分析模型输出质量并撰写报告
  • 熟悉LLM相关技术,如Prompt工程、RAG、Agent框架
  • 掌握Python编程,能进行数据处理和分析
  • 了解软件测试方法和逻辑验证
  • 了解数据隐私与脱敏技术

申请策略

  • 关注康明斯AI Lab的业务方向,了解其在汽车和工业场景的AI应用
  • 求职信中表达对LLM评测的兴趣,并提及自己在此领域的思考或尝试
  • 突出与LLM相关的项目经验,如使用LangChain开发过Chatbot或RAG系统
  • 强调软件测试或数据分析的经历,尤其是设计过测试用例或评估指标
  • 展示Python编程能力和数据处理技能,如果有SQL经验也值得提及
  • 若有AI Agent或ChatBI相关经验,务必突出
  • 提前学习Prompt Engineering和RAG概念,动手实践小项目
  • 了解LangChain、LlamaIndex等框架,尝试构建简单的Agent

面试指南

  • 使用STAR法则:情境-任务-行动-结果,结构化描述项目经历
  • 对于评测设计,从目的、维度、指标、数据集、方法到结论的逻辑
  • 结合具体技术细节,展示动手能力,并提及权衡取舍
  • 请介绍一下你如何使用LangChain构建过一个RAG系统?
  • 如何设计一个评测方案来评估Chatbot的回答质量?
  • 你如何理解LLM的幻觉问题?有哪些缓解方法?
  • 你有过测试用例设计的经验吗?能举例说明吗?
  • 如何对一个AI Agent进行端到端测试?

职位点评

74
综合评分

前沿LLM评测实习,技术成长空间大,WLB良好,薪资未披露。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
适合追求技术成长、希望在AI评测领域积累经验,并注重工作生活平衡的在校学生。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利40
成长发展90
工作生活75
使命价值70

薪资福利

40较低

该职位未披露薪资,作为实习生薪酬可能偏低,但公司平台稳定,福利尚可。

薪资信号未披露(AI估算:4K-8K/月)

成长发展

90较高

聚焦前沿LLM技术,提供持续学习机会,技能成长空间大。

技术前沿前沿/新兴技术
技术栈LLM、RAG、Agent、LangChain、LlamaIndex、OpenAI API、Python、SQL
成长机会持续学习机会
业务类型ambiguous

工作生活

75中等

JD明确提及重视工作生活平衡,且非100%现场办公,但具体办公地点未知。

工作模式混合式弹性办公
办公地点未明确
加班情况明确说明WLB/不加班
工作生活平衡重视健康、安全与工作生活平衡

使命价值

70中等

AI行业高速增长,但社会影响力偏中性,使命感信号不强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs