
康明斯
AI Lab - LLM Applied Evaluation and Benchmark Intern
AI Lab - LLM Applied Evaluation and Benchmark Intern
发布于 大约 2 小时前实习/见习
北京市
无经验要求
实习生
混合式弹性办公
本科
NLP工程
Ai Agent
Chatbi
Llm
Prompt Engineering
Rag
Sql
大模型评测
数据脱敏
AI 估算 · 4k–8k
AI评测实习,技能门槛较高,北京市场实习薪资中等偏上
职位详情
关于这个职位
康明斯AI Lab招聘大模型应用评测实习生,主要负责设计评测框架、构建基准数据集,以及测试Chatbot/ChatBI等LLM应用
你将参与Agent系统的验证与输出质量分析,积累LLM评测与优化经验
适合对AI质量保障感兴趣的在读本科或研究生
最低要求
计算机科学 / 数据科学 / 人工智能或相关专业本科或研究生在读
熟悉软件测试方法:了解测试用例设计、边界测试与逻辑验证
具备良好的逻辑分析能力:能够系统性设计评测场景并识别问题
熟悉大语言模型(LLM)相关技术:如Prompt工程、RAG、Agent框架等
熟悉Python或其他编程语言:具备基础数据处理能力
了解数据隐私与脱敏方法:如匿名化、数据掩码等
具备良好的学习能力、问题解决能力和团队合作精神
工作职责
设计并执行大模型应用评测:针对Chatbot与ChatBI等应用,设计系统化测试方案,包括功能测试、逻辑测试与边界测试
构建评测数据与指标体系:构建评测数据集,并设计评估指标(如准确率、鲁棒性、一致性、幻觉率等)
参与Agent应用搭建与测试:参与AI Agent系统的构建与测试,验证多步骤推理与工具调用能力
执行模型输出评估:结合人工评测与自动评测(如LLM-as-a-judge)评估模型输出质量
分析模型问题与行为:识别模型幻觉、逻辑错误、偏差等问题,并提出优化建议
数据处理与脱敏:进行数据清洗与脱敏(如匿名化、掩码处理),确保符合数据隐私要求
撰写评测报告:输出评测方法、结果分析及优化建议,并向相关方汇报
向团队成员和相关方展示成果与洞察
优先资格
有Chatbot或数据问答相关经验者优先
熟悉AI开发框架(如LangChain、LlamaIndex、OpenAI API)者优先
有SQL或数据分析经验者优先(适用于ChatBI场景)
AI 洞察
优缺点分析
优点
- 接触前沿LLM技术,学习评测体系构建,技能积累快
- 在康明斯这样的大型跨国企业,能够了解AI在工业场景的应用
- 提供完整的学习机会,导师指导可能,为职业发展打下基础
- 工作内容涉及多个技术方向,如Prompt工程、RAG、Agent,拓宽视野
- 评测工作需要严谨的逻辑和耐心,可能较为枯燥
- 跨部门协作,需要与不同团队沟通,沟通成本高
- 适合对AI质量保障和评测感兴趣,具备逻辑分析能力,且希望在工业场景应用AI的学生
缺点 / 挑战
- 作为实习生,可能面临任务多样性和时间压力
角色解读
- 积累大模型评测经验,可转向AI质量保障、AI产品经理或NLP工程方向
- 通过Agent开发实践,向AI应用开发或机器学习工程方向发展
- 在工业场景中落地AI,具备跨领域的职业竞争力
- 设计并执行大模型应用的评测方案,包括功能、逻辑和边界测试
- 构建和维护评测数据集与指标体系,评估模型准确率、鲁棒性、一致性等
- 参与AI Agent的搭建与测试,验证多步骤推理和工具调用能力
- 结合人工评测与自动评测(LLM-as-a-judge)分析模型输出质量并撰写报告
- 熟悉LLM相关技术,如Prompt工程、RAG、Agent框架
- 掌握Python编程,能进行数据处理和分析
- 了解软件测试方法和逻辑验证
- 了解数据隐私与脱敏技术
申请策略
- 关注康明斯AI Lab的业务方向,了解其在汽车和工业场景的AI应用
- 求职信中表达对LLM评测的兴趣,并提及自己在此领域的思考或尝试
- 突出与LLM相关的项目经验,如使用LangChain开发过Chatbot或RAG系统
- 强调软件测试或数据分析的经历,尤其是设计过测试用例或评估指标
- 展示Python编程能力和数据处理技能,如果有SQL经验也值得提及
- 若有AI Agent或ChatBI相关经验,务必突出
- 提前学习Prompt Engineering和RAG概念,动手实践小项目
- 了解LangChain、LlamaIndex等框架,尝试构建简单的Agent
面试指南
- 使用STAR法则:情境-任务-行动-结果,结构化描述项目经历
- 对于评测设计,从目的、维度、指标、数据集、方法到结论的逻辑
- 结合具体技术细节,展示动手能力,并提及权衡取舍
- 请介绍一下你如何使用LangChain构建过一个RAG系统?
- 如何设计一个评测方案来评估Chatbot的回答质量?
- 你如何理解LLM的幻觉问题?有哪些缓解方法?
- 你有过测试用例设计的经验吗?能举例说明吗?
- 如何对一个AI Agent进行端到端测试?
职位点评
74
综合评分
前沿LLM评测实习,技术成长空间大,WLB良好,薪资未披露。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
适合追求技术成长、希望在AI评测领域积累经验,并注重工作生活平衡的在校学生。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利40
成长发展90
工作生活75
使命价值70
薪资福利
40较低
该职位未披露薪资,作为实习生薪酬可能偏低,但公司平台稳定,福利尚可。
薪资信号未披露(AI估算:4K-8K/月)
成长发展
90较高
聚焦前沿LLM技术,提供持续学习机会,技能成长空间大。
技术前沿前沿/新兴技术
技术栈LLM、RAG、Agent、LangChain、LlamaIndex、OpenAI API、Python、SQL
成长机会持续学习机会
业务类型ambiguous
工作生活
75中等
JD明确提及重视工作生活平衡,且非100%现场办公,但具体办公地点未知。
工作模式混合式弹性办公
办公地点未明确
加班情况明确说明WLB/不加班
工作生活平衡重视健康、安全与工作生活平衡
使命价值
70中等
AI行业高速增长,但社会影响力偏中性,使命感信号不强。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
康明斯 的其他在招职位
相似职位推荐
Watch Jobs