
携程
AI QA(MJ036437)
AI QA(MJ036437)
发布于 大约 14 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
仅现场办公
本科
质量保证
Golden Dataset
Human Evaluation
Llm
Prompt Engineering
Root Cause Analysis
英语
跨部门沟通
Ai Quality Assessment
AI 估算 · 20k–35k
上海AI QA,携程大厂,3年经验,薪资有竞争力,结合AI领域热度,月薪2-3.5万合理。
职位详情
关于这个职位
作为AI QA工程师,你将负责评估和优化携程的LLM/AIGC产品,建立质量评测标准,结合自动化与人工评估进行端到端质量控制
需要敏锐挖掘模型badcase,推动问题闭环解决
适合具备LLM/产品运营经验、善于跨团队协作的候选人
最低要求
· 学历要求:全日制本科及以上学历
· 工作经验:3年以上互联网产品运营经验,有LLM/AIGC产品运营经验者优先
· 专业技能:熟练掌握AI评估方法论(如Golden Dataset构建、人工评估SOP)
具备敏锐的细节把控能力(“找bug”思维),能从海量数据中挖掘潜在风险
熟悉Prompt Engineering,能够复现或验证问题(侧重验证而非日常维护)
· 软技能:具备较强的跨部门沟通能力,能够用数据影响并推动跨职能伙伴解决复杂问题
· 语言能力:具备良好的英语书面和口语能力
工作职责
· AI质量评估框架与标准:建立并维护大语言模型(LLM)的质量评估标准,涵盖准确性、安全性、合规性和指令遵循能力
设计结合自动化和人工评估的评估流程,定期量化模型性能
· 端到端质量控制与风险管理:负责模型迭代的回归测试和验收测试,在发布前强制执行质量门禁,防止性能退化
监控线上表现,挖掘badcase,识别模型幻觉、逻辑错误或体验缺陷,并及时发出风险警报
· 问题驱动改进与闭环管理:主导质量问题的根本原因分析(RCA),准确诊断失败源于数据、提示词还是模型架构
推动算法、产品和运营团队解决质量缺陷,跟踪修复率并进行重新验证,确保闭环流程
· 跨部门协作:拉通业务需求与技术实现,确保AI为用户带来真实价值
优先资格
有项目管理经验者优先
AI 洞察
优缺点分析
优点
- 身处AI前沿领域,接触LLM评估方法论,技能稀缺性和职业前景好
- 携程是上市大厂,平台稳定,有完善的福利和资源支持
- 工作涉及技术+业务+运营,能锻炼跨团队协作和数据影响力
- AI质量是新兴方向,有机会成为行业早期专家
- 需要极强的细心和耐心,从海量数据中找badcase可能比较枯燥
- 跨团队推动问题解决需要高情商和沟通技巧,可能面临阻力
- AI技术迭代快,需要不断学习新知识,保持专业敏锐度
- 适合对AI有热情、细心敏感、喜欢与技术团队协作解决问题的人,尤其是有产品运营背景并希望转型AI领域的求职者
缺点 / 挑战
暂无明显挑战项
角色解读
- 在AI质量方向深耕,成为AI质量专家,主导质量体系和评测平台的建设
- 向AI产品运营或AI产品经理方向发展,利用质量洞察反哺产品优化
- 有机会接触到携程大模型业务的核心场景,积累前沿的LLM应用经验
- 制定和维护LLM产品的质量评估标准,包括准确性、安全性和指令遵循能力,确保模型符合业务要求
- 设计并执行自动化+人工的评估流程,对模型迭代进行回归测试和验收测试,把控上线质量门槛
- 监控线上模型表现,从大量数据中挖掘badcase,分析问题根源并推动跨团队修复和闭环验证
- 掌握AI评估方法论,如Golden Dataset构建、人工评估SOP设计,能量化模型性能
- 熟悉Prompt Engineering,能够通过调整prompt复现或验证模型问题
- 具备数据敏感性和“找bug”思维,能从海量数据中发现潜在风险
- 出色的跨部门沟通和影响力,能用数据说服并推动算法、产品、运营团队解决问题
申请策略
- 在简历中体现你对AI质量的热情,可以附上你写过的评测方案或分析报告
- 了解携程的业务场景和AI产品方向,面试时展示你如何将质量工作与业务价值挂钩
- 突出你在LLM/AIGC产品运营中的实际经验,如模型评测、badcase分析的具体案例
- 强调你掌握的AI评估工具和方法,如Golden Dataset、评估SOP,并量化成果
- 展示你数据驱动影响决策的成功项目,包括如何用数据说服伙伴
- 如果你有Prompt Engineering经验,务必提到,哪怕只是验证类工作
- 学习LLM评估的主流框架和指标,如BLEU、ROUGE、BERTScore等,了解自动化评估工具
- 练习Prompt Engineering,尝试用提示词复现和修复模型问题
面试指南
- 使用STAR法则:情境-任务-行动-结果,结构化描述具体项目
- 展现逻辑思维:从问题定义、方法设计、执行到数据验证,体现闭环能力
- 强调数据驱动和跨团队协作,用数据说话,并展示沟通策略
- 请描述一次你发现并推动解决模型质量问题的经历,具体如何定位和验证?
- 你会如何设计一个LLM的评估标准?涵盖哪些维度,如何量化?
- 如何平衡自动化评估和人工评估的效率和成本?
- 如果线上模型出现大量badcase,你如何快速定位是数据、prompt还是模型架构问题?
- 你如何说服不配合的算法团队优先解决你提出的质量问题?
职位点评
72
综合评分
大厂AI质量岗,前沿技术栈,发展空间大,但现场办公且WLB未明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和前沿领域机会的求职者,对工作生活平衡要求较低。
表现最好
成长发展
相对薄弱
工作生活
薪资福利72
成长发展85
工作生活55
使命价值68
薪资福利
72中等
携程作为上市大厂,提供有竞争力的薪资和福利,但JD未明确具体数字,整体补偿性中等偏上。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
85较高
职位涉及LLM/AIGC前沿领域,能积累稀缺的AI质量评估经验,成长空间大,但JD未提及明确的晋升通道。
技术前沿前沿/新兴技术
技术栈LLM、AI Evaluation、Golden Dataset、Human Evaluation、Prompt Engineering、Regression Testing、Root Cause Analysis
业务类型ambiguous
工作生活
55较低
要求现场办公,JD未提及弹性或远程工作,生活质量取决于团队节奏,整体一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
68中等
AI质量工作有助于提升产品安全性和用户体验,具有一定社会价值,但JD未强调使命愿景。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
携程 的其他在招职位
相似职位推荐
Watch Jobs