Trip.com logo
携程
AI QA(MJ036437)

AI QA(MJ036437)

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
本科
质量保证
Golden Dataset
Human Evaluation
Llm
Prompt Engineering
Root Cause Analysis
英语
跨部门沟通
Ai Quality Assessment

AI 估算 · 20k–35k

上海AI QA,携程大厂,3年经验,薪资有竞争力,结合AI领域热度,月薪2-3.5万合理。

职位详情

关于这个职位

作为AI QA工程师,你将负责评估和优化携程的LLM/AIGC产品,建立质量评测标准,结合自动化与人工评估进行端到端质量控制

需要敏锐挖掘模型badcase,推动问题闭环解决
适合具备LLM/产品运营经验、善于跨团队协作的候选人

最低要求

· 学历要求:全日制本科及以上学历

· 工作经验:3年以上互联网产品运营经验,有LLM/AIGC产品运营经验者优先
· 专业技能:熟练掌握AI评估方法论(如Golden Dataset构建、人工评估SOP)
具备敏锐的细节把控能力(“找bug”思维),能从海量数据中挖掘潜在风险
熟悉Prompt Engineering,能够复现或验证问题(侧重验证而非日常维护)
· 软技能:具备较强的跨部门沟通能力,能够用数据影响并推动跨职能伙伴解决复杂问题
· 语言能力:具备良好的英语书面和口语能力

工作职责

· AI质量评估框架与标准:建立并维护大语言模型(LLM)的质量评估标准,涵盖准确性、安全性、合规性和指令遵循能力

设计结合自动化和人工评估的评估流程,定期量化模型性能
· 端到端质量控制与风险管理:负责模型迭代的回归测试和验收测试,在发布前强制执行质量门禁,防止性能退化
监控线上表现,挖掘badcase,识别模型幻觉、逻辑错误或体验缺陷,并及时发出风险警报
· 问题驱动改进与闭环管理:主导质量问题的根本原因分析(RCA),准确诊断失败源于数据、提示词还是模型架构
推动算法、产品和运营团队解决质量缺陷,跟踪修复率并进行重新验证,确保闭环流程
· 跨部门协作:拉通业务需求与技术实现,确保AI为用户带来真实价值

优先资格

有项目管理经验者优先

AI 洞察

优缺点分析

优点

  • 身处AI前沿领域,接触LLM评估方法论,技能稀缺性和职业前景好
  • 携程是上市大厂,平台稳定,有完善的福利和资源支持
  • 工作涉及技术+业务+运营,能锻炼跨团队协作和数据影响力
  • AI质量是新兴方向,有机会成为行业早期专家
  • 需要极强的细心和耐心,从海量数据中找badcase可能比较枯燥
  • 跨团队推动问题解决需要高情商和沟通技巧,可能面临阻力
  • AI技术迭代快,需要不断学习新知识,保持专业敏锐度
  • 适合对AI有热情、细心敏感、喜欢与技术团队协作解决问题的人,尤其是有产品运营背景并希望转型AI领域的求职者

缺点 / 挑战

暂无明显挑战项

角色解读

  • 在AI质量方向深耕,成为AI质量专家,主导质量体系和评测平台的建设
  • 向AI产品运营或AI产品经理方向发展,利用质量洞察反哺产品优化
  • 有机会接触到携程大模型业务的核心场景,积累前沿的LLM应用经验
  • 制定和维护LLM产品的质量评估标准,包括准确性、安全性和指令遵循能力,确保模型符合业务要求
  • 设计并执行自动化+人工的评估流程,对模型迭代进行回归测试和验收测试,把控上线质量门槛
  • 监控线上模型表现,从大量数据中挖掘badcase,分析问题根源并推动跨团队修复和闭环验证
  • 掌握AI评估方法论,如Golden Dataset构建、人工评估SOP设计,能量化模型性能
  • 熟悉Prompt Engineering,能够通过调整prompt复现或验证模型问题
  • 具备数据敏感性和“找bug”思维,能从海量数据中发现潜在风险
  • 出色的跨部门沟通和影响力,能用数据说服并推动算法、产品、运营团队解决问题

申请策略

  • 在简历中体现你对AI质量的热情,可以附上你写过的评测方案或分析报告
  • 了解携程的业务场景和AI产品方向,面试时展示你如何将质量工作与业务价值挂钩
  • 突出你在LLM/AIGC产品运营中的实际经验,如模型评测、badcase分析的具体案例
  • 强调你掌握的AI评估工具和方法,如Golden Dataset、评估SOP,并量化成果
  • 展示你数据驱动影响决策的成功项目,包括如何用数据说服伙伴
  • 如果你有Prompt Engineering经验,务必提到,哪怕只是验证类工作
  • 学习LLM评估的主流框架和指标,如BLEU、ROUGE、BERTScore等,了解自动化评估工具
  • 练习Prompt Engineering,尝试用提示词复现和修复模型问题

面试指南

  • 使用STAR法则:情境-任务-行动-结果,结构化描述具体项目
  • 展现逻辑思维:从问题定义、方法设计、执行到数据验证,体现闭环能力
  • 强调数据驱动和跨团队协作,用数据说话,并展示沟通策略
  • 请描述一次你发现并推动解决模型质量问题的经历,具体如何定位和验证?
  • 你会如何设计一个LLM的评估标准?涵盖哪些维度,如何量化?
  • 如何平衡自动化评估和人工评估的效率和成本?
  • 如果线上模型出现大量badcase,你如何快速定位是数据、prompt还是模型架构问题?
  • 你如何说服不配合的算法团队优先解决你提出的质量问题?

职位点评

72
综合评分

大厂AI质量岗,前沿技术栈,发展空间大,但现场办公且WLB未明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和前沿领域机会的求职者,对工作生活平衡要求较低。
表现最好
成长发展
相对薄弱
工作生活
薪资福利72
成长发展85
工作生活55
使命价值68

薪资福利

72中等

携程作为上市大厂,提供有竞争力的薪资和福利,但JD未明确具体数字,整体补偿性中等偏上。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

85较高

职位涉及LLM/AIGC前沿领域,能积累稀缺的AI质量评估经验,成长空间大,但JD未提及明确的晋升通道。

技术前沿前沿/新兴技术
技术栈LLM、AI Evaluation、Golden Dataset、Human Evaluation、Prompt Engineering、Regression Testing、Root Cause Analysis
业务类型ambiguous

工作生活

55较低

要求现场办公,JD未提及弹性或远程工作,生活质量取决于团队节奏,整体一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

68中等

AI质量工作有助于提升产品安全性和用户体验,具有一定社会价值,但JD未强调使命愿景。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs