JD logo
京东
算法开发

算法开发

发布于 大约 9 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Llm
人工智能
具身智能
多模态
数据集建设
机器学习
模型评测
自动化评测

AI 估算 · 30k–50k

京东大厂AI算法岗,硕士以上为主,前沿技术方向,薪资在互联网中上水平,结合北京市场,月薪30-50K。

职位详情

关于这个职位

加入京东探索研究院,参与建设覆盖文本、音视频及具身模型的统一评测体系,设计落地模型评测方法与指标体系

你将面向基座模型构建通用能力评测,并面向业务侧抽象目标设计专项评测方案,推动自动化评测与数据集建设
适合对LLM、多模态等前沿技术有深入理解,善于将业务问题转化为量化指标的算法人才

最低要求

本科及以上学历,计算机、人工智能、自动化、机器人等相关专业

熟悉至少一个方向:LLM/多模态/语音/具身智能数据、训练或评测
有模型评测、Benchmark、自动化评测或数据标注相关经验优先
具备将“业务问题”转化为“可量化评测指标”的能力
对评测结果的稳定性、可复现性、统计显著性有基本认知

工作职责

参与建设覆盖文本、音视频及具身模型的统一评测体系,设计并落地模型评测方法与指标体系

面向基座模型,构建通用能力评测(理解、推理、事实性、安全性、鲁棒性等),支撑模型版本对比与演进决策
面向业务侧(客服、导购、搜索、推荐等),抽象业务目标,设计专项评测指标、用例集与评测方案
负责自动化评测与判分策略(规则/模型判分/多模型互评),并协同人工标注体系提升评测可信度
参与评测数据集建设,包括数据采样、难例挖掘、数据版本管理与评测结果分析
与工程团队协作,打通模型数据 – 实验 – 评测全链路闭环

AI 洞察

优缺点分析

优点

  • 京东大厂平台,资源丰富,接触前沿AI技术(LLM、多模态、具身智能)
  • 核心岗位,直接影响模型质量和业务效果,成就感强
  • 团队为探索研究院,技术氛围浓厚,有内部培训和大牛指导
  • 薪资福利具有竞争力,包括年终奖、股票等
  • 评测工作繁琐且要求细致,需要处理大量数据和复杂的指标设计
  • 技术迭代快,需持续学习新模型和评测方法
  • 适合对模型质量有追求、喜欢量化分析和问题拆解,同时具备较强工程能力的AI工程师

缺点 / 挑战

  • 需要与多个业务部门协调,沟通成本较高

角色解读

  • 在AI评测领域深耕,成为评测专家,影响公司模型演进方向
  • 横向拓展到模型训练、数据工程等方向,成为AI全栈人才
  • 晋升为技术主管或架构师,带领评测团队,制定评测标准
  • 设计和维护统一的模型评测体系,覆盖文本、音视频、具身模型等多种模态
  • 构建基座模型的通用能力评测指标,如理解、推理、安全性等,为模型选型提供依据
  • 对接业务部门(客服、搜索等),抽象业务目标,制定专项评测方案和用例
  • 开发自动化评测与判分策略,包括规则、模型判分和多模型互评,提升评测效率
  • 扎实的机器学习/深度学习基础,熟悉LLM、多模态或具身智能至少一个方向
  • 具备模型评测或Benchmark构建经验,了解评测稳定性、可复现性等统计概念
  • 较强的业务抽象能力,能将模糊的业务需求转化为可量化的评测指标
  • 良好的工程协作能力,能配合工程团队打通评测全链路

申请策略

  • 在面试中展现你对评测稳定性和可复现性的深入思考,这是该职位核心
  • 可以提前准备一个评测方案设计案例,展示你的系统性思维
  • 突出你在LLM/多模态等领域的项目经验,特别是涉及模型评测、Benchmark构建的经历
  • 强调你将业务问题转化为技术方案的能力,附上具体案例和数据
  • 展示你对评测统计学知识的理解,如置信区间、显著性检验等
  • 如果有开源贡献或相关论文,请重点列出
  • 系统复习模型评测方法论,如GLUE、SuperGLUE、MMLU等Benchmark设计思路
  • 学习自动化评测框架,如lm-evaluation-harness、HELM等

面试指南

  • 对于评测方案设计:先明确评测目标,然后分解为多个维度,每个维度选择合适的指标和数据集,最后考虑自动化和人工标注的结合
  • 对于业务抽象:使用MECE原则(相互独立、完全穷举)分解业务目标,再找到可量化的代理指标,同时考虑指标之间的关联
  • 对于稳定性和可复现性:强调随机种子控制、多次实验取平均、置信区间计算、标准化数据集和评估流程等
  • 请设计一个针对大语言模型的评测方案,涵盖哪些维度?
  • 如何确保评测结果的稳定性和可复现性?有哪些常见陷阱?
  • 如果业务方提出一个模糊的需求(如“提升用户满意度”),你如何转化为评测指标?
  • 请比较规则判分、模型判分和多模型互评的优缺点
  • 你如何做难例挖掘?有哪些策略?

职位点评

73
综合评分

京东大厂AI评测岗,前沿技术栈,高发展潜力,但WLB一般且通勤不便。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和职业发展,能接受一定强度工作和对通勤不敏感的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活40
使命价值70

薪资福利

80较高

京东大厂提供有竞争力的薪资和福利,但JD未明确具体待遇,故评分中等偏上。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

前沿技术(LLM/多模态/具身智能),核心评测岗位,成长空间大,内部培训机会多。

技术前沿前沿/新兴技术
技术栈LLM、多模态、具身智能、模型评测、自动化评测
业务类型profit_center

工作生活

40较低

仅现场办公,京东总部位于亦庄科技园,通勤不便,JD未提及WLB,但大厂工作强度较高。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

70中等

AI评测对模型质量和业务效果有直接贡献,但属于幕后工作,社会影响力一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs