
蚂蚁集团
蚂蚁集团-大模型应用算法(自动化评测与benchmark)-健康事业群
蚂蚁集团-大模型应用算法(自动化评测与benchmark)-健康事业群
发布于 大约 14 小时前普通员工/个人贡献者
上海市 / 杭州市
其它
全职员工
仅现场办公
不限
机器学习工程
Dpo
Llm
Rag
Reward Model
Rlhf
Sft
大模型评测
AI 估算 · 35k–55k
大厂大模型算法岗,技术门槛高,薪资竞争力强,通常15薪左右。
职位详情
关于这个职位
加入蚂蚁集团健康事业群,专注于大模型评测体系建设,负责设计高质量Benchmark、开发自动化评测框架,并通过诊断模型缺陷闭环优化算法
你将接触前沿LLM技术,深度参与医疗AI场景,工作地点在上海或杭州
最低要求
)计算机/数学/统计/AI 相关专业本科及以上,硕士/博士优先
)扎实的算法与工程能力:熟练 Python,能独立完成评测框架开发、数据处理与分析
)深刻理解 LLM/Transformer 及后训练范式:SFT、RLHF/DPO/Reward Modeling 等
理解 Agent/RAG 的典型失败模式与评测要点
)有大模型评测/后训练经验:大模型评测、后训练、A/B 实验、统计推断等方向有实战沉淀
工作职责
)高质量Benchmark 建设
构建高区分度评测集:针对医疗多专科、复杂对话决策、长链路推理、记忆/一致性、工具使用、RAG 证据依赖等难点设计专项集
负责评测数据全流程治理,建立数据泄露/污染检测机制,防止评测虚高
推动"可持续评测":小样本高敏感集 + 大样本回归集的组合,支撑日常迭代与版本回归
)自动化评测框架与裁判模型 建设
设计并落地自动评测框架:支持规则/打分 Rubric、程序化评估(如工具调用/代码)、以及 LLM-as-a-Judge 混合评测,保证高吞吐、低成本、强复现
构建评测流水线,必要时训练/微调裁判模型或 reward model,用于特定医疗任务下的稳定评判与偏差控制
)效果诊断与后训练闭环
系统化归因:针对指令遵循失败、知识缺失/遗忘、逻辑断裂、证据不一致、幻觉模式、拒答策略不当、工具调用失败等,形成可行动的归因方案
将诊断结论转化为训练策略:SFT 数据补齐、偏好数据/对比数据构造、DPO/RLHF 奖励设计、课程学习与难度采样等,推动模型持续提升
建立线上/离线一致性验证:离线评测与线上关键指标(安全风险、满意度、转化等)关联分析,持续校准评测有效性
)评测体系与指标方法论 建设
设计并迭代覆盖多维能力的评测体系:通用能力、医疗专业能力、安全合规及稳健性等
建立可对标的指标体系与实验规范:采样策略、置信区间、显著性检验、多重比较校正等,确保评测结论可信、可复验、可解释
输出高信度评测报告:不仅给分数,更给差距来源、风险等级、上线门槛与下一步改进优先级
)前沿评测研究与复杂场景评估 设计
跟进并复现业界评测与框架:HELM、lm-evaluation-harness 等
对标 MMLU、GSM8K、HumanEval/MBPP、C-Eval/CMMLU、AGIEval 等,形成内部可持续对标体系
探索复杂场景评测:Agent 多步任务成功率、RAG 的证据忠实性与引用正确性、长上下文一致性、跨轮对话稳定性等,并推动工程化落地
优先资格
)熟悉或有经验构建/使用主流评测集与框架者优先:C-Eval、CMMLU、HumanEval、AGIEval,或 HELM、lm-evaluation-harness 等
)有医疗/合规/安全相关经验加分
有大厂大模型算法/评测/平台化经验加分
发表过顶会论文(ICLR/NeurIPS/ACL等)优先
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台大,健康事业群业务前景广阔,能接触真实医疗场景
- 薪资福利在行业内具竞争力,有机会发表顶会论文
- 与顶尖算法团队合作,提升技术视野和影响力
- 评测工作细致繁琐,需严谨的实验设计和数据治理能力
- 需持续跟进业界最新评测方法,保持技术敏感度
- 适合对技术有极致追求、喜欢解决复杂问题,并有意深入医疗AI领域的算法工程师
缺点 / 挑战
- 大模型评测是前沿方向,技术挑战大,个人成长迅速
- 医疗领域对安全合规要求极高,评测标准严格,可能带来较大工作压力
角色解读
- 成为大模型评测领域的专家,主导评测体系建设,直接影响模型迭代方向
- 向算法负责人或技术专家发展,带领团队负责模型后训练与评测一体化
- 可横向扩展至模型训练、AI Infra或AI产品方向,成为复合型人才
- 构建大模型评测体系,设计高质量benchmark,覆盖医疗专科、复杂对话、长链路推理等场景,并治理数据泄露问题
- 开发自动化评测框架,融合规则打分、程序化评估和LLM-as-a-Judge,保证评测的高吞吐、低成本和高复现性
- 对模型效果进行系统化归因,诊断指令遵循失败、幻觉、逻辑断裂等问题,并将分析结果转化为SFT、DPO等训练策略
- 探索Agent、RAG等复杂场景的评测方法,跟进业界评测框架,推动工程化落地
- 扎实的Python编程能力,能独立开发评测框架、处理数据并进行统计分析
- 深入理解LLM/Transformer架构及后训练范式(SFT、RLHF/DPO、Reward Modeling)
- 熟悉Agent/RAG的典型失败模式与评测要点,有评测集构建或使用经验
- 具备统计推断和实验设计知识,能进行A/B测试、显著性检验等
申请策略
- 了解蚂蚁健康事业群的产品方向(如医保、好大夫等),展示对医疗场景的理解
- 准备体现你对评测体系设计的系统性思考,如多维指标、数据泄露防治等
- 突出大模型评测或后训练项目经验,展示具体的benchmark构建或评测框架开发案例
- 强调Python和数据处理能力,如有开源贡献或评测集,务必列出
- 如有顶会论文或大厂实习经历,放在显眼位置
- 医疗、合规或安全相关项目经验是重要加分项
- 熟悉主流评测集和框架(如HELM、lm-evaluation-harness),尝试复现
- 深入理解RLHF/DPO原理,最好有实际微调或评测经验
面试指南
- 使用STARI法则:简述情境(Situation)、任务(Task)、行动(Action)、结果(Result)、洞察(Insight)
- 对评测类问题,从评测集设计、数据治理、评测执行、结果分析到闭环优化,展现系统性思维
- 对开放性问题,先拆解问题,再分点回答,使用因果推理和假设验证
- 如何设计一个针对医疗大模型的评测集?需要注意哪些问题?
- 如何判断一个评测结果是否可靠?如何处理数据泄露问题?
- 请介绍你做过的大模型评测或后训练项目,具体流程是什么?
- 如何利用LLM-as-a-Judge进行自动化评测?有哪些偏差?如何控制?
- 当模型在测试集上分数高但线上效果差,可能是什么原因?如何解决?
职位点评
71
综合评分
蚂蚁大厂、前沿大模型评测技术、薪资有竞争力,WLB不明。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿、渴望快速成长,且能接受不确定工作强度的算法工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值75
薪资福利
70中等
大厂算法岗薪资竞争力强,但JD未披露具体薪资,福利待遇需面议确认。
薪资信号未披露(AI估算:35K-55K/月)
成长发展
85较高
岗位处于大模型评测前沿,技术挑战大,成长空间广阔,但JD未明确晋升机制。
技术前沿前沿/新兴技术
技术栈LLM、SFT、RLHF、DPO、Reward Model、Agent、RAG、Benchmark
业务类型ambiguous
工作生活
50较低
仅现场办公,未明确WLB,大厂可能有一定工作强度,通勤和弹性政策不明。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
医疗健康方向具有社会价值,大模型赛道前景好,但JD未直接强调使命感。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs