Alibaba logo
阿里巴巴
日常实习生-大模型安全评测实习生

日常实习生-大模型安全评测实习生

发布于 大约 8 小时前

实习/见习

杭州市
无经验要求
实习生
仅现场办公
硕士
NLP工程
Ai Safety
Llm
Llm-As-A-Judge
Nlp
Prompt Engineering
Pytorch
Sft/Dpo
大模型安全

AI 估算 · 4k–6k

阿里日常实习生,杭州地区,薪资按行业实习标准估算,日薪约200-300元。

职位详情

关于这个职位

这是一份阿里巴巴的大模型安全评测日常实习生职位

你将深度参与大模型安全评测体系的设计与建设,围绕内容安全、价值观对齐与越狱攻击等方向,构建多维度评测方案,并参与评测数据集的构建与维护
同时,你还会研究并落地基于LLM-as-a-Judge的自动化评判方法,以及参与评测工具链和平台的研发
适合对AI安全充满热情、具备扎实NLP基础的硕士在读同学

最低要求

硕士及以上学历在读,计算机、人工智能、网络安全等相关专业优先

具备扎实的深度学习与自然语言处理基础,熟悉深度学习框架(PyTorch),熟练掌握 Prompt Engineering、模型微调(SFT/DPO)等基础技术,具备较强的算法实现与实验能力
了解 Qwen、DeepSeek、GLM、Llama 等主流大模型架构及推理框架(vLLM、SGLang)者优先
了解大模型安全评测、AI Safety、Red Teaming、Jailbreak Attack & Defense、Alignment、LLM-as-a-Judge 等相关研究方向,熟悉主流安全评测 Benchmark 与评测方法论、自动化评测样本生成,以及评判模型构建、评分一致性度量、不确定性量化、Judge 偏差分析与校准等方法
具备良好的论文阅读与复现能力,能够跟踪并理解前沿学术研究工作
有相关项目、研究经验或顶会论文(NeurIPS/ICML/ICLR/ACL/EMNLP 等)者优先
熟练掌握 Python 编程,具备良好的工程实现能力和代码规范意识,有大规模数据处理或评测平台开发经验者优先
具备较强的逻辑分析能力、数据敏感度与问题拆解能力,对大模型安全评测研究有浓厚兴趣,能够独立推进课题
工作地点杭州,每周至少实习4天,持续3个月以上

工作职责

参与大模型安全评测体系的设计与建设,围绕内容安全、价值观对齐与越狱攻击等方向,搭建多维度、多场景、多语种的系统化评测方案,推动模型安全能力的量化分析与行业评估标准的完善

参与大模型安全评测数据集构建与维护,覆盖通用风险、垂直领域风险及长尾风险等场景,探索基于红队对抗(Red Teaming)、自动化Prompt生成、合成数据等技术的高质量评测样本生产方案
参与基于LLM-as-a-Judge的自动化评判方法研究与落地,探索评判模型的偏差校准、不确定性量化及与人类标注一致性提升的关键技术路径,构建可信、可解释的安全评测闭环
参与自动化安全评测工具链与评测平台的研发与迭代,沉淀可复用的评测Pipeline与Judge模型能力,提升评测效率、覆盖度与结果一致性,支撑大模型版本迭代过程中的安全回归与持续监控
跟踪国内外大模型安全评测、AI Safety Benchmark、Red Teaming 等前沿研究进展,复现相关论文与开源方案(如HarmBench、JailbreakBench、SafetyBench等),推动研究成果在实际评测场景中的落地应用

优先资格

优先考虑:计算机、人工智能、网络安全等相关专业

了解 Qwen、DeepSeek、GLM、Llama 等主流大模型架构及推理框架(vLLM、SGLang)
有相关项目、研究经验或顶会论文(NeurIPS/ICML/ICLR/ACL/EMNLP 等)
有大规模数据处理或评测平台开发经验

AI 洞察

优缺点分析

优点

  • 阿里巴巴平台大,资源丰富,能够接触前沿大模型安全研究,与行业顶尖团队协作
  • AI安全是增长潜力高的新兴领域,技术含金量高,职业发展空间广阔
  • 能系统学习评测体系构建、自动化工具链开发、LLM-as-a-Judge等硬核技能
  • 要求每周至少4天、持续3个月以上,时间投入较大,需与学业平衡
  • 岗位知识面宽,涉及NLP、安全、评测方法等,学习曲线较陡
  • 适合对AI安全有强烈好奇心,拥有扎实深度学习与NLP基础的硕士在读生,愿意投入时间深入研究大模型安全评测这一前沿方向

缺点 / 挑战

  • 需要独立推进课题,对问题拆解和实验能力要求较高,可能有一定压力

角色解读

  • 从实习起步,深入大模型安全评测方向,积累对AI安全、对齐、红队等领域的深度理解,逐步成为安全算法专家
  • 可沿算法研究或工程开发双线发展:或撰写顶会论文,或打造自动化评测平台,成为行业稀缺的AI安全复合型人才
  • 实习表现优异可争取转正,进入阿里巴巴核心AI团队,参与大规模模型安全体系建设
  • 参与大模型安全评测体系的设计与搭建,围绕内容安全、价值观对齐和越狱攻击等方向,制定多维度评测方案,量化模型安全能力
  • 构建和维护安全评测数据集,探索红队对抗、自动化Prompt生成、合成数据等方法,生产高质量评测样本
  • 研究并落地LLM-as-a-Judge自动化评判方法,改进评分一致性、偏差校准和不确定性量化,建立可信的评测闭环
  • 参与自动化评测工具链与平台开发,沉淀可复用的Pipeline,支持模型版本迭代中的安全回归与持续监控
  • 扎实的深度学习与NLP基础,熟练掌握PyTorch、Prompt Engineering、模型微调(SFT/DPO),具备算法实现和实验能力
  • 了解大模型安全评测、AI Safety、Red Teaming、Jailbreak Attack等知识,熟悉主流安全Benchmark与评测方法论
  • 熟练Python编程,具备良好的工程实现能力、代码规范意识和数据处理经验
  • 较强的论文阅读与复现能力,能跟踪前沿研究,理解学术成果并落地到实际场景

申请策略

  • 在简历中附上你对AI安全的研究笔记、博客或GitHub项目,展示兴趣与思考深度
  • 提前了解阿里巴巴通义实验室、达摩院等团队在AI安全方向的工作成果,并在面试中体现了解
  • 突出NLP或深度学习的项目经历,尤其是模型微调、Prompt设计、安全对齐相关的内容
  • 如有复现HarmBench、JailbreakBench等安全基准的经历,或参与过Red Teaming项目,务必重点描述
  • 强调Python编程能力、数据处理经验,以及使用过Qwen、DeepSeek、GLM、Llama等大模型的经验
  • 列出顶会论文(NeurIPS/ICML/ICLR/ACL/EMNLP等)或开源贡献,展示研究实力
  • 系统了解主流安全评测Benchmark(如HarmBench、JailbreakBench、SafetyBench),精读2-3篇核心论文
  • 动手实践模型微调(SFT/DPO),熟悉PyTorch和常见推理框架如vLLM、SGLang

面试指南

  • 概念解释题:先定义核心概念,再结合例子说明,最后联系实际应用场景
  • 项目经验题:用STAR法则(情境、任务、行动、结果)清晰描述,强调个人贡献和思考
  • 设计题:从目标→方法→评估→优化的结构展开,体现系统性思维
  • 你如何理解大模型安全评测?请列举你了解的安全评测基准和它们的特点
  • 请详细介绍你使用PyTorch进行模型微调的项目,包括数据、方法、结果
  • 如果让你设计一个评测大模型越狱攻击的测试集,你会如何构建?
  • LLM-as-a-Judge的可靠性有哪些挑战?你有哪些改进思路?
  • 解释SFT和DPO的区别,以及它们在模型安全对齐中的作用

职位点评

72
综合评分

阿里大模型安全评测实习,前沿技术,成长性强,薪资一般,需现场办公

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
该职位最适合以技能成长和前沿技术探索为核心驱动,对AI安全充满热情,且能接受现场实习安排的硕士在读同学。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利55
成长发展85
工作生活60
使命价值80

薪资福利

55较低

实习岗位薪资一般,但阿里巴巴的平台价值和品牌背书带来一定稳定性与福利预期,整体补偿性动机满足度中等偏下。

薪资信号未披露(AI估算:4K-6K/月)

成长发展

85较高

该岗位聚焦大模型安全前沿方向,涉及Red Teaming、LLM-as-a-Judge、SFT/DPO等先进技术,技能成长和研究视野拓展空间巨大。

技术前沿前沿/新兴技术
技术栈Red Teaming、LLM-as-a-Judge、SFT/DPO、PyTorch、vLLM、SGLang、Prompt Engineering、AI Safety
业务类型ambiguous

工作生活

60中等

职位明确要求现场办公,每周至少4天,未提及弹性或远程安排,生活自由度一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

大模型安全评测具有显著社会价值,能够推动AI治理与可信AI发展,行业前景广阔,使命感满足度较高。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号推动模型安全能力的量化分析与行业评估标准的完善
创新程度积极采用新技术
Watch Jobs