
阿里巴巴
日常实习生-大模型安全评测实习生
日常实习生-大模型安全评测实习生
发布于 大约 8 小时前实习/见习
杭州市
无经验要求
实习生
仅现场办公
硕士
NLP工程
Ai Safety
Llm
Llm-As-A-Judge
Nlp
Prompt Engineering
Pytorch
Sft/Dpo
大模型安全
AI 估算 · 4k–6k
阿里日常实习生,杭州地区,薪资按行业实习标准估算,日薪约200-300元。
职位详情
关于这个职位
这是一份阿里巴巴的大模型安全评测日常实习生职位
你将深度参与大模型安全评测体系的设计与建设,围绕内容安全、价值观对齐与越狱攻击等方向,构建多维度评测方案,并参与评测数据集的构建与维护
同时,你还会研究并落地基于LLM-as-a-Judge的自动化评判方法,以及参与评测工具链和平台的研发
适合对AI安全充满热情、具备扎实NLP基础的硕士在读同学
最低要求
硕士及以上学历在读,计算机、人工智能、网络安全等相关专业优先
具备扎实的深度学习与自然语言处理基础,熟悉深度学习框架(PyTorch),熟练掌握 Prompt Engineering、模型微调(SFT/DPO)等基础技术,具备较强的算法实现与实验能力
了解 Qwen、DeepSeek、GLM、Llama 等主流大模型架构及推理框架(vLLM、SGLang)者优先
了解大模型安全评测、AI Safety、Red Teaming、Jailbreak Attack & Defense、Alignment、LLM-as-a-Judge 等相关研究方向,熟悉主流安全评测 Benchmark 与评测方法论、自动化评测样本生成,以及评判模型构建、评分一致性度量、不确定性量化、Judge 偏差分析与校准等方法
具备良好的论文阅读与复现能力,能够跟踪并理解前沿学术研究工作
有相关项目、研究经验或顶会论文(NeurIPS/ICML/ICLR/ACL/EMNLP 等)者优先
熟练掌握 Python 编程,具备良好的工程实现能力和代码规范意识,有大规模数据处理或评测平台开发经验者优先
具备较强的逻辑分析能力、数据敏感度与问题拆解能力,对大模型安全评测研究有浓厚兴趣,能够独立推进课题
工作地点杭州,每周至少实习4天,持续3个月以上
工作职责
参与大模型安全评测体系的设计与建设,围绕内容安全、价值观对齐与越狱攻击等方向,搭建多维度、多场景、多语种的系统化评测方案,推动模型安全能力的量化分析与行业评估标准的完善
参与大模型安全评测数据集构建与维护,覆盖通用风险、垂直领域风险及长尾风险等场景,探索基于红队对抗(Red Teaming)、自动化Prompt生成、合成数据等技术的高质量评测样本生产方案
参与基于LLM-as-a-Judge的自动化评判方法研究与落地,探索评判模型的偏差校准、不确定性量化及与人类标注一致性提升的关键技术路径,构建可信、可解释的安全评测闭环
参与自动化安全评测工具链与评测平台的研发与迭代,沉淀可复用的评测Pipeline与Judge模型能力,提升评测效率、覆盖度与结果一致性,支撑大模型版本迭代过程中的安全回归与持续监控
跟踪国内外大模型安全评测、AI Safety Benchmark、Red Teaming 等前沿研究进展,复现相关论文与开源方案(如HarmBench、JailbreakBench、SafetyBench等),推动研究成果在实际评测场景中的落地应用
优先资格
优先考虑:计算机、人工智能、网络安全等相关专业
了解 Qwen、DeepSeek、GLM、Llama 等主流大模型架构及推理框架(vLLM、SGLang)
有相关项目、研究经验或顶会论文(NeurIPS/ICML/ICLR/ACL/EMNLP 等)
有大规模数据处理或评测平台开发经验
AI 洞察
优缺点分析
优点
- 阿里巴巴平台大,资源丰富,能够接触前沿大模型安全研究,与行业顶尖团队协作
- AI安全是增长潜力高的新兴领域,技术含金量高,职业发展空间广阔
- 能系统学习评测体系构建、自动化工具链开发、LLM-as-a-Judge等硬核技能
- 要求每周至少4天、持续3个月以上,时间投入较大,需与学业平衡
- 岗位知识面宽,涉及NLP、安全、评测方法等,学习曲线较陡
- 适合对AI安全有强烈好奇心,拥有扎实深度学习与NLP基础的硕士在读生,愿意投入时间深入研究大模型安全评测这一前沿方向
缺点 / 挑战
- 需要独立推进课题,对问题拆解和实验能力要求较高,可能有一定压力
角色解读
- 从实习起步,深入大模型安全评测方向,积累对AI安全、对齐、红队等领域的深度理解,逐步成为安全算法专家
- 可沿算法研究或工程开发双线发展:或撰写顶会论文,或打造自动化评测平台,成为行业稀缺的AI安全复合型人才
- 实习表现优异可争取转正,进入阿里巴巴核心AI团队,参与大规模模型安全体系建设
- 参与大模型安全评测体系的设计与搭建,围绕内容安全、价值观对齐和越狱攻击等方向,制定多维度评测方案,量化模型安全能力
- 构建和维护安全评测数据集,探索红队对抗、自动化Prompt生成、合成数据等方法,生产高质量评测样本
- 研究并落地LLM-as-a-Judge自动化评判方法,改进评分一致性、偏差校准和不确定性量化,建立可信的评测闭环
- 参与自动化评测工具链与平台开发,沉淀可复用的Pipeline,支持模型版本迭代中的安全回归与持续监控
- 扎实的深度学习与NLP基础,熟练掌握PyTorch、Prompt Engineering、模型微调(SFT/DPO),具备算法实现和实验能力
- 了解大模型安全评测、AI Safety、Red Teaming、Jailbreak Attack等知识,熟悉主流安全Benchmark与评测方法论
- 熟练Python编程,具备良好的工程实现能力、代码规范意识和数据处理经验
- 较强的论文阅读与复现能力,能跟踪前沿研究,理解学术成果并落地到实际场景
申请策略
- 在简历中附上你对AI安全的研究笔记、博客或GitHub项目,展示兴趣与思考深度
- 提前了解阿里巴巴通义实验室、达摩院等团队在AI安全方向的工作成果,并在面试中体现了解
- 突出NLP或深度学习的项目经历,尤其是模型微调、Prompt设计、安全对齐相关的内容
- 如有复现HarmBench、JailbreakBench等安全基准的经历,或参与过Red Teaming项目,务必重点描述
- 强调Python编程能力、数据处理经验,以及使用过Qwen、DeepSeek、GLM、Llama等大模型的经验
- 列出顶会论文(NeurIPS/ICML/ICLR/ACL/EMNLP等)或开源贡献,展示研究实力
- 系统了解主流安全评测Benchmark(如HarmBench、JailbreakBench、SafetyBench),精读2-3篇核心论文
- 动手实践模型微调(SFT/DPO),熟悉PyTorch和常见推理框架如vLLM、SGLang
面试指南
- 概念解释题:先定义核心概念,再结合例子说明,最后联系实际应用场景
- 项目经验题:用STAR法则(情境、任务、行动、结果)清晰描述,强调个人贡献和思考
- 设计题:从目标→方法→评估→优化的结构展开,体现系统性思维
- 你如何理解大模型安全评测?请列举你了解的安全评测基准和它们的特点
- 请详细介绍你使用PyTorch进行模型微调的项目,包括数据、方法、结果
- 如果让你设计一个评测大模型越狱攻击的测试集,你会如何构建?
- LLM-as-a-Judge的可靠性有哪些挑战?你有哪些改进思路?
- 解释SFT和DPO的区别,以及它们在模型安全对齐中的作用
职位点评
72
综合评分
阿里大模型安全评测实习,前沿技术,成长性强,薪资一般,需现场办公
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
该职位最适合以技能成长和前沿技术探索为核心驱动,对AI安全充满热情,且能接受现场实习安排的硕士在读同学。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利55
成长发展85
工作生活60
使命价值80
薪资福利
55较低
实习岗位薪资一般,但阿里巴巴的平台价值和品牌背书带来一定稳定性与福利预期,整体补偿性动机满足度中等偏下。
薪资信号未披露(AI估算:4K-6K/月)
成长发展
85较高
该岗位聚焦大模型安全前沿方向,涉及Red Teaming、LLM-as-a-Judge、SFT/DPO等先进技术,技能成长和研究视野拓展空间巨大。
技术前沿前沿/新兴技术
技术栈Red Teaming、LLM-as-a-Judge、SFT/DPO、PyTorch、vLLM、SGLang、Prompt Engineering、AI Safety
业务类型ambiguous
工作生活
60中等
职位明确要求现场办公,每周至少4天,未提及弹性或远程安排,生活自由度一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
大模型安全评测具有显著社会价值,能够推动AI治理与可信AI发展,行业前景广阔,使命感满足度较高。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号推动模型安全能力的量化分析与行业评估标准的完善
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs