Zhihu logo
知乎
大模型安全研究员

大模型安全研究员

发布于 大约 14 小时前

普通员工/个人贡献者

深圳市
中级经验
全职员工
仅现场办公
硕士
网络安全
Jailbreak
Llm
Pytorch
Rag
安全
安全对齐
红队

AI 估算 · 30k–60k

AI安全为前沿领域,人才稀缺,深圳互联网大厂硕士研究员月薪普遍3-6万,15薪合理。

职位详情

关于这个职位

该职位专注于大模型全生命周期的安全研究,包括攻击面分析、红队评测和防御对齐机制落地

你将深入研究Prompt注入、Jailbreak、Agent安全等前沿威胁,并参与构建自动化评测平台与安全基线
适合对AI安全有热情、具备扎实机器学习基础和攻防经验的研究人员

最低要求

计算机 / 人工智能 / 网络空间安全 / 软件工程相关 硕士及以上

深入理解 Transformer / LLM 推理机制,熟悉 LoRA / QLoRA / RAG / Agent 框架(LangChain、CrewAI、LangGraph 等)
熟练 Python
掌握 PyTorch / TensorFlow
有 C++ / Go / Rust 加分
熟悉常见攻防:越狱、注入、对抗样本、后门、差分隐私、联邦学习、TEE
有 Benchmark 构建、自动化评测平台、红队工具开发经验

工作职责

攻击面研究

◦ 研究 LLM / 多模态模型 / Agent 在训练、微调、推理、部署全生命周期中的安全风险
◦ 覆盖:Prompt Injection、Jailbreak、数据投毒、后门攻击、对抗样本、模型窃取/反演、成员推断、上下文污染、工具调用越权、RAG 污染等
安全评测与红队体系
◦ 构建自动化安全评测 Benchmark、攻击语料库、红队测试框架
◦ 对接 OWASP Top 10 for LLM Applications
防御与对齐机制
◦ 研究并落地:输入/输出护栏、意图识别、安全对齐(SFT / RLHF / DPO / RLAIF)、拒答边界、内容安全过滤、Agent 权限隔离与调用审计
智能体(Agent)安全
◦ 针对 ReAct / Function Calling / MCP / 多步工作流,建模工具滥用、记忆篡改、间接注入等新型威胁
前沿跟踪与成果转化
◦ 跟踪 NeurIPS / ICLR / S&P / CCS / USENIX 等前沿进展
◦ 输出论文、专利、技术报告、安全基线规范,推动能力产品化

优先资格

顶会论文(NeurIPS / ICLR / ICML / ACL / S&P / CCS / USENIX 等)一作

CVE / 大模型漏洞挖掘 / CTF(AI 安全赛道)获奖
多模态(VLM)、Agent 安全、AI for SOC / 漏洞挖掘方向经验

AI 洞察

优缺点分析

优点

  • AI安全是当前最热门的前沿方向之一,技术壁垒高,个人成长快
  • 公司为知乎,大型互联网平台,有丰富真实业务场景和算力资源
  • 工作内容多元化,涵盖研究、开发、评测,能快速积累多维度经验
  • 有机会发表顶会论文、推动行业标准,提升个人影响力
  • 攻防对抗性质强,可能会面临安全事件应急的高压场景
  • 岗位对综合能力要求高,既需要理论基础又需要工程落地能力
  • 适合对AI安全有强烈兴趣,具备机器学习和安全攻防双重背景,且能适应快节奏研究环境的技术型人才

缺点 / 挑战

  • 技术迭代快,需要持续追踪最新研究,学习压力大

角色解读

  • 安全研究员→高级安全研究员→技术专家或安全团队负责人
  • 可向AI安全架构师、AI红队负责人、安全算法总监等方向发展
  • 也可转向学术界或创业,专注于AI安全相关产品与服务
  • 研究LLM/多模态/Agent全生命周期的安全风险,覆盖训练、微调、推理、部署各阶段
  • 构建自动化安全评测Benchmark、攻击语料库和红队测试框架,对接OWASP等标准
  • 设计并落地防御机制,如输入/输出护栏、安全对齐、Agent权限隔离等
  • 跟踪学术界前沿安全研究成果,转化为论文、专利或产品化能力
  • 扎实的机器学习和深度学习基础,深入理解Transformer和LLM推理机制
  • 熟悉常见攻防技术,如越狱、注入、对抗样本、后门等,并有实际红队或评测经验
  • 熟练的编程能力,精通Python,掌握PyTorch/TensorFlow,了解C++/Go/Rust更佳
  • 熟悉Agent框架(如LangChain、LangGraph)和RAG、LoRA等微调技术

申请策略

  • 认真研究知乎的AI安全方向和现有产品,面试中提出有建设性的见解
  • 准备1-2个深度项目故事,用STAR方法清晰展示从问题发现到解决方案的完整过程
  • 突出大模型安全相关的项目经历,如红队评测、漏洞挖掘、防御机制研发等
  • 展示顶会论文、CTF获奖、CVE等荣誉,并能具体说明个人贡献
  • 强调对Transformer、RAG、Agent框架的深入理解,可附上代码仓库或技术博客
  • 如果有自动化评测工具开发经验,务必详细描述架构和成果
  • 系统学习LLM安全领域的经典攻击手法和防御方案,熟悉OWASP Top 10 for LLM
  • 动手实践主流Agent框架,尝试构建简单的红队测试脚本或安全评测benchmark

面试指南

  • 对于项目类问题,采用“背景-挑战-方案-结果”的STAR框架,突出自己在攻防思路上的创新和可量化成果
  • 对于技术设计类问题,先明确威胁模型,再分层提出检测、防御、缓解措施,同时考虑实用性和性能
  • 对于前沿跟踪类问题,简要复述论文核心思想,然后结合当前岗位场景谈落地可能性,展现思考深度
  • 请介绍一个你实际做过的大模型安全项目,如何评估和防御攻击?
  • 如何设计一个针对Agent的安全评测框架?考虑哪些威胁模型?
  • 你对Prompt Injection和Jailbreak的异同及防御思路有何理解?
  • 给定一个使用RAG的问答系统,你会如何测试和增强它的安全性?
  • 最近读过哪些AI安全方向的顶会论文?对你有什么启发?

职位点评

72
综合评分

前沿AI安全研究岗,技术成长空间极大,但WLB不明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和前沿研究、看重职业发展潜力的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展92
工作生活50
使命价值85

薪资福利

65中等

职位未明确薪资福利,但知乎作为上市大厂,薪酬水平通常具竞争力,具体因面试定级而异。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

92较高

该职位处于AI安全前沿,技术含量高,研究深度和广度兼备,成长空间极大。

技术前沿前沿/新兴技术
技术栈LLM、多模态模型、Agent、Prompt Injection、Jailbreak、RLHF、DPO、RLAIF、RAG、LoRA、QLoRA、LangChain、LangGraph、PyTorch、TensorFlow
业务类型ambiguous

工作生活

50较低

JD未提及远程或弹性工作,默认现场办公,WLB信号不明确,可能因研究性质存在加班可能。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

AI安全领域社会价值高,岗位直接防范人工智能风险,符合科技向善的使命感。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs