
知乎
大模型安全研究员
大模型安全研究员
发布于 大约 14 小时前普通员工/个人贡献者
深圳市
中级经验
全职员工
仅现场办公
硕士
网络安全
Jailbreak
Llm
Pytorch
Rag
安全
安全对齐
红队
AI 估算 · 30k–60k
AI安全为前沿领域,人才稀缺,深圳互联网大厂硕士研究员月薪普遍3-6万,15薪合理。
职位详情
关于这个职位
该职位专注于大模型全生命周期的安全研究,包括攻击面分析、红队评测和防御对齐机制落地
你将深入研究Prompt注入、Jailbreak、Agent安全等前沿威胁,并参与构建自动化评测平台与安全基线
适合对AI安全有热情、具备扎实机器学习基础和攻防经验的研究人员
最低要求
计算机 / 人工智能 / 网络空间安全 / 软件工程相关 硕士及以上
深入理解 Transformer / LLM 推理机制,熟悉 LoRA / QLoRA / RAG / Agent 框架(LangChain、CrewAI、LangGraph 等)
熟练 Python
掌握 PyTorch / TensorFlow
有 C++ / Go / Rust 加分
熟悉常见攻防:越狱、注入、对抗样本、后门、差分隐私、联邦学习、TEE
有 Benchmark 构建、自动化评测平台、红队工具开发经验
工作职责
攻击面研究
◦ 研究 LLM / 多模态模型 / Agent 在训练、微调、推理、部署全生命周期中的安全风险
◦ 覆盖:Prompt Injection、Jailbreak、数据投毒、后门攻击、对抗样本、模型窃取/反演、成员推断、上下文污染、工具调用越权、RAG 污染等
安全评测与红队体系
◦ 构建自动化安全评测 Benchmark、攻击语料库、红队测试框架
◦ 对接 OWASP Top 10 for LLM Applications
防御与对齐机制
◦ 研究并落地:输入/输出护栏、意图识别、安全对齐(SFT / RLHF / DPO / RLAIF)、拒答边界、内容安全过滤、Agent 权限隔离与调用审计
智能体(Agent)安全
◦ 针对 ReAct / Function Calling / MCP / 多步工作流,建模工具滥用、记忆篡改、间接注入等新型威胁
前沿跟踪与成果转化
◦ 跟踪 NeurIPS / ICLR / S&P / CCS / USENIX 等前沿进展
◦ 输出论文、专利、技术报告、安全基线规范,推动能力产品化
优先资格
顶会论文(NeurIPS / ICLR / ICML / ACL / S&P / CCS / USENIX 等)一作
CVE / 大模型漏洞挖掘 / CTF(AI 安全赛道)获奖
多模态(VLM)、Agent 安全、AI for SOC / 漏洞挖掘方向经验
AI 洞察
优缺点分析
优点
- AI安全是当前最热门的前沿方向之一,技术壁垒高,个人成长快
- 公司为知乎,大型互联网平台,有丰富真实业务场景和算力资源
- 工作内容多元化,涵盖研究、开发、评测,能快速积累多维度经验
- 有机会发表顶会论文、推动行业标准,提升个人影响力
- 攻防对抗性质强,可能会面临安全事件应急的高压场景
- 岗位对综合能力要求高,既需要理论基础又需要工程落地能力
- 适合对AI安全有强烈兴趣,具备机器学习和安全攻防双重背景,且能适应快节奏研究环境的技术型人才
缺点 / 挑战
- 技术迭代快,需要持续追踪最新研究,学习压力大
角色解读
- 安全研究员→高级安全研究员→技术专家或安全团队负责人
- 可向AI安全架构师、AI红队负责人、安全算法总监等方向发展
- 也可转向学术界或创业,专注于AI安全相关产品与服务
- 研究LLM/多模态/Agent全生命周期的安全风险,覆盖训练、微调、推理、部署各阶段
- 构建自动化安全评测Benchmark、攻击语料库和红队测试框架,对接OWASP等标准
- 设计并落地防御机制,如输入/输出护栏、安全对齐、Agent权限隔离等
- 跟踪学术界前沿安全研究成果,转化为论文、专利或产品化能力
- 扎实的机器学习和深度学习基础,深入理解Transformer和LLM推理机制
- 熟悉常见攻防技术,如越狱、注入、对抗样本、后门等,并有实际红队或评测经验
- 熟练的编程能力,精通Python,掌握PyTorch/TensorFlow,了解C++/Go/Rust更佳
- 熟悉Agent框架(如LangChain、LangGraph)和RAG、LoRA等微调技术
申请策略
- 认真研究知乎的AI安全方向和现有产品,面试中提出有建设性的见解
- 准备1-2个深度项目故事,用STAR方法清晰展示从问题发现到解决方案的完整过程
- 突出大模型安全相关的项目经历,如红队评测、漏洞挖掘、防御机制研发等
- 展示顶会论文、CTF获奖、CVE等荣誉,并能具体说明个人贡献
- 强调对Transformer、RAG、Agent框架的深入理解,可附上代码仓库或技术博客
- 如果有自动化评测工具开发经验,务必详细描述架构和成果
- 系统学习LLM安全领域的经典攻击手法和防御方案,熟悉OWASP Top 10 for LLM
- 动手实践主流Agent框架,尝试构建简单的红队测试脚本或安全评测benchmark
面试指南
- 对于项目类问题,采用“背景-挑战-方案-结果”的STAR框架,突出自己在攻防思路上的创新和可量化成果
- 对于技术设计类问题,先明确威胁模型,再分层提出检测、防御、缓解措施,同时考虑实用性和性能
- 对于前沿跟踪类问题,简要复述论文核心思想,然后结合当前岗位场景谈落地可能性,展现思考深度
- 请介绍一个你实际做过的大模型安全项目,如何评估和防御攻击?
- 如何设计一个针对Agent的安全评测框架?考虑哪些威胁模型?
- 你对Prompt Injection和Jailbreak的异同及防御思路有何理解?
- 给定一个使用RAG的问答系统,你会如何测试和增强它的安全性?
- 最近读过哪些AI安全方向的顶会论文?对你有什么启发?
职位点评
72
综合评分
前沿AI安全研究岗,技术成长空间极大,但WLB不明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长和前沿研究、看重职业发展潜力的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展92
工作生活50
使命价值85
薪资福利
65中等
职位未明确薪资福利,但知乎作为上市大厂,薪酬水平通常具竞争力,具体因面试定级而异。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
92较高
该职位处于AI安全前沿,技术含量高,研究深度和广度兼备,成长空间极大。
技术前沿前沿/新兴技术
技术栈LLM、多模态模型、Agent、Prompt Injection、Jailbreak、RLHF、DPO、RLAIF、RAG、LoRA、QLoRA、LangChain、LangGraph、PyTorch、TensorFlow
业务类型ambiguous
工作生活
50较低
JD未提及远程或弹性工作,默认现场办公,WLB信号不明确,可能因研究性质存在加班可能。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
85较高
AI安全领域社会价值高,岗位直接防范人工智能风险,符合科技向善的使命感。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
知乎 的其他在招职位
相似职位推荐
Watch Jobs