
知乎
大模型安全研究员
大模型安全研究员
发布于 大约 14 小时前普通员工/个人贡献者
深圳市
高级经验
全职员工
仅现场办公
硕士
信息安全
Agent安全
Dpo
Jailbreak
Llm安全
Pytorch
Rag
Rlhf
AI 估算 · 30k–60k
大模型安全是前沿方向,人才稀缺,深圳互联网大厂薪资竞争力强。
职位详情
关于这个职位
该职位负责研究大模型全生命周期的安全风险,包括提示注入、越狱、数据投毒等攻击手段,并构建自动化评测和红队体系
同时探索防御和对抗对齐机制,如SFT/RLHF/DPO,以及Agent安全
适合对AI安全有浓厚兴趣、具备扎实机器学习功底的研究型人才
最低要求
计算机 / 人工智能 / 网络空间安全 / 软件工程相关 硕士及以上
技术能力
深入理解 Transformer / LLM 推理机制,熟悉 LoRA / QLoRA / RAG / Agent 框架(LangChain、CrewAI、LangGraph 等)
熟练 Python
掌握 PyTorch / TensorFlow
有 C++ / Go / Rust 加分
熟悉常见攻防:越狱、注入、对抗样本、后门、差分隐私、联邦学习、TEE
有 Benchmark 构建、自动化评测平台、红队工具开发经验
工作职责
攻击面研究
◦ 研究 LLM / 多模态模型 / Agent 在训练、微调、推理、部署全生命周期中的安全风险
◦ 覆盖:Prompt Injection、Jailbreak、数据投毒、后门攻击、对抗样本、模型窃取/反演、成员推断、上下文污染、工具调用越权、RAG 污染等
安全评测与红队体系
◦ 构建自动化安全评测 Benchmark、攻击语料库、红队测试框架
◦ 对接 OWASP Top 10 for LLM Applications
防御与对齐机制
◦ 研究并落地:输入/输出护栏、意图识别、安全对齐(SFT / RLHF / DPO / RLAIF)、拒答边界、内容安全过滤、Agent 权限隔离与调用审计
智能体(Agent)安全
◦ 针对 ReAct / Function Calling / MCP / 多步工作流,建模工具滥用、记忆篡改、间接注入等新型威胁
前沿跟踪与成果转化
◦ 跟踪 NeurIPS / ICLR / S&P / CCS / USENIX 等前沿进展
◦ 输出论文、专利、技术报告、安全基线规范,推动能力产品化
优先资格
顶会论文(NeurIPS / ICLR / ICML / ACL / S&P / CCS / USENIX 等)一作
CVE / 大模型漏洞挖掘 / CTF(AI 安全赛道)获奖
多模态(VLM)、Agent 安全、AI for SOC / 漏洞挖掘方向经验
AI 洞察
优缺点分析
优点
- 大模型安全是当前和未来的热门方向,技术前沿性强
- 知乎作为大型互联网公司,平台资源丰富,可接触真实业务场景
- 岗位涉及研究与实践结合,有产出论文和专利的机会
- 安全攻防对抗性强,需要不断更新知识体系
- 对数学和编程功底要求高,需要扎实的机器学习基础
- 适合对AI安全有强烈兴趣,具备扎实机器学习背景和编程能力的研究型人才
缺点 / 挑战
- 需要持续跟踪最新研究进展,学习压力大
角色解读
- 成长为AI安全领域的专家,主导安全评测体系和防御机制的落地
- 可向安全研究负责人或安全架构师方向发展
- 随着AI Agent的普及,Agent安全方向有广阔前景
- 研究大模型在训练、微调、推理、部署全生命周期中的安全风险,包括提示注入、越狱、数据投毒等攻击手段
- 构建自动化安全评测基准和红队测试框架,对接OWASP Top 10 for LLM Applications
- 设计并落地安全防御机制,如输入输出护栏、安全对齐(SFT/RLHF/DPO)和Agent权限隔离
- 深入理解Transformer架构和LLM推理机制,熟悉LoRA、QLoRA、RAG及Agent框架
- 熟练使用Python和PyTorch/TensorFlow,有C++/Go/Rust加分
- 熟悉常见攻防技术,如越狱、注入、对抗样本、差分隐私等
申请策略
- 了解知乎的业务场景和对安全的重视程度
- 准备展示一个完整的LLM安全研究项目
- 突出安全相关项目经验,如红队测试、漏洞挖掘、安全工具开发
- 强调对LLM机制的深入理解,如Transformer、RAG、Agent架构
- 如有顶会论文或CVE,务必突出显示
- 展示Python和PyTorch的使用熟练度
- 系统学习LLM安全和对抗攻击相关知识,如提示注入、越狱论文
- 提升红队工具开发和自动化评测能力
面试指南
- 对于技术问题,采用'原理-方法-案例'的结构回答,先说明概念,再给出具体方法,最后举例
- 对于项目经验,采用STAR法则,清晰描述情境、任务、行动和结果
- 请描述一下你对大模型提示注入攻击的理解和防护方法?
- 如何构建一个有效的LLM安全评测基准?
- 你了解哪些安全对齐方法?它们的优缺点是什么?
- 如何防护Agent框架中的工具调用越权问题?
- 你是否有实际的漏洞挖掘或红队测试经验?
- 深入复习Transformer、RLHF、DPO等核心原理
职位点评
76
综合评分
前沿AI安全研究岗位,技术成长空间大,但薪资未披露且WLB不确定。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和前沿研究,愿意接受挑战的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值80
薪资福利
80较高
该职位属于高薪技术岗位,知乎平台实力强,薪资竞争力较高,但JD未明确具体薪资和福利。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
90较高
该职位处于大模型安全前沿,涉及大量新技术和攻防对抗,成长空间大,且鼓励论文和专利产出。
技术前沿前沿/新兴技术
技术栈LLM、Transformer、LoRA、QLoRA、RAG、Agent、LangChain、PyTorch、DPO、RLHF、TEE、差分隐私
业务类型ambiguous
工作生活
50较低
深圳实地办公,JD未提及弹性工作或远程,可能加班强度较高,WLB一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
大模型安全对于维护AI生态安全具有重要社会价值,行业发展前景广阔。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
知乎 的其他在招职位
相似职位推荐
Watch Jobs